登录社区云,与社区用户共同成长
邀请您加入社区
从头开始训练一个模型,所有模型的参数都会被初始化并根据训练数据进行更新。最初使用的就是直接通过transformers 对模型训练。
本地大模型部署正从极客实验走向大众实践,其本质是将AI服务从云端SaaS模式转向可控、低延迟、数据私有的边缘计算范式。核心原理在于通过轻量级运行时(如Ollama)封装模型推理复杂性,结合高性价比开源模型(如DeepSeek-R1:1.5b)实现CPU/GPU协同加速,并依托RAG技术桥接私有知识与大语言模型能力。该方案显著降低显存门槛、规避网络限流与隐私风险,广泛适用于法律合同审查、技术文档问答
大模型本地部署的核心在于理解推理引擎(如vLLM)与模型生态(如DeepSeek、Qwen)的协同机制。其底层原理涉及显存动态分配、Tokenizer兼容性、量化格式适配及OpenAI API协议翻译等关键技术环节。技术价值体现在降低冷启动不确定性、提升HuggingFace模型加载鲁棒性,并支撑RAG、VSCode插件集成等真实场景。典型应用包括消费级GPU(RTX 4090)上的低延迟API服
大模型本地部署是指在个人设备上运行开源语言模型,实现数据隐私可控、低延迟交互与工作流深度集成。其核心原理是通过轻量级推理运行时(如Ollama)加载量化模型(如DeepSeek-R1的GGUF格式),暴露标准OpenAI兼容API,并由桌面级GUI(如Cherry Studio)提供可视化交互与状态管理能力。该方案显著降低工程门槛,避免Docker依赖与Python环境冲突,技术价值在于‘开箱即稳
Claude Code并非Anthropic官方产品,而是一个面向中文开发者的本地化AI编程增强工具链,其核心是构建在VS Code之上的轻量级胶水层,通过对接Ollama、DeepSeek等开源模型实现对话式代码生成与重构。它基于OpenAI兼容协议设计,强调上下文感知、低侵入性和技能可编程性,技术原理涵盖后端服务(模型推理)、前端客户端(IDE集成)与声明式Skills系统三层架构。该方案显著
vLLM (https://github.com/vllm-project/vllm) 是一个快速且易于使用的库,用于进行大型语言模型的推理和部署。
本文系统梳理了当前主流的大语言模型推理部署框架,包括vLLM、SGLang、TensorRT-LLM、Ollama和XInference等。从核心技术、架构设计、性能指标和适用场景等维度进行对比分析:vLLM采用PagedAttention和ContinuousBatching技术,显存利用率达95%以上,适合高并发企业应用;SGLang的RadixAttention技术在多轮对话场景下吞吐量比v
讲解ollama下载、安装、运行,以及常用本地大模型
1)Ollama默认是装在C盘下(不建议,后期模型下载占很大空间),如果要装其他盘,不要急着点安装,先进入你想安装的安装盘,在盘里创建Ollama文件夹,接着在Ollama文件夹下创建models文件夹用于存放模型。通过设置参数值为新模型所在路径,如E:\ollama\models,我们可以将模型镜像存储在E盘,避免C盘空间不足的问题。引入电脑1搭建好的Ollama模型,点击右上角的用户头像,找到
大语言模型(LLM)本地部署并非传统软件安装,而是基于推理框架与模型权重的环境配置过程。其核心原理在于将Hugging Face发布的模型文件(如safetensors或GGUF格式),通过Ollama、vLLM或llama.cpp等运行时引擎加载至GPU/CPU执行。技术价值体现在可控性、数据隐私与低延迟响应,广泛应用于代码辅助、智能办公、企业API集成及非技术用户日常交互等场景。本文聚焦Dee
大语言模型(LLM)的本地化部署是当前AI工程落地的核心能力之一,其本质是通过模型量化、推理优化与服务封装,实现低延迟、高可控的私有化AI能力。技术价值在于保障数据安全、降低API依赖、支持定制化微调与领域知识增强。结合检索增强生成(RAG)架构,可显著提升模型在专业文档、企业知识库等场景下的事实准确性与上下文相关性。本文以DeepSeek-R1-7B为典型实例,详解从模型获取、环境配置、vLLM
大语言模型(LLM)的推理效率与长上下文支持能力,核心取决于其底层架构设计与系统级优化。从Transformer注意力机制演进看,Grouped-Query Attention(GQA)通过分组共享KV缓存显著降低显存占用与带宽压力;而YaRN位置编码则在RoPE基础上引入动态插值与上下文缩放,实现128K+长度稳定外推。这些技术不仅提升数学推理与代码生成等垂直任务表现,更直接决定企业级部署中的吞
LLama-Factory零代码微调DeepSeek教程,包教包会。
大语言模型(LLM)的私有化部署是当前AI工程化落地的关键环节,其核心在于将开源模型转化为稳定、高效的服务。实现这一目标通常涉及模型服务化框架、容器化技术及性能优化三大支柱。vLLM凭借其PagedAttention算法,在内存优化和高并发处理上表现突出;而TGI作为Hugging Face官方方案,则强调与生态的无缝集成。Docker容器化技术通过将复杂的环境依赖和模型服务封装成标准镜像,实现了
本文介绍了如何在星图GPU平台上自动化部署【ollama】DeepSeek-R1-Distill-Qwen-7B镜像,构建高效学术论文助手。该模型专为复杂推理优化,支持文献综述整合、LaTeX公式推导与学术化润色,典型应用于科研写作全流程提效,如自动撰写引言段落、推导热传导方程稳定性条件等。