Ollama 对接 VS Code,打造零延迟本地代码助手
为什么我把 Ollama 装在了本地?
以前写代码,遇到复杂的逻辑或者需要生成样板文件时,我习惯性地会去调用云端的 API。虽然方便,但总有两个问题像刺一样扎在心里:一是网络波动带来的延迟,有时候敲完回车得盯着光标转圈好几秒,那种“心流”被打断的感觉特别难受;二是隐私顾虑,尤其是处理公司内部的核心业务逻辑或未公开的算法时,把代码片段上传到第三方服务器始终是个隐患。
最近换了台搭载 AMD Strix Halo 架构的新本,得益于 Ryzen AI 和 Radeon GPU 的强力协同,加上统一内存架构带来的大带宽优势,我终于可以把大模型完全“搬”回本地了。今天不聊虚的参数,直接分享一套我亲测好用的方案:用 Ollama 做后端,配合 VS Code 插件,打造真正零延迟、纯离线的本地代码助手。
环境搭建:让 Ollama 静默运行
要实现无感知的代码辅助,第一步是把这个“大脑”在后台跑起来。Ollama 的优势就在于轻量,它不像某些图形化软件那样占用大量前台资源,非常适合做个安静的后台服务。
安装过程非常简单,去官网下载对应系统的安装包,一路默认选项即可。对于 Strix Halo 这种新架构设备,新版 Ollama 已经能自动识别 Radeon GPU 并进行加速,无需我们手动去折腾复杂的 ROCm 驱动或环境变量。
安装完成后,我们需要稍微配置一下,确保它能稳定监听本地端口,以便编辑器随时调用。打开终端(Windows 下推荐 PowerShell),执行以下命令来设置监听地址并启动服务:
$env:OLLAMA_HOST = "127.0.0.1:11434"
ollama serve
这一步很关键,127.0.0.1:11434 是我们后续在 VS Code 中连接的“暗号”。启动后,你可以最小化终端窗口,Ollama 就会在后台待命。接着,拉取一个适合代码生成的模型,比如 qwen2.5-coder:7b 或者 llama3:
ollama run qwen2.5-coder:7b
首次运行会自动下载模型文件。一旦下载完成,你的本地推理引擎就就绪了。在 Strix Halo 的大内存支持下,即使是 7B 甚至 14B 参数的模型,也能被完整加载到高速内存中,由 Radeon GPU 全速运算,首字延迟几乎可以忽略不计。
VS Code 对接:安装与配置
有了后端服务,接下来就是打通编辑器的“任督二脉”。在 VS Code 的扩展商店中,搜索并安装 Continue 插件(Twinny 也是不错的选择,操作逻辑类似)。Continue 对本地模型的支持非常友好,配置起来几乎没有门槛。
安装完成后,点击侧边栏的 Continue 图标,点击右上角的齿轮图标进入配置文件 config.json。我们需要修改其中的 models 部分,告诉插件不要再去连云端,而是指向我们本地的 Ollama 服务。配置示例如下:
{
"models": [
{
"title": "Local Coder",
"provider": "ollama",
"model": "qwen2.5-coder:7b",
"apiBase": "http://127.0.0.1:11434"
}
],
"tabAutocompleteModel": {
"title": "Local Autocomplete",
"provider": "ollama",
"model": "qwen2.5-coder:7b",
"apiBase": "http://127.0.0.1:11434"
}
}
这里特别注意 apiBase 字段,必须和我们刚才启动 Ollama 时设置的地址一致。保存文件后,插件状态栏应该会显示连接成功。此时,你的 VS Code 已经完全脱离了对外部网络的依赖,所有的推理请求都在本机内部闭环完成。
实战体验:零延迟的心流编程
配置好后,真正的魔法时刻开始了。我试着打开一个 Python 文件,准备写一个带类型提示和文档字符串的递归斐波那契函数。
以往用云端 API 时,输入函数名和注释后,往往需要停顿一下等待响应。但在本地环境下,当我敲下 def fib( 的瞬间,补全建议几乎是“贴”着光标出现的。这种零感知的延迟,让我能完全沉浸在逻辑构建中,不需要因为等待生成而打断思路。
例如,当我写下:
def fibonacci(n: int) -> int:
"""
计算第 n 个斐波那契数,使用递归实现。
"""
Continue 插件立刻通过本地 Ollama 模型给出了完整的实现,包括边界条件判断和递归调用,甚至主动添加了详细的 Docstring:
if n <= 0:
raise ValueError("Input must be a positive integer")
elif n == 1 or n == 2:
return 1
else:
return fibonacci(n-1) + fibonacci(n-2)
整个过程流畅得就像有一个经验丰富的搭档坐在旁边,你刚起个头,他就递上了完美的下一句。更重要的是,这一切都发生在离线状态下。哪怕我拔掉网线,或者身处没有信号的会议室、高铁上,这个助手依然随叫随到,响应速度丝毫不减。
隐私与安全:核心代码的“保险箱”
对于开发者而言,除了效率,数据安全更是底线。在使用云端服务时,我们不得不信任服务商的隐私政策,担心代码片段被用于模型训练或意外泄露。但在本地部署的方案中,数据从未离开过你的机器。
无论是公司严禁外发的核心算法,还是涉及用户隐私的数据处理逻辑,都可以放心地交给本地模型去分析、重构或生成单元测试。所有数据流转仅限于内存和硬盘之间,彻底杜绝了外部泄露的风险。这种“数据不出域”的安全感,是任何云端 API 都无法比拟的。
现在,我的开发工作流已经完全离不开这套组合拳:Ollama 在后台默默提供算力,VS Code 在前台无缝集成,Ryzen AI 与 Radeon GPU 在底层高效调度。这不仅是一个工具的安装,更是一种回归——让技术重新服务于专注与创造,而不是被网络和焦虑所束缚。如果你也拥有一台性能不错的笔记本,不妨试试把 AI 留在本地,体验那种纯粹、私密且高效的编程乐趣。
更多推荐



所有评论(0)