最近圈子里有个说法越传越猛:既然 RAG + 工具调用 + 多轮迭代就能让大模型搞定专业知识,那微调是不是已经没必要了?

说实话,我第一次听到这个观点的时候,愣了一下。

因为我之前也花过不少精力搞微调,搞数据标注,搞训练流程,折腾得死去活来。现在有人告诉我,这条路可能走到头了?

我不信。

于是花了些时间,翻了 2025-2026 年的论文、行业报告和大厂的技术博客,想搞清楚这个事。

结论先说在前面:微调没死,但它的角色变了。而且变得很厉害。


一. 范式转换:从"写好提示词"到"搭好运行环境"

搞 AI 应用的同学应该都有感觉——这两年,玩法完全不一样了。

2023 年那会儿,大家都在卷 Prompt Engineering。核心逻辑很简单:写出更好的指令,让模型给你更好的答案。Few-Shot、Chain-of-Thought,各种花样层出不穷。

有用吗?有用。但很快就不够了。

因为应用场景从"问一个问题"变成了"完成一个任务"。光靠提示词,撑不住。

2025 年中,一个新的概念起来了——Context Engineering(上下文工程)。

Anthropic 的官方工程博客给了个定义:

“上下文工程是指在 LLM 推理过程中,策划和维护最优信息令牌集合的策略集合。”

说人话就是:不光要告诉模型"做什么",还要帮它把工作台整理好。

记忆管理、工具选择、检索策略、动态上下文窗口编排……全都是上下文工程的活。

Karpathy 公开说过一句话,我特别喜欢:“我非常喜欢’上下文工程’这个词,胜过提示工程。”

Simon Willison 更绝,直接把这个领域劈成两半——"上下文工程"管选什么信息喂给模型,"提示编程"管怎么写指令。

两件事,两个专业方向。

但你以为这就完了?

2025 年末到 2026 年,又来了一波。Harness Engineering(智能体套件工程)。

Aakash Gupta 在 Medium 上写了篇文章,标题很直白:“2025年是智能体之年,2026年是智能体套件之年。”

Oracle 的定义更形象:智能体套件就是"包裹在概率模型外层的确定性软件层,控制工作实际执行的方式"。

翻译成人话:LLM 是个概率怪物,套件就是给它套上的笼头。

Anthropic 官方工程博客也跟进了这个方向,分享如何从人类工程师的工作方式中汲取灵感,给长时间运行的 AI 智能体建一套靠谱的套件。

学术圈也在动。arXiv 上的 ACE 框架提出了一个很骚的概念——把上下文看成"可演进的行动手册",让 LLM 通过自动构建和优化运行上下文来实现自我改进。

三个阶段串起来看,逻辑非常清晰:

Prompt Engineering → Context Engineering → Harness Engineering

从"写好指令"到"管理信息环境"到"设计自治系统"。

核心驱动力就三个字:复杂度。

应用场景从单次问答到完成任务到自主工作流,每升一级,上一级的方案就不够用了。

每个阶段都在解决上一级的可靠性问题。提示词不可靠,就加上下文。上下文不可靠,就加系统约束。

重心从"让模型知道什么"转向"让模型怎么工作"。


二. 微调到底怎么了?

先说一个很多人的误区。

"微调"这个词,涵盖的范围其实非常广。

你往模型里灌领域知识语料,叫微调。你教模型按特定格式输出,也叫微调。你用 RLHF 调模型的语气风格,还叫微调。

但它们的命运完全不一样。

Sebastian Raschka 在《The State of LLMs 2025》里说了个关键判断:LLM 基准性能的进步,更多来自改进的工具链和推理时扩展(inference-time scaling),而不是训练或核心架构变化。

什么意思呢?

模型变强,主要不是靠训练变强的,是靠用得越来越花。

但微调也没闲着。它发生了几个根本性的变化:

全量微调已经不是默认选项了。PEFT 方法——LoRA、QLoRA、适配器——已经在生产环境中基本取代了全量微调。成本降了一个量级。

QLoRA 的 4 位量化,让单张消费级 GPU 上微调十亿参数模型变成了现实。以前需要一整个机房的算力,现在你台式机就能跑。

新变体还在不断冒出来。DoRA、LoRA+,一代接一代推着 PEFT 往前走。

开源模型生态也炸了。Meta 的 Llama 系列持续霸占开源 LLM 领域,给了微调极其丰富的基础模型选择。

所以我拉了个表,把不同类型的微调拆开看:

继续预训练(CPT)——目的:注入领域知识。大部分可以被 RAG 替代。

监督微调(SFT)——目的:教会特定任务格式/行为。部分可以被替代,看任务。

偏好对齐(RLHF/DPO)——目的:塑造输出风格/价值观。很难替代。

PEFT(LoRA 等)——目的:低成本适应特定场景。看需求。

发现没有?

很多人说"微调不需要了",其实说的是"通过继续预训练灌知识的微调不需要了"。

但行为塑造、风格控制、格式约束这些微调,工程化手段根本没法完全替代。


三. 工程化方案能干啥,不能干啥

RAG + 工具调用 + 多轮迭代这套组合拳,确实能搞定大量垂直领域问题。这没毛病。

能做到的事情一大堆:

让模型从外部知识库检索准确的专业信息。多步推理处理复杂问题。实时更新知识库,不用重训模型。用工具获取实时数据。通过多轮自我纠错提高回答质量。

事实性知识问答、需要最新信息的场景、多源信息整合、流程化任务——这些场景,工程化方案特别能打。

但是。

有些东西它确实搞不定。

第一,"直觉"型知识。

某些领域知识不光是事实性的,它包含深层的模式识别能力。

比如资深医生的诊断"直觉"——不是你把症状匹配检索出来就能有的能力。

比如资深律师的法律论证结构感——不是查到法条就能写出的论证逻辑。

比如代码审查中的"代码味道"感知——不是一张检查清单能覆盖的。

这类知识得内化到模型权重里。RAG 给不了你。

就像打游戏的"肌肉记忆"。你背再多的攻略,也不如练 1000 把来得实在。

第二,极低延迟要求。

工程化方案每次查询都要:检索 50-200ms,多轮推理几秒,可能的工具调用几百毫秒。

微调后的小模型呢?10-50ms。

数量级的差距。实时交互场景里,这就是能用和不能用的区别。

第三,离线/端侧部署。

车载系统、工业设备、军事应用——这些场景连网都连不上,你调什么外部知识库?

Vikas Chandra 在《On-Device LLMs 2026》里说得很直白:

“对于大多数实践者来说,微调就是路径。基础模型已经足够好了,适应你的领域或任务才是你增值的地方。”

第四,输出格式和风格的精确控制。

需要模型始终以特定格式输出——JSON Schema、医学报告模板、法律合同条款——或者特定风格时,微调能把这种行为内化到模型权重里。

不用每次在提示中重复说明。重复说明本身也消耗 token,也消耗成本。

第五,安全合规与数据隔离。

金融、医疗、国防——数据不能出本地。微调可以在隔离环境里完成,避免把敏感数据送到外部 API 或知识库。

除了这些,工程化方案还有一堆隐性成本,很多人没算过:

Token 消耗——每次查询都要带一大坨上下文,长上下文的推理成本比微调模型高得多。

系统复杂度——向量数据库、检索管道、工具注册表、编排框架、监控系统,一整套基础设施要维护。

可靠性——多个组件串联,哪一环出问题都影响结果。

调试难度——输出不对的时候,你得排查是提示词的问题、检索结果的问题、工具返回值的问题、还是编排逻辑的问题。

像是在玩一个复杂的塔防游戏,塔越多,能防住的敌人越多,但维护成本也越高。


四. 大厂们在想什么

看行业格局,几家巨头的态度分化非常明显。

OpenAI 在推规模化部署。2026 年 2 月正式退役了 GPT-4o、GPT-4.1 和 o4-mini 的部分版本,推动开发者往 GPT-5 系列迁移。Microsoft Azure 接了退役后的微调模型推理。

但这个过渡给依赖 GPT-4o 微调的企业造成了实际影响——部分生产环境的微调模型直接挂了。

信号很明显:基础模型迭代太快,企业级微调面临"模型一升级,微调就要重来"的困境。

Anthropic 在押注安全与可靠性。连发了好几篇关于上下文工程和智能体套件的深度工程博客,引领了从提示工程到上下文工程的范式转换。

信号也很明显:Anthropic 觉得"怎么用模型"比"怎么改模型"更重要。 但不排斥特定场景下用微调。

Google 通过 Gemini 系列和 Vertex AI 平台,微调和工程化方案两手都支持。2026 年的竞争围绕分发、变现和生态展开,而不是单纯比谁的模型更强。

Meta 是开源微调生态的最大推手。Llama 系列持续为开源微调提供基础模型,官方微调指南和最佳实践直接面向企业和领域特定的微调工作。

还有一个关键数据:专有 AI 模型使用率从 2025 年 Q1 的 80% 下降到了 Q4 的 44%。

开源模型在崛起,游戏规则正在改变。企业有了更多微调和定制化的选择,也不再被单一供应商绑架。


五. 钱的问题

聊技术不聊钱,都是耍流氓。

我拉了个三种方法的成本对比:

微调——前期投入高(算力+数据准备),每次推理成本低,维护成本中等(要定期重训),数据成本高(要标注数据),基础设施需要 GPU 集群。

RAG——前期投入低到中,每次推理成本中等,维护成本低(更新知识库就行),数据成本低(文档就行),基础设施需要向量数据库加检索管道。

智能体系统——前期投入中到高,每次推理成本高(多步推理+工具调用),维护成本高(系统复杂),数据成本中等,基础设施需要编排框架加工具集成加监控。

看出来了吗?

高频、窄域、对延迟敏感的任务,微调的长期 ROI 最高。

知识频繁更新、需要灵活性的场景,RAG 的 ROI 更优。

复杂多步骤任务,尽管智能体系统成本最高,但能创造的价值也远超其他方法。

DataRobot 做过分析,智能体 AI 成本更高是因为它得在多步工作流中推理、维护上下文、调用外部工具。Kore.ai 的对比研究也表明,在知识库用例中,RAG 展现出了优于微调模型的性能。


六. 四种知识注入范式的终极对比

EMNLP 2025 Findings 接收了一篇论文(arXiv: 2502.10708),做了目前最系统的知识注入方法分类。

我简化成一张表:

微调/继续预训练——机制是改模型权重,灵活性低,知识深度最高,更新成本高(得重训)。

RAG——机制是外部知识检索,灵活性高,知识深度中等,更新成本最低(改文档就行)。

上下文学习(ICL)——机制是在提示中给示例,灵活性高,知识深度低,更新成本低。

规则注入——机制是结构化规则/提示,灵活性中等,知识深度低,更新成本低。

发现规律了没?

知识深度和灵活性,天然就是一对矛盾。 想要深,就得改权重,改了就不灵活。想要灵活,就得靠外部信息,外部信息的理解深度就有限。

但 2025-2026 年的行业共识已经很明确了:

工具(Tools) 在正确性上胜出——ID、数学、策略检查、实时数据。

RAG 在获取新鲜的组织特定知识上胜出。

微调 在行为塑造和领域风格上胜出。

RAG 是模型的知识库,微调是模型的个性和技能集。最先进的系统同时使用三者。

不是二选一。是各取所长。


七. 所以到底该怎么选?

我的判断很直接:

如果你的目标是"让模型知道更多领域知识"——

是的,工程化方案(RAG + 智能体)在大多数场景下已经是更优解。更灵活、更易维护、成本更低、效果相当甚至更好。

如果你的目标是"让模型以特定方式行事"——

微调仍然不可替代。输出格式控制、风格塑造、行为约束,这些需求工程化手段只能弥补,不能内化。

如果你的场景有特殊约束(延迟、离线、合规)——

微调可能是唯一可行方案。

说到这,我再给一个简单的决策路径:

你的需求是注入事实性领域知识?知识更新频繁就上 RAG,需要多源整合就智能体加 RAG,知识稳定又需要低延迟就考虑微调。

你的需求是改变模型行为或风格?输出格式控制走 SFT,语气风格调整走 RLHF/DPO,简单的行为约束可以先试提示工程。

你的场景有特殊约束?极低延迟就用微调小模型,离线端侧就只剩微调一条路,数据隔离合规就本地微调。

你的需求是复杂工作流?多步骤任务上智能体编排,需要工具调用就智能体加工具集成,需求复杂就全上——微调加 RAG 加智能体的混合架构。


写在最后

写这篇文章的过程中,我翻了很多资料,也想了很多。

说实话,我一开始是想给"微调已死"这个观点找一个确切的答案的。

但翻了这么多资料之后,我发现这个问题本身就有问题。

不是微调死了,是我们对微调的期待变了。

以前我们用微调来"让模型知道更多"。这条路,确实已经不那么划算了。RAG 和智能体做得更好。

但微调真正的价值,从来就不只是"知道更多"。而是"做得更好"。

特定格式、特定风格、特定约束下的可靠行为——这才是微调的不可替代之处。

范式转换已经发生了。从提示工程到上下文工程到智能体套件工程,这不是概念炒作,而是 AI 应用从"单次问答"到"自主工作流"的根本变化。

Harness Engineering 是 2026 年的关键词。套件——而非模型——将决定 AI 系统在生产环境中是否靠谱。

但套件和微调不是对立关系。是互补关系。

就像打游戏,你既需要好的装备(微调),也需要好的操作(工程化方案),更需要好的战术(套件设计)。缺一个都不行。

开源模型正在把门槛踩到地板上。专有模型使用率暴跌,Llama、Qwen、DeepSeek 这些开源模型的崛起,让微调变得越来越平民化。

这让我想起一句话:

工具在变,问题没变。

不管你是用微调还是用 RAG 还是用智能体,最终要回答的问题就一个:怎么让 AI 在你的场景下,可靠地把活干好?

路径不同,终点一样。


以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

更多推荐