在这里插入图片描述

🍃 予枫个人主页

📚 个人专栏: 《Java 从入门到起飞》《读研码农的干货日常》《Java 面试刷题指南

💻 Debug 这个世界,Return 更好的自己!

昨晚快十一点,LD突然在微信上问了我一个问题:

DeepSeek 这次更新,模型结构和参数量都没有变化,为什么 Agent 能力却提升了这么多?

他刚看完 DeepSeek-V4-Flash-0731 的评测数据。
在这里插入图片描述

在官方公布的结果中,Terminal Bench 2.1 达到 82.7 分,DeepSWE 为 54.4 分,DSBench-FullStack 为 68.7 分。几个指标都指向同一件事:新版本在终端操作、软件开发和多步骤任务执行方面,进步非常明显。

但奇怪的是,官方说明里又明确提到,新版本的模型结构和参数规模与此前的 Preview 版本保持一致。

既没有扩大参数量,也没有更换模型架构,能力为什么还能大幅提升?

我当时的第一反应也差不多:是不是评测环境变了?是不是宣传口径有水分?还是模型其实偷偷做了更大的调整,只是官方没有说?

我跟主管说,给我一点时间,我也想把这里面的逻辑搞清楚。

后来仔细看完相关说明,我发现答案其实集中在一个经常被普通用户忽略的环节:

后训练,Post-training。

一句话概括这次更新:

DeepSeek 没有重新造一个更聪明的大脑,而是重新教这个大脑如何更好地工作。

一、模型训练的两个阶段:一个决定“懂多少”,一个决定“怎么做”

要理解这次更新,首先要区分大模型训练中的两个主要阶段:预训练和后训练。
在这里插入图片描述

1. 预训练:让模型“读万卷书”

预训练阶段,模型会在海量文本、代码和其他数据上学习语言规律、世界知识、逻辑关系以及一定程度上的推理能力。

这个过程决定了模型基础能力的大致范围。

模型见过多少知识、能理解多复杂的概念、能否发现代码之间的关联,主要都来自预训练。

可以把它理解成一个人的基础教育阶段。

在这个阶段,他读书、学习数学、理解世界,逐渐形成知识储备和思维能力。

从现有说明来看,DeepSeek-V4-Flash-0731 并没有重新进行预训练。它的架构、参数规模和基础模型都没有明显变化。

也就是说,这个模型“脑子里装了多少东西”,大体没有变。

2. 后训练:让模型学会“把事情做完”

后训练发生在预训练之后。

这一阶段通常会使用指令微调、偏好优化、强化学习以及特定任务训练等方式,调整模型的行为模式。

它解决的问题不是模型“知不知道”,而是:

  • 能不能正确理解用户的目标;
  • 能不能把复杂任务拆成多个步骤;
  • 什么时候应该调用工具;
  • 工具返回错误后是否会调整方案;
  • 能不能根据环境反馈继续执行;
  • 是否能在长流程中保持目标一致;
  • 最终能不能把任务真正完成。

这有点像,一个人已经学过编程,也知道各种算法和开发工具,但他未必能独立完成一个真实项目。

他可能会写代码,却不知道先读需求还是先改文件;可能知道怎么运行测试,却经常忘记根据报错继续修复;也可能每一步都会,但无法把十几个步骤稳定地串联起来。

后训练做的,就是训练这种“做事方式”。

因此,DeepSeek 这次的变化可以理解为:

发动机没有更换,但变速箱、驾驶策略和控制系统被重新调校了。
在这里插入图片描述

同一台发动机,经过不同的调校,实际驾驶体验完全可能出现明显差异。

二、为什么提升最明显的是 Agent 能力?

这次公布的成绩,大多集中在 Agent 和代码执行类基准测试上。
在这里插入图片描述

例如 Terminal Bench 2.1,考察的并不是模型能否回答一道终端命令题,而是模型能不能进入一个真实或模拟的终端环境,连续完成操作。

一个任务可能包括:

  1. 查看目录和文件;
  2. 阅读项目代码;
  3. 分析错误原因;
  4. 修改代码;
  5. 安装依赖;
  6. 执行命令;
  7. 运行测试;
  8. 根据报错再次修改;
  9. 直到任务最终完成。

这和传统的单轮问答完全不同。

传统问答更像考试:

给你一道题,请一次性写出答案。

Agent 任务更像工作:

给你一个目标、一套工具和一个不断变化的环境,请你自己想办法把事情做完。

这里真正困难的,往往不是模型缺少某个知识点,而是模型能否形成稳定的行动闭环:

观察环境 → 制定计划 → 调用工具 → 获取结果 → 判断对错 → 调整策略 → 继续执行。

而这种多步骤、长链路、需要根据反馈不断修正的能力,恰好是后训练最容易产生效果的地方。

预训练可以让模型知道 Git、Python、Linux、测试框架和软件工程知识,但它未必天然知道,在一个具体任务里应该先做什么、后做什么,以及失败之后应该如何恢复。

通过针对性的后训练,模型可以反复练习真实或模拟任务,并根据任务最终是否完成获得反馈。

练得多了,模型形成的不是更多“知识”,而是更有效的“工作习惯”。

因此,“模型结构没有变化,但 Agent 能力大幅提升”并不矛盾。

更准确地说:

它的能力上限可能没有发生根本变化,但它把已有能力转化为实际任务结果的效率提高了。

三、同一个模型,为什么后训练差异会这么大?

很多人容易把参数量理解成模型能力的唯一指标。

但参数量只决定了一部分问题。

现实中,即使底座模型相同,不同的后训练方式,也可能训练出行为差异很大的模型。

比如,同样面对一个代码任务,有的模型会立刻开始改文件;有的模型会先查看项目结构;有的模型在运行一次测试失败后就放弃;有的模型则会继续读取日志、定位问题并尝试第二种方案。

这些差异不一定来自知识量,而可能来自训练过程中对不同行为的奖励。

假设训练系统更鼓励以下行为:

  • 修改代码前先理解项目;
  • 使用工具后认真读取返回结果;
  • 失败后继续尝试,而不是直接输出结论;
  • 尽量减少无意义的工具调用;
  • 完成任务后运行测试验证;
  • 在长流程中持续检查目标是否已经达成。

那么经过大量任务训练后,模型就可能表现得更像一个成熟的执行者。

它未必变得更“博学”,但会变得更可靠、更有耐心,也更善于利用工具。

这正是 Agent 产品最看重的能力。

四、接口升级和模型能力升级,不是一回事

除了重新进行后训练,这次更新还涉及 Agent 接口和生态适配。

例如,模型开始支持更加统一的 Responses API,并适配部分代码 Agent 和工具调用场景。

这对开发者很重要。

统一的接口可以更方便地处理模型回复、推理状态、工具调用记录以及多轮执行过程,降低接入 Agent 系统的工程成本。

但需要注意:

接口更好用,不等于模型变得更聪明。

接口升级解决的是“怎么接”的问题。

后训练解决的是“接进去以后,模型能不能把活干好”的问题。

两者会共同改善最终体验,但不应该混为一谈。

举个简单的例子。

一个员工能力很强,但公司的协作系统非常混乱,文件找不到、任务无法流转,他的实际效率依然会很低。

更好的接口,相当于换了一套更顺畅的办公系统。

更好的后训练,则相当于员工本人掌握了更成熟的工作方法。

办公系统不会直接提高员工智商,但它能减少协作摩擦,让已有能力更容易发挥出来。

五、成绩很好看,但还要保留两个判断

虽然这次 Agent 指标提升明显,但在解读评测结果时,仍然需要保持谨慎。

1. 官方环境中的高分,不一定能直接复制到所有产品中

部分测试可能依赖特定的运行环境、工具配置、提示词策略、推理档位以及 Agent Harness。

模型在官方环境中取得高分,至少能够证明:在这套测试配置下,新版本的任务完成能力有明显提高。

但它并不能自动证明,在所有第三方 Agent 框架中都能获得同样的提升。

换到不同的 IDE 插件、代码仓库、工具协议或上下文管理方式后,结果可能发生变化。

Agent 的最终表现从来不只由模型决定,还受到多个环节影响:

  • 系统提示词;
  • 工具描述;
  • 上下文管理;
  • 超时限制;
  • 最大执行步数;
  • 错误恢复机制;
  • 文件和终端权限;
  • 测试环境;
  • 推理预算。

所以,更准确的说法应该是:

DeepSeek-V4-Flash-0731 在官方公布的环境和配置下,Agent 表现出现了明显提升。至于在具体业务中的提升幅度,还需要独立测试。

2. 官方没有公布后训练的完整细节

目前可以确认的是:模型架构和参数规模没有发生明显变化,主要调整集中在后训练阶段。

但究竟使用了哪些训练数据、构建了什么任务环境、采用了怎样的奖励机制、强化了哪些具体行为,官方并没有完整披露。

因此,我们可以判断提升的主要方向,却不能武断地把成绩归因于某一种具体技术。

例如,提升可能来自:

  • 更高质量的软件工程任务数据;
  • 更真实的终端和代码执行环境;
  • 更有效的强化学习奖励;
  • 更长链路的任务轨迹;
  • 对工具调用错误的专项训练;
  • 更强的自我检查和测试意识;
  • 更合理的推理预算分配。

这些都具备合理性,但在官方进一步披露之前,只能视为可能的解释,而不是确定事实。

六、这次更新真正值得关注的是什么?

这次 DeepSeek 更新揭示了一个很重要的行业趋势:

大模型竞争正在从“谁的模型更大”,逐渐转向“谁能把已有能力训练得更好用”。

过去几年,行业经常通过增加参数、扩充数据、提升算力来获得能力提升。

但随着基础模型能力逐渐接近,单纯堆参数带来的边际收益正在下降,而训练成本仍然非常高。

相比之下,精细化的后训练可能是一条更现实的路线。

同样的基础模型,通过更好的任务数据、更真实的执行环境和更合理的奖励机制,就可能在某些场景中获得明显提升。

尤其是在 Agent 领域,用户最终关心的并不是模型会不会背知识,而是它能不能:

  • 真正修改好一个项目;
  • 自动完成一组重复任务;
  • 根据错误继续修复;
  • 正确调用多个工具;
  • 在长流程中稳定执行;
  • 以更低的成本完成工作。

从这个角度看,模型能力的竞争正在从“会不会回答”,转向“能不能交付”。

七、写在最后

回到主管昨晚提出的问题:

为什么 DeepSeek 的结构和参数量都没变,Agent 能力却能明显提升?

答案是:

因为这次改变的不是模型拥有多少能力,而是模型如何组织、调用和兑现这些能力。

预训练更像是在建立知识和能力储备,后训练则决定模型如何面对任务、如何使用工具、如何根据反馈行动,以及如何把一件复杂的事情真正做完。

这次更新实际上包含两件相对独立的事:

第一,重新进行了后训练,强化了多步骤任务执行、工具调用和错误恢复能力,这是 Agent 指标提升的核心解释。

第二,改进了接口和 Agent 生态适配,降低了开发者的接入成本,但这属于工程体验优化,不能直接等同于模型智力提升。

至于这些评测提升能否完整复制到真实业务中,最终还是要放进具体工具链里测试。

毕竟,对于 Agent 来说,真正有价值的从来不是排行榜上的一个分数,而是它能否在你的环境里,把你交给它的事情稳定地做完。

模型有没有变聪明,有时候很难判断。

但它有没有变得更会干活,实际用一次就知道了。

更多推荐