让Codex越用越懂你?OpenAI团队成员爆火【自我蒸馏】玩法!
🌈个人主页:一条泥憨鱼(欢迎各位大佬莅临)
![]()
前言:
不要让 Codex 只当一次性助手,让它学会自我进化。本文拆解 OpenAI Codex 团队成员 VB 爆火的「自我蒸馏」玩法,并分享实测后的四轮升级方案。
一个让 Codex 自己教自己的玩法
OpenAI Codex 团队成员 VB(之前在 HuggingFace)最近发了一条推文,社区直接炸了。他说的玩法叫「自我蒸馏」。

简单说,就是让 Codex 回看自己的会话历史,把那些你反复手动在做的事情——检查 CI 为什么挂了、审查 PR、写 changelog、追踪 bug、清理 diff——自动转化成 Skill、Sub-Agent 或者定时任务。
我第一次看到的时候,脑子里只有一个念头:这才是 Agent 该有的样子。
不是每次都从零开始,而是让 Codex 越用越懂你,越用越像你自己的手和脑。
VB 的原版思路
核心很简单。不要让 Codex 当一个一次性聪明工具,让它变成一个能不断复用经验、持续升级的工程化 Agent。
具体操作就是给 Codex 一段提示词,让它做三件事:
1. 回看近期会话,找出你反复在做的事
2. 识别哪些是重复模式
3. 把重复工作流沉淀成 Skill,特定角色沉淀成 Sub-Agent,周期性任务做成自动化
普通用户用 Agent:帮我完成这个任务。
高级用户用 Agent:帮我把能力产品化、流程化、自动化。
是两个完全不同的维度。
原版的问题
按 VB 的提示词在自己电脑上跑了一遍,我发现几个明显的坑。
第一,只看「重复」,不看病。
原版让你找重复工作流,但真正卡效率的东西往往不是重复的事,而是那些默默失效的东西。Skill 没触发、Agent 机制压根没转起来、输出物又臭又长没人看——这些不是重复,是断点。
第二,没有评分和反馈。
自我审计怎么衡量好坏?标准是什么?原版没给答案。
第三,资产类型太窄。
只提了 Skill、Sub-Agent、Automation 三类。但实际跑项目的时候,你还需要项目地图、失败案例库、评分器、业务资产缩影……光这三类不够用。
第四,没考虑 Codex 自己的边界。
原版是个通用提示词,没结合 Codex 的 Worker 机制、Agent MD 文档、Skill 触发规则这些官方设计做针对性优化。
这些问题不解决,自我蒸馏就是个查重工具,离真正提升 Codex 的能力还差得远。
第一轮升级:基于本地 Codex 找真正的问题
先让 Codex 基于本地的使用记录做自我分析。结果它挖出来的问题比想的多得多:
- Skill 没有正确触发
- Agent 机制没跑起来
- 输出物过厚,啰嗦,没人精炼
- 缺少 loop 和反馈闭环
- 项目地图缺失
- 失败案例没有沉淀
- 业务价值优先级乱七八糟
这些,原版提示词一个都没扫出来。
因此可以把自我蒸馏的维度从找重复扩到这12 个扫描项。

这一轮的核心变化:从经验沉淀变成问题驱动。不是找什么可以复用,是找什么在拖慢你。
第二轮升级:基于 Codex 官方机制加固
第一轮解决了扫什么。第二轮解决怎么扫。
Codex 有自己的官方机制:Worker 并行执行、Agent MD 定义角色行为、Skill 触发规则决定什么时候调用什么、Scale 功能打包重复工作流。可以让 Codex 基于这些机制重新设计自我蒸馏流程。
比如 Skill 触发失败,不只记录,要分析触发条件写得合不合理。Agent MD 文档不只是写出来,要纳入沉淀资产。Worker 机制不只是知道有这个东西,要强制跑起来。
这轮之后,自我蒸馏不再是通用提示词 + 本地数据。变成了官方机制 + 本地问题 + 系统优化的一整套东西。
第三轮升级:抽象出通用版提示词
两轮迭代完,我整理了一个通用版的自我蒸馏提示词。
这个版本不绑定任何本地路径或项目,自动探测电脑上的项目、产物和历史,基于 Codex 官方机制设计,包含 12 维扫描体系。
流程分四步:
1. 扫描 — 自动探测本地项目、会话、Skill、Agent、输出物
2. 诊断 — 基于 12 个维度找出问题和断点
3. 生成 — 产出候选的 Skill、Sub-Agent、Automation
4. 验证 → 升级 — 测试候选资产有没有效,有效才正式纳入系统
跑一轮,Codex 比上一轮更懂你。跑十轮,它从一个聪明的工具变成了一个懂你的同事。
这到底是什么
很多人理解错了自我蒸馏。
它不是模型自己训练自己(Self-Improvement 在别的地方是这个意思)。
它是:Agent 执行任务 → 留下记录 → 回看记录 → 识别模式 → 打包资产 → 下次调用 → 继续优化。
一个闭环。每跑一圈,Agent 多一层经验。跑一百圈,它就积了一百层经验。
这其实就是为什么有人说 AI 在替代人的工作。因为你每教它一次,它就学会一套。教它一百次,它就有了你的工作 DNA。
普通用户 vs 高级用户
普通用户用 Codex:打开 → 描述需求 → 拿结果 → 下次从头来。
高级用户用 Codex:打开 → 描述需求 → 拿结果 → 让 Codex 分析这次对话 → 识别可复用部分 → 生成 Skill 或 Agent → 下次直接调用 → 继续优化。
普通用户每次都在教,高级用户每次都在培养。Codex 不是工具,是实习生。你教得多它就更懂你,你培养得好它就更独立。
自我蒸馏,就是把培养实习生的过程自动化了。
怎么开始

如果你也想试,我建议这个顺序:
1. 先用 VB 的原版提示词跑一次,看能扫出什么
2. 别只看重复,把断点、失败、输出物厚度、评分这些维度加进去
3. 结合你本地的真实数据——你有什么 Skill、什么 Agent、什么输出物——让 Codex 分析真实的
4. 先产出 candidate,验证通过再正式用,别一开始就追求完美
5. 每周或每月跑一次。Codex 会越用越像你的东西
实际上 VB 这条推文之所以炸,不是因为它多复杂,而是它捅破了一层窗户纸:我们一直在让 Agent 替我们干活,但从来没想过让 Agent 学会怎么干得更好。自我蒸馏,就是这层窗户纸的另一边。
更多推荐



所有评论(0)