本文深入探讨了AI编程的核心技术演进,从基础的Prompt Engineering到高级的Loop Engineering,详细解析了Context Engineering和Harness Engineering的关键要点。文章强调AI编程的重心已从简单的提示词优化转向设计一套完整的Agent工作系统,并提供了实用的Claude Code和Codex loop原语应用指南。特别指出,四层技术并非简单的阶梯式进步,而是相互嵌套的体系,缺一不可。最后,文章提出了落地的实践建议,帮助读者逐步掌握AI编程的精髓,实现编程效率与质量的双重提升。

图片


过去一年,几乎每个用 Claude Code、Codex、Cursor 写代码的人都遇到过同一种割裂感:有时候像开了挂,一天推进一个模块;有时候像带了个实习生,改了半天还在原地打转。

很多人把这归因于"模型不行"。但如果你最近读外网那批一线工程师的文章,会发现他们早就不在这个问题上纠缠了。他们讨论的关键词,从 Prompt Engineering,变成了 Context Engineering、Harness Engineering,最近又冒出一个 Loop Engineering。

这背后是一件正在发生的事:AI 编程的重心,正在从"写好一句提示词",移到"设计一套让 Agent 干活的系统"。

以前我们问的是:“我该怎么问 AI?”
现在更要紧的是:“我该如何组织 AI 干活,并且在它干错时不背锅?”

这篇文章会把这四层一次性讲透——包括外网最近才落地、Claude Code 和 Codex 现在都已经内置的那套 loop 原语。但我想先说清楚一个很多文章故意不提的前提:这四层不是"越上面越高级"的进步阶梯,上层用错了,比不用还危险。 我们最后会回到这一点。


  1. Prompt Engineering:把一句话说清楚

最早大家用 AI,注意力几乎全在提示词上:

你是一个资深 Java 架构师,请帮我优化下面这段代码。

提示词工程的价值是真实的。OpenAI、Anthropic、Google 的官方指南其实高度一致地强调几件事:指令清楚、用分隔符把指令和上下文隔开、输出格式明确、给例子、定义成功标准、反复迭代。Anthropic 甚至特别强调:在优化 prompt 之前,先定义"什么算成功"以及怎么评估。

所以提示词工程不是咒语学。它的本质是:把你的意图,翻译成模型更容易理解的形式。

但问题在于,当 AI 开始读文件、调工具、跑命令、处理多轮任务时,光靠一句话就不够了。真实工程里,AI 翻车往往不是"没听懂这句话",而是:它不知道项目背景、不知道哪些文件重要、不知道哪些规则碰不得、不知道之前在哪栽过、不知道该跑哪个测试、不知道什么时候该停。

这就把问题推进到了第二层。


  1. Context Engineering:给 AI 此刻该看的信息

Karpathy 和 Shopify CEO Tobi Lütke 在 2025 年都公开推过一个说法:比起 Prompt Engineering,Context Engineering 是更准确的描述。

为什么?因为对一个复杂任务来说,AI 能不能做对,不只取决于你问得好不好,更取决于它此刻手里拿到的是什么信息。

Anthropic 给 context engineering 下的定义很直接:context 是模型推理时纳入的那一组 token;上下文工程,就是优化这些 token 的"效用",让模型在有限的上下文窗口里稳定地完成目标。它不只包含 prompt,还包括系统指令、工具、MCP、外部数据、消息历史。

这句话值得改写我们旧的判断方式:

旧判断:AI 答得不好 = prompt 写得不好
新判断:AI 答得不好 = 它拿到的信息不对、不够、太乱、过期,或互相打架

举个例子。你让 AI 修一个"登录按钮点了没反应"的 bug。如果只丢一句"帮我修一下",它只能猜。但如果你给它:相关页面文件、登录表单组件、接口调用代码、浏览器报错、最近一次提交 diff、项目约束、跑测试的命令、不许动的文件——准确率会肉眼可见地提升。

所以上下文工程的核心,不是"prompt 写多长",而是"下一步该进什么、不该进什么、要压缩什么、要实时检索什么、要常驻什么"。 一个好的 CLAUDE.mdAGENTS.md、文件索引、测试命令、架构说明,本质上都是 context engineering 的产物。


  1. Harness Engineering:把"会写文本的模型"包装成"能干活的 Agent"

图片

如果说 Prompt 是"怎么说",Context 是"给什么",那么 Harness 就是:你给 AI 配了什么工具、权限、约束、反馈和运行环境。

Addy Osmani(Google Cloud AI 总监)在《Agent Harness Engineering》里用了一个被反复引用的公式:

Agent = Model + Harness

模型本身不是一个完整的 Agent。模型只有被工具、上下文策略、hooks、沙箱、子 Agent、反馈循环、恢复路径包起来,才变成一个真正能干活的 Agent。

这解释了一个反直觉的现象:Claude Code、Codex、Cursor、Cline、Aider 底层可能接近似的模型,但体验天差地别。差的不是模型,是 harness。 一个不错的模型配一套好 harness,会跑赢一个更强的模型配一套烂 harness。

一个 coding agent 的 harness 通常包括:系统提示词、项目级规则文件、工具调用能力、文件读写权限、命令执行权限、沙箱、测试命令、错误恢复机制、上下文压缩、日志追踪、子 Agent 编排、人工确认点。

Harness Engineering 最核心的工作方法,Addy 给它起了个很形象的名字——棘轮原则(the ratchet principle):harness 只收紧,不放松。 每当 agent 犯一次错,你不去手改它这一次的输出,而是改外层系统,让这个错"以后再也不可能发生"。

诊断的时候,你要分清楚"它为什么犯错":

它不知道某条约定          → 写进 CLAUDE.md / AGENTS.md
它知道但违反了            → 加一个 hook 强制拦截
它缺信息                  → 加一个 skill 或 MCP 把信息喂进去
它用了危险命令            → 收紧权限 / 沙箱拦截
它的上下文被污染了        → 用 subagent 做隔离
它在 40 步的大任务里迷路   → 拆成 planner / executor / reviewer

注意这里发生了一件事:Prompt 和 Context 并没有"被淘汰",它们被重新归类成了 harness 里的两个组件。 这是后面理解四层关系的关键。


  1. Loop Engineering:让系统去 prompt Agent,而不是你

图片

再往上一层,就是外网最近(2026 年 6 月)讨论度飙升的 Loop Engineering。它不是 Addy 一个人的提法,Addy 在文章里引了两个一线的人:

  • Peter Steinberger:“你不该再 prompt 你的 coding agent 了。你该设计去 prompt 它们的 loop。”
  • Boris Cherny(Anthropic 的 Claude Code 负责人):“我不再 prompt Claude 了。我让 loop 跑着,由它去 prompt Claude、决定下一步做什么。我的工作是写 loop。”

一句话概括 Addy 的定义:Loop engineering 就是把"那个不断 prompt agent 的人"——也就是你——替换掉,改成设计一个系统,让系统去 prompt agent。

回想一下你过去和 AI 编程的样子:

你:帮我实现功能      AI:写一版
你:报错了            AI:修一版
你:测试没过          AI:再修一版
你:你改错文件了      AI:重新改

在这个过程里,人其实在充当"循环控制器":分配任务、复制错误、要求修复、要求测试、提醒边界、判断是否继续。Loop Engineering 要做的,就是把这些人工操作工程化。

4.1 一个 loop 需要五个构件 + 一处记忆

这是最值得你今天就抄走的部分。Addy 总结了一个 loop 真正需要的五件东西,而且 Claude Code 和 Codex 现在都已经内置齐了:

构件 作用 在 Claude Code / Codex 里
① Automations(心跳) 让 loop 真的"转起来",定时自动发现和分诊任务 /loop 定时重跑、cron、hooks、GitHub Actions
② Worktrees(并行隔离) 多个 agent 并行时不互相踩文件 git worktree--worktree flag、isolation: worktree
③ Skills(知识沉淀) 不用每次重讲项目背景 SKILL.md (一个目录 + 指令 + 可选脚本)
④ Plugins / Connectors 把 agent 接进你已有的工具 MCP servers
⑤ Sub-agents(职责分离) 一个写代码,另一个来审 subagent 编排
⑥ Memory(外部记忆) agent 每轮失忆,状态必须落盘 prd.json / progress.txt / AGENTS.md / Linear board

第六件"记忆"看着像废话,但它是整套机制的承重墙。长循环之所以能稳定跑,不是因为模型记性好,恰恰相反——模型设计上就是失忆的,所以状态必须活在磁盘上,而不是上下文里。 用 Addy 的话说:“agent 会忘,但 repo 不会。” 每一轮都从干净状态启动,从盘上读够状态再继续——这同时也顺手解决了上下文越积越乱的问题。

4.2 /loop/goal:谁来判断"做完了"?

这里有个容易被忽略、但极其关键的区分:

  • /loop:按你设的节奏重跑。
  • /goal:一直跑到你写的某个可验证条件成立为止,而且——每一轮结束后,由另一个独立的小模型来判定"是否达标"。

也就是说:写代码的 agent 不当自己的裁判。 你给它一句"test/auth 下所有测试通过,且 lint 干净",然后就可以走开了。Codex 里也叫 /goal,同样是"跑到可验证的停止条件成立",支持暂停、恢复、清空。

这就是 Loop Engineering 真正的厉害之处:它不是让 AI 一次性变聪明,而是让 AI 通过执行 → 验证 → 修复 → 再验证,逐步收敛——而验证这一环,有一个它自己骗不过去的裁判。

4.3 Claude Code 和 Codex 的 loop 和 goal

图片

总结:两家殊途同归,五个构件全都齐了。这就是 Addy Osmani 文章里说的"你不用再争论哪个工具更好,因为它们长成了同一个形状"。

loop 和 goal 是 Loop Engineering 吗?

/loop 和 /goal 是 Loop Engineering 的原语(primitive),但不等于 Loop Engineering 本身。

打个比喻: /loop 和 /goal 是螺丝刀和扳手——工具。

Loop Engineering 是你设计整条流水线的能力——用这些工具搭出什么系统。Loop Engineering 的完整含义是:你不再是那个坐在终端前反复 prompt agent 的人。

你设计一个系统——由系统去 prompt agent、分配任务、验证结果、记录进度、决定下一步。

你的工作从"写 prompt"变成"写 loop"。

具体来说,一个真正的 loop 需要你设计五件事:

  1. 心跳(用 /loop 或 cron 让它定时自转)。

  2. 隔离(用 worktree 让并行 agent 不踩文件)。

  3. 知识(用 skills / CLAUDE.md 让它不用每次重学项目)。

  4. 连接(用 MCP 插件接入你的工具链)。

  5. 分权(用 sub-agent 让"写的"和"审的"不是同一个)。

  6. 外部记忆(状态落盘,因为 agent 每轮都失忆)。

只是敲一行 /loop 不叫 Loop Engineering——就像只是打开 VS Code 不叫软件工程。

/loop让 loop 成为可能;但怎么拆任务、怎么设停止条件、怎么控 token 预算、怎么 review 产出、怎么在 agent 犯错后收紧 harness——这些"设计决策"的总和,才是 Loop Engineering。

Boris Cherny(Claude Code 负责人)的那句话最准确:“我不再 prompt Claude 了。我让 loop 跑着,由它去 prompt Claude、决定做什么。我的工作是写 loop。”


  1. 四层不是楼梯,是套娃

图片

很多人(包括这篇文章的初稿)会把四层画成一个"越往上越高级"的金字塔。但更准确的关系是嵌套,不是并列递进:

  • Context 把 Prompt 包进去——prompt 只是上下文里的一种 token。
  • Harness 把 Prompt + Context 一起包进去——它俩成了 harness 的组件。
  • Loop 又把整个 harness 包进去——loop 就是"会按节奏自转、会派小弟、会自己喂自己"的 harness。

所以它们的真实关系更像俄罗斯套娃。一句话各自概括:

Prompt  = 把一句话说清楚
Context = 准备好一桌资料
Harness = 搭好工具台和安全围栏
Loop    = 让整套东西在流水线上自己转

四层缺一不可,但缺的方式不同:

  • 只有 prompt,没有 context → AI 瞎猜
  • 只有 context,没有 harness → AI 乱用工具
  • 只有 harness,没有 loop → 还得你一直在旁边催
  • 只有 loop,没有验证 → AI 只是在自动化地、批量地犯错

最后一条最危险,也是下一节的主题。


  1. 没人愿意讲的另一半:loop 的反作用力

图片

到这儿,大部分文章会收在"快上 loop,这是未来"。但如果只讲到这,我就是在带你跳坑。Addy 本人对 loop 的态度是一句"我持谨慎(I’m skeptical)",而他原文里最值钱的一段话,几乎所有转述都漏掉了:

同一个 loop,两个人能跑出完全相反的结果。一个人用它在自己吃透的领域里跑得更快;另一个人用它来逃避理解工作本身。loop 不知道区别——但你知道。

所以 loop 工程比 prompt 工程更难,不是更简单。落地之前,至少把这三件事想清楚:

① 成本不是小事。 Addy 直说:“你必须非常小心 token 成本。” loop 一旦自转起来,消耗是会失控的——token 富裕和 token 紧张的人,用同一个 loop 会得到完全不同的账单。在你把任何东西挂上 /loop 之前,先想好预算上限和熔断条件。

② 你的 review 带宽才是真正的天花板。 worktree 解决了"机器层面的文件冲突",但没解决"人层面的审查瓶颈"。Addy 把这叫"编排税(orchestration tax)":你能同时跑几个 agent,不取决于工具,取决于你一天能认真 review 多少 PR。开十个并行 loop、然后闭着眼睛全 merge,不是高效,是埋雷。

③ 别把"按 enter 的人"当成"工程师"。 Addy 的原话很重:“去搭你的 loop,但要像一个打算继续当工程师的人那样去搭,而不是只当那个按下启动键的人。” loop 的杠杆点,是放大你"已经理解的东西";它不会替你理解任何东西。


  1. 明天早上你可以这样开始

不用一上来就搭全自动 loop。给一条最小路径,今天就能跑:

  1. 1. 先写一个能用的 harness。 在仓库根目录建 CLAUDE.md / AGENTS.md,把"这个项目怎么跑测试、哪些文件不许动、出了什么事故所以现在不那么做"写进去。这是回报最高、成本最低的一步。

  2. 2. 加一道验证关。 给 hook 接上 typecheck / lint / test,让失败信号能回流给 agent。没有验证的自动化,只是在加速犯错。

  3. 3. 棘轮起来。 agent 每犯一次错,别只改这次的输出——改 harness,让它下次不可能再犯。坚持两周,你的 CLAUDE.md 会肉眼可见地长出"团队记忆"。

  4. 4. 最后才上 loop。 当你的单 agent 已经稳定、验证关已经可靠、预算熔断已经想清楚,再用 /goal 把一个边界清晰的小任务交出去,且每个问题最多自动修 3 轮、3 轮不过就停下来报卡点,不许扩大改动范围。


  1. 一段可直接复制的 Agent 规则模板(P-C-H-L 四层)

下面这段可以直接放进 CLAUDE.mdAGENTS.md、Codex 项目规则或某个 skill 里。相比初版,我把第四层换成了真实的 loop 原语和成本边界:

# Agent 工作规则:P-C-H-L 四层循环

## 1. Prompt 层:理解任务
- 先复述任务目标与成功标准,明确"不做什么"。
- 未理解前不要直接改代码。

## 2. Context 层:收集上下文
- 先读相关文件、项目规则、测试与接口定义。
- 不凭空猜业务规则;上下文过大时先生成摘要和文件索引。

## 3. Harness 层:执行边界(棘轮:只收紧不放松)
- 每次
## 4. Loop 层:验证闭环(写代码的不当自己的裁判)
- 每个任务按 Plan → Act → Verify → Reflect → Iterate → Stop 执行。
- 用可验证的停止条件,例如:"test/auth 全部通过且 lint 干净"。
- 状态落盘:进度写进 progress.txt,任务清单维护在 tasks.json。
- 每个问题最多自动修复 3 轮;3 轮仍失败则停止、报卡点,不扩大范围。
- 成本边界:单次循环 token / 时长超过 [上限] 立即暂停并汇报。

  1. 为什么这件事值得你认真对待

AI 编程的核心竞争力,正在从"谁会写 prompt",转向"谁会设计 Agent 工作系统、并且为它的产出负责"。开发者的能力模型在变:

过去:写代码 + Debug + 架构
现在:写代码 + Debug + 架构
     + Context 组织能力
     + Harness 设计能力
     + Loop 编排能力
     + 对自动化产出的判断与 review 能力  ← 最容易被忽略,也最值钱

真正的分水岭,不在于你用 Claude、Codex 还是 Cursor。分水岭在于两件事:

  • 你是在"问 AI 问题",还是在"设计一套让 AI 干活的系统"?
  • 你是那个"理解工作、用 loop 放大自己"的人,还是那个"用 loop 逃避理解、闭眼按启动键"的人?

  1. 一句话总结

Prompt   让 AI 听懂你说什么。
Context  让 AI 知道该看什么。
Harness  让 AI 在安全边界内使用工具(棘轮:只收紧不放松)。
Loop     让系统去 prompt AI,持续执行、验证、收敛——但裁判不是它自己,买单的是你。

提示词工程是人与 AI 的对话技巧;上下文工程是 AI 的信息架构;Harness 工程是 AI 的运行环境;Loop 工程是 AI 的工作流水线。

但最后那台流水线归谁负责、烧谁的预算、由谁来 review——这部分永远是你的。未来 AI 编程拼的不是谁 prompt 写得更花,而是谁能把 AI 组织成一个稳定、可控、可验证、可复用、且自己拎得清边界的工程系统。

最后

如果说程序员已经是高薪职业,那么干AI的程序员,就是高薪中的高薪。

图片

现在的市场,已经用数据给程序员指明了方向:学AI大模型,就是冲刺高薪的最优解!

图片

看着身边越来越多的同行转型大模型、拿到高薪offer,很多人心里都动了心,但真正的难题来了:零基础小白不知道从哪入门?有基础的程序员找不到系统学习路径?实战项目练手无门?面试不知道考什么?

别慌!今天就给大家整理了一份【2026年最新版】AI大模型免费学习资源包,覆盖从入门到实战、从理论到面试、从基础到进阶的全流程,所有资料均已整理归档,无冗余、无套路,免费分享给每一位想抓住AI风口的程序员和小白!

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

1、大模型系统化学习路线

在这里插入图片描述

2、大模型学习书籍&文档

在这里插入图片描述

3、AI大模型最新行业报告

在这里插入图片描述

4、大模型项目实战&配套源码

img

5、大模型大厂面试真题

img

四阶段精细化学习规划(附时间节点,可直接照做)

结合上述资源,给大家整理了一份可直接落地的四阶段学习规划,总时长约2个月,小白可循序渐进,程序员可根据自身基础调整节奏,高效掌握大模型核心能力,快速实现从“入门”到“能落地、能面试”的跨越。

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范
第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署
第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建
第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

6、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
在这里插入图片描述
在这里插入图片描述

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

https://mp.weixin.qq.com/s/RUSTEmAy6wQRx5sjOAXd4g

更多推荐