清华新框架:7B模型赢GPT-4,靠的是更聪明的计划
哈喽,我是黑棠。
不微调、不训练、零参数更新,只是换了一种"做计划"的方式。
一个80亿参数的小模型,把GPT-4干翻了。而这个模型本身一行代码都没改。
这就是清华大学深圳国际研究生院和华南理工大学团队刚挂上arXiv的论文,提出**ATG(Atomic Task Graph,原子任务图)**框架。
ATG 智能体的标准五阶段全链路:输入 → 分层递归规划 → 原子任务图表征 → 校验 + 依赖式执行 → 最终输出,附带局部故障修复闭环。
AI Agent 都在走独木桥
先看看现状。
当下ReAct、Reflexion等主流的AI Agent,干活的方式都是一条直线:观察、思考、行动,再观察、再思考、再行动,一根筋走到底。
- ReAct:经典基础范式,循环「思考→执行工具→接收结果观察」,一步接一步往下走;
- Reflexion:在 ReAct 基础上加自我反思复盘,跑完一轮会复盘错误存入记忆再重试,但底层依旧是单条时序链路。


这种串行模式存在致命缺陷:
中间任何一步出错了,错误会沿着链条持续传导,后续操作全部跑偏。而任务步骤越长,模型要回头读的"历史文本"上下文就越长,极易产生幻觉、编造无效动作。。。
在 ALFWorld 家务模拟测试中,ReAct有**42.86%**的执行轨迹里出现了无效或幻觉动作。
接近一半的任务出错。
你让AI去厨房热个菜,它可能中途对着空气操作半天,自己还浑然不觉。
Errors are coupled with previous steps and can propagate along the trajectory. Without an explicit dependency structure, failures cannot be localized to a clear affected region.
错误会和前面的步骤耦合,沿着轨迹一路传播。没有显式的依赖结构,失败就没法被定位到一个清晰的局部。
不是模型不够大,是组织工作的方式错了。
清华把它掰成了一张图
ATG的核心思路:抛弃单线串行执行,把完整任务拆解成一张有向图。
每个节点是什么、依赖谁、产出给谁,全部标注清楚。
然后递归地往下拆,一直拆到每个节点就是单次工具调用的原子粒度:一次搜索、一次计算、一次查询,到这个粒度为止。
互不依赖的任务可并行执行,不用排队等待。

在正式执行之前还有个"思想实验"。系统先在脑子里把整张图预演一遍,提前排查——工具选错了、中间少一步、依赖搞反了等漏洞。仅此一步就能拦截**18.9%到27.4%**存在风险的执行方案。
出错后的修复逻辑也很巧妙。
不用从头重来。系统会顺着任务图的演化历史,定位到出错的那一小块子图,只修那一块,已经验证过的部分全部冻结。类似写文档时只改出错的段落,不需要重写全文。
这套设计还有关键优势:每个原子节点只关心自己那点上下文,不用加载整条冗长历史。上下文短了、聚焦了,幻觉自然就少了。
8B模型凭什么赢GPT-4
研究团队拿Llama-3-8B搭配ATG,对标 GPT-4 + 主流 ReAct 线性框架:
| 基准测试 | ATG (Llama-3-8B) | GPT-4 (ReAct) |
|---|---|---|
| ALFWorld(家务任务) | 63.65 | 41.24 |
| WebShop(网购决策) | 68.36 | 64.34 |
| ScienceWorld(科学推理) | 56.79 | 66.16 |
三项任务里ATG赢了两项,ScienceWorld上GPT-4仍然领先。虽不是"全面碾压",但一个8B模型能对标 GPT-4,表现已经十分亮眼。它的参数量,连GPT-4的一个零头都不到。
两项关键优化指标:
1、幻觉动作率,从ReAct的42.86%掉到12.14%,相对下降71.7%。
2、平均执行步数,从31.42降到18.36,少了将近一半。
更少步骤意味着更低的token消耗,任务结果还更准。
For multi-step tasks, however, performance depends not only on model capability but also on how planning and execution are organized.
对于多步任务,性能不仅取决于模型能力,也取决于规划和执行是如何组织的。
性能瓶颈的钥匙,不在参数量,在组织方式。
搬进你自己的对话框
ATG听起来是实验室里的大工程,但它的内核思想,你用ChatGPT、用Claude的时候就能直接复刻。
核心就一句:把"做计划"和"去执行"拆开,让它们各干各的。
下面几个实操技巧,全都对应论文里的设计机制。
1、做计划,交给最强的那个模型。
复杂任务别让一个模型又当军师又当兵。计划阶段用你最顺手的ChatGPT、Claude,把任务拆清楚、依赖理明白;真正干活的时候,切到GLM-5.2、DeepSeek这类性价比模型就行。计划是脑力活,执行是苦力活,分开用,省钱还更稳。这正是ATG"计划和执行是两个独立阶段"的思路。
2、不知道怎么问,就让AI帮你问。
很多人卡在"我连需求都描述不清"。其实有句万能指令:
改写我的提问指令,让其他AI能给出更高质量的回答。
把你想说的话丢进去,它还你一句专业提问。这一步本质就是ATG的"递归分解":把一个模糊的粗任务,编译成清晰的原子步骤。
3、连需求是什么都不知道,就让AI反过来问你。
换这句:
每次只问我一个问题,逐步理清我的需求痛点,直到你能给出切实可行的落地方案。
让AI当那个追问的人,而不是你绞尽脑汁去表达。条件允许的话,直接开plan mode(规划模式),让模型专门给你设计落地方案,先不写代码、不干活。
4、方案出来了,先别急着动手。
这是最关键的一步。
新开一个对话,把方案丢给AI,让它对抗式审查:找漏洞、挑毛病、追问"如果这里失败了怎么办"。
这一步就是ATG那个"思想实验"的个人版——动手前先在脑子里预演一遍,把危险计划拦在门外。论文数据显示,它能提前拦下将近三成的危险计划。
5、最后,把计划改成分阶段实施。
别让AI一口气干到底,加上一句:
每完成一个阶段就暂停,向我汇报,等我确认再继续。
哪一段出问题,只重做那一段,前面验证过的全部保留。这就是ATG"最小子图修复"的精髓——局部出错,局部修,不推翻全局。
整套操作就是轻量化的穷人版ATG:强模型做计划、AI帮你提问和澄清、动手前对抗审查、执行时分段汇报。
省token、少跑偏、结果更稳。
参考链接:
[1] Atomic Task Graph: A Unified Framework for Agentic Planning and Execution (https://arxiv.org/abs/2607.01942)
更多推荐


所有评论(0)