作为每天深度使用 Claude Code、Cursor 与私有 Agent Harness 的一线后端架构师,最近我一直在反思一个问题:

为什么模型参数越来越大、推理评测分数越来越高,但有些时候,我们在日常项目里使用 AI Agent 反而觉得它变“钝”了、变“啰嗦”了?

直到 2026 年 9 月 4 日,OpenAI Codex 团队的核心架构师 Eric Provencher(@pvncher) 发布了一篇极具震撼力的技术长文——《Rethinking skills and prompts for GPT-6 Astra》

读完之后我恍然大悟:不是新一代模型变钝了,而是我们这帮工程师,还在用一年前针对 GPT-5.6 Sol / Luna 时代定制的“臃肿脚手架”去束缚最新的 GPT-6 Astra!

今天这篇实战长文,我将结合 OpenAI 官方的建议与实际工程代码,带大家对项目中的 Skills 体系AGENTS.md 规范以及 Prompt 交互模式 进行一次彻底的重构实践。


一、 Skills 重构实战:从“过度自信”到“渐进式路由”

很多同学在给 Agent 开发或引入 Skill 时,往往把它当成一个带有大段 System Prompt 的粗糙文件。

在 GPT-6 Astra 时代,这种搞法会导致两大底层灾难:

  1. 上下文截断(Context Truncation):已注册的所有 Skill 描述会在 Session 初始无条件占位。描述过长会导致宿主环境启动强制 Truncation,让模型失去辨识力;
  2. 抢麦效应(Pick-me Energy):过于宽泛的描述会导致误命中,把简单的单点修改带入复杂的无用工作流中。

❌ 重构前的“负面教材”(Bad Skill Description)

<!-- skills/db_migration/SKILL.md (反面教材) -->
---
name: db_migration
description: Comprehensive database expert tool for handling everything about SQL, tables, column migrations, schemas, ORM queries, performance indexing, and database backups.
---

# Instructions
1. Every time you touch a database file, read docs/db_architecture.md.
2. Step 1: Dump the database schema.
3. Step 2: Write raw SQL DDL.
4. Step 3: Run migration script and check error logs.
5. Step 4: Ask human for confirmation before touching any records.

问题分析

  • 这个描述充满了“抢麦冲动”,哪怕开发者只是想加一个普通的 is_active 过滤条件,Astra 也会被迫触发该技能;
  • 内部把操作步骤定死成保姆式菜谱,完全剥夺了 Astra 自主分析 ORM 代码的能力。

✅ 重构后的“渐进式路由规范”(Good Router Skill)

<!-- skills/db_migration/SKILL.md (推荐范式:轻量路由) -->
---
name: db_migration
description: Executes and rolls back schema-altering migrations for production databases. Do NOT use for standard ORM queries, typo fixes, or local schema inspection.
---

# Database Migration Router

When executing a schema-altering database migration:
- Review the targeted migration guidelines: [schema_rules.md](references/schema_rules.md)
- Execute the migration dry-run script: `python scripts/dry_run.py`
- If validation fails, inspect the generated logs and fix discrepancies.

For deeper architectural context or rollback playbooks, refer to `references/rollback_playbook.md` on-demand.

改进亮点

  • 极其克制精准的描述:明确了“何时用”以及“何时不要用(Do NOT use...)”,极大降低误触发率;
  • 渐进式揭示(Progressive Disclosure):主文件仅保留不到 20 行的轻量级路由,沉重的规范与回滚手册全部移至 references/,只有在真正需要时才懒加载入上下文,极其节省 Token。

二、 AGENTS.md 瘦身:消除不必要的全局防御性条款

在团队代码仓库里,AGENTS.md 是一个全局生效的文件。因此,任何一条低效规则,都会在后续成千上万次变更中被按比例持续扣税。

❌ 旧版臃肿规则:处处设防,人人自危

<!-- 旧版 AGENTS.md 片段 -->
1. 在对任何代码进行修改之前,你必须使用 find 工具完整遍历目录,并通读 README.md 和 ARCHITECTURE.md。
2. 每次完成单行代码编辑后,必须强制运行全部单元测试套件。
3. 严格禁止在没有获得用户显式授权的情况下执行任何终端指令。

在 GPT-6 Astra 看来:

  • 哪怕用户只是让你改个注释里的错别字,它也必须先去把几万行的架构文档通读一遍,带来数十秒的白白等待和上万 Token 的算力浪费;
  • 第三条的过度恐吓,导致 Astra 表现得极其谨慎(Tentative),写完一个函数就立刻中断停下来问你:“我是否可以保存?我是否可以运行检查?”,极度打断人类思路。

✅ 新版精炼准则:分级放权,闭环自驱

<!-- 新版精炼 AGENTS.md -->
# Engineering Principles for GPT-6 Astra

## 1. Context Navigation
- Locate files contextually via symbol search or targeted ripgrep. Avoid sweeping whole-repo read operations unless specifically requested for architectural audits.

## 2. Autonomous Local Test Permission
- Local tests utilize isolated mock fixtures with zero production risk.
- **Permission Granted**: You are authorized to run local test suites, analyze failure tracebacks, implement fixes, and re-run tests autonomously without prompting for human approval at each step.

## 3. Decision Boundaries
- Stop and request confirmation only for: external API network calls, database drop operations, or modifying core CI/CD deployment pipelines.

实测效果

  • 剔除了强制全仓预读后,简单任务的首字响应与交付时间缩短了 65% 以上
  • 明确赋予本地测试自驱权限后,Astra 能够一口气自主完成“编码 -> 单测报错 -> 自动捕获 Traceback -> 修复 Bug -> 测试全绿”,体验丝滑流畅!

三、 提问范式转变:用“完工定义(DoD)”驱动深度交付

很多开发者从旧模型切换到 Astra 时,最常抱怨的一句话是:“它怎么写了个开头就停下来了?”

Eric Provencher 在长文中指出,这是因为 Astra 具有更强的人机协作分寸感。面对一条边界模糊的需求,它倾向于快速交付第一版实现,然后等待你的审查。

如果你希望它持续深入地完成端到端任务,你必须改变提问习惯,将过去对过程的指手画脚,升级为对最终成果的验收准则(Definition of Done)

❌ 传统的弱指令提问

“帮我给 User 服务加一个导出 Excel 的功能,快点写。”
(结果:Astra 生成了一个基础 Controller 方法,然后停下等待你的确认。)

✅ 契约式的 DoD 驱动提问

“请为 User 服务实现导出 Excel 功能:
1. 支持百万级大数据的流式分页导出,避免内存溢出;
2. 运行本地测试 pytest tests/test_export.py 验证各种边界条件(空列表、非法字段、超时拦截);
3. 自主排查并修复所有测试失败用例;
4. 完工定义:直到所有测试通过且生成完整覆盖率报告后,再向我交付最终代码与验证总结。”

在这种提示词下,Astra 会将完整的自治权限与明确的目标对齐,在沙箱环境中自发循环调试,交出一份真正开箱即用的高分答卷。


四、 总结

大模型的发展史,就是一部不断淘汰冗余胶水代码与人为约束的历史。

面对 GPT-6 Astra 这样具备高阶推理与自省能力的新一代智能体:

  1. 精简 Skills:践行渐进式揭示,根文档只做最小路由;
  2. 给 AGENTS.md 减负:按环境分级授权,让安全沙箱测试全自动跑起来;
  3. 拥抱 DoD:把精力从盯细节,转向立规矩、定标准、验结果。

现在就去检查你的项目代码库吧,卸下历史沉疴,让你的 Coding Agent 真正迎来飞驰时刻!

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐