这里的“CEO”指的是工作范围。一个开发者,带着几十个Agent,把产品从一个想法一路做到上线。

在Anthropic里,Boris Cherny已经看到了这种工作方式。

在和AMD首席技术官Mark对话中,Boris给这类开发者起了一个很特别的名字:一人军队。

备注:Boris:Claude Code创始人及负责人,Mark:负责AMD的技术和芯片工程,也是AMD首席技术官。

两个人坐在一起讨论起Agent开始独立工作后的现实问题:

一个工程师怎样同时管理10个、100个Agent,企业为什么只给编辑器加一个AI按钮还不够,以及任务跑上几天后,谁来验收和兜底。

这场对谈里,Boris还复盘了Claude Code最初6个月“并不好用”的经历,解释Anthropic如何逐个清理研发瓶颈,并给出一个更激进的预测:Agent接下来会从做功能走向做完整产品。

以下为访谈内容,我们进行了翻译与整理。

Claude Code走出自动补全,模型开始自己选路

Claude Code刚立项时,市面上的AI编程产品大多还在做自动补全。

开发者输入几个字符,模型猜后面的几行代码。

Boris和团队判断,模型很快会越过这一步。它需要读取整个仓库,理解任务,选择工具,自己安排执行顺序。

“We wanted something that was purely agentic.”

Boris Cherny:我们想做一个完全以Agent为核心的产品。

这个判断走在了当时模型能力前面。

Boris坦言,Claude Code最初6个月并不好用。直到2025年5月Claude Opus 4出现,产品才从试验进入可用阶段。

模型能力上来后,产品的控制方式也变了。

过去的工作流由程序员决定:先做第一步,成功后走第二步,失败则进入另一条分支。Boris现在更愿意把目标交给模型,再把上下文和工具交给它。

假设任务是“把订单服务升级到新接口”,开发者不用把每个文件和每条命令都写进提示词。

Agent可以搜索调用点、读取类型定义、修改实现并运行测试。开发者要提前写清兼容范围、验收条件和禁止触碰的边界。

只在编辑器里加个Agent,公司快不起来

Boris引用了一个上世纪90年代的例子。办公室买了电脑,纸、笔和文件柜全部保留,每个工作流也照旧运行。电脑只是被摆在角落里,公司很难获得明显的生产力提升。

很多团队现在也在做类似的事。

开发者有了Claude Code、Codex或Cursor,需求还在文档里排队,测试环境仍然要人工申请,发布要等几轮审批,生产日志又不允许Agent访问。

AI只加速了中间一小段。

今年以来,每位工程师的代码产出提高了8倍。

Boris随后补充,这个结果来自持续处理一个又一个瓶颈。编码速度上来后,团队开始处理代码审查;审查跟上后,再往安全检查、用户反馈、故障处理和市场材料延伸。

“The thing that we did to get the 8x is we systematically improve a bottleneck at a time.”

Boris Cherny:我们之所以能得到8倍提升,是因为每次都系统地解决一个瓶颈。

比8倍这个数字更有参考价值的,是Anthropic找瓶颈的方法。

代码生成已经很快,那就去查PR等了多久、测试环境启动要多久、发布环节是否仍在靠人搬运。哪一步最慢,Agent就先进入哪一步。

代码不再堵路,好想法开始变得稀缺

当编码和一部分审查工作被Agent代替,Boris观察到了一个新限制:团队能不能找到好想法,然后安全地把它推向市场。

“As engineering is no longer the bottleneck, now we’re actually bottlenecked on the speed with which we can get good ideas and bring them to market.”

Boris Cherny:工程实现不再是瓶颈以后,新瓶颈变成了两件事:找到好想法,以及把它推向市场。

他接着说出了“一人团队”和“CEO archetype”。

这种开发者不会只等待一张写好的工单。他会去看客服记录、访谈用户、查业务数据,找到问题后让Agent做出第一版,再带着反馈继续迭代。

这不要求每个程序员去学销售话术。

它要求开发者知道自己做的功能解决了谁的问题,上线后该看哪个指标,用户说“不好用”时去哪里找证据。

团队也要给这种尝试留出空间。

Boris:他的一项工作就是让同事可以安心试验新想法,不会因为一次实验失败就影响绩效评价。

如果一家公司嘴上鼓励AI实验,出错后立即追责,员工很快会回到最保守的用法:让AI改改文案,写几个不重要的函数。这样的工作流很安全,公司也不会得到新的做法。

一人团队,背后是一支Agent团队

一个人能够推动更完整的产品,靠的是调度一支Agent团队,而非同时精通所有职种。

Boris把企业的AI使用分成了一条递进路径:每位工程师从运行1个Agent,发展到10个、100个,再到1000个。

一个Agent时,开发者通常会盯着它工作。

信任建立后,他可以再启动第二个任务,在多个仓库副本和会话之间切换。规模继续上升,Agent就开始调用子Agent,子Agent还可以继续向下拆任务。

“For Claude Code, we support up to five layers now, this kind of nesting.”

Boris Cherny:Claude Code现在最多支持5层这样的子Agent嵌套。

Boris:大多数公司仍然处在单Agent和多Agent并行之间;Anthropic平均处在再往上一层的阶段,许多工程师正在运行几十个甚至上百个Agent。

这是Boris在访谈中对Anthropic内部状态的描述,不能外推成每家公司的目标。

普通团队先把3个Agent管明白,比盲目追求1000个更实际。

一个负责改代码,一个负责跑测试,一个负责检查改动范围。每个任务有独立分支、明确输入、停止条件和失败日志,这才是一支可以继续扩大的Agent团队。

Agent干上几周,人不能只负责点“同意”

任务从几分钟拉长到几天、几周,人工确认的方式也得跟着变。

Boris说,如果Agent每执行一条命令都要问人“是或否”,操作者最后会停止阅读命令,只顾着连续点击“同意”。他自己也曾经忽略Bash命令的具体内容。

“At some point the person actually just stops reading. And they just say yes, yes, yes, because they’re tired of pressing yes.”

Boris Cherny:到了某个时候,人会停止阅读,只是不断点“是”,因为他已经厌倦了反复确认。

Anthropic的做法是在模型训练中增加抗提示注入能力,运行时再用分类器判断高风险动作。人不需要介入每条低风险命令,删除、发布、密钥、生产数据等动作仍然可以设置硬性防线。

开发团队可以先做四件事:

•按命令和资源分级,不要给Agent一个什么都能做的总账号;

•保留完整工具调用和文件修改日志,出问题时可以重放;

•为模型、提示词和工具更新保留固定评测集;

•只把删除、付款、发布等不可逆动作交给人确认。

长任务的信任不来自Agent“从不犯错”,它来自错误能被看到、停下和撤回。

Agent团队背后,还有一笔算力和系统账

Mark Papermaster把话题带回到了AMD正在面对的芯片设计。新制程的物理收益不再像过去那么稳定,工程师却要继续在更大的状态空间里优化更多变量。

“I don’t think we could continue to scale without these agentic workflows.”

Mark Papermaster:如果没有这些Agent工作流,我不认为我们还能继续扩展下去。

这是对开发者容易被忽略的一层。

一个Agent在本地跑几分钟,大概不需要专门基础设施。几十个Agent在云端同时运行,就要处理任务队列、独立环境、上下文存储、计算预算、失败重试和状态恢复。

一次大型代码迁移可以被拆成几百个子任务。如果每个Agent都重复读取整个仓库,Token和计算费用会很快上升。平台得复用索引和上下文,控制并发,并且在收益不足时停止继续扩大。

程序员除了管理代码运行时,还要管理一层Agent运行时。

Claude开始从“做功能”走向“做产品”

访谈结尾,Mark让Boris预测未来2至3年。Boris觉得这个时间跨度对AI来说太长,只愿意谈接下来6个月。

他预计,Agent将运行更长时间,人们会同时启动更多Agent,而且不需要像今天这样频繁纠正方向。

“It won’t just be features. It’s going to be products. We might start to see entire startups being built by Claude.”

Boris Cherny:Claude将不再只构建某个功能,它会开始构建产品。我们甚至可能看到由Claude完成主体工作的创业项目。

这番预测并非是“一个人即将取代一家公司”。而是Agent代替的环节越多,人就越要知道产品为什么存在,结果怎样才算合格,错误发生时怎样停下。

写在最后

Boris所说的“一人团队”,背后有Agent、工具、评测、权限和算力系统。

一个人负责推动产品,系统替他接住大量执行工作。

人保留的工作,是决定做什么,给出业务背景,设置安全边界,并且对上线结果负责。

写代码的速度还会继续提高。会提问题、能看数据、懂用户,也知道怎样让Agent安全交付的开发者,才能把这些速度变成可交付的产品。

参考链接:

https://www.youtube.com/watch?v=BOOfy3Yshtw&t=1s

更多推荐