2026年5月24日,George Hotz 在自己的博客上写了一篇文章,标题叫《The Eternal Sloptember》。

Sloptember 是他生造的一个词——Slop(垃圾代码)+ September(九月)。他的意思很明确:整个行业正在经历一场漫长的"垃圾代码之秋",而 AI coding agents 是这场灾难的主要推手。

这位17岁就破解了 iPhone、被索尼起诉过的传奇黑客,在文章里说了一句话:

“AI agents 进入软件开发,将成为该领域历史上最昂贵的错误之一。”

然后,整个英语技术社区在几个小时内分裂成了两派。

“I’m calling it now, the adoption of AI agents into software development will be one of the most costly mistakes in the field’s history. Agents cannot program, and it’s taking longer and longer to realize that they can’t. They are a highly sophisticated statistical model designed to mimic the distribution of programming.”

互动数据:1488赞 / 293转发 / 941收藏 / 56.7万浏览


一、Hotz 的六年反转

在说 Hotz 的论点之前,有必要先交代一个背景。

2024年,Hotz 还在说"o1-preview 是第一个真正能编程的 AI 模型"。那时候他是 LLM 的乐观派。

2026年,他站到了 Yann LeCun 和 Gary Marcus 那一边——后者是 AI 领域著名的"怀疑论者",始终认为 LLM 不可能真正拥有智能。

六个月的反转,不是情绪化的撤退,是 Hotz 所说的"真正试过了"之后的结论。

他在这六个月里做了什么?

  • 用 Agent 重写了 tinygrad 的部分代码
  • 用 Agent 逆向工程了一个 USB PCIe 芯片
  • 测试了各种模型、各种 harness、各种 prompt 组合

结论是什么?“每次我都觉得自己手动做,会更好更快。”


二、Hotz 的核心论点

Hotz 的论点不是情绪性的抱怨,而是有一套完整的逻辑链条。

第一层:LLM 在模仿,不在理解。

Hotz 区分了两种能力:解决问题 vs. 模仿解决问题的分布。

他说:“LLM 是一个高度精密的统计模型,被设计用来模仿编程的分布。输出是残缺的,但残缺的方式越来越难检测——而这恰恰是你对一个越来越准确的统计模型所期望的。”

这句话什么意思?

一个不够准确的统计模型,生成的代码漏洞百出,一眼就能看出问题。但一个越来越准确的统计模型,生成的代码看起来越来越像样——但问题藏在更深的地方:逻辑是对的,格式是对的,但业务语义是错的;测试能跑,但测试本身被注释掉了。

第二层:检验机制失效了。

Hotz 提出了一个深刻的问题:人类判断代码质量的方式,是通过"过程假设"来推断"结果质量"的。

我们看到一段漂亮的代码,会假设写它的人经过了思考、测试、迭代——一个类人的创作过程。这个假设在以前是可靠的。

但现在,这个假设已经不成立了。

第三层:大公司比个人更危险。

这是 Hotz 最有洞察力的论点。

他说,在高绩效的个人和小团队里,Agent 反而没那么危险。因为这些人有一个共同特征:强大的错误校正能力。他们能分辨什么是"看起来对但实际错"。

“这些人会花时间去探索和调整——什么时候用它,什么时候信它,怎么用它——但我没见过他们任何一个人不仔细阅读和理解每一行代码的,除了在某些封闭领域。”

但大公司不一样。

“反馈循环慢,利益对齐差。底层员工没有这种自我检查能力。他们用 Agent 产生了10倍的输出。你觉得这个组织的平均输出质量在发生什么?”

GitHub 的数据给了他支持:AI agent 产生的 PR(Pull Request),从2025年9月的400万,飙升到2026年3月的1700万。半年,四倍多的增长。

Hotz 的解读:数量井喷,不代表质量提升。这更像是一场"垃圾代码的黄金时代"。

第四层:苹果是个完美的压力测试。

Hotz 透露,苹果正在给所有工程师强推 AI。

他提了一个具体问题:

“当人们在抽象地讨论 AI 能做什么的时候,想象力是无限的。但让我们聚焦到一个具体案例——你觉得 macOS 在接下来两年,会变得更好还是更烂?”

这个问题之所以有力,是因为苹果是一个代码质量曾经被视为生命的公司。如果 AI 真的在提升代码质量,macOS 应该会变好。如果不是,答案很清楚。


三、支持方:Karpathy 的反转

如果要找一个和 Hotz 同样重量级、但立场相反的人,Andrej Karpathy 是最合适的对比。

2025年秋天,Karpathy 公开说 AI agents 没戏,距离行业炒作的水平差得远。

2025年12月,GPT-5.4 和 Opus 4.6 发布。

Karpathy 随即改口:AI agents 改变了编程。然后他离开了自己创办的 Eureka Labs,加入了 Anthropic。

他在播客里给出了具体的效率数字:如果你用对了方法,生产率提升远不止10倍。

但是——这里有一个"但是"——Karpathy 并没有否认 Hotz 的担忧。他原话是:

“当你就这样看那些代码的时候,有时候我真的会有点心悸(a little bit of a heart attack)。因为它不一定总是超级棒的代码。很臃肿,有大量复制粘贴,有别扭脆弱的抽象。能跑,但真的……很粗糙。”

规划和理解,仍然需要人类专业知识。

这是一个很有意思的共存:Karpathy 认为 Agent 有巨大价值,同时承认它的输出质量不可靠。两个结论同时成立,靠的是一条清晰的边界:Agent 适合特定场景,不适合所有场景。


四、OpenAI 内部视角

支持 Hotz 担忧的,不只是外部观察者。

一位在 OpenAI 工作的开发者,网名 roon,在今年早些时候表达了更激进的观点:AI 会犯足以拖垮整个系统的错误。那些 bug 极难发现,但最终还是会修好。

更有意思的是他的结论:开发者们很快就会停止手工审查自己的 AI 生成代码。

不是因为代码不需要审查,而是因为当代码量足够大的时候,人类已经没有能力全部审查了。质量控制的方式,必须发生根本性变化。

这条逻辑链的终点是什么?也许是一套全新的工程规范:代码审查不再是人工阅读,而是自动化测试、形式化验证、AI 辅助审计。但这套体系目前还不存在。


五、社区的分裂说明了什么

当 Hotz 的文章发出后,社区的反应暴露了一个深层分歧。

一方是"LeCun/Marcus 阵营"。 他们的核心信仰是:当前 LLM 的架构有根本性局限,不可能在真正重要的认知任务上达到人类水平。编程需要真正的推理,而不仅仅是模仿代码分布。Hotz 把自己归入这一边。

另一方是"工程实用主义阵营"。 他们的核心信仰是:Hotz 在用完美的标准否定一个 imperfect 但有真实价值的工具。GPT-5.4 和 Opus 4.6 证明模型能力在跨越阈值,Agent 在某些场景的效率提升是实实在在的。Karpathy 是这一边的代表。

两边的争论,本质上不是在争"AI 有没有用",而是在争:我们是在用 Agent 压缩成本,还是在把成本转移到未来?


六、留给读者的问题

这篇文章的目的不是给结论。George Hotz 可能错。Karpathy 可能也错。

Hotz 可能在用完美的标准否定一个 imperfect 但有巨大实用价值的工具。他的"六个月的测试"样本量有限,且 tinygrad 和 USB 逆向工程可能不是最具代表性的 Agent 应用场景。

Karpathy 可能也错。他的"10倍效率"在某些场景是真实的——原型开发、API 胶水代码、测试生成。但在大型系统的核心逻辑层,Agent 产生的那堆"能跑但很粗糙"的代码,可能正在成为未来五年的技术债务。而这种债务,有滞后性——它不会在第一年显现。

真正值得每个工程师和每个技术管理者思考的问题,是 Hotz 本人提出的那三个:

第一,你所在的场景,到底更像原型开发,还是生产维护?

原型阶段,效率就是一切。Agent 适合。生产维护阶段,正确性和可维护性是一切。Agent 的不确定性成本在这里最高。

第二,你的团队,有没有能力分辨 Agent 输出的质量?

这条问题最为关键。Hotz 说的"高绩效者的自我检查能力",不是每个人或每个团队都有的。如果你用 Agent 的人不具备这个能力,你可能正在积累一种不易察觉的技术债务。

第三,当你在用 Agent 提效的时候,你是在压缩成本,还是在转移成本?

任何工具都有代价。Agent 的代价,是它把人类从"写代码"中解放出来的同时,把"承担后果"的责任也一并留给了人类。你选择用它,就必须承担识别它的错误的义务。如果你没有这个能力,这个义务就会变成负债。


信息来源:geohot.github.io/blog(The Eternal Sloptember,2026年5月24日),Twitter/X @geohotarchive,the-decoder.com 相关报道,GitHub State of AI in Software Development 2026 报告

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐