GPT-5.6 一小时攻破 50 年数学猜想:一份 700 词 Prompt,64 个子 Agent,三页纸的证明

2026 年 7 月 10 日,OpenAI 向全球开放 GPT-5.6。不到 24 小时,它做出了人类数学家花了半个世纪都没做到的事。

GPT-5.6 CDC猜想突破 — 封面图


一、什么事?

7 月 11 日,OpenAI 研究员 Ethan Knight 在 X 上发了一条帖子:

“昨天我们刚向所有用户开放 GPT-5.6 Sol Ultra。今天分享一个消息:它用 64 个子智能体,在不到一小时内,证明了已有 50 年历史的循环双覆盖猜想。”

OpenAI 把完整的证明 PDF 和 700 词的 Prompt 一起放到了 CDN 上,任何人可以下载查阅。

这条消息迅速在 Hacker News、知乎、微博、掘金、V2EX 等平台刷屏。为什么反应这么大?因为这不是解一道奥数题——这是攻克一个在维基百科"未解数学问题"列表上挂了 50 年的猜想。如果最终通过同行评审,这意味着:大型语言模型首次独立完成了一个真正的数学研究级突破。


二、这个猜想到底在说什么?

循环双覆盖猜想(Cycle Double Cover Conjecture,简称 CDC),由数学家 George Szekeres(1973 年)和 Paul Seymour(1979 年)分别独立提出。它的表述极其简单,小学生都能听懂:

任何一张没有"桥"的图,能否找到一组环,使得图中的每条边都恰好被恰好两个环覆盖?

什么叫"桥"?想象一个公路网,如果某条路一旦断掉,整个网络就会分裂成两个互相不通的部分——这条路就是一座桥。所谓"没有桥的图",就是不存在这种脆弱连接的图,每个顶点至少有两条路互相连通。

什么叫"恰好覆盖两次"?每条路(边)都必须被走两遍——不多不少。

听起来像一道小学奥数题对吧?但就是这个问题,难住了半个世纪的数学家。历史上出现过多次所谓"证明"——2015 年有人上传 arXiv,后来发现漏洞撤稿;2018 年又有人宣称证明,结果也有 gap。

所以当 GPT-5.6 说它证出来了,业内人的第一反应是:先别急着庆祝,验过了再说。

CDC 猜想原理图解:无桥图、环覆盖与双覆盖示意


三、GPT-5.6 做了什么?

OpenAI 公开了整个过程的细节。GPT-5.6 Sol Ultra 的证明只有三页纸,用到的数学工具没有一样是 1985 年以后发明的。

证明的三步走

第一步:归约到三次图

三次图就是每个顶点恰好连出三条边的图。数学界早就知道,如果能证明三次图满足 CDC 猜想,整个猜想就成立了。这一步是标准操作,没难度。

第二步:8-流定理打标签

利用 Jaeger 在 1970 年代的 8-流定理,给每条边打上一个来自 F₂³(三元有限域,只有 8 个元素)的"标签"。每个标签非零,并且在每个"路口"(顶点),三条边上的标签之和必须为零。

这有点像给公路网中的每条路标记一个颜色(从 8 种颜色里选),要求在每一个交叉口,三种颜色的组合必须抵消。这个定理本身是 1970 年代的成果,GPT-5.6 直接拿了现成的。

第三步:线性代数收尾——最妙的跳跃

这是证明的核心。GPT-5.6 把每条边的标签转换成"标签集合"——每条边得到一个恰好包含两个元素的集合。然后证明:在每个路口,每个可能的标签值要么出现 0 次,要么出现 2 次。

这一步被归结为一个线性代数方程组是否有解的问题。GPT-5.6 用对偶空间的性质证明了该方程组总有解。

曼彻斯特大学的数学家 Thomas Bloom 是第一批公开评价这份证明的学者。他的评价值得全文引用:

“这是一个非常漂亮的证明。它简短、初等、方法并不复杂。如果当年有人想到,80 年代就能完成。”

他还发现了一个有意思的细节:GPT-5.6 没有引用 Bermond、Jackson 和 Jaeger 在 1983 年的一篇关键论文——而该论文似乎已经为 GPT-5.6 的方法提供了核心思路。Bloom 猜测,模型可能在训练数据中"吸收"了这些思想,但没有显式引用。这是一个关于 AI 与学术规范的微妙问题。


四、700 词 Prompt 里藏着什么?

这份证明真正的技术含量,不在数学上,在 Prompt 工程上。

OpenAI 公开了完整的 Prompt。它不是那种"请证明 CDC 猜想"的一行指令,而是一份精心设计的约束型 Prompt。我把它拆解成几个核心设计原则:

原则一:定义验收标准,不规定解题路径

这是最关键的反直觉设计。Prompt 没有说"用归纳法"或"用流理论"或"找极小反例"——它只说最终结果必须满足什么条件:

  • 每一个有限、无桥、无自环的多重图,都必须被证明存在圈双覆盖
  • 不能只证明三次图(那是归约,不是证明的终点)
  • 不能只证明平面图
  • 不能假设图一定连通

核心理念:当解路径未知时,约束输入端和输出端,把中间交给模型自己探索。 这与当前 Agent 开发的最佳实践完全一致。

原则二:提前消灭所有歧义

Prompt 花了大篇幅定义每一个术语:

  • 什么是图?什么算桥?什么算环?什么算圈双覆盖?
  • 平行边允不允许?两条平行边能不能组成一个环?
  • 不连通图怎么处理?无边图怎么处理?
  • 环不必是诱导环,不必彼此边不相交——唯一要求是每条边恰好出现两次

这看起来啰嗦,但越是重要的任务,越不能依赖模型"应该知道我的意思"。模型出错的根因,往往不是推理能力不够,而是一开始理解的任务就和你要的不一样。

原则三:明确列出"不算答案"的结果

这是最值得直接照搬的技巧。Prompt 没有只说"请给出完整证明",而是专门列出了一批"看起来很接近、实际上不算完成任务"的情况:

  • 只证明了特殊情况(如三次图、平面图)——不行
  • 给出了不完整的证明框架——不行
  • 找到了证明思路但没有写完整——不行
  • 提交了一份"进展报告"——不行

告诉模型什么不算完成,比告诉它什么是完成更有效。 边界条件比目标描述更不容易被"优化"掉。

原则四:植入"对抗性验证"

Prompt 要求模型在生成证明的同时,启动独立的"对抗子 Agent"——专门负责找漏洞、找边界情况、找潜在错误。生成和验证分离,这是在模拟人类数学研究的同行评审机制。

原则五:强制保持路线多样性

在早期阶段,不同子 Agent 被明确要求尝试完全不同的路径:有人走代数路线,有人走组合路线,有人走结构归纳。在结果收敛之前,没有一个"当前最优方向"——这防止了系统过早锁定在一个可能错误的方法上。

原则六:禁止联网 + 禁止投降

Prompt 明确要求:不要上网搜索是否已经有人证明过这个猜想。而且还加了一句狠的——“假设这个猜想确实是对的,别浪费时间怀疑它有没有反例。”

以及:“至少工作 8 小时再考虑放弃或返回。”

虽然系统预留了 8 小时计算时间,GPT-5.6 实际只用了不到 1 小时就把证明跑出来了。但那个"被迫坚持"的心理设定,可能是关键。

64 子 Agent 工作流程图:并行探索 → 对抗验证 → 收敛证明


五、社区反应:两种声音

目前整个事件处于"等待验证"的阶段。但社区反应已经明显分成两派:

乐观派:这是里程碑

Noam Brown(OpenAI o1 核心贡献者)在 ICML 会议现场第一时间表态:“这次不靠内部特供模型,纯靠公开可用的 GPT-5.6 Sol Ultra 就把活儿干了。”

支持者认为,这证明前沿模型在数学推理领域的天花板还在快速拉高——而且多 Agent 并行架构可以在不提升模型能力本身的情况下,把任务时间压缩一个数量级。

审慎派:别着急开香槟

更多数学家持保留态度。CDC 猜想历史上被"证明"过太多次,又太多次在评审中失败。Bloom 虽然称赞证明本身"漂亮",但也指出引用缺失的问题。

Hacker News 上数学背景的评论者指出了一个尴尬的事实:证明中使用的所有数学工具,没有一样是近 30 年的东西。 如果证明是对的,这意味着真正的突破不在新理论的创造,而在对这些旧工具的组合运用——一种"组合式创造力",传统上被认为是人类数学直觉的核心。

还有人对时间点提出了质疑:GPT-5.6 发布的时间恰好与 OpenAI 安全负责人 Johannes Heidecke 和首席未来学家 Joshua Achiam 的离职相重叠,公司内部的部署安全页面也标记了 GPT-5.6 存在"令人担忧的对齐问题"。证明是真的还是公关策略?这个问题暂时没有答案,但它提醒我们:任何公司发出来的"里程碑"都需要放到更大的背景下看。


六、更深一层的意义

无论这份证明最终是否通过评审,它已经揭示了几件重要的事:

1. AI 数学的瓶颈从"生成"转向了"验证"

这是两个月内的第二个重大 AI 数学声明。2026 年 6 月 OpenAI 和 DeepMind 各自在 Erdős 单位距离猜想上有过动作。现在加上 CDC。

模式很明显:AI 系统正在以远超人类数学家阅读速度的节奏,生成对悬而未决猜想的候选证明。 人类已经跟不上 AI 生成的速度了。未来,形式化验证(Lean/Rocq 等)将不再可选——它们是从"AI 声称证明了"到"数学界确认证明了"之间的必经桥梁。

2. Prompt 设计的范式转移

这份 700 词 Prompt 值得每个做 Agent 开发的人仔细研究。它揭示了一种新的范式:

旧范式 新范式
告诉模型怎么做 只定义什么是"完成"
写步骤 写约束
要求输出 禁止非目标输出
单一 Agent 串行 多 Agent 并行+对抗验证
给定方法 强制路线多样性

这个范式不限于数学。任何需要深度推理的领域——代码审查、安全审计、法律推理、药物发现——都可以移植。

3. 700 词就能驱动的事,不需要 700 页

这可能是最反直觉的点。整个 Prompt 只有 700 词。它不是在"教"模型数学,而是在"管"模型的注意力。把核心里程碑钉死,其余交给模型自己找路——这种"轻干预"风格,可能比工程师想象的要有效得多。

4. "组合式创造力"可能被低估了

CDC 证明没有用到任何新理论。它用的全是不超过 1985 年的工具。如果证明是对的,这意味着 AI 的"创造力"可能以一种我们没预料到的形式展现:不是从零生造理论,而是找到已有工具之间的关联——这种关联因为超越了单个人类研究者能掌握的知识面,从未被尝试。


七、接下来会发生什么

  1. 未来几周:图论社区的专家将对证明进行逐行审查。最关键的是 Lemma 2.2——HN 上已经有评论指出这一步可能存在微妙的 gap。
  2. 如果证明成立:这篇论文将在 arXiv 上出现(可能带人类合著者),然后走向 Journal of Combinatorial Theory 之类的期刊。这将是 LLM 首次独立解决的"维基百科未解问题列表"上的猜想。
  3. 如果证明有漏洞:这也不是全输。GPT-5.6 能走到"专家需要几小时才找出 gap"的程度,本身就说明推理能力的边界在位移。
  4. 形式化验证跟进:无论结果如何,这个案例大概率会加速数学界向 Lean 等形式化工具的迁移。

对于内容创作者和技术写作者来说,现在是最好的观察窗口期:故事正在发生,结局还没写定。


附:如果你想自己试试

OpenAI 公开了完整的 Prompt 和证明 PDF。核心思路如果你要复刻到自己的 Agent 架构中:

  • 不要把超长上下文当成"说明书",把它当成"护栏"
  • 多 Agent 不是把一个人做的事分给多个人——是让多人同时试不同的事
  • 对抗 Agent 不是附属品,是质量保证的核心组件
  • 告诉模型"你可以做这个"不如告诉它"以下这些不算完成"

本文完成于 2026 年 7 月 13 日,证明尚未通过正式同行评审,以上分析基于已公开的 OpenAI 公告、Thomas Bloom 公开评论、Hacker News 讨论、以及多家科技媒体的报道。

数据来源:OpenAI CDN、Ethan Knight X 账号、Thomas Bloom 公开评审线程、IT之家、量子位、团子技术日报、ChatForest、Kingy AI、Singularity.Kiwi

更多推荐