从SAI复现报告看AI学术圈的"信任危机"与结构性困境

**【图片位置1:Keller Jordan推文截图 — 作为引子】**

OpenAI研究员Keller Jordan最近在X上发了一句话,把AI学术圈炸了锅:

“大多数大实验室的人现在几乎不读论文了,ICLR/ICML/NeurIPS上的论文大多是夸大其词和造假。”

如果只是"嘴炮",这顶多算一个圈内人的情绪发泄。但问题是,数据站在他这边。

今年7月,芝加哥大学谭宸浩教授联合创办的SAI(Science of AI)做了一件非常"得罪人"的事:他们把ICML 2026的全部168篇Oral论文拿来实验复现。结果相当难看——105篇完成复现的论文中,只有8篇复现率超过80%。中位数复现得分在28%-30%之间。

也就是说,两万多篇投稿里筛出来的最顶层论文,绝大多数经不起"跑一遍代码"的检验。

**【图片位置2:SAI复现得分分布图 — verifiable claims】**


一、比"造假"更可怕的,是系统性"不可验证"

先澄清一点:SAI报告里暴露的问题,大部分不是"故意造假"那么戏剧化

真正普遍的情况是:

  • 代码跑不通
  • 关键文件缺失
  • 依赖环境损坏
  • 实验结果和论文对不上
  • 模型已经下线,后人无法复现

这些问题听起来像是"疏忽",但累积起来造成的结果是:一篇论文声称的成果,外人几乎无法验证。

这就形成了一个危险的灰色地带——论文作者可以说"我开源了",但你就是跑不出来;他说"可能是环境配置问题",你也没办法证伪。

更讽刺的是那篇ICLR 2026的论文:效果好得反常,开源代码一看,原来是用测试集标签调参。这种低级错误能被顶会接收,说明审稿流程本身已经很难识别"看起来合理"的陷阱。

**【图片位置3:Mathew Shen推文截图 + AxiomFlow评论截图 — 拼接或任选其一】**


二、为什么"实验审稿"这么难做?

SAI的报告里有一个数字让我印象很深:

完整重跑一篇ICML Oral论文,成本中位数约为8,900美元,17篇超过10万美元,最贵的一篇接近220万美元

这意味着什么?

意味着"可复现性"正在成为AI领域的阶级壁垒。

只有资金充裕的大实验室或公司,才付得起复现一篇论文的成本。普通高校研究者、独立研究者、学生,根本没有资源去验证顶会论文的真实性。于是大家只能选择**“相信”**——相信审稿人把关了,相信同行评议有效。

但SAI的数据告诉我们:这个信任链已经断裂了。

而且,那些没有开源代码的64篇Oral论文(168篇中104篇开源),直接就是"无懈可击"——你无法验证,只能默认它是对的。正如一位评论者说的:“之所以能发现这个漏洞,是因为代码是开源的。又有多少类似的测试漏洞,仅仅因为代码不是开源的而被忽视了?”

**【图片位置4:JFPuget推文截图】**


三、"不读论文"是傲慢,还是无奈?

回到Keller Jordan那句话。很多人批评他"上岸后抽梯子"——OpenAI从学术界招人、用学术界的成果、抢学术界的GPU,最后说学术界"基本都是欺诈"。

这个批评有道理,但也忽略了一个事实:

在大模型时代,真正重要的进展确实越来越不依赖论文了。

GPT-4的技术细节没有论文,Gemini的核心训练方法不会公开,各家的Agent架构只在内部迭代。当产业界的算力、数据、工程能力远超学术界时,论文作为"知识传播媒介"的价值确实在衰减。

但这里有一个更深层的问题:

产业界的人可以"不读论文",但想进入产业界的人,还是要靠论文敲门。

申请PhD、找教职、进OpenAI——这些都需要论文做凭证。论文在"知识传播"上的可信度在下降,在"人才筛选"中的价值却丝毫未减。

这就造成了一个荒诞的局面:论文变成了一个"你必须参与但不必相信"的游戏。 你写论文不是为了传播知识,而是为了拿到门票;你读论文不是为了学习,而是为了跟进"哪些方向还在被审稿人接受"。

**【图片位置5:Mengye Ren推文截图 — 可配合简短点评】**


四、这对普通研究者意味着什么?

如果你是正在投顶会的学生,或者刚入行的研究者,这个数据可能让人沮丧。但我想提供几个务实的视角:

1. "可复现"正在成为差异化竞争力

当大部分论文都跑不通时,一篇真正能复现的论文反而更稀缺。如果你能在开源代码、实验细节、环境配置上做到"别人能跑通",这已经超过了大多数Oral论文。这不是"底线要求",这是竞争优势

2. 小模型、小实验是独立研究者的机会

SAI报告显示,越依赖大规模算力的论文,复现成本越高,可信度越难验证。反过来,在小模型、小数据集上做的扎实分析,反而更容易被社区验证和认可。独立研究者不必盲目追逐"大","精"和"真"更有长期价值。

3. 论文之外,建立"可验证"的个人品牌

在GitHub上维护一个稳定的开源项目、在社交媒体上分享可复现的实验过程、写技术博客时附上完整的运行记录——这些"可验证"的积累,比一篇"可能跑不通"的顶会论文更能建立长期信任。


五、论文制度会崩溃吗?短期内不会

有人可能会问:既然论文复现率这么低,那论文制度是不是该被淘汰了?

我的判断是:短期内不会。

因为论文制度解决的不只是"知识传播"问题,它还解决了**“人才筛选""资源分配”**问题。在没有更好的替代机制之前,PhD录取委员会、招聘团队、基金评审人依然需要论文作为"可量化的信号"。

但长期来看,如果"不可验证"成为常态,论文的信号价值也会衰减。也许未来的评价体系会更看重:

  • 开源项目的实际影响力
  • 技术博客的社区反馈
  • 可复现的实验记录
  • 真实的工程落地能力

**【图片位置6:Rylan Schaeffer推文截图】**


六、写在最后

那位说"希望学生能写出夸大其词的论文"的教授,其实是在自嘲——大多数学生连"造假"的能力都没有,还在挣扎LaTeX排版。

这句话背后是一个被忽视的事实:顶会论文的门槛看起来很高(23918篇投稿选168篇Oral),但实际上**“写好一篇论文"和"做好一项研究"正在变成两件事**。很多人把精力花在怎么让论文"看起来 impressive”,而不是让研究"真正可靠"。

这不是某个人的道德问题,这是激励机制的系统性扭曲

当"发表"的回报远大于"被揭穿"的风险时,理性人都会选择优化前者。SAI的实验审稿之所以重要,不是因为它抓出了几个"坏人",而是它用数据证明了一件事:

AI学术圈需要一场关于"可信度"的重建。

而重建的起点,可能是每个人都先问自己一个问题:我写的这篇论文,别人能复现吗?


参考与延伸阅读


更多推荐