ICML 2026 Oral论文复现率仅7.6%:当顶会论文不可验证时,研究者该怎么办?
从SAI复现报告看AI学术圈的"信任危机"与结构性困境

OpenAI研究员Keller Jordan最近在X上发了一句话,把AI学术圈炸了锅:
“大多数大实验室的人现在几乎不读论文了,ICLR/ICML/NeurIPS上的论文大多是夸大其词和造假。”
如果只是"嘴炮",这顶多算一个圈内人的情绪发泄。但问题是,数据站在他这边。
今年7月,芝加哥大学谭宸浩教授联合创办的SAI(Science of AI)做了一件非常"得罪人"的事:他们把ICML 2026的全部168篇Oral论文拿来实验复现。结果相当难看——105篇完成复现的论文中,只有8篇复现率超过80%。中位数复现得分在28%-30%之间。
也就是说,两万多篇投稿里筛出来的最顶层论文,绝大多数经不起"跑一遍代码"的检验。

一、比"造假"更可怕的,是系统性"不可验证"
先澄清一点:SAI报告里暴露的问题,大部分不是"故意造假"那么戏剧化。
真正普遍的情况是:
- 代码跑不通
- 关键文件缺失
- 依赖环境损坏
- 实验结果和论文对不上
- 模型已经下线,后人无法复现
这些问题听起来像是"疏忽",但累积起来造成的结果是:一篇论文声称的成果,外人几乎无法验证。
这就形成了一个危险的灰色地带——论文作者可以说"我开源了",但你就是跑不出来;他说"可能是环境配置问题",你也没办法证伪。
更讽刺的是那篇ICLR 2026的论文:效果好得反常,开源代码一看,原来是用测试集标签调参。这种低级错误能被顶会接收,说明审稿流程本身已经很难识别"看起来合理"的陷阱。

二、为什么"实验审稿"这么难做?
SAI的报告里有一个数字让我印象很深:
完整重跑一篇ICML Oral论文,成本中位数约为8,900美元,17篇超过10万美元,最贵的一篇接近220万美元。
这意味着什么?
意味着"可复现性"正在成为AI领域的阶级壁垒。
只有资金充裕的大实验室或公司,才付得起复现一篇论文的成本。普通高校研究者、独立研究者、学生,根本没有资源去验证顶会论文的真实性。于是大家只能选择**“相信”**——相信审稿人把关了,相信同行评议有效。
但SAI的数据告诉我们:这个信任链已经断裂了。
而且,那些没有开源代码的64篇Oral论文(168篇中104篇开源),直接就是"无懈可击"——你无法验证,只能默认它是对的。正如一位评论者说的:“之所以能发现这个漏洞,是因为代码是开源的。又有多少类似的测试漏洞,仅仅因为代码不是开源的而被忽视了?”

三、"不读论文"是傲慢,还是无奈?
回到Keller Jordan那句话。很多人批评他"上岸后抽梯子"——OpenAI从学术界招人、用学术界的成果、抢学术界的GPU,最后说学术界"基本都是欺诈"。
这个批评有道理,但也忽略了一个事实:
在大模型时代,真正重要的进展确实越来越不依赖论文了。
GPT-4的技术细节没有论文,Gemini的核心训练方法不会公开,各家的Agent架构只在内部迭代。当产业界的算力、数据、工程能力远超学术界时,论文作为"知识传播媒介"的价值确实在衰减。
但这里有一个更深层的问题:
产业界的人可以"不读论文",但想进入产业界的人,还是要靠论文敲门。
申请PhD、找教职、进OpenAI——这些都需要论文做凭证。论文在"知识传播"上的可信度在下降,在"人才筛选"中的价值却丝毫未减。
这就造成了一个荒诞的局面:论文变成了一个"你必须参与但不必相信"的游戏。 你写论文不是为了传播知识,而是为了拿到门票;你读论文不是为了学习,而是为了跟进"哪些方向还在被审稿人接受"。

四、这对普通研究者意味着什么?
如果你是正在投顶会的学生,或者刚入行的研究者,这个数据可能让人沮丧。但我想提供几个务实的视角:
1. "可复现"正在成为差异化竞争力
当大部分论文都跑不通时,一篇真正能复现的论文反而更稀缺。如果你能在开源代码、实验细节、环境配置上做到"别人能跑通",这已经超过了大多数Oral论文。这不是"底线要求",这是竞争优势。
2. 小模型、小实验是独立研究者的机会
SAI报告显示,越依赖大规模算力的论文,复现成本越高,可信度越难验证。反过来,在小模型、小数据集上做的扎实分析,反而更容易被社区验证和认可。独立研究者不必盲目追逐"大","精"和"真"更有长期价值。
3. 论文之外,建立"可验证"的个人品牌
在GitHub上维护一个稳定的开源项目、在社交媒体上分享可复现的实验过程、写技术博客时附上完整的运行记录——这些"可验证"的积累,比一篇"可能跑不通"的顶会论文更能建立长期信任。
五、论文制度会崩溃吗?短期内不会
有人可能会问:既然论文复现率这么低,那论文制度是不是该被淘汰了?
我的判断是:短期内不会。
因为论文制度解决的不只是"知识传播"问题,它还解决了**“人才筛选"和"资源分配”**问题。在没有更好的替代机制之前,PhD录取委员会、招聘团队、基金评审人依然需要论文作为"可量化的信号"。
但长期来看,如果"不可验证"成为常态,论文的信号价值也会衰减。也许未来的评价体系会更看重:
- 开源项目的实际影响力
- 技术博客的社区反馈
- 可复现的实验记录
- 真实的工程落地能力

六、写在最后
那位说"希望学生能写出夸大其词的论文"的教授,其实是在自嘲——大多数学生连"造假"的能力都没有,还在挣扎LaTeX排版。
这句话背后是一个被忽视的事实:顶会论文的门槛看起来很高(23918篇投稿选168篇Oral),但实际上**“写好一篇论文"和"做好一项研究"正在变成两件事**。很多人把精力花在怎么让论文"看起来 impressive”,而不是让研究"真正可靠"。
这不是某个人的道德问题,这是激励机制的系统性扭曲。
当"发表"的回报远大于"被揭穿"的风险时,理性人都会选择优化前者。SAI的实验审稿之所以重要,不是因为它抓出了几个"坏人",而是它用数据证明了一件事:
AI学术圈需要一场关于"可信度"的重建。
而重建的起点,可能是每个人都先问自己一个问题:我写的这篇论文,别人能复现吗?
参考与延伸阅读
- SAI实验审稿完整报告:how-much-science-is-verifiable
- Keller Jordan原推文及讨论
- Mathew Shen关于ICLR论文测试集泄露的发现
更多推荐



所有评论(0)