OpenAI研究员:我们都不读论文了

栏目:互联网 | 来源:机器之心Pro | 2026-08-09 23:36

前沿实验室的人几乎不读论文了?

OpenAI 的一位研究员一句话扫射三大顶会:太多夸大其词和造假!

事情的起因,是一篇效果好得让人想不通的 ICLR 论文,网友研究了一下才发现其中的「秘诀」。

在顶会发论文都「进化」成这样了吗?

一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心结论—— 这一层层拷问下来,顶会论文究竟有几篇经得起检验?

还真有人这么干了。

105 篇中,只有 8 篇「合格」

今年 7 月,由芝加哥大学计算机科学与数据科学副教授谭宸浩联合创办的 SAI,公布了一次大规模「实验审稿」。

他们选中的,是 ICML 2026 全部 168 篇 Oral 论文。

今年 ICML 共收到 23918 篇投稿,最终只有 168 篇获得 Oral 资格,占比约 0.7%。

换句话说,SAI 检查的已经是两万多篇投稿中筛出的最顶层。

除了和传统审稿人一样阅读论文的方法、实验设计和结果,SAI Review 还会下载代码、模型和数据,配置环境并运行实验,最后把运行结果与论文原文逐项对照。

SAI 审查了全部 168 篇 Oral,其中只有 104 篇论文代码开源,最终完成了 105 篇完整复现。

其中,只有 34 篇复现了超过 40% 的主张;复现比例超过 80% 的,只剩 8 篇。

无论每篇论文至少包含 1 项、3 项还是 5 项可验证主张,复现得分中位数始终在 28%—30%,整体分布变化不大。

排除未运行、提前中止或超出硬件能力的实验后,复现得分中位数仍只有 42%—50%;当每篇论文至少包含 3 项可验证主张时,中位数稳定在 42%。

复现里最常见的问题都遇到了:代码无法运行、文件缺失、说明不完整、依赖损坏,或者代码跑出的结果和论文对不上。

还有 4 篇论文依赖已经下线的模型。后来的研究者即使愿意花钱、花时间,也不可能重新得到相同结果。

SAI 还列举了两个更具体的例子。

一篇论文把「只训练基础模型0.77%的参数」写成主要卖点,实际发布的检查点却训练了6.31%的参数,约为宣称数字的8 倍

另一篇论文展示了由裁判模型评分的可靠性表格,开源代码中却找不到这个裁判模型,也没有脚本能够算出表格里的数字。

劣质论文,收益高风险低

SAI 的复现结果可以说是相当糟糕。

更糟糕的是,这里发现的问题还只是「有条件被发现」的问题。

那些没有代码的论文,直接就「无懈可击」。

而即使代码完全公开,想要验证一篇论文,所花费的时间、精力和金钱都是巨额的,最后的结果还不如人意,不知道要多崩溃了。

按照 SAI 基于 Google Cloud 公开按需价格给出的估算,完整重跑一篇 ICML Oral 论文,成本中位数约为8900 美元。105 篇论文中,17 篇超过 10 万美元,最昂贵的一篇接近220 万美元

论文越依赖大规模算力,独立复现就越困难。

没有代码,别人无从检查;有了代码,也未必有人付得起这个成本。

于是,一篇存在问题的论文完全可能顺利通过评审、获得引用,再被写进简历,换来录取、教职或者大实验室的工作机会。

偶然有人发现结果对不上,会议也很少重新审查,论文也未必会被撤回。

这就是评论区所说的「做出糟糕的研究有收益,却几乎没有代价」。

不读论文,但是招聘要看论文

在大模型领域,确实有许多真正重要的进展不再以论文的形式出现。

作为 OpenAI 的工程师,站在产业前沿,有这种感受并不难理解。毕竟有更充足的算力、更快的实验反馈和大量不公开的内部结果,有「不读论文」的底气。

但这么说出来,多少有点微妙。

一条评论讽刺科技公司里的人这样是「上岸后抽走梯子」:从高校招走研究人员,建立在学术界公开积累的成果之上,用更高的价格抢走人才和 GPU,自己越来越少接受同行评审,最后却转过头宣布学术研究「主要是骗局」

稍显刻薄,但确实有道理。

这些前沿实验室的人可以「不读论文」,但是想进入的人还是要先发论文。

对于缺少产业经历的学生和年轻研究者来说,顶会论文依然是证明研究能力最直接的凭证。

申请博士、寻找教职、进入 OpenAI 这样的前沿实验室,都要依靠论文获得关注度。

产业界的人在进入大实验室之后轻视论文,却仍然用论文数量、会议级别和引用成绩筛选站在门外的人。

论文于是陷入一种尴尬的位置:它在知识传播上的可信度受到质疑,在人才竞争中的价值却丝毫没有消失。

所以,「大实验室已经不读论文了」听起来稍显清高和傲慢。因为真正有资格不读论文的人,往往已经凭借论文跨过了那道门槛。

当然,也不是所有学生都是精心设计骗局的学术反派。

一位高校研究者开玩笑说,他倒希望自己的学生已经有能力写出一篇夸大其词甚至造假的论文。

有的人在「争做学术骗子」,而有的人还挣扎在 LaTeX。

https://x.com/MathewShen42/status/2084465434506768867

https://x.com/kellerjordan0/status/2084721463089902074

https://sai.science/blog/how-much-science-is-verifiable

https://x.com/mengyer/status/2085134204786921886

了解更多

猜你想看

← 返回首页