242 篇论文,两队独立复现给出了相反的结论——复现正在从「没人做」变成「做了也不算数」
先说结论
这两周被反复引用的数字是「顶会论文只有个位数能被完整复现」。这个数字确实刺眼,但它不是最值得记住的那一个。
最值得记住的是 Hugging Face 那份复现报告里的 242:242 篇论文,不同的独立复现团队对同一条 claim 给出了相反的判定。一边说验证通过,一边说不成立。
这才是新东西。过去大家抱怨的是「没人复现」——太贵、太慢、没人有动机。现在复现便宜到能在三周内覆盖三分之一个会议,但紧接着冒出来的问题不是「复现率低」,而是「复现结果不一致」。验证从一个缺席的问题,变成了一个裁决的问题。
事情是怎么发生的
两件事叠在了一起。
一是 SAI 在 7 月 22 日发布的审计:把 ICML 2026 全部 168 篇 oral 论文过了一遍,完成了 105 篇的完整复现。在其中「至少含 5 条可验证结论」的 92 篇里,只有 34 篇复现出超过 40% 的结论,只有 8 篇超过 80%;复现分数的中位数稳定在 28%–30%。同时给出了一个此前很少被量化的价格:完整重跑一篇 oral 的中位成本约 8,900 美元,17 篇超过 10 万美元,最贵的接近 220 万美元。
二是 Hugging Face 在 8 月 13 日公布的社区复现结果:7 月 15 日到 8 月 2 日,19 天,1,221 名参与者用各自的 coding agent 逐条核验,覆盖 2,226 篇论文(ICML 2026 共接收 6,352 篇),产出 6,816 份日志,判定 35,908 条 claim。结果是一张灰度很高的图:1,103 篇至少有一条结论被验证通过,266 篇全部通过;496 篇至少有一条被证伪或存疑,49 篇全军覆没;502 篇只有玩具规模的证据,280 篇根本没跑出结论;以及那 242 篇彼此矛盾的。
与这两份数据同期,业内关于「顶会论文还值不值得读」的争论在社交媒体上再次发酵——但真正能被检查的,只有上面这两组数字。
为什么重要
第一,验证的成本曲线断了。19 天、一千多名业余参与者、三分之一个会议——这在两年前不成立。复现正在从稀缺的学术义务变成可批量采购的商品。一旦如此,「有没有被独立复现」就有条件从道德倡议变成会议、期刊乃至企业选型的硬性字段。
第二,8,900 美元这个中位数,是产业侧真正该记下的数。它说明「照着论文做一遍」是有明码标价的,而且价格高到足以改变采信方式。企业引入外部方法时,要么内建复现能力,要么接受未经验证就上线的风险——这两条路都在推动一个新岗位形态:不是做研究,而是替组织判断别人的研究是否成立。
第三,论文这件产物的两个用途正在分叉。作为知识载体,它的可信度被上面这批数字直接压低了;作为能力凭证,它的价值并没有同步下降——顶会 oral 依旧是学界与业界通用的硬信号,而按 SAI 的口径,这批 oral 里能撑住八成结论的只有 8 篇。信号与内容之间出现这么大的落差,制度早晚要被拆开重做。
站得住与站不住的地方
站不住的地方要先说,而且 SAI 自己说得最清楚:低复现分数不等于有意造假。代码陈旧、专有数据不可获取、机器环境依赖,都会把分数压到很低;他们也明确写了系统仍在 beta、会犯错。用这批数字去支撑「三大会主要是造假」,是对数据的严重超支。
样本也要看清楚。SAI 的 8 篇是从 92 篇的子集里数出来的,不是从 168 篇里;Hugging Face 那 2,226 篇是自选样本,参与者水平参差,将近三分之一压根没得出结论。而那 242 篇矛盾,同样可以是复现方法不统一造成的——它指向的未必是论文有问题,也可能是复现这件事本身还没有标准。
站得住的是被具体指认的那几条:理论用反向 KL、代码用正向 KL;评测用 EOS 补齐导致困惑度失真;定理在特定步数下有反例。这些不是「跑不出来」,是机制层面能被逐行对照的错误,责任归属清楚,不需要靠统计说话。
接下来该盯什么
一是会议会不会真的设立反驳与批评轨道。2025 年已有一篇由 Schaeffer、Orabona、Koyejo、Donoho 等人联署的立场论文提出这件事(arXiv:2506.19882),但真正的门槛不在提案,而在裁决:那 242 篇矛盾谁来判?没有仲裁机制,自动复现只会制造更多噪声。
二是复现成本会不会进入强制披露项。像论文披露利益冲突一样披露算力预算和复现代价,是成本最低、最容易落地的一步。
三是「第三方复现报告」会不会在产业侧成为采购前置条件,走上和药品独立试验类似的路。
四是反向风险:当复现由 agent 批量完成,「已复现」这个标签本身就会成为被优化的目标。今天它还稀缺,所以可信;等它变多,第一批被污染的往往就是它。