论文导读

机器写的论文更「新」吗?差距主要在「目的」一个维度

论文导读(NeurIPS 2026 AI4MetaScience 研讨会海报,非存档):机器生成论文被判「维度新颖」的比例高于人类论文,但差距主要来自研究目的这一维;用大模型复审新颖度判定,驳回率随模型与提示词在 0% 到 100% 之间变化。

机器写的论文更「新」吗?差距主要在「目的」一个维度
约 6 分钟阅读
本文目录

FARS 流水线在报告的 18.6 万美元成本下产出了 166 篇完整论文;Agents4Science 2025 收到了 300 多篇由 AI 系统撰写的投稿。机器生成的论文已经成批出现,但现有的评价方式,包括审稿打分、系统自评、直接让大模型判断「这篇新不新」,都回答不了一个更基础的问题:这些论文里有没有先行文献中不存在的贡献,还是只是把已有工作重新组合?

这篇论文是一次按贡献主张逐条做的新颖性审计,已作为海报论文被 NeurIPS 2026 AI for Meta-Science 研讨会接收(非存档,可引用版本为 Zenodo 预印本)。它得到了一个对机器有利的差距,而论文的主要篇幅在说明:为什么这个差距还不能当作结论。另有一条 7 分钟的视频讲解。

在 B 站 观看高清版

论文做了什么

审计单位是贡献主张,不是整篇论文。每篇论文拆成若干条主张,每条主张再拆成四个维度:目的(要解决什么)、机制(用什么方法)、评估(怎么验证)、领域(在什么场景)。机器一侧是 FARS 的 166 篇论文,共 549 条主张;人类一侧从 8,613 篇有录用结果的 ICLR 2025 投稿里,按标题与摘要的向量相似度一对一匹配出 166 篇,共 494 条主张。

检索按维度分别发起,结果截断在每篇论文自己的日期之前,两侧用完全相同的检索栈。随后由 GPT-4o 和 Claude Sonnet 4.6 两个评审模型逐维度回答一个事实问题:这个维度的内容,是否出现在检索到的某篇先行工作里?维度上有分歧时由 Gemini 2.5 Pro 裁决。最终状态不由任何模型直接给出,而是按规则推出:任一维度未被覆盖,记为「维度新颖」;所有维度被同一篇先行工作覆盖,记为「已覆盖」;所有维度都被覆盖但分散在多篇工作里,记为「重组」。评审规则在 20 条验证样本上校准后冻结,全量只跑一次。

冻结规则下,机器主张被判维度新颖的比例是 56.1%,人类是 35.6%,差距 20.5 个百分点(95% 置信区间 14.3 至 26.5)。人类主张被单篇先行工作完全覆盖的比例是 21.5%,机器是 8.6%。人类一侧内部,ICLR 录用稿与拒稿的分布几乎相同(维度新颖分别为 34.4% 和 36.6%)。

差距落在哪里

把维度新颖的判定拆开看,机器一侧 308 条里有 203 条(66%)只有「目的」一个维度未被覆盖,人类一侧 176 条里有 102 条(58%)。换用更严的规则重新计算:

  • 要求目的以外至少有一个维度未被覆盖:机器 19.1%,人类 15.0%,差距 4.1 个百分点,95% 置信区间 −0.3 至 8.5,包含零;
  • 要求机制维度未被覆盖:差距 1.8 个百分点(−2.2 至 5.9);
  • 要求至少两个维度未被覆盖:差距 5.8 个百分点(2.3 至 9.4)。

只保留匹配相似度在中位数(0.676)以上的一半配对,差距为 12.9 个百分点(4.1 至 21.8)。两侧主张的类型构成也不同:机器偏向「发现」类(373 条发现、174 条方法),人类偏向「方法」类(257 条方法、211 条发现),按对方的类型构成重新加权,可以解释 20.5 个百分点中的 2 到 5 个。

结论是:两侧的差别主要在于各自声明的研究目的与检索到的工作相比有多新;到了机制层面,两者相差不大。

这篇的证据强度

这是一篇研讨会海报论文,非存档,没有做人工校准。论文自己把所有新颖度比例定性为探索性上界,把机器与人类之间的差距定性为待校准的假设。支撑这一定性的有两组测量。

第一组针对评审层。作者让一个对抗式复审模型拿着同样的检索结果,去推翻抽样出的「目的新颖」判定,三个模型、两种提示词,每格都是同样的 20 条(每侧)。在锚定原评审标准的提示词下,GPT-4o 推翻机器 3/20、人类 5/20,Sonnet 推翻 1/20 和 0/20,Gemini 推翻 19/20 和 19/20;GPT-4o 与 Sonnet 标出的条目没有一条重合。换成不设锚点的「严苛审稿人」提示词,GPT-4o 和 Gemini 两侧都推翻 20/20。同一批条目,驳回率可以在 0% 到 100% 之间取值,取决于用哪个模型、怎么问。三取二投票也修不好:锚定提示词下多数票为 4/20 和 5/20,不锚定时为 20/20,跟着提示词走,不跟着数据走。

第二组针对检索层。作者独立于检索通道构建了 106 对金标先行工作(机器 57 对、人类 49 对),来源是论文自身最相关的引用加人工确认。实际部署的检索只在 24.6%(机器)和 28.6%(人类)的配对里把金标论文放进了被判主张的近邻列表。在金标样本的维度新颖主张中,机器 12 条里有 7 条、人类 10 条里有 5 条,金标论文完全没有被检回;另有机器 4 条、人类 5 条,金标论文已在近邻列表里且正对应被判未覆盖的维度,评审没有认定其构成覆盖。机器一侧召回更低,意味着差距本身可能有一部分来自检索。

完整性审计是另一项独立结果。对 Agents4Science 2025 的 306 篇投稿做双人盲评,按五级标准判断造数证据(二元判定 Cohen's κ = 0.53,13 处边界分歧全部回原文仲裁)。确凿证据出现在 20 篇里:拒稿 16 篇、直接拒稿 2 篇、撤稿 2 篇,录用的 47 篇中为 0。与拒稿 16/197 相比,单侧 Fisher 检验 p = 0.029;只计两位评审都标出的案例时 p = 0.072。零格很脆弱,论文只把它写成相关关系。16 篇拒稿中有 10 篇,会议的 AI 审稿人点名指出了造数,常常直接引用作者在强制 AI 参与清单里的自述。这一结果同时反映了检出和主动披露,不能外推到没有强制清单的场合。

对实践的意义

Zico 的合同审查分两档:速审模型逐条给出判定概率,高置信的直接标记,低置信的转给大模型深审或人工复核。这类「一个模型把关另一个模型」的设计,这篇论文给划了两条线。

一是复审模型不能替代校准。复核环节有一个隐含的严格度参数,由模型和提示词共同决定,换一个组合,驳回率可以从 0% 变到 100%。多模型投票只能消除模型之间的分歧,消除不了共同的标准偏差。放行阈值和深审的严格度,要用人工标注过的条款来定,并随每次判定记录所用的模型与提示词。深审同意速审,不等于速审是对的。

二是「没检到」不等于「不存在」。合同审查里的「未发现风险」「未找到对应条款」都是否定结论,要先用一组独立标注的样本测出漏检率,再决定这个结论能说多重。本文的检索只找回了四分之一多一点的已知先行工作,在这种召回下,「新颖」只能读作「没检到」。

完整性审计还有一条可以直接借鉴的做法:强制披露清单把一部分造数变成了作者自述,AI 审稿人再据此引用。合同与文书流程引入 AI 生成内容时,先要求披露生成方式,再做自动核查,比单做事后检测更容易发现问题。

延伸阅读

本文对应的论文条目见研究页。