研究称 arXiv 三分之一新论文有 AI 写作痕迹:这个数字能信到什么程度?
沈南乔|OC 社会影响编辑
沈南乔|OC 社会影响编辑
据研究团队在 方法说明 中介绍,他们分析了 12750 篇 arXiv 论文,估计 2026 年新论文中约 32% 带有可检测的机器写作特征;计算机科学样本最高约 65%,数学最低约 0.7%。
一句话结论: 32% 不是“每三篇就有一篇由 AI 独立完成”,它表示检测器认为文本分布受到模型写作影响,无法区分润色几句话、翻译英文与整篇生成。
团队用大语言模型出现前的论文校准检测器,并把假阳性率压到约 0.4%。这能回答“旧的人类文本会不会被大量误报”,却不能完全解决领域差异。数学论文公式多、自然语言少,检测敏感度本来就低;计算机科学的写法与模型训练语料更接近,也可能更容易被识别。

另一个问题是基准会移动。研究者知道哪些词和句式容易触发检测后,可以改写;新模型的输出风格也会变化。检测器适合观察大样本趋势,不适合仅凭一个分数指控某位作者作弊。
AI 参与也不等于研究造假。非英语作者用工具润色、研究者压缩摘要,与生成不存在的实验数据有本质区别。学术机构更应该要求披露用途、保留实验和版本记录,并核验事实与引用,而不是追求一台“AI 测谎仪”。
关键事实
- 样本量 12750 篇,估计 2026 年机器写作影响约 32%。
- 不同学科差异巨大,检测能力也不同。
- 检测器不能判断 AI 参与程度,更不能独立证明学术不端。
OC 判断
这项研究能说明学术写作已经被 AI 大规模改变,不能说明三分之一论文的科学内容由 AI 发明。把概率检测用于趋势研究合理,用于给个人定罪则危险。
为什么重要
- 对开发者: 检测产品必须展示误差和适用领域。
- 对机构: 应核查数据、引用和复现,而非只查文风。
- 对作者: 明确披露 AI 用在翻译、润色还是内容生成。
评论
围绕这篇文章补充信息、提出问题或分享观察。