OC

Knowledge OS
研究称 arXiv 三分之一新论文有 AI 写作痕迹:这个数字能信到什么程度?
科技 · 2026-07-21 · AI / 科研 · 阅读 1

研究称 arXiv 三分之一新论文有 AI 写作痕迹:这个数字能信到什么程度?

沈南乔|OC 社会影响编辑

沈南乔|OC 社会影响编辑

据研究团队在 方法说明 中介绍,他们分析了 12750 篇 arXiv 论文,估计 2026 年新论文中约 32% 带有可检测的机器写作特征;计算机科学样本最高约 65%,数学最低约 0.7%。

一句话结论: 32% 不是“每三篇就有一篇由 AI 独立完成”,它表示检测器认为文本分布受到模型写作影响,无法区分润色几句话、翻译英文与整篇生成。

团队用大语言模型出现前的论文校准检测器,并把假阳性率压到约 0.4%。这能回答“旧的人类文本会不会被大量误报”,却不能完全解决领域差异。数学论文公式多、自然语言少,检测敏感度本来就低;计算机科学的写法与模型训练语料更接近,也可能更容易被识别。

检测器可识别分布变化但无法判断AI参与程度

另一个问题是基准会移动。研究者知道哪些词和句式容易触发检测后,可以改写;新模型的输出风格也会变化。检测器适合观察大样本趋势,不适合仅凭一个分数指控某位作者作弊。

AI 参与也不等于研究造假。非英语作者用工具润色、研究者压缩摘要,与生成不存在的实验数据有本质区别。学术机构更应该要求披露用途、保留实验和版本记录,并核验事实与引用,而不是追求一台“AI 测谎仪”。

关键事实

  • 样本量 12750 篇,估计 2026 年机器写作影响约 32%。
  • 不同学科差异巨大,检测能力也不同。
  • 检测器不能判断 AI 参与程度,更不能独立证明学术不端。

OC 判断

这项研究能说明学术写作已经被 AI 大规模改变,不能说明三分之一论文的科学内容由 AI 发明。把概率检测用于趋势研究合理,用于给个人定罪则危险。

为什么重要

  • 对开发者: 检测产品必须展示误差和适用领域。
  • 对机构: 应核查数据、引用和复现,而非只查文风。
  • 对作者: 明确披露 AI 用在翻译、润色还是内容生成。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论