计算机与人工智能预印本实验阅读 1 分钟

如今近三分之一的网络文本由人工智能写成

大语言模型主要从网络上收集的文本中学习。而这些文本中,本身由人工智能写成的内容越来越多。作者称之为**“野生”人工智能文本**:由众多不同模型为人类读者写成、发布在网上,并且与人类文本混杂在一起、未加标注地被卷入训练数据。它既不是“模型崩溃”——即一个模型用自己的输出重新训练——也不是为辅助训练而专门生成、经过筛选的合成数据。

马里兰大学和Pangram Labs(一家销售人工智能文本检测器的公司)的Jenna Russell、Mohit Iyyer及其同事,着手测量这类文本究竟有多少,以及它会对模型产生什么影响。

网络上有多少人工智能文本?

团队利用FineWeb处理流程——它对规模庞大的网络存档Common Crawl进行筛选——重建了截至2026年6月的语料库:9600万份文档,830亿个词元(词元即模型读取的词语片段)。每份文档都用该公司的检测器Pangram进行了标注,其公布的误报率为0.05%;在2022年底ChatGPT发布之前的2021年的6万份文档中,它只把0.062%标记为人工智能文本。

在通过FineWeb质量筛选的网络文本中,人工智能写成的词元所占比例:

  • 2021年6月:不到0.1%;
  • 2024年6月:10.1%,2025年6月:16.1%;
  • 2026年6月:27.5%,2026年8月:31.1%;
  • 预测:2027年底42.3%,2028年底50.7%。

这种增长并不均衡。2026年,教程和“知识类文章”的词元中约有一半被标注为人工智能文本,而新闻中这一比例为9%,个人博客为5%。更糟糕的是,用于构建训练集的质量筛选器偏爱人工智能文本:FineWeb保留人工智能文档的频率是人类文档的2.3倍,DCLM筛选器则高达9.8倍。

800个模型接受检验

团队预训练了800个小型语言模型,参数量从1990万到9.73亿不等。他们在一套固定的人类文本中,按每个人类词元掺入0到64个人工智能词元的比例加入人工智能文本,并把每个模型与另一个同样的模型进行比较——后者得到的是同等数量的全新人类词元。

  • 人工智能文本只对数据匮乏的模型有帮助,即每个参数对应的人类词元少于约10个时。
  • 从常规的算力最优预算——每个参数约20个词元——开始,加入人工智能文本会增加模型在人类文本上的误差,而额外的人类文本则继续降低误差。
  • 用于预测人类文本时,人工智能文本的最佳比例从每个参数5个词元时的37%降至20个词元时的1%。而用于预测人工智能文本时,这一比例始终高于90%。
  • 重复使用同样的人类文本,胜过加入新的人工智能文本:多过一遍数据后误差降低2.3%,多过八遍后降低约6.3%。
  • 用人工智能文本训练的模型开始像人工智能一样写作:“delve”和“tapestry”这类词语的出现频率从每千词0.16次升至0.54次。

现有的“缩放定律”——根据模型规模和数据量预测模型误差的公式——把人工智能词元当作人类词元同等对待,因而在这一点上出了错。作者提出了一条新定律:收益会饱和,而危害按对数增长,因此一个人工智能词元的价值可能变为负值。该定律以最多2.68亿参数的模型拟合后,对规模大3.6倍的模型的预测误差比现有最佳定律低41%,不过附录指出,在人工智能文本比例较低的两个测试集上,其优势并不显著。

不加筛选的代价

根据这条定律,按2026年8月的人工智能文本比例,用未经筛选的网络文本进行训练,所需算力是仅用其中人类文本训练的1.6倍;按2028年的预测比例,则为3.0倍。而且这种损害很容易被忽视:人工智能文本更容易预测,因此一个含22.3%人工智能文本的验证集,把95.5%的有害训练报告成了改进。标准基准测试的得分在加入人工智能文本后的提升幅度,也与加入人类文本时大致相当。

作者建议:当目标是人类文本时,应筛除人工智能文本;在加入人工智能数据之前,先重复使用人类数据;并分别报告模型在人类文本和人工智能文本上的误差。这项研究的局限确实存在:模型参数不超过9.73亿,只涉及英语,只研究了预训练,而且只用了一个检测器,还是由作者所在公司开发的——这些结论对该公司的业务有利。为了便于独立核查,他们公开了语料库、全部800个模型以及代码。

Legal notice