Информатика и ИИПрепринтЭксперимент3 мин чтения

ПОЧТИ ТРЕТЬ ИНТЕРНЕТА ТЕПЕРЬ ПИШЕТ ИИ

Большие языковые модели учатся в основном на текстах, собранных в интернете. Всё больше этих текстов пишет сам ИИ. Авторы называют это «диким» ИИ-текстом: он написан множеством разных моделей для людей-читателей, опубликован в сети и попадает в обучающие данные вперемешку с человеческим текстом и без пометок. Это не «коллапс модели», когда модель переобучают на её собственном выводе, и не отобранные синтетические данные, специально созданные в помощь обучению.

Дженна Расселл, Мохит Айер и их коллеги из Мэрилендского университета и Pangram Labs — компании, продающей детектор ИИ-текста, — решили измерить, сколько такого текста существует и как он влияет на модель.

Сколько ИИ в интернете?

С помощью конвейера FineWeb, который фильтрует огромный веб-архив Common Crawl, команда воссоздала корпус вплоть до июня 2026 года: 96 миллионов документов, 83 миллиарда токенов — фрагментов слов, которые читает модель. Каждый документ был размечен детектором компании Pangram с заявленной долей ложных срабатываний 0,05%; на 60 000 документов 2021 года, то есть до выхода ChatGPT в конце 2022-го, он пометил как ИИ лишь 0,062%.

Доля написанных ИИ токенов в веб-тексте, прошедшем фильтры качества FineWeb:

  • меньше 0,1% в июне 2021 года;
  • 10,1% в июне 2024-го, 16,1% в июне 2025-го;
  • 27,5% в июне 2026-го, 31,1% в августе 2026-го;
  • прогноз: 42,3% к концу 2027-го, 50,7% к концу 2028-го.

Рост неравномерен. В 2026 году около половины токенов учебных руководств и «статей-справок» помечены как ИИ — против 9% новостей и 5% личных блогов. Хуже того, фильтры качества, используемые для сборки обучающих наборов, отдают предпочтение ИИ-тексту: FineWeb сохраняет ИИ-документы в 2,3 раза чаще, чем человеческие, а фильтр DCLM — в 9,8 раза чаще.

800 моделей на проверке

Команда предобучила 800 небольших языковых моделей размером от 19,9 миллиона до 973 миллионов параметров, добавляя от нуля до 64 ИИ-токенов на каждый человеческий токен к фиксированному массиву человеческого текста, и сравнила каждую с такой же моделью, которая вместо этого получила столько же свежих человеческих токенов.

  • ИИ-текст помогал только моделям, страдающим от нехватки данных, — ниже примерно 10 человеческих токенов на параметр.
  • Начиная с обычного вычислительно-оптимального бюджета около 20 токенов на параметр, добавление ИИ-текста увеличивало ошибку на человеческом тексте, тогда как дополнительный человеческий текст продолжал её снижать.
  • Оптимальная доля ИИ-текста для предсказания человеческого текста упала с 37% при 5 токенах на параметр до 1% при 20. Для предсказания ИИ-текста она оставалась выше 90%.
  • Повторение того же человеческого текста оказалось лучше добавления свежего ИИ-текста: ошибка на 2,3% ниже после одного дополнительного прохода и примерно на 6,3% — после восьми.
  • Модели, обученные на ИИ-тексте, начали писать как ИИ: частота слов вроде «delve» и «tapestry» выросла с 0,16 до 0,54 на 1000 слов.

Существующие «законы масштабирования» — формулы, предсказывающие ошибку модели по её размеру и объёму данных, — считают ИИ-токен равноценным человеческому и потому ошибаются. Авторы предлагают новый закон, в котором польза насыщается, а вред растёт логарифмически, так что ценность ИИ-токена может стать отрицательной. Подогнанный на моделях до 268 миллионов параметров, он предсказывает модели в 3,6 раза крупнее с на 41% меньшей ошибкой, чем лучший существующий закон, хотя в приложении отмечено, что на двух тестовых наборах с малой долей ИИ его преимущество незначимо.

Цена отказа от фильтрации

Согласно этому закону, обучение на нефильтрованном веб-тексте с долей ИИ, как в августе 2026 года, требует в 1,6 раза больше вычислительной мощности, чем обучение только на его человеческой части, — и в 3,0 раза больше при доле, прогнозируемой на 2028 год. Причём вред легко не заметить: ИИ-текст проще предсказывать, поэтому валидационный набор с 22,3% ИИ-текста представил 95,5% вредных прогонов как улучшения. Результаты стандартных бенчмарков тоже росли от ИИ-текста примерно так же, как от человеческого.

Авторы рекомендуют отфильтровывать ИИ-текст, если цель — человеческий текст, повторять человеческие данные, прежде чем добавлять ИИ-данные, и сообщать ошибки на человеческом и ИИ-тексте раздельно. Ограничения реальны: модели не крупнее 973 миллионов параметров, только английский язык, только предобучение и один-единственный детектор, созданный компанией авторов, — бизнесу которой эти выводы выгодны. Чтобы сделать возможной независимую проверку, они публикуют корпус, все 800 моделей и код.

Legal notice