Informática e IAPrepublicaciónExperimento4 min de lectura

CASI UN TERCIO DE LA WEB YA LO ESCRIBE LA IA

Los grandes modelos de lenguaje aprenden sobre todo de texto recopilado en la web. Y cada vez más de ese texto está escrito, a su vez, por IA. Los autores lo llaman texto de IA «salvaje» (wild): escrito por muchos modelos distintos para lectores humanos, publicado en línea y arrastrado a los datos de entrenamiento mezclado con texto humano y sin etiquetar. No se trata del «colapso del modelo», en el que un modelo se reentrena con su propia producción, ni de datos sintéticos seleccionados y producidos a propósito para ayudar al entrenamiento.

Jenna Russell, Mohit Iyyer y sus colegas de la Universidad de Maryland y de Pangram Labs, una empresa que vende un detector de texto generado por IA, se propusieron medir cuánto texto de este tipo hay y qué efecto tiene sobre un modelo.

¿Cuánta IA hay en la web?

Con la cadena de procesamiento FineWeb, que filtra el enorme archivo web Common Crawl, el equipo reconstruyó el corpus hasta junio de 2026: 96 millones de documentos, 83 000 millones de tokens, los fragmentos de palabra que lee un modelo. Cada documento se etiquetó con el detector de la empresa, Pangram, cuya tasa de falsos positivos declarada es del 0,05 %; en 60 000 documentos de 2021, anteriores al lanzamiento de ChatGPT a finales de 2022, solo marcó como IA el 0,062 %.

Proporción de tokens escritos por IA en el texto web que supera los filtros de calidad de FineWeb:

  • menos del 0,1 % en junio de 2021;
  • 10,1 % en junio de 2024, 16,1 % en junio de 2025;
  • 27,5 % en junio de 2026, 31,1 % en agosto de 2026;
  • previsión: 42,3 % a finales de 2027, 50,7 % a finales de 2028.

El aumento es desigual. En 2026, aproximadamente la mitad de los tokens de tutoriales y de «artículos de conocimiento» están etiquetados como IA, frente al 9 % de las noticias y el 5 % de los blogs personales. Peor aún, los filtros de calidad que se usan para construir los conjuntos de entrenamiento favorecen el texto de IA: FineWeb conserva los documentos de IA 2,3 veces más a menudo que los humanos, y el filtro DCLM, 9,8 veces más.

800 modelos puestos a prueba

El equipo preentrenó 800 pequeños modelos de lenguaje, de 19,9 millones a 973 millones de parámetros, añadiendo entre cero y 64 tokens de IA por cada token humano a un cuerpo fijo de texto humano, y comparó cada uno con el mismo modelo al que se le daba, en su lugar, el mismo número de tokens humanos nuevos.

  • El texto de IA solo ayudaba a los modelos escasos de datos, por debajo de unos 10 tokens humanos por parámetro.
  • A partir del presupuesto habitual óptimo en cálculo, de unos 20 tokens por parámetro, añadir texto de IA aumentaba el error con el texto humano, mientras que el texto humano adicional seguía reduciéndolo.
  • La mejor proporción de texto de IA para predecir texto humano cayó del 37 % con 5 tokens por parámetro al 1 % con 20. Para predecir texto de IA, se mantuvo por encima del 90 %.
  • Repetir el mismo texto humano superaba a añadir texto de IA nuevo: un error un 2,3 % menor tras una pasada adicional, y alrededor de un 6,3 % menor tras ocho.
  • Los modelos entrenados con texto de IA empezaron a escribir como una IA: expresiones como «delve» y «tapestry» pasaron de 0,16 a 0,54 por cada 1000 palabras.

Las «leyes de escala» existentes —fórmulas que predicen el error de un modelo a partir de su tamaño y sus datos— tratan un token de IA como uno humano y se equivocan en esto. Los autores proponen una nueva ley con un beneficio que se satura y un perjuicio que crece de forma logarítmica, de modo que el valor de un token de IA puede volverse negativo. Ajustada con modelos de hasta 268 millones de parámetros, predice el comportamiento de modelos 3,6 veces mayores con un 41 % menos de error que la mejor ley existente, aunque el apéndice señala que su ventaja no es significativa en dos conjuntos de prueba con proporciones bajas de IA.

La factura de no filtrar

Según esta ley, entrenar con texto web sin filtrar con la proporción de IA de agosto de 2026 cuesta 1,6 veces la potencia de cálculo necesaria para entrenar solo con su parte humana, y 3,0 veces con la proporción prevista para 2028. Y el daño pasa fácilmente desapercibido: el texto de IA es más fácil de predecir, así que un conjunto de validación con un 22,3 % de texto de IA presentó el 95,5 % de los entrenamientos perjudiciales como mejoras. Las puntuaciones en las pruebas de referencia estándar también subieron aproximadamente lo mismo con texto de IA que con texto humano.

Los autores recomiendan filtrar el texto de IA cuando el objetivo es el texto humano, repetir los datos humanos antes de añadir datos de IA e informar por separado de los errores con texto humano y con texto de IA. Las limitaciones son reales: modelos de no más de 973 millones de parámetros, solo en inglés, solo preentrenamiento y un único detector, fabricado por la empresa de los autores, cuyo negocio se ve favorecido por estas conclusiones. Para permitir verificaciones independientes, publican el corpus, los 800 modelos y el código.

Legal notice