वेब का लगभग एक-तिहाई हिस्सा अब एआई लिखता है
बड़े भाषा मॉडल ज़्यादातर वेब से इकट्ठा किए गए पाठ से सीखते हैं। उस पाठ का अधिकाधिक हिस्सा ख़ुद एआई का लिखा होता है। लेखक इसे “जंगली” एआई-पाठ (wild AI text) कहते हैं: कई अलग-अलग मॉडलों द्वारा मानव पाठकों के लिए लिखा गया, ऑनलाइन प्रकाशित, और प्रशिक्षण-आँकड़ों में मानव-पाठ के साथ मिला-जुला और बिना लेबल बह आया पाठ। यह न तो “मॉडल पतन” (मॉडल कोलैप्स) है, जिसमें कोई मॉडल अपने ही आउटपुट पर दोबारा प्रशिक्षित होता है, और न ही प्रशिक्षण में मदद के लिए जान-बूझकर बनाया गया चुनिंदा कृत्रिम (सिंथेटिक) डेटा।
मैरीलैंड विश्वविद्यालय और एआई-पाठ डिटेक्टर बेचने वाली कंपनी Pangram Labs की जेना रसेल, मोहित अय्यर और उनके सहयोगियों ने यह मापने का बीड़ा उठाया कि ऐसा पाठ कितना है और यह मॉडल पर क्या असर डालता है।
वेब पर कितना एआई है?
FineWeb प्रक्रिया-शृंखला का उपयोग करके, जो वेब के विशाल अभिलेखागार Common Crawl को छानती है, टीम ने जून 2026 तक का कॉर्पस फिर से बनाया: 9.6 करोड़ दस्तावेज़, 83 अरब टोकन — शब्दों के वे टुकड़े जिन्हें मॉडल पढ़ता है। हर दस्तावेज़ को कंपनी के डिटेक्टर Pangram से लेबल किया गया, जिसकी बताई गई ग़लत-सकारात्मक दर 0.05% है; 2022 के अंत में ChatGPT के जारी होने से पहले, 2021 के 60,000 दस्तावेज़ों में से इसने केवल 0.062% को एआई के रूप में चिह्नित किया।
FineWeb के गुणवत्ता-फ़िल्टरों से गुज़रने वाले वेब-पाठ में एआई-लिखित टोकनों का हिस्सा:
- जून 2021 में 0.1% से कम;
- जून 2024 में 10.1%, जून 2025 में 16.1%;
- जून 2026 में 27.5%, अगस्त 2026 में 31.1%;
- पूर्वानुमान: 2027 के अंत में 42.3%, 2028 के अंत में 50.7%।
यह बढ़ोतरी असमान है। 2026 में ट्यूटोरियल और “ज्ञान लेख” के लगभग आधे टोकन एआई-लेबल वाले हैं, जबकि समाचारों में 9% और निजी ब्लॉगों में 5%। इससे भी बुरा यह कि प्रशिक्षण-समुच्चय बनाने में इस्तेमाल होने वाले गुणवत्ता-फ़िल्टर एआई-पाठ का पक्ष लेते हैं: FineWeb एआई-दस्तावेज़ों को मानव-दस्तावेज़ों की तुलना में 2.3 गुना ज़्यादा बार रखता है, और DCLM फ़िल्टर 9.8 गुना ज़्यादा।
800 मॉडलों की परीक्षा
टीम ने 1.99 करोड़ से 97.3 करोड़ पैरामीटर तक के 800 छोटे भाषा मॉडल पूर्व-प्रशिक्षित (प्रीट्रेन) किए। उन्होंने मानव-पाठ के एक तय संग्रह में प्रति मानव टोकन शून्य से 64 एआई टोकन तक जोड़े, और हर एक की तुलना उसी मॉडल से की जिसे इसके बजाय उतने ही नए मानव टोकन दिए गए।
- एआई-पाठ ने केवल आँकड़ों से वंचित मॉडलों की मदद की, यानी प्रति पैरामीटर लगभग 10 मानव टोकन से नीचे।
- प्रति पैरामीटर लगभग 20 टोकन के सामान्य, गणना की दृष्टि से इष्टतम बजट से आगे, एआई-पाठ जोड़ने से मानव-पाठ पर त्रुटि बढ़ी, जबकि अतिरिक्त मानव-पाठ उसे घटाता रहा।
- मानव-पाठ का पूर्वानुमान लगाने के लिए एआई-पाठ का सबसे अच्छा हिस्सा प्रति पैरामीटर 5 टोकन पर 37% से गिरकर 20 पर 1% रह गया। एआई-पाठ का पूर्वानुमान लगाने के लिए यह 90% से ऊपर बना रहा।
- एक ही मानव-पाठ को दोहराना नया एआई-पाठ जोड़ने से बेहतर रहा: एक अतिरिक्त दौर के बाद 2.3% कम त्रुटि, आठ के बाद लगभग 6.3% कम।
- एआई-पाठ पर प्रशिक्षित मॉडल एआई की तरह लिखने लगे: “delve” और “tapestry” जैसे शब्द प्रति 1,000 शब्दों में 0.16 से बढ़कर 0.54 हो गए।
मौजूदा “स्केलिंग नियम” — वे सूत्र जो किसी मॉडल के आकार और आँकड़ों से उसकी त्रुटि का अनुमान लगाते हैं — एआई टोकन को मानव टोकन जैसा ही मानते हैं और यहाँ ग़लत साबित होते हैं। लेखक एक नया नियम प्रस्तावित करते हैं, जिसमें लाभ संतृप्त हो जाता है और हानि लघुगणकीय रूप से बढ़ती है, जिससे किसी एआई टोकन का मूल्य ऋणात्मक हो सकता है। 26.8 करोड़ पैरामीटर तक के मॉडलों पर फ़िट किया गया यह नियम 3.6 गुना बड़े मॉडलों के बारे में सबसे अच्छे मौजूदा नियम से 41% कम त्रुटि के साथ पूर्वानुमान लगाता है, हालाँकि परिशिष्ट में बताया गया है कि कम एआई-हिस्से वाले दो परीक्षण-समुच्चयों पर इसकी बढ़त महत्वपूर्ण नहीं है।
न छानने का बिल
इस नियम के अनुसार, अगस्त 2026 के एआई-हिस्से वाले बिना छने वेब-पाठ पर प्रशिक्षण में केवल उसके मानव हिस्से पर प्रशिक्षण की तुलना में 1.6 गुना कंप्यूटिंग शक्ति लगती है — और 2028 के लिए अनुमानित हिस्से पर 3.0 गुना। और नुक़सान आसानी से नज़र से छूट जाता है: एआई-पाठ का पूर्वानुमान लगाना ज़्यादा आसान है, इसलिए 22.3% एआई-पाठ वाले एक सत्यापन-समुच्चय ने 95.5% हानिकारक रनों को सुधार के रूप में दिखाया। मानक बेंचमार्क स्कोर भी एआई-पाठ के साथ लगभग उतने ही बढ़े जितने मानव-पाठ के साथ।
लेखक सुझाव देते हैं कि जब लक्ष्य मानव-पाठ हो तो एआई-पाठ को छाना जाए, एआई-डेटा जोड़ने से पहले मानव-डेटा दोहराया जाए, और मानव-पाठ तथा एआई-पाठ पर त्रुटियाँ अलग-अलग बताई जाएँ। सीमाएँ वास्तविक हैं: 97.3 करोड़ पैरामीटर से बड़े मॉडल नहीं, केवल अंग्रेज़ी, केवल पूर्व-प्रशिक्षण, और एक ही डिटेक्टर, जिसे लेखकों की कंपनी ने बनाया है — जिसके कारोबार के पक्ष में ये निष्कर्ष जाते हैं। स्वतंत्र जाँच संभव बनाने के लिए वे कॉर्पस, सभी 800 मॉडल और कोड सार्वजनिक कर रहे हैं।
