कंप्यूटिंग और एआईप्रीप्रिंटप्रयोगपढ़ने में 4 मिनट

वेब का लगभग एक-तिहाई हिस्सा अब एआई लिखता है

बड़े भाषा मॉडल ज़्यादातर वेब से इकट्ठा किए गए पाठ से सीखते हैं। उस पाठ का अधिकाधिक हिस्सा ख़ुद एआई का लिखा होता है। लेखक इसे “जंगली” एआई-पाठ (wild AI text) कहते हैं: कई अलग-अलग मॉडलों द्वारा मानव पाठकों के लिए लिखा गया, ऑनलाइन प्रकाशित, और प्रशिक्षण-आँकड़ों में मानव-पाठ के साथ मिला-जुला और बिना लेबल बह आया पाठ। यह न तो “मॉडल पतन” (मॉडल कोलैप्स) है, जिसमें कोई मॉडल अपने ही आउटपुट पर दोबारा प्रशिक्षित होता है, और न ही प्रशिक्षण में मदद के लिए जान-बूझकर बनाया गया चुनिंदा कृत्रिम (सिंथेटिक) डेटा।

मैरीलैंड विश्वविद्यालय और एआई-पाठ डिटेक्टर बेचने वाली कंपनी Pangram Labs की जेना रसेल, मोहित अय्यर और उनके सहयोगियों ने यह मापने का बीड़ा उठाया कि ऐसा पाठ कितना है और यह मॉडल पर क्या असर डालता है।

वेब पर कितना एआई है?

FineWeb प्रक्रिया-शृंखला का उपयोग करके, जो वेब के विशाल अभिलेखागार Common Crawl को छानती है, टीम ने जून 2026 तक का कॉर्पस फिर से बनाया: 9.6 करोड़ दस्तावेज़, 83 अरब टोकन — शब्दों के वे टुकड़े जिन्हें मॉडल पढ़ता है। हर दस्तावेज़ को कंपनी के डिटेक्टर Pangram से लेबल किया गया, जिसकी बताई गई ग़लत-सकारात्मक दर 0.05% है; 2022 के अंत में ChatGPT के जारी होने से पहले, 2021 के 60,000 दस्तावेज़ों में से इसने केवल 0.062% को एआई के रूप में चिह्नित किया।

FineWeb के गुणवत्ता-फ़िल्टरों से गुज़रने वाले वेब-पाठ में एआई-लिखित टोकनों का हिस्सा:

  • जून 2021 में 0.1% से कम;
  • जून 2024 में 10.1%, जून 2025 में 16.1%;
  • जून 2026 में 27.5%, अगस्त 2026 में 31.1%;
  • पूर्वानुमान: 2027 के अंत में 42.3%, 2028 के अंत में 50.7%।

यह बढ़ोतरी असमान है। 2026 में ट्यूटोरियल और “ज्ञान लेख” के लगभग आधे टोकन एआई-लेबल वाले हैं, जबकि समाचारों में 9% और निजी ब्लॉगों में 5%। इससे भी बुरा यह कि प्रशिक्षण-समुच्चय बनाने में इस्तेमाल होने वाले गुणवत्ता-फ़िल्टर एआई-पाठ का पक्ष लेते हैं: FineWeb एआई-दस्तावेज़ों को मानव-दस्तावेज़ों की तुलना में 2.3 गुना ज़्यादा बार रखता है, और DCLM फ़िल्टर 9.8 गुना ज़्यादा।

800 मॉडलों की परीक्षा

टीम ने 1.99 करोड़ से 97.3 करोड़ पैरामीटर तक के 800 छोटे भाषा मॉडल पूर्व-प्रशिक्षित (प्रीट्रेन) किए। उन्होंने मानव-पाठ के एक तय संग्रह में प्रति मानव टोकन शून्य से 64 एआई टोकन तक जोड़े, और हर एक की तुलना उसी मॉडल से की जिसे इसके बजाय उतने ही नए मानव टोकन दिए गए।

  • एआई-पाठ ने केवल आँकड़ों से वंचित मॉडलों की मदद की, यानी प्रति पैरामीटर लगभग 10 मानव टोकन से नीचे।
  • प्रति पैरामीटर लगभग 20 टोकन के सामान्य, गणना की दृष्टि से इष्टतम बजट से आगे, एआई-पाठ जोड़ने से मानव-पाठ पर त्रुटि बढ़ी, जबकि अतिरिक्त मानव-पाठ उसे घटाता रहा।
  • मानव-पाठ का पूर्वानुमान लगाने के लिए एआई-पाठ का सबसे अच्छा हिस्सा प्रति पैरामीटर 5 टोकन पर 37% से गिरकर 20 पर 1% रह गया। एआई-पाठ का पूर्वानुमान लगाने के लिए यह 90% से ऊपर बना रहा।
  • एक ही मानव-पाठ को दोहराना नया एआई-पाठ जोड़ने से बेहतर रहा: एक अतिरिक्त दौर के बाद 2.3% कम त्रुटि, आठ के बाद लगभग 6.3% कम।
  • एआई-पाठ पर प्रशिक्षित मॉडल एआई की तरह लिखने लगे: “delve” और “tapestry” जैसे शब्द प्रति 1,000 शब्दों में 0.16 से बढ़कर 0.54 हो गए।

मौजूदा “स्केलिंग नियम” — वे सूत्र जो किसी मॉडल के आकार और आँकड़ों से उसकी त्रुटि का अनुमान लगाते हैं — एआई टोकन को मानव टोकन जैसा ही मानते हैं और यहाँ ग़लत साबित होते हैं। लेखक एक नया नियम प्रस्तावित करते हैं, जिसमें लाभ संतृप्त हो जाता है और हानि लघुगणकीय रूप से बढ़ती है, जिससे किसी एआई टोकन का मूल्य ऋणात्मक हो सकता है। 26.8 करोड़ पैरामीटर तक के मॉडलों पर फ़िट किया गया यह नियम 3.6 गुना बड़े मॉडलों के बारे में सबसे अच्छे मौजूदा नियम से 41% कम त्रुटि के साथ पूर्वानुमान लगाता है, हालाँकि परिशिष्ट में बताया गया है कि कम एआई-हिस्से वाले दो परीक्षण-समुच्चयों पर इसकी बढ़त महत्वपूर्ण नहीं है।

न छानने का बिल

इस नियम के अनुसार, अगस्त 2026 के एआई-हिस्से वाले बिना छने वेब-पाठ पर प्रशिक्षण में केवल उसके मानव हिस्से पर प्रशिक्षण की तुलना में 1.6 गुना कंप्यूटिंग शक्ति लगती है — और 2028 के लिए अनुमानित हिस्से पर 3.0 गुना। और नुक़सान आसानी से नज़र से छूट जाता है: एआई-पाठ का पूर्वानुमान लगाना ज़्यादा आसान है, इसलिए 22.3% एआई-पाठ वाले एक सत्यापन-समुच्चय ने 95.5% हानिकारक रनों को सुधार के रूप में दिखाया। मानक बेंचमार्क स्कोर भी एआई-पाठ के साथ लगभग उतने ही बढ़े जितने मानव-पाठ के साथ।

लेखक सुझाव देते हैं कि जब लक्ष्य मानव-पाठ हो तो एआई-पाठ को छाना जाए, एआई-डेटा जोड़ने से पहले मानव-डेटा दोहराया जाए, और मानव-पाठ तथा एआई-पाठ पर त्रुटियाँ अलग-अलग बताई जाएँ। सीमाएँ वास्तविक हैं: 97.3 करोड़ पैरामीटर से बड़े मॉडल नहीं, केवल अंग्रेज़ी, केवल पूर्व-प्रशिक्षण, और एक ही डिटेक्टर, जिसे लेखकों की कंपनी ने बनाया है — जिसके कारोबार के पक्ष में ये निष्कर्ष जाते हैं। स्वतंत्र जाँच संभव बनाने के लिए वे कॉर्पस, सभी 800 मॉडल और कोड सार्वजनिक कर रहे हैं।

Legal notice