प्रौद्योगिकी

माइक्रोसॉफ्ट ने अपने ही दस्तावेज़ों में AI स्क्रैपिंग को “इतिहास की सबसे बड़ी श्रम-चोरी” कहा

Adrian Kessler
हमें Google पर जोड़ें

माइक्रोसॉफ्ट के एक वैज्ञानिक ने उस चीज़ को एक नाम दिया जो कंपनी बना रही थी, और वह नाम चापलूसी वाला नहीं था। बड़े भाषा मॉडल खुले वेब से कैसे सीखते हैं, इसकी समीक्षा करते हुए उन्होंने इसे “मानव इतिहास की सबसे बड़ी श्रम चोरी” कहा। यह पंक्ति आंतरिक पढ़ने के लिए लिखी गई थी। अब यह अदालत में एक प्रदर्शनी बन चुकी है।

यह वाक्यांश एक ‘गॉचा’ के रूप में सामने आ रहा है: AI की दिग्गज कंपनी का अपना कर्मचारी व्यवसाय मॉडल को चोरी बता रहा है। यह पढ़ना बहुत छोटा है। जो बातें खोली गई अदालती दस्तावेज़ वास्तव में दिखाते हैं, वह यह है कि एक कंपनी जो उस तंत्र को समझती थी जिसका वह मुद्रीकरण कर रही थी, उस तंत्र को सादी भाषा में वर्णित किया, और फिर भी उत्पाद को शिप कर दिया। दिलचस्प हिस्सा अपमान नहीं है। यह उसके नीचे का आरेख है।

यह दस्तावेज़ ब्रेंट हेख्ट (Brent Hecht) का है, जो माइक्रोसॉफ्ट में एप्लाइड साइंस के निदेशक हैं, और यह कॉपीराइट मामले में सामने आया है जो द न्यूयॉर्क टाइम्स ने OpenAI और माइक्रोसॉफ्ट के खिलाफ दायर किया था। हेख्ट ने तर्क दिया कि प्रकाशित कार्यों पर बिना भुगतान के मॉडलों को प्रशिक्षित करना “अभूतपूर्व अनुपात की एक चौंकाने वाली चोरी” के बराबर है। एक अलग आंतरिक प्रस्तुति इस तंत्र में और गहराई तक गई: इसमें चेतावनी दी गई कि माइक्रोसॉफ्ट की AI सामग्री रणनीति ने एक “डूम लूप” शुरू कर दिया है जो “हमारे मॉडलों के प्रदर्शन और पूरे वेब को एक साथ नुकसान पहुंचाएगा।” एक पंक्ति में लिखा है, बड़े भाषा मॉडल “एक ऐसा उत्पाद हैं जो अपनी आपूर्ति श्रृंखला को नष्ट कर देता है।”

यह अंतिम वाक्य सात शब्दों में पूरी कहानी है। एक चैटबॉट जो सर्च बॉक्स के अंदर ही सवाल का जवाब देता है, वह उस पेज पर क्लिक करने का कारण खत्म कर देता है जिससे उसने सीखा था। कम क्लिक का मतलब है उन साइटों के लिए कम राजस्व जो लेखन का उत्पादन करती हैं, जिसका मतलब है कि उनमें से कम साइटें बचेंगी, जिसका मतलब है कि अगले मॉडल के प्रशिक्षण के लिए कम ताज़ा मानव पाठ उपलब्ध होगा। माइक्रोसॉफ्ट ने इस लूप को बाहर से सिद्धांतित नहीं किया। उसके अपने डेटा ने इसे मापा: Copilot के उत्तर इंजन ने टाइम्स की साइट पर क्लिक-थ्रू दरों को सामान्य सर्च की तुलना में 93 प्रतिशत तक कम कर दिया।

दस्तावेज़ इस व्यापार के इनपुट पक्ष को भी मापते हैं। OpenAI के मध्य-प्रशिक्षण डेटा में टाइम्स, डेली न्यूज़ और सेंटर फॉर इन्वेस्टिगेटिव रिपोर्टिंग के 91,000 से अधिक कार्यों की प्रतियां थीं। कॉमन क्रॉल (Common Crawl) से लिया गया एक डेटासेट अकेले nytimes.com से 20 लाख से अधिक दस्तावेज़ ले गया। प्रोजेक्ट मैंगो (Project Mango) नामक एक संग्रह में समाचार प्रकाशकों के कम से कम 160,000 अद्वितीय कार्य शामिल थे। दस्तावेज़ों में पेवॉल को बायपास करने और पाठ को फीड करने से पहले उससे कॉपीराइट नोटिस हटाने का वर्णन है।

OpenAI के अपने अधिकारी इस प्रभाव के बारे में अनजान नहीं थे। निक टर्ले (Nick Turley), जो ChatGPT चलाते हैं, को उन उत्पादों का वर्णन करते हुए उद्धृत किया गया है जो पत्रकारिता के लिए “बड़े पैमाने पर प्रतिस्थापनात्मक” हैं और इस बदलाव को प्रकाशकों के लिए एक “अस्तित्वगत खतरा” बताते हैं। यह वही निष्कर्ष है जिस पर हेख्ट पहुंचे थे, बस एक अलग नौकरी के शीर्षक के तहत दायर किया गया।

यहाँ यह बताया गया है कि शर्मिंदगी से परे यह भाषा क्यों मायने रखती है। माइक्रोसॉफ्ट ने इन टिप्पणियों से खुद को दूर कर लिया है, अदालत को बताया कि उसकी वास्तविक स्थिति कॉपीराइट कानून का अनुपालन करती है, और दोनों कंपनियों ने लीक पर टिप्पणी करने से इनकार कर दिया। लेकिन एक उचित-उपयोग बचाव आंशिक रूप से इस बात पर निर्भर करता है कि कंपनी क्या जानती थी और उसका इरादा क्या था। ऐसे दस्तावेज़ जिनमें उसके अपने वैज्ञानिक नुकसान का नाम लेते हैं — चोरी, एक नष्ट आपूर्ति श्रृंखला, एक खोखला वेब — ऐसी राय नहीं हैं जिन्हें कंपनी आसानी से खारिज कर सके। वे इस बात के सबूत के रूप में पढ़े जाते हैं कि इस तंत्र को स्केल होने से पहले समझ लिया गया था।

जिस वेब से इन मॉडलों ने सीखा, वह उन लोगों द्वारा बनाया गया था जिन्होंने मान लिया था कि दूसरे छोर पर एक पाठक है। माइक्रोसॉफ्ट के दस्तावेज़ दिखाते हैं कि वह लिखित रूप में जानता था कि पाठक को इंजीनियरिंग के ज़रिए बाहर किया जा रहा है, और उसने निर्माण जारी रखा।

टैग: , , , , ,

हमें Google पर जोड़ें

चर्चा

0 टिप्पणियाँ हैं।