प्रौद्योगिकी

ChatGPT के टेक्स्ट पर EU में अदृश्य वॉटरमार्क, जिसे OpenAI ने 2024 में रोक रखा था

Adrian Kessler
हमें Google पर जोड़ें

OpenAI लंबे समय तक सार्वजनिक रूप से यह समझाता रहा कि वह ChatGPT के जवाबों पर वॉटरमार्क क्यों नहीं लगाएगा। अब कंपनी फिर भी ऐसा कर रही है। इसकी वजह तकनीक के बारे में उसकी राय बदलना नहीं है। वजह है एक ऐसा कानून, जिसकी समय-सीमा तय है और उल्लंघन पर जुर्माना भी।

कंपनी का कहना है कि यूरोपीय संघ में उपयोगकर्ताओं के लिए ChatGPT और Codex से तैयार किए गए टेक्स्ट में एक अदृश्य सांख्यिकीय निशान होगा। आने वाले कुछ हफ़्तों में इसे सभी प्लान पर चरणबद्ध तरीके से लागू किया जाएगा। बाकी दुनिया में यही निशान सिर्फ़ डेवलपर API के एक विकल्प के रूप में मौजूद है, और यह विकल्प डिफ़ॉल्ट रूप से बंद रहता है। OpenAI ने अपनी सीमा उस क्षेत्राधिकार की सरहद पर खींची है, जो उस पर जुर्माना लगा सकता है।

ChatGPT का वॉटरमार्क कैसे काम करता है

textGrain नाम की यह विधि आउटपुट पर कुछ भी दिखाई देने वाला नहीं छापती। जब किसी वाक्य में अगले कई शब्द लगभग समान रूप से ठीक बैठ सकते हों, तो एक गुप्त कुंजी उनमें से किसी एक शब्द को चुनने की संभावना बढ़ा देती है। एक बार का यह छोटा-सा झुकाव अपने आप में कुछ नहीं बताता। लेकिन किसी अनुच्छेद में ऐसे सैकड़ों चुनाव मिलकर एक पैटर्न बनाते हैं, जिसे कुंजी रखने वाला डिटेक्टर परख सकता है। चूँकि संकेत शब्दों में ही मौजूद रहता है, इसलिए कॉपी-पेस्ट करने पर भी बना रहता है। OpenAI ने यह तकनीकी रिपोर्ट University of Pennsylvania और Yale के शोधकर्ताओं के साथ तैयार की। रिपोर्ट के मुताबिक़, गुणवत्ता पर इसका कोई उल्लेखनीय असर नहीं पड़ता: Artificial Analysis Intelligence Index पर वॉटरमार्क वाले आउटपुट को 49.76 अंक मिले, जबकि बिना निशान वाले आउटपुट को 49.57।

OpenAI के पास पहले से मौजूद औज़ार

OpenAI के भीतर यह सब नया नहीं है। 2024 की गर्मियों में Wall Street Journal ने बताया था कि कंपनी के पास एक काम करने वाला टेक्स्ट वॉटरमार्क था, जिसे आंतरिक दस्तावेज़ों में 99.9% प्रभावी आँका गया था, लेकिन कंपनी उसे जारी नहीं कर रही थी। OpenAI ने जवाब दिया कि वह “सोच-समझकर कदम उठा रही है।” कंपनी ने तकनीकी और सामाजिक, दोनों तरह की वजहें बताई थीं: बुरे इरादे वाले लोग किसी दूसरे मॉडल से अनुवाद या दोबारा लिखवाकर इस तरीके को “आसानी से नाकाम कर सकते हैं”; साथ ही, इससे उन लोगों के लिए AI को लेखन-सहायक के रूप में इस्तेमाल करना कलंकित हो सकता है जिनकी मातृभाषा अंग्रेज़ी नहीं है। इस हफ़्ते की घोषणा की ख़बर देते हुए TechCrunch ने उस दौर की एक तीसरी वजह भी याद दिलाई: यह चिंता कि उपयोगकर्ता उन प्रतिद्वंद्वी सेवाओं की ओर चले जाएँगे, जो वॉटरमार्क नहीं लगातीं।

इस पुराने रिकॉर्ड के संदर्भ में देखें तो नया विस्तार बताता है कि OpenAI ने वास्तव में किन चिंताओं का हल निकाला है। कंपनी के अपने आँकड़ों के मुताबिक़, वॉटरमार्क को दरकिनार करने की समस्या अब भी बनी हुई है। कारोबारी चिंता को सिर्फ़ एक बाज़ार तक सीमित कर दिया गया है।

आलोचकों के नहीं, OpenAI के अपने आँकड़े

अनुकूल परिस्थितियों में, जब ग़लत सकारात्मक नतीजों की दर 1% हो, तो डिटेक्टर 200 टोकन वाले वॉटरमार्कयुक्त अनुच्छेदों में से लगभग 80% और 400 टोकन वाले अनुच्छेदों में करीब 95% की पहचान कर लेता है। 10% शब्दों को समानार्थी शब्दों से बदलने पर पहचान दर 92% से गिरकर 66% रह जाती है। एक चौथाई शब्द बदल देने पर यह घटकर 17% हो जाती है। छोटे जवाबों, गणित और अनूदित टेक्स्ट को पकड़ना बेहद मुश्किल है। OpenAI ख़ुद चेतावनी देता है कि आदर्श परिस्थितियों में अच्छा प्रदर्शन “रोज़मर्रा के इस्तेमाल में भरोसेमंद पहचान की गारंटी नहीं देता” और वॉटरमार्क न मिलना इस बात का सबूत नहीं है कि टेक्स्ट किसी इंसान ने लिखा है। कंपनी यह भी कहती है कि निशान से उपयोगकर्ता की पहचान नहीं की जा सकती।

इस लिहाज़ से textGrain लापरवाही से किए गए कॉपी-पेस्ट को पकड़ने का कामचलाऊ संकेत है, लेकिन किसी ऐसे व्यक्ति के सामने कमज़ोर पड़ जाता है जो संपादन में एक मिनट लगाने को तैयार हो। कई भाषाओं में पढ़ने-लिखने वाले इस संघ में, अनुवाद से जुड़ी यह कमी कोई छोटी-मोटी बात नहीं है।

EU क्यों, और अभी क्यों

इसके पीछे कानूनी वजह AI Act का अनुच्छेद 50 है, जिसके पारदर्शिता संबंधी नियम 2 अगस्त से लागू हुए। इसके तहत जनरेटिव सिस्टम देने वाली कंपनियों को सिंथेटिक टेक्स्ट, ऑडियो, तस्वीरों और वीडियो पर मशीन से पढ़े जा सकने वाले तरीके से निशान लगाना होगा और पहचान का एक माध्यम भी देना होगा। उस तारीख़ से पहले बाज़ार में आ चुके सिस्टम—जिनमें ChatGPT भी शामिल है—को नियमों का पालन करने के लिए 2 दिसंबर तक का समय दिया गया है। क़ानूनी फ़र्म Cooley के विश्लेषण के मुताबिक़, उल्लंघन पर 1.5 करोड़ यूरो या दुनिया भर के सालाना कारोबार का 3% तक जुर्माना हो सकता है—इनमें से जो भी रकम ज़्यादा हो।

दो बातें दिखाती हैं कि यह कदम किसी सिद्धांत के बजाय कानूनी बाध्यता के हिसाब से कितनी बारीकी से उठाया गया है। पहली बात है डिटेक्टर। कानून पहचान का एक माध्यम माँगता है; OpenAI ने ऐसा माध्यम बनाया है, लेकिन इसे सिर्फ़ मंज़ूरशुदा शोधकर्ताओं और विशेषज्ञ संगठनों को दिया है, जिन्हें इसके लिए आवेदन करना होगा। The Decoder की रिपोर्ट के मुताबिक़, कंपनी का कहना है कि वह इसकी पहुँच “तभी बढ़ाएगी जब हमें लगेगा कि नतीजों की ज़िम्मेदाराना व्याख्या की जा सकती है।” उसने इसके लिए कोई समय-सीमा नहीं बताई है। लिस्बन या वारसॉ में बैठा कोई शिक्षक या संपादक आज किसी संदिग्ध टेक्स्ट की जाँच नहीं कर सकता।

दूसरी बात है इसका भौगोलिक दायरा। Anthropic ने अगस्त में Claude के टेक्स्ट पर वॉटरमार्क लगाना शुरू किया था। वह लोगों के अपने मॉडल तक पहुँचने के तरीके से परे, दुनिया भर में अपना निशान लागू करती है; इस वजह से कुछ उपयोगकर्ताओं ने उसकी आलोचना भी की। OpenAI ने उलटा रास्ता चुना: जहाँ नियामक जुर्माना लगा सकता है वहाँ वॉटरमार्क डिफ़ॉल्ट रूप से चालू, बाकी जगह डेवलपर की मर्ज़ी पर, और शुरुआत में दुनिया भर के लिए कोई डिफ़ॉल्ट व्यवस्था नहीं। अगर उपयोगकर्ताओं के बिना वॉटरमार्क वाले प्रतिद्वंद्वी सेवाओं की ओर चले जाने का पुराना डर दूर हो गया होता, तो नक्शे पर इस तरह सीमा खींचने की शायद ही कोई वजह होती।

अब आगे क्या

OpenAI का कहना है कि वह textGrain को ओपन सोर्स के रूप में जारी करेगी और यह Google के SynthID जैसे तरीकों के बराबर या उनसे बेहतर है। कोड सार्वजनिक होने के बाद इन दोनों दावों की जाँच की जा सकेगी। ब्रसेल्स के लिए सवाल इससे सीमित है: क्या ऐसा निशान, जो हल्के-से संपादन से मिट सकता है और जिसे ऐसा डिटेक्टर पढ़ता है जिसे लगभग कोई चला ही नहीं सकता, उस नियम की कसौटी पर खरा उतरता है जिसका मक़सद दूसरे सिस्टमों के लिए AI टेक्स्ट की पहचान संभव बनाना है?

2 दिसंबर के बाद, डिफ़ॉल्ट रूप से OpenAI का निशान उन्हीं ChatGPT उपयोगकर्ताओं के शब्दों पर होगा, जिनके नियामक कंपनी को बिल भेज सकते हैं।

टैग: , , , ,

हमें Google पर जोड़ें

चर्चा

0 टिप्पणियाँ हैं।