प्रौद्योगिकी

OpenAI ने AGI का युग घोषित किया। बताए गए बेंचमार्क में स्कोर 37 अंक कम

Adrian Kessler

जेन्सेन हुआंग (Jensen Huang) का X पर पोस्ट एक ही वाक्य और बधाई तक सीमित था: “फ्रॉम चैटजीपीटी टू o1 टू एस्ट्रा इन 4 इयर्स, एजीआई हैज़ अराइव्ड। कॉन्ग्रैचुलेशंस @OpenAI टीम।” उन्होंने यह 6 सितंबर को भेजा। इससे तीन दिन पहले, OpenAI के अध्यक्ष ग्रेग ब्रॉकमैन (Greg Brockman) ने प्रेस से लगभग वही बात कही थी: “वेलकम टू द एजीआई एरा।” ये दोनों घोषणाएँ लगभग एक साथ आईं, दो ऐसे व्यक्तियों से जिनके परस्पर पूरक हित थे, और इन्हें बड़े पैमाने पर पुष्टि के रूप में लिया गया।

इस दावे के पीछे का बेंचमार्क ARC-AGI-3 था। OpenAI ने कहा कि Astra, जो GPT-6 पदनाम के तहत जारी किया गया उनका नया फ्रंटियर मॉडल है, ने ARC-AGI-3 पर 99.9% और FrontierMath Tier 4 पर 98% अंक प्राप्त किए। मानक परिस्थितियों में इस स्तर के अंक एक वास्तविक विच्छिन्नता (discontinuity) का प्रतिनिधित्व करेंगे — एक ऐसा मॉडल जो सिर्फ अच्छा प्रदर्शन नहीं करता, बल्कि उस क्षेत्र में पहुँचता है जिसे पहले के बेंचमार्क आकांक्षात्मक मानते थे। ARC-AGI-3 बनाने वाले संगठन ने अपने मानक मूल्यांकन हार्नेस से एक स्कोर प्रकाशित किया: 62.7%।

इन दोनों संख्याओं के बीच सैंतीस प्रतिशत अंकों का अंतर है। दोनों ही वास्तविक मूल्यांकनों से आए हैं। OpenAI का आंतरिक हार्नेस और बेंचमार्क निर्माताओं का संदर्भ हार्नेस एक ही प्रोटोकॉल नहीं हैं, और एक ही मॉडल प्रत्येक के तहत अलग-अलग स्कोर उत्पन्न करता है। ARC-AGI-3 संगठन जिस संदर्भ स्थिति का उपयोग करता है — वह जिसे वह क्षेत्र में मॉडलों की तुलना के लिए वैध मानता है — उसने 62.7% उत्पन्न किया। OpenAI की आंतरिक सेटअप ने 99.9% उत्पन्न किया। इन संख्याओं के बीच का अंतर एक मजबूत बेंचमार्क परिणाम और आगमन की घोषणा के बीच का अंतर है।

AGI की बधाई के पीछे चिप की बिक्री

Astra को NVIDIA चिप्स पर प्रशिक्षित किया गया था। हुआंग NVIDIA चिप्स बेचते हैं। जब कोई सीईओ सार्वजनिक रूप से किसी ग्राहक को एक ऐतिहासिक सीमा पार करने पर बधाई देता है — एक ऐसी सीमा जो उस उत्पाद को बनाने में उपयोग किए गए हार्डवेयर को आगे आने वाली चीज़ों के लिए परिभाषित बुनियादी ढाँचा बनाती है — तो यह घोषणा, संरचनात्मक रूप से, एक वाणिज्यिक दावा है। कोई षड्यंत्र नहीं। एक संरचनात्मक वास्तविकता: हितों का टकराव दिखाई दे रहा था, फ्रेमिंग आगमन के बारे में थी, प्रदर्शन के बारे में नहीं, और अधिकांश कवरेज ने बिना किसी टिप्पणी के दोनों को स्वीकार कर लिया।

AI बुनियादी ढाँचे के लिए चिप बाजार कथा पर चलता है। यदि Astra AGI है, तो जिसने भी Astra को प्रशिक्षित किया वह AGI-पश्चात दुनिया का हार्डवेयर बन जाता है — और अगले प्रशिक्षण रन के लिए चिप खरीदने वाली कंपनियाँ उस बेंचमार्क की ओर खरीदारी करेंगी। इस विशिष्ट अर्थ में, हुआंग की बधाई एक उत्पाद वक्तव्य भी थी। यह वक्तव्य एक ऐसी संख्या पर निर्भर था जिसे बेंचमार्क संगठन ने स्वयं अलग तरह से मापा था।

स्वतंत्र सत्यापन क्या दिखाता है — और क्या नहीं

प्रकाशन के समय तक, Astra Artificial Analysis Intelligence Index या Arena.ai की रैंकिंग में दिखाई नहीं देता — ये फ्रंटियर मॉडलों के लिए दो सबसे अधिक देखी जाने वाली स्वतंत्र मूल्यांकन प्रणालियाँ हैं। प्रमुख फ्रंटियर रिलीज़ के लिए स्वतंत्र सत्यापन आमतौर पर कुछ दिनों के भीतर आता है। यहाँ अनुपस्थिति खराब प्रदर्शन का प्रमाण नहीं है। इसका मतलब है कि बाहरी मान्यता, जो सामान्यतः इस परिमाण के दावे के साथ होती है, अभी तक साकार नहीं हुई है।

बेंचमार्क निर्माताओं का 62.7% कोई खंडन नहीं है। ARC-AGI-3 पर इस स्तर का स्कोर — एक परीक्षण जो पहले के बेंचमार्कों को फुलाने वाली ऑप्टिमाइज़ेशन चालों का विरोध करने के लिए डिज़ाइन किया गया है — वास्तव में मजबूत है। ARC-AGI-3 के पूर्ववर्ती संतृप्त हो गए थे: मॉडलों ने परीक्षण प्रश्नों से मिलता-जुलता प्रशिक्षण डेटा अवशोषित किया और नवीन तर्क में सुधार किए बिना संख्याओं को ऊपर धकेल दिया। ARC-AGI-3 ने प्रश्न डिज़ाइन को बदलकर पैटर्न पुनर्प्राप्ति पर अमूर्तन की आवश्यकता की। संदर्भ हार्नेस के तहत उस परीक्षण पर बासठ दशमलव सात प्रतिशत, दो साल पहले मौजूद किसी भी चीज़ से कहीं ऊपर है।

जिन शोधकर्ताओं ने आपत्तियाँ उठाईं, वे इस बारे में सटीक थे। मॉडल की क्षमता उनका लक्ष्य नहीं थी। प्रदर्शन से घोषणा तक की छलांग थी। “इन बेंचमार्कों पर अच्छा स्कोर” और “एजीआई आ गया है” के बीच एक कदम की आवश्यकता है: AGI की एक स्थिर, सहमत परिभाषा जिसके विरुद्ध आगमन को मापा जा सके। क्षेत्र में ऐसी कोई परिभाषा मौजूद नहीं है। OpenAI के पास एक आंतरिक परिभाषा है। OpenAI की अपनी परिभाषा के अनुसार, Astra योग्य हो सकता है। लेकिन एक कंपनी का अपने उत्पाद को उस परिभाषा के विरुद्ध मापना जो उसने स्वयं लिखी है, एक बाहरी मानक द्वारा मापे गए परिणाम से भिन्न प्रकार का परिणाम है।

वह वाक्य जो परिभाषा के साथ नहीं आया

हुआंग की पोस्ट में कोई चेतावनी नहीं थी। “AGI has arrived” एक घोषणात्मक वाक्य है — न “कुछ मापदंडों के अनुसार” और न “कुछ परिभाषाओं के तहत”, बल्कि एक स्पष्ट आगमन। उन्होंने जिस चार वर्षों की प्रगति का नाम लिया — ChatGPT, o1, Astra — वह क्षमता के प्रक्षेप पथ के रूप में वास्तविक है। इस श्रृंखला के प्रत्येक मॉडल ने जो संभव था उसे बढ़ाया। इस श्रृंखला को एक अंतिम बिंदु वाली यात्रा के रूप में फ्रेम करना, और उस अंतिम बिंदु की घोषणा करना, एक अलग दावा करता है: यह कहता है कि आगमन यात्रा से भिन्न है, कि एक ढलान के बजाय एक रेखा है, और Astra ने उसे पार कर लिया।

उस दावे के पीछे बेंचमार्क संख्या 62.7% थी। जिन लोगों ने परीक्षण बनाया, उन्होंने इसे प्रकाशित किया। यह जो प्रश्न उठाता है — क्या AGI की घोषणा एक माप है या बाजार की चाल — वह 6 सितंबर को मौजूद था। कवरेज ने बड़े पैमाने पर इसका उत्तर बिना पूछे ही दे दिया।

टैग: , , , , ,

चर्चा

0 टिप्पणियाँ हैं।