प्रौद्योगिकी

Claude Opus 5.5 हुआ 40% सस्ता, जब Anthropic के CEO ने AI धीमा करने को कहा

Susan Hill
हमें Google पर जोड़ें

क्लॉड ओपस 5.5 वह करता है जो एंथ्रोपिक के पिछले मॉडलों ने नहीं किया: इसकी लागत कम है, यह तेज़ चलता है, और एक बड़े तथा महंगे सिस्टम से मेल खाता है या उससे बेहतर प्रदर्शन करता है। यह मॉडल एजेंटिक कोडिंग, कंप्यूटर उपयोग, चार्ट पढ़ने और बहु-विषयक तर्क को उस स्तर पर संभालता है जो – एंथ्रोपिक के अपने डेटा के अनुसार – कंपनी के पिछले सबसे सक्षम मॉडल क्लॉड फ़ेबल 5.1 से कई मापदंडों पर आगे है। उन लोगों और डेवलपर्स के लिए जो ओपस 5 को उपयोगी लेकिन महंगा पाते थे, मॉडल की क्षमता और उसकी लागत के बीच का अंतर अब काफ़ी बदल चुका है।

कीमत का अंतर स्पष्ट है। ओपस 5.5 प्रति मिलियन इनपुट टोकन पर $4 और प्रति मिलियन आउटपुट टोकन पर $20 लेता है; ओपस 5 की दरें क्रमशः $5 और $25 थीं। कैश्ड रीड घटकर प्रति मिलियन टोकन $0.50 से $0.20 हो गए हैं। एंथ्रोपिक का कहना है कि सामान्य वर्कलोड पर कुल लागत लगभग 40% कम आती है। गति भी उसी दिशा में है: मानक मॉडल ओपस 5 की तुलना में 30% से अधिक तेज़ टेक्स्ट जनरेट करता है। एक अलग फ़ास्ट-मोड विकल्प, जिसकी कीमत $8 इनपुट और $40 आउटपुट प्रति मिलियन टोकन है, मानक ओपस 5 की गति से 2.5 गुना तक पहुँच जाता है – जो लेटेंसी-संवेदनशील अनुप्रयोगों के लिए एक उपयोगी सेटिंग है।

एंथ्रोपिक के प्रकाशित प्रदर्शन आंकड़ों के अनुसार, ओपस 5.5 छह बेंचमार्कों में से चार में फ़ेबल 5.1, ओपस 5 और GPT-6 एस्ट्रा से आगे है। टर्मिनल-बेंच 4.0 पर, जो एक लाइव टर्मिनल वातावरण में कोड निष्पादन का परीक्षण करता है, ओपस 5.5 का स्कोर 66.4% है जबकि फ़ेबल 5.1 का 55.8% है। ह्यूमैनिटीज़ लास्ट एग्ज़ाम पर, जो शैक्षणिक और पेशेवर ज्ञान को विभिन्न विषयों में परखता है, परिणाम 67.7% बनाम 65.6% है। OSWorld 2.0, जो कंप्यूटर-इंटरफ़ेस संचालन को मापता है, 81.8% बनाम 80.7% दिखाता है। एक डेलॉइट परीक्षण में पाया गया कि ओपस 5.5 ने अपने न्यूनतम प्रयास सेटिंग पर समीक्षा में 72% ज्ञात कोडिंग त्रुटियों का पता लगाया, जबकि ओपस 5 ने उच्च प्रयास पर 56% का पता लगाया। ये आंकड़े एंथ्रोपिक और उसके चयनित भागीदारों से आते हैं; बताई गई त्रुटि की सीमा ±1.6 से ±5 प्रतिशत अंकों तक है, और लॉन्च के समय कोई स्वतंत्र तृतीय-पक्ष सत्यापन प्रकाशित नहीं किया गया है।

दो क्षेत्र इस पैटर्न को तोड़ते हैं। ऑटोमेशनबेंच पर, GPT-6 एस्ट्रा का स्कोर 41.4% है जबकि ओपस 5.5 का 40.0% है। टर्मिनल-बेंच-साइंस पर अंतर और बड़ा है: एस्ट्रा 64.6% तक पहुँचता है जबकि ओपस 5.5 58.7% पर रुकता है। दोनों अंतर बताई गई त्रुटि सीमाओं के भीतर आते हैं – वे शोर हो सकते हैं – लेकिन हो सकता है कि न हों। एंथ्रोपिक ने इन पंक्तियों को अपनी प्रकाशित तालिका में शामिल किया है, जो अधिकांश AI कंपनियाँ लॉन्च के समय नहीं करतीं। इन आंकड़ों को अभी भी स्वतंत्र जाँच की आवश्यकता है इससे पहले कि उन्हें अंतिम माना जा सके।

सुरक्षा के मामले में, एंथ्रोपिक का कहना है कि ओपस 5.5 को रिलीज़ से पहले METR सहित बाहरी टीमों द्वारा मूल्यांकित किया गया था। कंपनी के अपने आंतरिक व्यवहारिक ऑडिट में, लगभग 2,000 परिदृश्यों को डिज़ाइन किया गया ताकि यह परखा जा सके कि मॉडल उस पर लगाए गए प्रतिबंधों को दरकिनार करने की कोशिश करता है या नहीं, ओपस 5.5 को ओपस 5 की तुलना में ऐसे प्रयासों में 85% कम संभावित बताया गया है। मजबूत मॉडलों में आमतौर पर समाधान खोजने की अधिक क्षमता होती है, जो इस सुधार को सार्थक बनाता है यदि यह कायम रहता है। तैनाती का अनुभव ही असली परीक्षा होगा।

इस लॉन्च को असामान्य बनाने वाली बात इसका समय है। इस महीने की शुरुआत में, एंथ्रोपिक के सीईओ डारियो अमोदेई (Dario Amodei) ने एक निबंध प्रकाशित किया जिसमें उन्होंने लिखा कि वे इस निष्कर्ष पर पहुँचे हैं कि AI जोखिमों को पूरी तरह से संबोधित करने के लिए “क्षमताओं की प्रगति की दर को धीमा करना आवश्यक है ताकि जोखिम की रोकथाम को पकड़ने का समय मिल सके।” OpenAI के सैम ऑल्टमैन (Sam Altman) और एलन मस्क (Elon Musk) ने इस सामान्य चिंता से सहमति व्यक्त की। Nvidia के जेन्सेन हुआंग (Jensen Huang) ने कहा कि अंतर्निहित विज्ञान इसका समर्थन नहीं करता। और फिर एंथ्रोपिक ने अपने पूर्ववर्ती से तेज़, सस्ता और अधिक सक्षम मॉडल जारी कर दिया। एक व्याख्या: बेहतर सुरक्षा मूल्यांकन और व्यापक पहुँच वाला मॉडल ठीक वही है जो अमोदेई के मन में था। दूसरी व्याख्या: निबंध ने क्षमताओं की प्रगति को चिंता का कारण बताया, और क्षमताएँ बढ़ीं। दोनों व्याख्याएँ एक ही तथ्य-समूह में बैठती हैं, और अकेले एंथ्रोपिक के बेंचमार्क यह तय नहीं कर सकते कि कौन सी सही है।

क्लॉड ओपस 5.5 22 सितंबर 2026 से API मॉडल आईडी claude-opus-5-5 के तहत उपलब्ध है। यह क्लॉड पर Pro, Max, Team और Enterprise योजनाओं के अंतर्गत चलता है, और AWS, Google Cloud तथा Microsoft Azure के माध्यम से सुलभ है। एंथ्रोपिक पाँच-घंटे की सब्सक्रिप्शन टियर पर उपयोग सीमाएँ बढ़ा रहा है। सॉनेट 5.5 और हाइकू 5.5, जो 5.5 परिवार के शेष सदस्य हैं, आने वाले हफ्तों में जारी होने वाले हैं, हालाँकि दोनों के लिए कोई मूल्य निर्धारण या विशिष्ट रिलीज़ तिथि घोषित नहीं की गई है।

टैग: , , , , ,

हमें Google पर जोड़ें

चर्चा

0 टिप्पणियाँ हैं।