प्रौद्योगिकी

Anthropic के Fable 5.1 ने कैश लागत 75% घटाई और एजेंटिक स्कोर दोगुने से भी ज़्यादा

Susan Hill

Anthropic ने 1 सितंबर को Claude को Fable 5.1 के साथ अपडेट किया, जिससे कैश्ड इनपुट टोकन की लागत $1.00 प्रति मिलियन से घटाकर $0.25 प्रति मिलियन कर दी गई — यह 75% की कमी ऐसे समय में आई है जब अधिकांश प्रोडक्शन AI डेवलपर्स को यह एहसास हो चुका है कि उनका इंफ्रास्ट्रक्चर बजट कच्ची कंप्यूटेशन पर नहीं, बल्कि संदर्भ संचय (कॉन्टेक्स्ट एक्युमुलेशन) पर केंद्रित होता है। एक लाइव एजेंटिक सेशन में, एक ही Claude वार्तालाप में सैकड़ों-हजारों टोकन कैश में जमा हो सकते हैं क्योंकि टर्न दर टर्न संदर्भ बढ़ता जाता है। $0.25 प्रति मिलियन पर, यह संचय एक डेवलपर के लिए लागत सीमा के बजाय एक जानबूझकर डिज़ाइन विकल्प बन जाता है जिसके चारों ओर उसे काम करना पड़ता था।

मूल्य परिवर्तन के साथ आए बेंचमार्क परिणाम ऐसे प्रदर्शन लाभ दिखाते हैं जो आर्थिक तर्क को और मजबूत करते हैं। Terminal-Bench-Science 0.1 पर, जो प्रयोगात्मक डिज़ाइन और पुनरावृत्त विश्लेषण की आवश्यकता वाले बहु-चरणीय वैज्ञानिक तर्क को मापता है, Fable 5.1 ने 52.6% स्कोर किया जबकि Fable 5 का स्कोर 24.7% था — पिछले परिणाम को दोगुने से अधिक कर दिया। AutomationBench में 17.1% से 31.4% तक सुधार हुआ, और Terminal-Bench 4.0, जो एक व्यापक एजेंटिक क्षमता मूल्यांकन है, 42.0% से बढ़कर 55.8% हो गया। CursorBench 3.2.0 पर स्कोर 73.4% रहा। सभी चार मूल्यांकनों में पैटर्न एकसमान है: Fable 5.1 मामूली रूप से बेहतर नहीं है, बल्कि उन कार्यों की श्रेणियों में काफी अधिक विश्वसनीय है जो एजेंटिक मूल्य को परिभाषित करते हैं।

संयुक्त प्रभाव Claude के साथ निर्माण की लागत अंकगणित को फिर से लिखता है। एक एजेंटिक एप्लिकेशन जो कम टर्न में कार्य पूरा करता है — क्योंकि मॉडल अधिक विश्वसनीय है — सफल परिणाम तक पहुँचने के रास्ते में कुल टोकन चक्रों की कम खपत करता है। इस पर 75% कैश कटौती लागू करें, और उच्च-पुन:उपयोग वाले एजेंटिक वर्कफ़्लो में प्रभावी प्रति-कार्य लागत में कमी 45% या उससे अधिक तक पहुँच जाती है। Anthropic ने संयुक्त बचत के लिए एक एकल शीर्षक संख्या प्रकाशित नहीं की है, लेकिन जो डेवलपर अपने स्वयं के टोकन अर्थशास्त्र का मॉडल बनाते हैं, वे संदर्भ-भारी वर्कलोड के लिए इस सीमा के आसपास के आंकड़ों पर पहुँचेंगे।

Fable 5.1 तुरंत Anthropic के डायरेक्ट API के माध्यम से मॉडल पहचानकर्ता claude-fable-5-1 के तहत, और Amazon Web Services Bedrock, Google Cloud Platform तथा Microsoft Azure के माध्यम से उपलब्ध है। Anthropic ने Enterprise Frontier Safeguards को एक समवर्ती क्षमता के रूप में घोषित किया: ग्राहक-नियंत्रित डेटा प्रतिधारण, ग्राहक-प्रबंधित एन्क्रिप्शन कुंजियाँ, और प्रत्येक ग्राहक के मौजूदा क्लाउड इंफ्रास्ट्रक्चर टेनेंट के भीतर तैनाती, जो अंतर्निहित क्लाउड लागतों के अतिरिक्त बिना किसी शुल्क के शामिल है।

सामान्य रिलीज़ के साथ-साथ, Anthropic ने Mythos 5.1 पेश किया, जो उसी अंतर्निहित मॉडल का एक प्रकार है जो कंपनी के अनुसार सत्यापित संगठनों के लिए अधिक उदार सुरक्षा उपायों के साथ संचालित होता है। इसकी पहुँच केवल सत्यापित साइबर सुरक्षा अनुसंधान संस्थानों और जीवन-विज्ञान कंपनियों तक सीमित है। कंपनी ने प्रदर्शित अनुप्रयोगों का हवाला दिया जिनमें प्रोटीन बाइंडर डिज़ाइन और जैविक मॉडल ऑप्टिमाइज़ेशन शामिल है, जो मानक रिलीज़ की तुलना में 2.5 गुना तक अधिक इन्फ़रेंस थ्रूपुट पर काम करता है। Mythos 5.1 तक पहुँच स्व-सेवा नहीं है: Anthropic आवेदनों की व्यक्तिगत रूप से समीक्षा करता है और उसने नामांकित समूह के आकार को प्रकाशित नहीं किया है।

Fable 5.1 के एजेंटिक आंकड़े, विशेष रूप से Terminal-Bench-Science पर, Anthropic के प्रकाशित परिणामों को तुलनीय मूल्यांकनों पर OpenAI के सबसे हालिया खुलासा किए गए आंकड़ों से आगे रखते हैं। क्रॉस-कंपनी बेंचमार्क तुलनाओं में पद्धतिगत सावधानी आवश्यक है — विक्रेता ऐसे मूल्यांकन चुनते हैं जो उनके मॉडलों के पक्ष में हों, और Anthropic द्वारा हाइलाइट किए गए विशिष्ट परीक्षण संभवतः उनके अनुकूल परिणामों के लिए चुने गए थे। जिस चीज़ को आसानी से नकारा नहीं जा सकता वह आंतरिक दोहरीकरण पैटर्न है: Fable 5.1 वही मॉडल नहीं है जिसमें मूल्य कटौती जोड़ी गई हो। प्रदर्शन परिवर्तन इतना बड़ा है कि मूल्य निर्धारण की कहानी और प्रदर्शन की कहानी को अलग नहीं किया जा सकता।

जो डेवलपर वर्तमान में Claude का उपयोग नहीं करते, उनके लिए कैश मूल्य निर्धारण का यह कदम वह संख्या है जिसे अपने स्वयं के टोकन अर्थशास्त्र में अनुवाद करना उचित है। कोई भी AI प्रदाता जो $0.25 प्रति मिलियन कैश्ड टोकन के करीब नहीं पहुँचता, उसे अब एंटरप्राइज सेल्स वार्तालापों में सीधे लागत तुलना के सवालों का सामना करना पड़ेगा। इस कटौती से पहले भी Anthropic का कैश मूल्य कई प्रतिस्पर्धियों से कम था; अब यह अंतर और बढ़ गया है। प्रदर्शन सुधारों को उपयोग के मामलों में सामान्यीकृत करना कठिन है, लेकिन एजेंटिक और वैज्ञानिक-तर्क खंड में, Fable 5.1 एक बेंचमार्क स्तर निर्धारित करता है जिसके विरुद्ध किसी भी प्रदाता की अगली बड़ी रिलीज़ को मापा जाएगा।

टैग: , , ,

चर्चा

0 टिप्पणियाँ हैं।