प्रौद्योगिकी

मेटा ने Muse Glimmer लॉन्च किया — बिना सर्वर के GPU पर चलने वाला 30B AI एजेंट

Adrian Kessler

मेटा ने एक 30 बिलियन पैरामीटर वाला AI एजेंट बनाया है जो पूरी तरह से कंज्यूमर हार्डवेयर पर चलता है — और इसका सोर्स कोड मुफ्त में जारी किया है। Muse Glimmer नाम的这个 मॉडल आपके कार्यों को मेटा के सर्वरों के माध्यम से रूट नहीं करता। यह आपके अपने GPU पर स्थानीय रूप से निष्पादित होता है, और 18 से 20 गीगाबाइट्स के क्वांटाइज्ड मेमोरी फुटप्रिंट के साथ, यह वर्तमान हाई-एंड कंज्यूमर ग्राफिक्स कार्डों की सीमा में फिट बैठता है।

यह महत्वपूर्ण है क्योंकि स्थानीय मॉडलों की पिछली पीढ़ी — 7 बिलियन और 13 बिलियन पैरामीटर वाले वेरिएंट जो पिछले दो वर्षों में Ollama लाइब्रेरी में भरे थे — सक्षम टेक्स्ट जनरेटर थे लेकिन खराब ऑटोनॉमस एजेंट थे। वे मल्टी-स्टेप रीज़निंग, बीच में विफल होने वाले टूल कॉल्स, और तीन कदम पहले क्या हुआ था इसे याद रखने की आवश्यकता वाले कार्यों में संघर्ष करते थे। Muse Glimmer विशेष रूप से उन वर्कफ़्लो के लिए डिज़ाइन किया गया है: कोडिंग, फंक्शन कॉलिंग, शेड्यूल मैनेजमेंट, फ़ाइल ऑर्गनाइज़ेशन, और मल्टी-स्टेप टास्क सीक्वेंस जो टूल कॉल के विफल होने पर स्वचालित रूप से रिकवर होते हैं।

अंतर्निहित आर्किटेक्चर Muse Spark का एक डिस्टिलेशन है, जो वह कमर्शियल मॉडल है जिसे मेटा ने पिछले महीने API एक्सेस के लिए बेचना शुरू किया था। लॉगिट डिस्टिलेशन और रीइन्फोर्समेंट लर्निंग के माध्यम से, कंपनी ने अपने क्लोज्ड फ्लैगशिप को एक ऐसे रूप में संपीड़ित किया जो 24 गीगाबाइट GPU पर फिट बैठता है — RTX 5090, Apple का M5 Max, या M4 Max। स्पेक्युलेटिव डिकोडिंग थ्रूपुट को और बढ़ाती है: RTX 5090 मॉडल को बिना इसके 3.1 गुना तेज़ चलाता है, M5 Max 1.8 गुना, M4 Max 1.5 गुना। व्यवहार में, यह अंतर एक ऐसे एजेंट के बीच की रेखा है जो रिस्पॉन्सिव लगता है और एक जिसमें धैर्य की आवश्यकता होती है।

मॉडल इंटरलीव्ड टेक्स्ट और इमेजेज — स्क्रीनशॉट, दस्तावेज़, मिक्स्ड-कंटेंट इनपुट — को प्रोसेस करता है और 100 से अधिक भाषाओं में काम करता है। यह उन फ्रेमवर्क्स के साथ मूल रूप से जुड़ता है जिन्हें स्थानीय AI उपयोगकर्ता पहले से चलाते हैं: Ollama, LM Studio, llama.cpp, MLX। यदि आप पहले से Hugging Face से मॉडल खींचते हैं और उन्हें अपने हार्डवेयर पर चलाते हैं, तो Muse Glimmer बिना किसी अतिरिक्त टूलिंग के उस वर्कफ़्लो में आ जाता है।

लाइसेंस Apache 2.0 है, जिसका अर्थ है कि कोई वाणिज्यिक प्रतिबंध नहीं हैं। व्यक्ति, कंपनियाँ और शोधकर्ता मेटा को भुगतान किए बिना इसका उपयोग कर सकते हैं। यह इसे OpenAI और Anthropic के मॉडलों से अलग श्रेणी में रखता है, जिनमें डेवलपमेंट कार्य के लिए भी प्रति टोकन भुगतान की आवश्यकता होती है। Google के Gemma4-31B और Alibaba के Qwen3.6-27B — आकार के हिसाब से इसके सबसे करीबी ओपन-वेट प्रतियोगी — के मुकाबले, मेटा Muse Glimmer को एजेंटिक और सामान्य लैंग्वेज-मॉडल बेंचमार्क्स पर अपने आकार के लिए मजबूत बताता है, बिना यह बताए कि यह किन कार्यों में जीतता है।

हार्डवेयर थ्रेशोल्ड चयनात्मक बना हुआ है। 18 गीगाबाइट्स के मॉडल वेट्स को GPU पर फिट करना तब तक सुलभ लगता है जब तक आप यह गणना न करें कि इसके लिए किस GPU की आवश्यकता है। RTX 5090 की वर्तमान कीमत दो हज़ार डॉलर से ऊपर है। Apple के M5 Max मशीनें तीन हज़ार के करीब से शुरू होती हैं। यह एक विशिष्ट आय वर्ग के लिए स्थानीय AI है, अधिकांश उपयोगकर्ताओं के लिए क्लाउड का प्रतिस्थापन नहीं। क्वांटाइज्ड वर्जन Muse Spark का एक कम-फ़िडेलिटी सिबलिंग भी है: यह कमर्शियल मॉडल से ट्रेनिंग सिग्नल प्राप्त करता है, लेकिन यह कमर्शियल मॉडल नहीं है। मेटा उच्च-क्षमता वाले वर्जन तक पहुँच बेचना जारी रखता है।

इस रिलीज़ में जो बदलता है वह स्थानीय मॉडलों का सक्षम एजेंट टियर है। ऑटोनॉमस टास्क कम्प्लीशन के लिए प्रशिक्षित 30 बिलियन पैरामीटर वाला मॉडल चलाना, समान पैरामीटर काउंट पर चैट मॉडल चलाने से अलग है। अंतर इस बात में है कि मॉडल टूल विफलताओं और मल्टी-स्टेप सीक्वेंस को कैसे संभालता है — न कि इस बात में कि यह एक एकल वाक्य को कितनी अच्छी तरह पूरा करता है।

वेट्स 10 अगस्त से Hugging Face पर Apache 2.0 के तहत उपलब्ध हैं। मेटा ने AMD, Arm, Dell, Intel और Nvidia के साथ डिवाइस-लेवल ऑप्टिमाइज़ेशन पार्टनरशिप की पुष्टि की है, जिसमें विशिष्ट हार्डवेयर कॉन्फ़िगरेशन के लिए आगे और ट्यून्ड बिल्ड होंगे। स्थानीय AI समुदाय हर महत्वपूर्ण रिलीज़ की तरह, दिनों के भीतर मॉडल का स्ट्रेस-टेस्ट करेगा — उस समुदाय के बेंचमार्क परिणाम आज से दो सप्ताह के भीतर Muse Glimmer की वास्तविक स्थिति का एक स्पष्ट चित्र प्रदान करेंगे।

टैग: , , , , ,

चर्चा

0 टिप्पणियाँ हैं।