प्रौद्योगिकी

DeepSeek V4.1 Flash: 552 अरब पैरामीटर, 8 अरब सक्रिय, कैश 60% सस्ता — और Opus 5 के बराबर

Adrian Kessler

DeepSeek V4.1 Flash एक नए आर्किटेक्चर पर चलता है, जिसे कंपनी Causal Encoder-Decoder कहती है। इसके 552 अरब पैरामीटर 20-लेयर एन्कोडर और 20-लेयर डिकोडर में फैले हैं, लेकिन इनपुट टोकन पर केवल 8 अरब और आउटपुट पर 16 अरब सक्रिय होते हैं। यह इसे उन मॉडलों की तुलना में संरचनात्मक रूप से अधिक हल्का बनाता है, जो हर ऑपरेशन के लिए पैरामीटर के बड़े हिस्से सक्रिय करते हैं — यह एक डिज़ाइन विकल्प है जो सीधे इन्फ़रेंस लागत और मेमोरी दक्षता में कारगर साबित होता है।

मेमोरी के फ़ायदे ठोस हैं। V4.1 Flash का KV कैश 890 बाइट प्रति टोकन पर है, जो V4-Flash के लगभग एक-चौथाई है। FP4 कैशिंग और Compressed Sparse Attention 2 पर्सिस्टेंट कैश फ़ुटप्रिंट को पिछली पीढ़ी के एक-आठवें हिस्से तक ले आते हैं। ऑफ-पीक पर कैश्ड इनपुट की लागत अब $0.003 प्रति मिलियन टोकन है — जो V4-Flash से 60% कम है। अनकैश्ड इनपुट में 33% और आउटपुट में 11% की गिरावट आई है।

जिन बेंचमार्क्स पर डेवलपर सबसे अधिक नज़र रखते हैं, मॉडल वहाँ अपनी जगह बनाए रखता है। DeepSWE v1.1 — स्वायत्त सॉफ़्टवेयर इंजीनियरिंग टेस्ट — इसे 74.2 देता है, जो Anthropic के Opus 5 के 74.0 से मामूली आगे और GPT-5.6 Sol के 73.0 से ऊपर है। GPQA Diamond पर स्कोर 90.9 है। सबसे उभरता अंतर Terminal-Bench 3.0 का है: Opus 5 के 43.3 के मुकाबले 30.0 — लंबी इंटरैक्टिव डिबगिंग की आवश्यकता वाले कार्यों पर यह एक वास्तविक अंतर है।

विज़न प्री-ट्रेनिंग से ही मॉडल में शामिल है। पहले, V4 ने विज़न को एक अलग Vision-Exp वैरिएंट में बाँट दिया था। V4.1 Flash दोनों की जगह एक ही मॉडल लाता है, जो DeepSeek-ViT के इर्द-गिर्द बना है — एक ख़ास उद्देश्य के लिए प्रशिक्षित एन्कोडर, जिसे शुरू से भाषा मॉडल के साथ सह-विकसित किया गया है। मल्टीमॉडल टियर खत्म हो गया है — हर कॉल में डिफ़ॉल्ट रूप से विज़न मिलता है।

कॉन्टेक्स्ट विंडो 1 मिलियन टोकन की है, और आउटपुट की ऊपरी सीमा 384,000 टोकन है — बिना चंकिंग के लंबे दस्तावेज़ विश्लेषण और विस्तृत एजेंटिक वर्कफ़्लो के लिए यह पर्याप्त है। पुराने deepseek-v4-flash और deepseek-v4-flash-vision-exp IDs का उपयोग करने वाले मौजूदा API कॉलर्स को पहले से ही V4.1 Flash पर रूट किया जा रहा है। 14 सितंबर को DeepSeek V4 Pro का ट्रैफ़िक भी — Flash की कीमत पर — स्विच हो जाएगा।

DeepSeek ने V4.1 Flash को “हमारे नए आर्किटेक्चर परिवार का सबसे छोटा मॉडल” बताया है। इसी Causal Encoder-Decoder डिज़ाइन पर एक बड़ा V4.1 Pro होने का संकेत मिलता है। अगर यह Flash की दक्षता की प्रवृत्ति बनाए रखता है, तो यह इस आर्किटेक्चर के परफ़ॉर्मेंस-पर-डॉलर को बेंचमार्क कर्व पर और ऊपर ले जाएगा — उस क्षेत्र तक, जिस पर अभी ऐसे मॉडल काबिज़ हैं जिनकी प्रति मिलियन टोकन लागत काफी अधिक है।

आर्किटेक्चर का यह पहलू केवल कीमत-तालिका से परे मायने रखता है। KV कैश की वृद्धि लंबे कॉन्टेक्स्ट पर बड़े मॉडल चलाने में प्राथमिक बाधा है, और यह हर प्रोसेस किए गए टोकन के साथ बढ़ती है। V4.1 Flash का दृष्टिकोण — कम सक्रिय पैरामीटर, संपीड़ित कैश — इस बाधा को सीधे संबोधित करता है। यह लंबे कॉन्टेक्स्ट डिप्लॉयमेंट के लिए एक उपयोगी टेम्पलेट है, न कि कोई कॉर्नर-केस ऑप्टिमाइज़ेशन।

टैग: , , , ,

चर्चा

0 टिप्पणियाँ हैं।