प्रौद्योगिकी

Microsoft की 10 लोगों की टीम ने एक स्पीच मॉडल बनाया जो OpenAI और Google से सस्ता और तेज़ है

Adrian Kessler

मॉडल का नाम MAI-Transcribe-2 है। मुस्तफ़ा सुलेमान (Mustafa Suleyman) के नेतृत्व वाले Microsoft AI डिवीज़न ने इसे 3 सितंबर को 0.10 डॉलर प्रति ऑडियो घंटे की दर से लॉन्च किया — यह दर 2026 के अंत तक सीमित है। पिछला वर्शन MAI-Transcribe-1.5 की कीमत 0.36 डॉलर प्रति घंटा थी। यह 72% की कमी महज़ मार्केटिंग का गोलमाल नहीं है। एक कॉन्टैक्ट सेंटर जो सालाना 100,000 घंटे का ऑडियो प्रोसेस करता है, वह पिछले मॉडल के लिए 36,000 डॉलर दे रहा था; अब उसी वर्कलोड की लागत 10,000 डॉलर है।

बेंचमार्क प्रदर्शन ही इस कीमत को असामान्य बनाता है। FLEURS बहुभाषी मूल्यांकन पर MAI-Transcribe-2 60 भाषाओं में 5.2% औसत वर्ड एरर रेट के साथ पहले स्थान पर है — जो OpenAI के GPT-Transcribe, Google के Gemini 3.5 Transcribe, ElevenLabs Scribe v2 और Meta के Whisper V3-Large से बेहतर है। Artificial Analysis लीडरबोर्ड पर, जो सटीकता और विलंबता दोनों को एक साथ ट्रैक करता है, यह कुल मिलाकर दूसरे स्थान पर है और वह सीमा निर्धारित करता है जिसे शोधकर्ता पेरेटो फ्रंटियर कहते हैं — वह सीमा जिसके आगे आप एक मीट्रिक को सुधारे बिना दूसरे को ख़राब नहीं कर सकते। मॉडल को उस फ्रंटियर के कुशल किनारे पर बैठने के लिए प्रशिक्षित किया गया था, न कि किसी एकल-मीट्रिक तालिका के शीर्ष का पीछा करने के लिए।

गति दूसरा दावा है जो जाँचने लायक है। Microsoft का कहना है कि MAI-Transcribe-2 ऑडियो को GPT-Transcribe से 10 गुना तेज़, ElevenLabs Scribe v2 से 7 गुना तेज़, और Gemini 3.5 Transcribe से 5 गुना तेज़ प्रोसेस करता है। लंबे-फ़ॉर्म ऑडियो — पॉडकास्ट ट्रांसक्रिप्शन, कानूनी जमा बयान, क्लिनिकल नोट्स — के लिए यह अंतर तय करता है कि कोई वर्कफ़्लो सेकंड में चलेगा या मिनटों में। मॉडल स्पीकर डायराइज़ेशन (यह पहचानना कि कब किसने बात की), शब्द-स्तरीय टाइमस्टैम्प, डोमेन शब्दावली के लिए कीवर्ड बायसिंग, और उन भाषाओं के लिए कोड-स्विचिंग सपोर्ट भी करता है जो वाक्य के बीच में मिश्रित होती हैं — विशेष रूप से हिंग्लिश और स्पैंग्लिश का परीक्षण उदाहरण के रूप में उल्लेख किया गया है।

इसे बनाने वाली टीम उस चीज़ के अनुपात में उल्लेखनीय है जो इसने बनाया। Microsoft कोर ग्रुप को 10 लोगों के रूप में वर्णित करता है, जो न्यूनतम आंतरिक नौकरशाही के साथ काम करते हैं और डेटा अधिग्रहण और विक्रेता प्रबंधन संभालने वाली बड़ी टीमों द्वारा समर्थित हैं। परिणामी GPU दक्षता का दावा विशिष्ट है: MAI-Transcribe-2 प्रतिस्पर्धी स्टेट-ऑफ़-द-आर्ट मॉडलों की तुलना में आधी GPU लागत पर चलता है। यह एंटरप्राइज़ लोड के तहत बड़े पैमाने पर कायम रहता है या नहीं, यह घोषणा से सत्यापित नहीं किया जा सकता, लेकिन आर्किटेक्चर का दावा परीक्षण के लिए पर्याप्त सटीक है।

मॉडल अब Microsoft Foundry, MAI Playground और Open Router पर उपलब्ध है — जिसका अर्थ है कि एक्सेस के लिए Azure कॉन्ट्रैक्ट या Microsoft एंटरप्राइज़ संबंध की आवश्यकता नहीं है। वितरण की यह व्यापकता जानबूझकर है। OpenAI साझेदारी के पुनर्गठन के बाद Microsoft AI का डायरेक्ट-टू-डेवलपर API की ओर धक्का एक व्यापक पुनर्स्थापन का हिस्सा है। अक्टूबर 2025 और अप्रैल 2026 में संशोधनों ने विशिष्टता और राजस्व-साझाकरण व्यवस्थाओं को समाप्त कर दिया, जिन्होंने 2019 से संबंध को परिभाषित किया था। Microsoft के पास अब मॉडल स्तर पर सीधे प्रतिस्पर्धा करने का प्रत्यक्ष प्रोत्साहन है, न कि केवल OpenAI के आउटपुट को वितरित करने का।

$0.10 की कीमत 2026 के अंत तक सीमित बताई गई है। उस तारीख के बाद मानक मूल्य का खुलासा नहीं किया गया है। MAI-Transcribe-2 का उत्पादन वर्कलोड के लिए मूल्यांकन कर रहे खरीदार एक ऐसे उत्पाद की कीमत लगा रहे हैं जिसकी लागत वे कैलेंडर वर्ष 2027 के लिए नहीं जानते। यह एक जोखिम है जिसे स्पष्ट रूप से नामित करना उचित है, भले ही वर्तमान दर मॉडल को हर दृश्य विकल्प के मुकाबले आकर्षक बनाती है।

टैग: , , , , ,

चर्चा

0 टिप्पणियाँ हैं।