प्रौद्योगिकी

Gemini 3.5 Transcribe: Google का AI जो 85 भाषाओं में बोलचाल की गलतियाँ खुद सुधारता है

Adrian Kessler

Gemini 3.5 Transcribe सिर्फ यह नहीं करता कि कोई क्या बोल रहा है, बल्कि वह जो बोला गया उसे उस चीज़ में बदल देता है जो वह कहना चाहते थे। जब कोई वक्ता बीच वाक्य में खुद को सुधारता है — ‘चलो इसे मंगलवार के लिए तय करें, नहीं, बुधवार’ — तो मॉडल ‘बुधवार’ आउटपुट करता है और सुधार को हटा देता है। फिलर शब्द गायब हो जाते हैं। पृष्ठभूमि का शोर इसे नहीं रोकता। परिणाम एक पॉलिश, फ़ॉर्मेटेड टेक्स्ट के रूप में आता है, न कि कच्चे ऑडियो कैप्चर के रूप में।

जो कोई भी इंटरव्यू, पॉडकास्ट या बहुभाषी सामग्री रिकॉर्ड करता है, उसके लिए यह अंतर पूरी वर्कफ़्लो है। बाज़ार में हर ट्रांसक्रिप्शन टूल ‘जो कहा गया’ उसे संभालता है। मानव संपादक जो बाद में इसे साफ करता था, वह बाकी सब संभालता था। Google अब उस संपादक को मॉडल में ही बना रहा है।

मॉडल दो अलग API पथों का समर्थन करता है। Live API सब-सेकंड लेटेंसी के साथ निरंतर द्विदिश स्ट्रीमिंग को संभालता है — यह रियल-टाइम वॉयस एजेंट, कस्टमर सर्विस बॉट और किसी भी चीज़ के लिए डिज़ाइन किया गया है जिसे तत्काल ट्रांसक्रिप्शन चाहिए। Interactions API रिकॉर्ड किए गए ऑडियो को संभालता है: पूरी मीटिंग, कॉल लॉग और इंटरव्यू, जो तीन प्रतिभागियों तक के लिए टाइमस्टैम्प के साथ स्पीकर एट्रिब्यूशन लौटाता है। दोनों स्ट्रीमिंग मोड में 4.0% वर्ड एरर रेट और नॉन-स्ट्रीमिंग में 2.6% हासिल करते हैं — जिसे स्वतंत्र बेंचमार्किंग फर्म Artificial Analysis द्वारा मापा गया है। Google का पिछला स्पीच-टू-टेक्स्ट मॉडल, Chirp 3, को अंतिम ट्रांसक्रिप्शन तक पहुँचने में 70% अधिक समय लगता था।

लॉन्च का उपभोक्ता पक्ष अधिक सीमित है। Android पर, Gboard Rambler पहले से ही वॉइस-टू-टेक्स्ट इनपुट के लिए Gemini 3.5 Transcribe का उपयोग करता है। Gemini macOS ऐप Speak to Window सुविधा के माध्यम से अंग्रेज़ी में इसका समर्थन करता है। Chrome को ‘जल्द आ रहा है’ के रूप में सूचीबद्ध किया गया है, जो उपयोगकर्ताओं को बिना ऐप बदले किसी भी वेब फ़ील्ड — जवाब, पोस्ट, फ़ॉर्म — में डिक्टेट करने देगा। इस रोलआउट के लिए कोई विशिष्ट तिथि की पुष्टि नहीं की गई है।

मॉडल की सीमाएँ मायने रखती हैं। मल्टी-स्पीकर एट्रिब्यूशन तीन प्रतिभागियों पर सीमित है; बड़े पैनल और राउंडटेबल के लिए वर्कअराउंड की आवश्यकता होती है। उपभोक्ता Rambler ऐप वर्तमान में ‘चुनिंदा देशों और भाषाओं’ में उपलब्ध है, न कि पूरे 85 भाषाओं में जो मॉडल समर्थन करता है। Google ने API के लिए मूल्य निर्धारण की घोषणा नहीं की है, जो Google AI Studio के माध्यम से सार्वजनिक प्रीव्यू में है। एंटरप्राइज़ एक्सेस Gemini Enterprise Agent Platform के माध्यम से आता है, जहाँ मूल्य निर्धारण अलग से बातचीत किया जाता है। छोटे क्रिएटर्स के लिए, लागत का प्रश्न खुला है।

प्रतिस्पर्धी ढाँचा भी प्रासंगिक है। OpenAI का Whisper, जो अभी भी स्वतंत्र डेवलपर्स के लिए डिफ़ॉल्ट है, अंग्रेज़ी ऑडियो पर 5–7% की सीमा में वर्ड एरर रेट हासिल करता है और फिलर हटाने और फ़ॉर्मेटिंग के लिए पोस्ट-प्रोसेसिंग कोड की आवश्यकता होती है। AssemblyAI और Deepgram जैसी सेवाएँ स्पीकर डायराइज़ेशन प्रदान करती हैं, लेकिन Gemini 3.5 Transcribe द्वारा डिफ़ॉल्ट रूप से लागू की जाने वाली बिल्ट-इन नेचुरल-लैंग्वेज करेक्शन नहीं। अंतर मापने योग्य है, हालाँकि यह 85-भाषा सीमा के कठिन छोर — क्षेत्रीय उच्चारण, कम-संसाधन वाली भाषाएँ, शोरगुल वाले वातावरण — पर कैसे टिकता है, यह स्थापित करने के लिए स्वतंत्र परीक्षण की आवश्यकता होगी।

Google की दीर्घकालिक दिशा के बारे में सबसे अधिक संकेत देने वाली सुविधा Chrome एकीकरण है। एक बार जब वॉइस इनपुट किसी भी वेब फ़ील्ड में काम करता है, तो मॉडल अब एक डेवलपर टूल नहीं रह जाता — यह बुनियादी ढाँचा बन जाता है कि लोग कैसे टाइप करते हैं। उस बदलाव के रोलआउट समयरेखा की पुष्टि नहीं की गई है।

टैग: , , , , ,

चर्चा

0 टिप्पणियाँ हैं।