प्रौद्योगिकी

Gemini 3.8 Live ने AI ग्राहक सेवा को दिया 97 भाषाओं में लिप-सिंक चेहरा

Adrian Kessler
हमें Google पर जोड़ें

यह सिस्टम Gemini 3.8 Live with Live Avatar है। इसमें Google का वाणी-से-वाणी मॉडल रियल-टाइम वीडियो परत के साथ जुड़ता है, जो बातचीत के दौरान होंठों की गति और चेहरे के भाव तैयार करती है। साथ ही, सिस्टम बातचीत रोके बिना पृष्ठभूमि में टूल कॉल भी संभालता है। भाषा की पहचान अपने-आप होती है—अवतार कॉल के बीच में ही एक बोली जाने वाली भाषा से दूसरी पर चला जाता है; इसके लिए न बातचीत किसी और को सौंपनी पड़ती है, न सिस्टम को दोबारा लोड करना पड़ता है और न ही कोई महसूस होने वाला विराम आता है।

इसे वीडियो ओवरले तकनीकों से अलग करने वाली बात यह है कि ऑडियो और वीडियो तैयार करने की प्रक्रिया अलग-अलग क्रमिक चरणों में नहीं, बल्कि एक ही लाइव इन्फरेंस पाथ में चलती है। इस जुड़ाव से विलंब इतना कम रहता है कि बातचीत की स्वाभाविक लय बनी रहती है। Google ऑडियो और वीडियो, दोनों आउटपुट में SynthID वॉटरमार्किंग को इस तरह शामिल करता है कि वह दिखाई नहीं देती—हर सेकंड में मशीन-पठनीय टैग होता है, जो बताता है कि सामग्री AI से बनाई गई है, भले ही स्ट्रीम रिकॉर्ड करके बाद में चलाई जाए। दोबारा एन्कोड करने के बाद भी वॉटरमार्क बना रहता है, इसलिए निर्यात किए गए क्लिप की उत्पत्ति की पुष्टि की जा सकती है।

भारत में एंटरप्राइज़ स्तर पर इसकी तैनाती संभालने वाली Equal AI इस बात का सबसे स्पष्ट संकेत देती है कि बड़े पैमाने पर संचालन में यह तकनीक क्या कर सकती है: कुल 97 भाषाओं के समर्थन के दायरे में, भारत की नौ भाषाएँ एक साथ सक्रिय और हर दिन दस लाख से अधिक लाइव कॉल। इतनी उपलब्धता और शेड्यूलिंग कवरेज के साथ मानव एजेंटों से इतनी कॉल संभालना आर्थिक रूप से अव्यावहारिक होगा। इस तैनाती की बुनियादी सोच किसी अवधारणा के प्रमाण की नहीं, बल्कि बड़े पैमाने पर काम संभालने की है।

लॉन्च के साथ जिस बात का खुलासा नहीं हुआ, वह है कीमत। Google ने लागत प्रकाशित नहीं की है और पूछताछ के लिए अपने एंटरप्राइज़ सेल्स टीम से संपर्क करने को कहा है। कस्टम अवतार बनाने के लिए—यानी अपने संदर्भ चित्रों से चेहरा तैयार करने वाले संगठनों के लिए—अलग सत्यापन प्रक्रिया के तहत एंटरप्राइज़ अनुमति-सूची में शामिल होना ज़रूरी है; यह सुविधा खुद से इस्तेमाल नहीं की जा सकती। Live मॉडल की Extended Thinking क्षमताएँ अभी निजी पूर्वावलोकन में हैं, इसलिए Google की Gemini की अन्य पेशकशों की तुलना में इसकी तर्क क्षमता सीमित रहती है। एक साथ चल सकने वाले सत्रों की सीमा का खुलासा भी नहीं किया गया है। लॉन्च का यह सीमित स्वरूप Google के चरणबद्ध एंटरप्राइज़ रिलीज़ के तौर-तरीके के अनुरूप है, जिनमें कीमत और क्षमता प्रकाशित करने के बजाय बातचीत से तय की जाती हैं।

Gemini 3.8 Live with Live Avatar अब Gemini Enterprise कंसोल और Live API के ज़रिये उपलब्ध है; इसके एंडपॉइंट संयुक्त राज्य अमेरिका और यूरोपीय संघ में हैं। Live मॉडल के लिए Extended Thinking को मौजूदा निजी पूर्वावलोकन समूह से बाहर व्यापक रूप से कब उपलब्ध कराया जाएगा, इसकी कोई समय-सीमा प्रकाशित नहीं की गई है।

इसे तैनात करने वाले एंटरप्राइज़ एक ऐसे सवाल का जवाब देंगे जिसका जवाब तकनीक खुद नहीं देती: क्या स्वचालित बातचीत का संकेत देने वाला दृश्य हटाने से उपयोगकर्ताओं का अनुभव बेहतर होता है, या इससे यह बताने वाला आखिरी ईमानदार संकेत भी मिट जाता है कि बातचीत स्वचालित है?

टैग: , , , , ,

हमें Google पर जोड़ें

चर्चा

0 टिप्पणियाँ हैं।