प्रौद्योगिकी

ElevenLabs v4 सिर्फ 10 सेकंड की रिकॉर्डिंग से आपकी आवाज़ का क्लोन बनाकर 90 भाषाएं बुलवाता है

Susan Hill
हमें Google पर जोड़ें

ElevenLabs ने Eleven v4 जारी किया है। यह टेक्स्ट-टू-स्पीच मॉडल लिखे हुए शब्दों को ज़ोर से पढ़ते हुए हँस सकता है, आह भर सकता है या लेखक के कहने पर गुस्से में फ़्रेंच लहजे में बोल सकता है। आवाज़ की तुरंत क्लोनिंग के लिए वॉइसमेल संदेश से भी छोटी रिकॉर्डिंग काफ़ी है। इसके बाद क्लोन की गई आवाज़ अपनी ख़ास ध्वनि बरकरार रखते हुए दर्जनों भाषाओं में बोल सकती है। ElevenLabs का मुफ़्त अकाउंट रखने वाला कोई भी व्यक्ति इसका इस्तेमाल कर सकता है।

आवाज़ के साथ काम करने वाले लोगों के लिए इससे कई-कई दिन का काम बच जाता है। पॉडकास्टर अपनी ही आवाज़ में किसी एपिसोड को जापानी में डब कर सकता है, इंडी गेम डेवलपर स्टूडियो बुक किए बिना हर छोटे पात्र को बोलने का अलग अंदाज़ दे सकता है, और ऑडियोबुक का नैरेटर स्क्रिप्ट में ही ठहराव या हल्की हँसी जोड़ सकता है। इसका दूसरा पहलू भी उतना ही ठोस है: अब किसी की आवाज़ की विश्वसनीय नकल तैयार करने के लिए वॉइस नोट, वीडियो कॉल की क्लिप या किसी सार्वजनिक पोस्ट के कुछ सेकंड ही काफ़ी हैं।

सबसे बड़ा बदलाव आवाज़ पर नियंत्रण का है, और क्लोन बनाने के लिए सिर्फ़ 10 सेकंड का ऑडियो चाहिए। ElevenLabs के पुराने मॉडल लिखे हुए पाठ को साफ़-सुथरे ढंग से पढ़ते थे, लेकिन भाव का अंदाज़ा उन्हें खुद लगाना पड़ता था। Version 4 में लेखक चौकोर कोष्ठकों के भीतर निर्देशन लिख सकता है, जैसे [हँसते हुए] या [फ़्रेंच लहजे में गुस्से से कहा], और पृष्ठभूमि की आवाज़ों के संकेत भी दे सकता है, जैसे [हल्की बारिश] या [फ़ोन वाइब्रेट हो रहा है]। कंपनी का कहना है कि मॉडल आसपास के संदर्भ से लहजे और बोलने की गति को भी समझता है, इसलिए तनावपूर्ण दृश्य की कोई पंक्ति बिना अलग संकेत के भी तनावपूर्ण सुनाई देती है। कई वक्ताओं वाले दृश्यों में लंबे अंशों तक हर आवाज़ एक जैसी बनी रहती है। सिंथेटिक नैरेशन में यह अब तक एक कमज़ोर पक्ष रहा है, क्योंकि अध्याय आगे बढ़ने के साथ आवाज़ें बदलने लगती थीं।

पिछले संस्करण में उपलब्ध 70 भाषाओं की जगह अब 90 से अधिक भाषाएँ हैं। TechCrunch के मुताबिक, ElevenLabs ने जापानी, ब्राज़ीलियाई पुर्तगाली, मंदारिन और कैंटोनीज़ में गुणवत्ता को सबसे ज़्यादा बेहतर बताया है। क्लोन की गई आवाज़ भाषा बदलने पर भी अपनी पहचान बनाए रखती है। मसलन, स्पेनिश बोलने वाले व्यक्ति की आवाज़ का क्लोन जर्मन पढ़ते हुए भी उसी व्यक्ति की आवाज़ लगता है, लेकिन उसका उच्चारण किसी मूल जर्मन वक्ता जैसा होता है। दूसरा मॉडल, v4 Turbo, वॉइस असिस्टेंट और कॉल-सेंटर एजेंट के लिए बनाया गया है। यह करीब 150 मिलीसेकंड में बोलना शुरू कर देता है—यानी बातचीत में दो लोगों के बारी-बारी से बोलने के बीच जितना ठहराव होता है, लगभग उतने ही समय में। इसके पीछे मौजूद चैटबॉट का जवाब लिखना पूरा होने से पहले ही यह बोलना शुरू कर सकता है।

इस बाज़ार में ElevenLabs अकेली कंपनी नहीं है। Google, OpenAI, Cartesia, Deepgram और Fish Audio भी इन्हीं डेवलपरों को सिंथेटिक आवाज़ें बेचते हैं। लॉन्च के कुछ ही घंटों के भीतर स्वतंत्र बेंचमार्किंग फ़र्म Artificial Analysis ने अपनी वॉइस लीडरबोर्ड पर v4 को पहले स्थान पर रखा। इस लीडरबोर्ड पर श्रोता बिना नाम बताए गए नमूनों को साथ-साथ सुनकर उनकी रेटिंग करते हैं। ElevenLabs का यह भी कहना है कि प्रतिद्वंद्वियों के साथ हुए ब्लाइंड टेस्ट में हर चार में से लगभग तीन श्रोताओं ने v4 को पसंद किया—हालाँकि यह आँकड़ा कंपनी की अपनी जाँच से आया है।

इस 10 सेकंड के दावे के साथ कुछ शर्तें भी जुड़ी हैं। ElevenLabs का कहना है कि क्लोन बनाने के लिए अपलोड की गई आवाज़ के मालिक की सहमति ज़रूरी है। कंपनी एक सार्वजनिक क्लासिफ़ायर भी चलाती है, जो उसके टूल से बने ऑडियो की पहचान कर सकता है, और कुछ राजनीतिक हस्तियों की आवाज़ के क्लोन बनाने पर पूरी तरह रोक लगाती है। ये जाँच-पड़ताल आम तौर पर होने वाले दुरुपयोग को रोक सकती हैं, लेकिन इनकी सफलता इस बात पर निर्भर करती है कि अपलोड करने वाला सच बोल रहा हो। ठग को किसी रिश्तेदार की आवाज़ का छोटा-सा नमूना ही चाहिए, ताकि वह नकली आपातकालीन कॉल कर सके। मुफ़्त योजना भी सीमित है: Unite.AI के प्लान संबंधी विश्लेषण के मुताबिक, इसमें महीने में करीब 10 मिनट का जनरेट किया हुआ ऑडियो मिलता है। सशुल्क योजनाएँ 6 डॉलर प्रति माह से शुरू होती हैं।

Eleven v4 और v4 Turbo, 28 सितंबर को ElevenLabs के क्रिएटर ऐप, उसके एजेंट प्लेटफ़ॉर्म और डेवलपर API पर उपलब्ध हुए। लंदन स्थित कंपनी ने फरवरी में Sequoia से 500 मिलियन डॉलर जुटाए थे, तब उसका मूल्यांकन 11 अरब डॉलर था। TechCrunch की रिपोर्ट के मुताबिक, कंपनी का सालाना आधार पर अनुमानित राजस्व 600 मिलियन डॉलर पार कर चुका है। मुख्य कार्यकारी अधिकारी माती स्तानिशेव्स्की (Mati Staniszewski) ने TechCrunch से कहा कि कंपनी आने वाले वर्षों में शेयर बाज़ार में सूचीबद्ध होने की तैयारी कर रही है, लेकिन उन्होंने कोई तारीख तय नहीं की।

क्रिएटरों के लिए 90 भाषाओं में संकेत मिलते ही हँसने वाली आवाज़, ब्राउज़र के एक टैब में रिकॉर्डिंग स्टूडियो होने जैसी है। बाकी सभी के लिए यह एक और वजह है कि फ़ोन पर कोई जानी-पहचानी आवाज़ पैसे माँगे, तो कॉल काटकर दोबारा फ़ोन करें।

टैग: , , , , ,

हमें Google पर जोड़ें

चर्चा

0 टिप्पणियाँ हैं।