हमारी सीरीज़ ए फंडिंग (Series A Funding) की घोषणा

हमारी सीरीज़ ए फंडिंग (Series A Funding) की घोषणा

पॉडकास्ट बनाने के लिए एआई आवाज़ें

पॉडकास्ट प्रोडक्शन पहले से ही सेगमेंट आधारित है, जो शॉर्ट कॉल्स में जनरेशन के लिए अनुकूल है। इंट्रो और विज्ञापन रीड़स एक बार जनरेट होते हैं और कैश हो जाते हैं, और अलग-अलग आवाज़ों को मिलाने से बिना दो लोगों को बुक किए एक टू-हैंडर (दो लोगों का शो) तैयार हो जाता है।

इस उपयोग मामले के लिए आवाजें

मिशाmisha
महिलायुवाभारतीय
केवलkeval
पुरुषयुवाभारतीय
लुईसlouis
पुरुषयुवाफ्रांसीसी
Best for फ्रांसीसीआवाज़ का उपयोग करें
करीनाkareena
महिलायुवाभारतीय
राकेशrakesh
पुरुषयुवाभारतीय
अल्वाalva
महिलायुवास्वीडिश
Best for स्वीडिशआवाज़ का उपयोग करें

एपिसोड को जोड़ना

अनुरोधों की सीमा 250 वर्णों तक है, इसलिए बीस मिनट के एक एपिसोड के लिए एडिटर में जोड़ी गई कई सौ कॉल्स की आवश्यकता होती है। यह सुनने में श्रमसाध्य लगता है लेकिन पॉडकास्ट प्रोडक्शन के लिए बिल्कुल उपयुक्त है, जो वैसे भी सेगमेंट पर आधारित होता है। इंट्रो, आउट्रो और विज्ञापनों को एक बार जेनरेट करके कैश कर लिया जाना चाहिए, न कि हर एपिसोड के लिए बार-बार जेनरेट किया जाए।

प्रायोजन और लाइसेंसिंग

व्यावसायिक उपयोग भुगतान वाले प्लान के अंतर्गत आता है, लेकिन होस्ट द्वारा विज्ञापन पढ़ने (होस्ट रीड स्पॉन्सरशिप) के बारे में अलग से जांच करना उचित है। कुछ विज्ञापनदाताओं के अनुबंधों में यह स्पष्ट होता है कि विज्ञापन किसी इंसान द्वारा पढ़ा जाना चाहिए, और किसी सिंथेटिक (कृत्रिम) आवाज़ द्वारा व्यक्तिगत रूप से विज्ञापन का समर्थन करना एक ऐसा सवाल खड़ा करता है जिसे अभियान के बाद के बजाय पहले ही सुलझा लेना बेहतर है।

बातचीत में दो आवाजें

ऐसा कोई एक कॉल नहीं है जो दो वक्ताओं के बीच बातचीत उत्पन्न करता हो। प्रत्येक वक्ता को अलग से जनरेट करें और खंडों को आपस में जोड़ें। समान आवाजों के बजाय विपरीत रजिस्टर (पिच) वाली आवाजों को मिलाना अधिक स्वाभाविक लगता है, और कास्टिंग शुरू करने के लिए मनोरंजन टैग वाले छह स्वर एक अच्छा शुरुआती बिंदु हैं।

फ़ीड के लिए ऑडियो क्वालिटी

आउटपुट 44.1 kHz मोनो है। WAV फ़ाइल को सीधे अपने एडिट में ले जाएं ताकि लाउडनेस नॉर्मलाइज़ेशन (तेज़ी का सामान्यीकरण) और कम्प्रेशन एक्सपोर्ट के समय केवल एक बार हो, न कि पहले से कम्प्रेस किए गए सोर्स पर। पॉडकास्ट प्लेटफॉर्म अपलोड के समय री-एनकोड करते हैं, जिससे आपके मास्टर ऑडियो की क्वालिटी पहली नज़र में दिखने की तुलना में कहीं अधिक महत्वपूर्ण हो जाती है।

विनिर्देश

नमूना दर

44.1 kHz मूल, टेलीफोनी के लिए 8 kHz पर पुनः नमूनाकृत (resampled)

विलंबता

~200 ms पहले बाइट तक (p50, वॉर्म रीज़न)

आउटपुट फ़ॉर्मेट

यूलॉ (ulaw), एलॉ (alaw), पीसीएम (PCM) 16-बिट, वेव (WAV), एमपी3 (MP3)

स्ट्रीमिंग ट्रांसपोर्ट्स

वेबसॉकेट (WebSocket), HTTP चंक्ड ट्रांसफर (chunked transfer)

गति सीमा

0.5× – 2.0×, प्रति अनुरोध पर सेट

इसके जैसी आवाज़ें खोजें

पॉडकास्ट बनाने के लिए एआई आवाज़ें

ऑडियोबुक वर्णन के लिए एआई आवाजें

एक उपन्यास हजारों अनुरोधों को आपस में सिलकर बनता है, और जहां ये जोड़ होते हैं वहीं से कहानी बिखरने लगती है। ये आवाजें पूरी किताब में एक जैसी बनी रहती हैं और नौ ऐसी भारतीय भाषाओं को कवर करती हैं जिन्हें अधिकांश विक्रेता उपलब्ध नहीं कराते हैं।

यूट्यूब वॉयसओवर के लिए एआई आवाजें

शॉर्ट-फ़ॉर्म की सफलता तेज़ रफ़्तार पर निर्भर करती है, और इसकी गति 2.0 तक बढ़ाई जा सकती है। एडिटिंग के बाद स्क्रिप्ट बदल जाती हैं, इसलिए लाइन-दर-लाइन जनरेट करने का मतलब है कि किसी सेक्शन को रीटाइम करने पर पूरी ट्रैक के बजाय केवल एक लाइन का ही खर्च आता है।

एक्सप्लेनर और प्रोडक्ट डेमो वीडियो के लिए

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

गर्म आवाजें

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

अमेरिकी अंग्रेजी एआई आवाजें

तैंतालीस अमेरिकी आवाजें, जो कैटलॉग में सबसे गहरा अंग्रेजी सेट है। इसमें इतनी रेंज है कि एक ही आवाज को बार-बार दोहराने के बजाय पूरे अभियान में अलग-अलग टोन के लिए कलाकारों का चयन किया जा सकता है, क्योंकि कोई अन्य आवाज फिट नहीं बैठती।

गेमिंग और कैरेक्टर आवाज़ों के लिए AI वॉइसेस

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

ध्यान और कल्याण के लिए एआई आवाजें

गाइडेड ऑडियो आवाज़ के चरित्र के बजाय पेसिंग पर निर्भर करता है। स्पीड को 0.5 तक कम किया जा सकता है, ठहराव इस बात से तय होते हैं कि आप स्क्रिप्ट कैसे लिखते हैं, और क्षेत्रीय वेलनेस कंटेंट के लिए नौ भारतीय भाषाएं उपलब्ध हैं।

ई-लर्निंग के लिए एआई आवाजें

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

पहुंच और स्क्रीन रीडर्स के लिए एआई आवाजें

स्क्रीन रीडर का अनुभव रखने वाले यूज़र अक्सर इसे सामान्य से काफी अधिक गति पर चलाते हैं। इसकी गति को 0.5 से 2.0 तक एडजस्ट किया जा सकता है, और इसमें नौ भारतीय भाषाओं को शामिल किया गया है, जहाँ पूरे उद्योग में सहायक ऑडियो की उपलब्धता काफी कम है।

ऑडियोबुक वर्णन के लिए एआई आवाजें

एक उपन्यास हजारों अनुरोधों को आपस में सिलकर बनता है, और जहां ये जोड़ होते हैं वहीं से कहानी बिखरने लगती है। ये आवाजें पूरी किताब में एक जैसी बनी रहती हैं और नौ ऐसी भारतीय भाषाओं को कवर करती हैं जिन्हें अधिकांश विक्रेता उपलब्ध नहीं कराते हैं।

यूट्यूब वॉयसओवर के लिए एआई आवाजें

शॉर्ट-फ़ॉर्म की सफलता तेज़ रफ़्तार पर निर्भर करती है, और इसकी गति 2.0 तक बढ़ाई जा सकती है। एडिटिंग के बाद स्क्रिप्ट बदल जाती हैं, इसलिए लाइन-दर-लाइन जनरेट करने का मतलब है कि किसी सेक्शन को रीटाइम करने पर पूरी ट्रैक के बजाय केवल एक लाइन का ही खर्च आता है।

एक्सप्लेनर और प्रोडक्ट डेमो वीडियो के लिए

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

गर्म आवाजें

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

अमेरिकी अंग्रेजी एआई आवाजें

तैंतालीस अमेरिकी आवाजें, जो कैटलॉग में सबसे गहरा अंग्रेजी सेट है। इसमें इतनी रेंज है कि एक ही आवाज को बार-बार दोहराने के बजाय पूरे अभियान में अलग-अलग टोन के लिए कलाकारों का चयन किया जा सकता है, क्योंकि कोई अन्य आवाज फिट नहीं बैठती।

ऑडियोबुक वर्णन के लिए एआई आवाजें

एक उपन्यास हजारों अनुरोधों को आपस में सिलकर बनता है, और जहां ये जोड़ होते हैं वहीं से कहानी बिखरने लगती है। ये आवाजें पूरी किताब में एक जैसी बनी रहती हैं और नौ ऐसी भारतीय भाषाओं को कवर करती हैं जिन्हें अधिकांश विक्रेता उपलब्ध नहीं कराते हैं।

यूट्यूब वॉयसओवर के लिए एआई आवाजें

शॉर्ट-फ़ॉर्म की सफलता तेज़ रफ़्तार पर निर्भर करती है, और इसकी गति 2.0 तक बढ़ाई जा सकती है। एडिटिंग के बाद स्क्रिप्ट बदल जाती हैं, इसलिए लाइन-दर-लाइन जनरेट करने का मतलब है कि किसी सेक्शन को रीटाइम करने पर पूरी ट्रैक के बजाय केवल एक लाइन का ही खर्च आता है।

एक्सप्लेनर और प्रोडक्ट डेमो वीडियो के लिए

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

गर्म आवाजें

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

अमेरिकी अंग्रेजी एआई आवाजें

तैंतालीस अमेरिकी आवाजें, जो कैटलॉग में सबसे गहरा अंग्रेजी सेट है। इसमें इतनी रेंज है कि एक ही आवाज को बार-बार दोहराने के बजाय पूरे अभियान में अलग-अलग टोन के लिए कलाकारों का चयन किया जा सकता है, क्योंकि कोई अन्य आवाज फिट नहीं बैठती।

गेमिंग और कैरेक्टर आवाज़ों के लिए AI वॉइसेस

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

ध्यान और कल्याण के लिए एआई आवाजें

गाइडेड ऑडियो आवाज़ के चरित्र के बजाय पेसिंग पर निर्भर करता है। स्पीड को 0.5 तक कम किया जा सकता है, ठहराव इस बात से तय होते हैं कि आप स्क्रिप्ट कैसे लिखते हैं, और क्षेत्रीय वेलनेस कंटेंट के लिए नौ भारतीय भाषाएं उपलब्ध हैं।

अक्सर पूछे जाने वाले प्रश्न

हाँ। प्रत्येक वक्ता को अलग-अलग जनरेट करें और अपने एडिटर में उन सेगमेंट को आपस में जोड़ लें। ऐसी कोई सिंगल कॉल नहीं है जिससे दो वक्ताओं के बीच की बातचीत को एक साथ प्रोड्यूस किया जा सके। हिंदी में कंट्रास्टिंग पेयर (विरोधाभासी जोड़ी) के रूप में अदिति और चिराग बेहतर काम करते हैं, और अंग्रेजी में एरिका और लक्ष्य।