हमारी सीरीज़ ए फंडिंग (Series A Funding) की घोषणा

हमारी सीरीज़ ए फंडिंग (Series A Funding) की घोषणा

विज्ञापनों और विज्ञापनों के लिए एआई आवाजें

कमर्शियल रीड्स छोटे, तेज़ होते हैं और इनके अलग-अलग वेरिएंट्स का परीक्षण करना फायदेमंद होता है। तीस सेकंड का एक विज्ञापन एक या दो रिक्वेस्ट्स का होता है, जिससे इसके चार वर्ज़न बनाना, एक सेशन बुक करने की तुलना में सस्ता हो जाता है।

इस उपयोग मामले के लिए आवाजें

रक्षितrakshith
पुरुषयुवाभारतीय
ऑटमautumn
महिलायुवाअमेरिकी
Best for अंग्रेज़ीआवाज़ का उपयोग करें
लक्ष्मीlakshmi
महिलायुवाभारतीय
सहानाsahana
महिलायुवाभारतीय
सेराफिनाseraphina
महिलायुवाब्रिटिश
Best for अंग्रेज़ीआवाज़ का उपयोग करें
केल्सीkelsey
महिलायुवाअमेरिकी
Best for अंग्रेज़ीआवाज़ का उपयोग करें

छोटा, तेज़ और दोहराया जाने वाला

व्यावसायिक रूप से पढ़े जाने वाले विज्ञापन संक्षिप्त होते हैं और तेज़ गति से पेश किए जाते हैं। 1.1 और 1.3 के बीच की गति अधिकांश विज्ञापनों के लिए उपयुक्त होती है, जबकि अस्वीकरण (डिस्क्लेमर) इससे भी अधिक तेज़ होते हैं। चूंकि अनुरोधों की सीमा 250 वर्णों तक होती है, इसलिए तीस सेकंड का विज्ञापन एक या दो कॉल का होता है, जिससे परीक्षण के लिए कई तरह के विकल्प तैयार करना शेड्यूलिंग की समस्या बनने के बजाय काफी किफायती हो जाता है।

ब्रॉडकास्ट डिलीवरी

आउटपुट मूल रूप से 44.1 kHz है। ऑन-एयर जाने वाली किसी भी चीज़ के लिए MP3 के बजाय WAV का अनुरोध करें, क्योंकि ब्रॉडकास्ट चेन अपना खुद का कम्प्रेशन लागू करती हैं और पहले से कम्प्रेश्ड सोर्स की गुणवत्ता और अधिक खराब हो जाती है। अपनी स्टेशन की लाउडनेस स्पेसिफिकेशन की पुष्टि करें, क्योंकि इसे हमारे बजाय आपके यहाँ लागू किया जाता है।

टोन टैग के बिना कास्टिंग करना

केवल एक आवाज़ में विज्ञापन टैग होता है, इसलिए कास्टिंग मनोरंजन और कथा पूल से आती है और सुनने पर निर्भर करती है। कैटलॉग में कोई टोन फ़ील्ड नहीं है। तीन या चार वेरिएंट बनाना और उनका परीक्षण करना, कागज पर सही आवाज़ चुनने का प्रयास करने की तुलना में अधिक विश्वसनीय है।

अधिकार और क्लोन की गई आवाज़ें

सशुल्क विज्ञापन (Paid advertising) सशुल्क योजनाओं के तहत व्यावसायिक उपयोग है, लेकिन विशिष्ट प्लेसमेंट के लिए शर्तों की पुष्टि कर लें। यदि उस स्थान पर कैटलॉग आवाज़ के बजाय किसी क्लोन की गई आवाज़ का उपयोग किया जाता है, तो आपको उस व्यक्ति से लिखित सहमति की भी आवश्यकता होगी, जिसमें बाज़ार और अवधि स्पष्ट रूप से लिखी होनी चाहिए, न कि केवल मानी गई हो।

विनिर्देश

नमूना दर

44.1 kHz मूल, टेलीफोनी के लिए 8 kHz पर पुनः नमूनाकृत (resampled)

विलंबता

~200 ms पहले बाइट तक (p50, वॉर्म रीज़न)

आउटपुट फ़ॉर्मेट

यूलॉ (ulaw), एलॉ (alaw), पीसीएम (PCM) 16-बिट, वेव (WAV), एमपी3 (MP3)

स्ट्रीमिंग ट्रांसपोर्ट्स

वेबसॉकेट (WebSocket), HTTP चंक्ड ट्रांसफर (chunked transfer)

गति सीमा

0.5× – 2.0×, प्रति अनुरोध पर सेट

इसके जैसी आवाज़ें खोजें

विज्ञापनों और विज्ञापनों के लिए एआई आवाजें

यूट्यूब वॉयसओवर के लिए एआई आवाजें

शॉर्ट-फ़ॉर्म की सफलता तेज़ रफ़्तार पर निर्भर करती है, और इसकी गति 2.0 तक बढ़ाई जा सकती है। एडिटिंग के बाद स्क्रिप्ट बदल जाती हैं, इसलिए लाइन-दर-लाइन जनरेट करने का मतलब है कि किसी सेक्शन को रीटाइम करने पर पूरी ट्रैक के बजाय केवल एक लाइन का ही खर्च आता है।

एक्सप्लेनर और प्रोडक्ट डेमो वीडियो के लिए

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

घोषणाओं और सार्वजनिक परिवहन के लिए एआई आवाजें

घोषणाएँ गूंजते हुए हॉलों में सुनी जाती हैं और हजारों बार दोहराई जाती हैं। उच्चारण शब्दकोश स्टेशनों और स्थानों के नामों को स्थायी रूप से तय करते हैं, यूलॉ (ulaw) और एलॉ (alaw) सीधे पब्लिक एड्रेस हार्डवेयर को फीड करते हैं, और एक ही आवाज पूरी बहुभाषी श्रृंखला को संभालती है।

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

वॉइस चैटबॉट्स के लिए एआई आवाजें

वेब चैट असामान्य है क्योंकि विज़िटर एक ही समय में पढ़ता और सुनता है। ये आवाज़ें इत्मीनान से बोलने के लिए उपयुक्त हैं, वेबसॉकेट (WebSocket) पर लगभग 200 मिलीसेकंड में चलना शुरू हो जाती हैं, और एक ही एकीकरण (integration) से बारह भाषाओं को कवर करती हैं।

गेमिंग और कैरेक्टर आवाज़ों के लिए AI वॉइसेस

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

आईवीआर (IVR) और टेलीफोनी के लिए एआई (AI) आवाजें

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

ध्यान और कल्याण के लिए एआई आवाजें

गाइडेड ऑडियो आवाज़ के चरित्र के बजाय पेसिंग पर निर्भर करता है। स्पीड को 0.5 तक कम किया जा सकता है, ठहराव इस बात से तय होते हैं कि आप स्क्रिप्ट कैसे लिखते हैं, और क्षेत्रीय वेलनेस कंटेंट के लिए नौ भारतीय भाषाएं उपलब्ध हैं।

यूट्यूब वॉयसओवर के लिए एआई आवाजें

शॉर्ट-फ़ॉर्म की सफलता तेज़ रफ़्तार पर निर्भर करती है, और इसकी गति 2.0 तक बढ़ाई जा सकती है। एडिटिंग के बाद स्क्रिप्ट बदल जाती हैं, इसलिए लाइन-दर-लाइन जनरेट करने का मतलब है कि किसी सेक्शन को रीटाइम करने पर पूरी ट्रैक के बजाय केवल एक लाइन का ही खर्च आता है।

एक्सप्लेनर और प्रोडक्ट डेमो वीडियो के लिए

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

घोषणाओं और सार्वजनिक परिवहन के लिए एआई आवाजें

घोषणाएँ गूंजते हुए हॉलों में सुनी जाती हैं और हजारों बार दोहराई जाती हैं। उच्चारण शब्दकोश स्टेशनों और स्थानों के नामों को स्थायी रूप से तय करते हैं, यूलॉ (ulaw) और एलॉ (alaw) सीधे पब्लिक एड्रेस हार्डवेयर को फीड करते हैं, और एक ही आवाज पूरी बहुभाषी श्रृंखला को संभालती है।

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

यूट्यूब वॉयसओवर के लिए एआई आवाजें

शॉर्ट-फ़ॉर्म की सफलता तेज़ रफ़्तार पर निर्भर करती है, और इसकी गति 2.0 तक बढ़ाई जा सकती है। एडिटिंग के बाद स्क्रिप्ट बदल जाती हैं, इसलिए लाइन-दर-लाइन जनरेट करने का मतलब है कि किसी सेक्शन को रीटाइम करने पर पूरी ट्रैक के बजाय केवल एक लाइन का ही खर्च आता है।

एक्सप्लेनर और प्रोडक्ट डेमो वीडियो के लिए

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

घोषणाओं और सार्वजनिक परिवहन के लिए एआई आवाजें

घोषणाएँ गूंजते हुए हॉलों में सुनी जाती हैं और हजारों बार दोहराई जाती हैं। उच्चारण शब्दकोश स्टेशनों और स्थानों के नामों को स्थायी रूप से तय करते हैं, यूलॉ (ulaw) और एलॉ (alaw) सीधे पब्लिक एड्रेस हार्डवेयर को फीड करते हैं, और एक ही आवाज पूरी बहुभाषी श्रृंखला को संभालती है।

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

वॉइस चैटबॉट्स के लिए एआई आवाजें

वेब चैट असामान्य है क्योंकि विज़िटर एक ही समय में पढ़ता और सुनता है। ये आवाज़ें इत्मीनान से बोलने के लिए उपयुक्त हैं, वेबसॉकेट (WebSocket) पर लगभग 200 मिलीसेकंड में चलना शुरू हो जाती हैं, और एक ही एकीकरण (integration) से बारह भाषाओं को कवर करती हैं।

गेमिंग और कैरेक्टर आवाज़ों के लिए AI वॉइसेस

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

अक्सर पूछे जाने वाले प्रश्न

केवल एक आवाज़ में विज्ञापन टैग है, इसलिए यह सेट मनोरंजन और कहानी संग्रह से लिया गया है। एल्बस और ब्लोफेल्ड अंग्रेजी में प्रस्तुत करते हैं, आरुषि और चिराग हिंदी में। व्यावसायिक विज्ञापनों को आमतौर पर 1.1 से 1.3 की गति की आवश्यकता होती है, और अस्वीकरणों (डिस्क्लेमर) के लिए इससे भी अधिक गति चाहिए भी तेज़ गति की।