पेशेवर आवाजें

पेशेवर आवाजें

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

व्यावसायिक एआई आवाजें

इस उपयोग मामले के लिए आवाजें

काटालिनाcatalina
महिलायुवालैटिन-अमेरिकी
Best for स्पैनिशआवाज़ का उपयोग करें
क्लाउडियाclaudia
महिलायुवाकास्टिलियन-मानक
Best for स्पैनिशआवाज़ का उपयोग करें
आंद्रेईandrei
पुरुषयुवारूसी
याकुबjakub
पुरुषयुवापॉलिश
अर्घ्यarghya
पुरुषयुवाभारतीय
मुरुगनmurugan
पुरुषयुवाभारतीय

दो वर्किंग पूल्स से लिया गया

कोई पेशेवर टैग नहीं है, इसलिए यह सेट शैक्षिक और वॉइस एजेंट समूहों से आता है, जो दोनों मिलकर उन संदर्भों को कवर करते हैं जहां एक संयमित शैली मायने रखती है। बाईस आवाज़ों में इनमें से कोई एक टैग है। उनके भीतर चयन किसी भी दस्तावेजी विशेषता के बजाय सुनने पर आधारित है।

चरित्र से अधिक गति

गति, जिसे 0.5 से 2.0 तक समायोजित किया जा सकता है, एकमात्र डिलीवरी नियंत्रण है। कॉर्पोरेट विवरण (नरेशन) के लिए, 1.0 से थोड़ा कम का सेटिंग अधिक नपा-तुला लगता है। इसमें कोई टोन पैरामीटर नहीं है, इसलिए बाद में किसी आवाज़ को अधिक औपचारिक नहीं बनाया जा सकता है।

शब्दावली की निरंतरता

कॉर्पोरेट सामग्री में ब्रांड के नाम, उत्पाद के नाम और संक्षिप्त रूपों (एक्रोनम) को लगातार दोहराया जाता है, और पूरी लाइब्रेरी में असंगतता किसी भी व्यक्तिगत गलत उच्चारण की तुलना में अधिक ध्यान देने योग्य होती है। उच्चारण शब्दकोश प्रत्येक शब्द को एक ही बार में ठीक कर देते हैं ताकि हर पीढ़ी आपस में मेल खाए, जो एकमुश्त (वन-ऑफ) स्क्रिप्ट की तुलना में बार-बार आने वाली सामग्री के लिए अधिक महत्वपूर्ण है।

एक लंबे स्क्रिप्ट में निरंतरता

अनुरोधों की सीमा 250 वर्णों तक है, इसलिए एक तिमाही प्रस्तुति या प्रशिक्षण स्क्रिप्ट को कई कॉलों को मिलाकर तैयार किया जाता है। पूरे रन के दौरान आवाज़, गति और सैंपल दर को स्थिर रखने से अधिकांश भिन्नताएं दूर हो जाती हैं, लेकिन फाइनल करने से पहले एक पूरा सेक्शन जनरेट करना और उसके जोड़ों को सुनना फिर भी उचित रहता है।

विनिर्देश

नमूना दर

44.1 kHz मूल, टेलीफोनी के लिए 8 kHz पर पुनः नमूनाकृत (resampled)

विलंबता

~200 ms पहले बाइट तक (p50, वॉर्म रीज़न)

आउटपुट फ़ॉर्मेट

यूलॉ (ulaw), एलॉ (alaw), पीसीएम (PCM) 16-बिट, वेव (WAV), एमपी3 (MP3)

स्ट्रीमिंग ट्रांसपोर्ट्स

वेबसॉकेट (WebSocket), HTTP चंक्ड ट्रांसफर (chunked transfer)

गति सीमा

0.5× – 2.0×, प्रति अनुरोध पर सेट

इसके जैसी आवाज़ें खोजें

पेशेवर आवाजें

गंभीर एआई आवाज

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

प्रभावशाली एआई आवाजें

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

संवादात्मक एआई आवाजें

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

परिपक्व एआई आवाजें

वयस्क आवाजें

छियासी आवाज़ों को परिपक्व (मैच्योर) टैग किया गया है, और बीस आवाज़ों में नैरेटिव (कथा) टैग भी है। वह ओवरलैप आमतौर पर ऑडियोबुक्स और डॉक्यूमेंट्री काम के लिए शुरुआती बिंदु होता है, जहाँ निरंतरता सेकंडों के बजाय घंटों तक दिखाई देती है।

ई-लर्निंग वॉइस ओवर

ई-लर्निंग के लिए एआई आवाजें

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

आईवीआर (IVR) वॉयस जनरेटर

आईवीआर (IVR) और टेलीफोनी के लिए एआई (AI) आवाजें

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

डीप एआई वॉयस

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

प्रसन्नचित्त एआई आवाज़

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

ऊर्जावान एआई आवाज़

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

महिला एआई आवाज

महिला आवाजें

एक सौ एक महिला आवाजें, जो छह लहजे के समूहों और सभी बारह अनुशंसित भाषाओं में फैली हुई हैं। उस पैमाने पर, लहजा और भाषा आमतौर पर लिंग की तुलना में कास्टिंग को अधिक सीमित करते हैं।

गंभीर एआई आवाज

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

प्रभावशाली एआई आवाजें

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

संवादात्मक एआई आवाजें

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

परिपक्व एआई आवाजें

वयस्क आवाजें

छियासी आवाज़ों को परिपक्व (मैच्योर) टैग किया गया है, और बीस आवाज़ों में नैरेटिव (कथा) टैग भी है। वह ओवरलैप आमतौर पर ऑडियोबुक्स और डॉक्यूमेंट्री काम के लिए शुरुआती बिंदु होता है, जहाँ निरंतरता सेकंडों के बजाय घंटों तक दिखाई देती है।

ई-लर्निंग वॉइस ओवर

ई-लर्निंग के लिए एआई आवाजें

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

आईवीआर (IVR) वॉयस जनरेटर

आईवीआर (IVR) और टेलीफोनी के लिए एआई (AI) आवाजें

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

गंभीर एआई आवाज

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

प्रभावशाली एआई आवाजें

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

संवादात्मक एआई आवाजें

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

परिपक्व एआई आवाजें

वयस्क आवाजें

छियासी आवाज़ों को परिपक्व (मैच्योर) टैग किया गया है, और बीस आवाज़ों में नैरेटिव (कथा) टैग भी है। वह ओवरलैप आमतौर पर ऑडियोबुक्स और डॉक्यूमेंट्री काम के लिए शुरुआती बिंदु होता है, जहाँ निरंतरता सेकंडों के बजाय घंटों तक दिखाई देती है।

ई-लर्निंग वॉइस ओवर

ई-लर्निंग के लिए एआई आवाजें

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

आईवीआर (IVR) वॉयस जनरेटर

आईवीआर (IVR) और टेलीफोनी के लिए एआई (AI) आवाजें

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

डीप एआई वॉयस

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

प्रसन्नचित्त एआई आवाज़

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

अक्सर पूछे जाने वाले प्रश्न

चूंकि कोई कॉर्पोरेट टैग नहीं है, इसलिए इन्हें शैक्षिक और वॉयस एजेंट पूल से लिया गया है। एलेक और एरिका अंग्रेजी में शांत और संयमित लगते हैं, आरुषि और अदिति हिंदी में। बार-बार आने वाली सामग्री के लिए, उच्चारण शब्दकोश सबसे महत्वपूर्ण विशेषता हैं, क्योंकि वे प्रत्येक स्क्रिप्ट के बजाय ब्रांड और उत्पाद नामों को एक ही बार में ठीक कर देते हैं।

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104