पेशेवर आवाजें

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

इस उपयोग मामले के लिए आवाजें

काटालिनाcatalina
महिलायुवालैटिन-अमेरिकी
Best for स्पैनिशआवाज़ का उपयोग करें
क्लाउडियाclaudia
महिलायुवाकास्टिलियन-मानक
Best for स्पैनिशआवाज़ का उपयोग करें
आंद्रेईandrei
पुरुषयुवारूसी
याकुबjakub
पुरुषयुवापॉलिश
अर्घ्यarghya
पुरुषयुवाभारतीय
मुरुगनmurugan
पुरुषयुवाभारतीय

दो वर्किंग पूल्स से लिया गया

कोई पेशेवर टैग नहीं है, इसलिए यह सेट शैक्षिक और वॉइस एजेंट समूहों से आता है, जो दोनों मिलकर उन संदर्भों को कवर करते हैं जहां एक संयमित शैली मायने रखती है। बाईस आवाज़ों में इनमें से कोई एक टैग है। उनके भीतर चयन किसी भी दस्तावेजी विशेषता के बजाय सुनने पर आधारित है।

चरित्र से अधिक गति

गति, जिसे 0.5 से 2.0 तक समायोजित किया जा सकता है, एकमात्र डिलीवरी नियंत्रण है। कॉर्पोरेट विवरण (नरेशन) के लिए, 1.0 से थोड़ा कम का सेटिंग अधिक नपा-तुला लगता है। इसमें कोई टोन पैरामीटर नहीं है, इसलिए बाद में किसी आवाज़ को अधिक औपचारिक नहीं बनाया जा सकता है।

शब्दावली की निरंतरता

कॉर्पोरेट सामग्री में ब्रांड के नाम, उत्पाद के नाम और संक्षिप्त रूपों (एक्रोनम) को लगातार दोहराया जाता है, और पूरी लाइब्रेरी में असंगतता किसी भी व्यक्तिगत गलत उच्चारण की तुलना में अधिक ध्यान देने योग्य होती है। उच्चारण शब्दकोश प्रत्येक शब्द को एक ही बार में ठीक कर देते हैं ताकि हर पीढ़ी आपस में मेल खाए, जो एकमुश्त (वन-ऑफ) स्क्रिप्ट की तुलना में बार-बार आने वाली सामग्री के लिए अधिक महत्वपूर्ण है।

एक लंबे स्क्रिप्ट में निरंतरता

अनुरोधों की सीमा 250 वर्णों तक है, इसलिए एक तिमाही प्रस्तुति या प्रशिक्षण स्क्रिप्ट को कई कॉलों को मिलाकर तैयार किया जाता है। पूरे रन के दौरान आवाज़, गति और सैंपल दर को स्थिर रखने से अधिकांश भिन्नताएं दूर हो जाती हैं, लेकिन फाइनल करने से पहले एक पूरा सेक्शन जनरेट करना और उसके जोड़ों को सुनना फिर भी उचित रहता है।

विनिर्देश

नमूना दर

44.1 kHz मूल, टेलीफोनी के लिए 8 kHz पर पुनः नमूनाकृत (resampled)

विलंबता

~200 ms पहले बाइट तक (p50, वॉर्म रीज़न)

आउटपुट फ़ॉर्मेट

यूलॉ (ulaw), एलॉ (alaw), पीसीएम (PCM) 16-बिट, वेव (WAV), एमपी3 (MP3)

स्ट्रीमिंग ट्रांसपोर्ट्स

वेबसॉकेट (WebSocket), HTTP चंक्ड ट्रांसफर (chunked transfer)

गति सीमा

0.5× – 2.0×, प्रति अनुरोध पर सेट

इसके जैसी आवाज़ें खोजें

पेशेवर आवाजें

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

वयस्क आवाजें

छियासी आवाज़ों को परिपक्व (मैच्योर) टैग किया गया है, और बीस आवाज़ों में नैरेटिव (कथा) टैग भी है। वह ओवरलैप आमतौर पर ऑडियोबुक्स और डॉक्यूमेंट्री काम के लिए शुरुआती बिंदु होता है, जहाँ निरंतरता सेकंडों के बजाय घंटों तक दिखाई देती है।

ई-लर्निंग के लिए एआई आवाजें

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

आईवीआर (IVR) और टेलीफोनी के लिए एआई (AI) आवाजें

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

महिला आवाजें

एक सौ एक महिला आवाजें, जो छह लहजे के समूहों और सभी बारह अनुशंसित भाषाओं में फैली हुई हैं। उस पैमाने पर, लहजा और भाषा आमतौर पर लिंग की तुलना में कास्टिंग को अधिक सीमित करते हैं।

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

वयस्क आवाजें

छियासी आवाज़ों को परिपक्व (मैच्योर) टैग किया गया है, और बीस आवाज़ों में नैरेटिव (कथा) टैग भी है। वह ओवरलैप आमतौर पर ऑडियोबुक्स और डॉक्यूमेंट्री काम के लिए शुरुआती बिंदु होता है, जहाँ निरंतरता सेकंडों के बजाय घंटों तक दिखाई देती है।

ई-लर्निंग के लिए एआई आवाजें

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

आईवीआर (IVR) और टेलीफोनी के लिए एआई (AI) आवाजें

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

आधिकारिक आवाज़ें

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

वयस्क आवाजें

छियासी आवाज़ों को परिपक्व (मैच्योर) टैग किया गया है, और बीस आवाज़ों में नैरेटिव (कथा) टैग भी है। वह ओवरलैप आमतौर पर ऑडियोबुक्स और डॉक्यूमेंट्री काम के लिए शुरुआती बिंदु होता है, जहाँ निरंतरता सेकंडों के बजाय घंटों तक दिखाई देती है।

ई-लर्निंग के लिए एआई आवाजें

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

आईवीआर (IVR) और टेलीफोनी के लिए एआई (AI) आवाजें

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

अक्सर पूछे जाने वाले प्रश्न

चूंकि कोई कॉर्पोरेट टैग नहीं है, इसलिए इन्हें शैक्षिक और वॉयस एजेंट पूल से लिया गया है। एलेक और एरिका अंग्रेजी में शांत और संयमित लगते हैं, आरुषि और अदिति हिंदी में। बार-बार आने वाली सामग्री के लिए, उच्चारण शब्दकोश सबसे महत्वपूर्ण विशेषता हैं, क्योंकि वे प्रत्येक स्क्रिप्ट के बजाय ब्रांड और उत्पाद नामों को एक ही बार में ठीक कर देते हैं।

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104