वॉइस लाइब्रेरी
वॉइस लाइब्रेरी
कैटलॉग में मौजूद हर आवाज़, बिना साइन इन किए यहीं पर सुनने के लिए उपलब्ध है। 22 भाषाओं और 27 लहजों (एक्सेन्ट) में कुल 244 आवाज़ें। लहजे, लिंग या उपयोग के आधार पर फ़िल्टर करें, अपनी पसंद की आवाज़ सुनें, और फिर उसकी ID सीधे API पर ले जाएं।
ऐप्स ढूंढें…
उपयोग का मामला

Narration is the one job where a voice has to hold up for hours rather than seconds. 163 of the 244 voices here carry the narration tag, the largest group in the catalog, across English, Hindi and nine other Indic languages.

News delivery is judged on clarity before character. These six come from voices carrying both the narration and educational tags, the combination that suits reading information aloud rather than performing it.

Documentary narration works by staying out of the way. The voice carries information the picture cannot, without competing with it. These six are drawn from the 163 narration-tagged voices, chosen for an even, unhurried delivery.

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

वॉइस एजेंट जवाब देने से पहले होने वाले ठहराव पर ही टिके होते हैं। सिंथेसिस लगभग 200 मिलीसेकंड में शुरू हो जाता है और वास्तविक समय से 3.3 गुना तेजी से चलता है, जिससे बजट वहीं बचता है जहां आमतौर पर इसकी जरूरत होती है: आपके मॉडल पर।

सपोर्ट कॉल उन लोगों तक पहुँचती हैं जो पहले से ही परेशान हैं, और अक्सर ख़राब नेटवर्क लाइन पर होते हैं। ये आवाज़ें चरित्र की तुलना में स्पष्टता को अधिक पसंद करती हैं, अलग-अलग रेंडर में स्थिर रहती हैं, और हिंदी और अंग्रेजी के बीच उसी तरह से बदलती हैं जैसे कॉल करने वाले वास्तव में करते हैं।

वेब चैट असामान्य है क्योंकि विज़िटर एक ही समय में पढ़ता और सुनता है। ये आवाज़ें इत्मीनान से बोलने के लिए उपयुक्त हैं, वेबसॉकेट (WebSocket) पर लगभग 200 मिलीसेकंड में चलना शुरू हो जाती हैं, और एक ही एकीकरण (integration) से बारह भाषाओं को कवर करती हैं।

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

एक उपन्यास हजारों अनुरोधों को आपस में सिलकर बनता है, और जहां ये जोड़ होते हैं वहीं से कहानी बिखरने लगती है। ये आवाजें पूरी किताब में एक जैसी बनी रहती हैं और नौ ऐसी भारतीय भाषाओं को कवर करती हैं जिन्हें अधिकांश विक्रेता उपलब्ध नहीं कराते हैं।

घोषणाएँ गूंजते हुए हॉलों में सुनी जाती हैं और हजारों बार दोहराई जाती हैं। उच्चारण शब्दकोश स्टेशनों और स्थानों के नामों को स्थायी रूप से तय करते हैं, यूलॉ (ulaw) और एलॉ (alaw) सीधे पब्लिक एड्रेस हार्डवेयर को फीड करते हैं, और एक ही आवाज पूरी बहुभाषी श्रृंखला को संभालती है।

पॉडकास्ट प्रोडक्शन पहले से ही सेगमेंट आधारित है, जो शॉर्ट कॉल्स में जनरेशन के लिए अनुकूल है। इंट्रो और विज्ञापन रीड़स एक बार जनरेट होते हैं और कैश हो जाते हैं, और अलग-अलग आवाज़ों को मिलाने से बिना दो लोगों को बुक किए एक टू-हैंडर (दो लोगों का शो) तैयार हो जाता है।

स्क्रीन रीडर का अनुभव रखने वाले यूज़र अक्सर इसे सामान्य से काफी अधिक गति पर चलाते हैं। इसकी गति को 0.5 से 2.0 तक एडजस्ट किया जा सकता है, और इसमें नौ भारतीय भाषाओं को शामिल किया गया है, जहाँ पूरे उद्योग में सहायक ऑडियो की उपलब्धता काफी कम है।

गाइडेड ऑडियो आवाज़ के चरित्र के बजाय पेसिंग पर निर्भर करता है। स्पीड को 0.5 तक कम किया जा सकता है, ठहराव इस बात से तय होते हैं कि आप स्क्रिप्ट कैसे लिखते हैं, और क्षेत्रीय वेलनेस कंटेंट के लिए नौ भारतीय भाषाएं उपलब्ध हैं।

शॉर्ट-फ़ॉर्म की सफलता तेज़ रफ़्तार पर निर्भर करती है, और इसकी गति 2.0 तक बढ़ाई जा सकती है। एडिटिंग के बाद स्क्रिप्ट बदल जाती हैं, इसलिए लाइन-दर-लाइन जनरेट करने का मतलब है कि किसी सेक्शन को रीटाइम करने पर पूरी ट्रैक के बजाय केवल एक लाइन का ही खर्च आता है।

कमर्शियल रीड्स छोटे, तेज़ होते हैं और इनके अलग-अलग वेरिएंट्स का परीक्षण करना फायदेमंद होता है। तीस सेकंड का एक विज्ञापन एक या दो रिक्वेस्ट्स का होता है, जिससे इसके चार वर्ज़न बनाना, एक सेशन बुक करने की तुलना में सस्ता हो जाता है।

जनरेशन रीयल टाइम से 3.3 गुना तेजी से चलती है, इसलिए ऑडियो इसके चलने की तुलना में तेजी से रेंडर होता है और बफ़र आगे रहता है। पहला ऑडियो SSE या WebSocket पर लगभग 200 मिलीसेकंड में आता है।

बड़े पैमाने पर काम करने पर लागत बढ़ने का मुख्य कारण डुप्लिकेशन (दोहराव) होता है, न कि जनरेशन (उत्पादन)। टेक्स्ट को हैश करने और जो पहले से मौजूद है उसे छोड़ने से इसमें से अधिकांश भाग हट जाता है, क्योंकि कैटलॉग और टेम्प्लेट के काम में लगातार एक ही वाक्यांश बार-बार दोहराए जाते हैं।

Twenty three voices carry the character and animation tag, the group with the widest delivery in the catalog. These six are drawn from it, mixing American, Indian and Japanese accents for dubbing and original work alike.

Trailer narration is the most compressed writing in film advertising: eight or nine lines carrying an entire premise. These six are drawn from the narration pool, chosen for weight and an unhurried delivery.

A synthetic voice is speech produced by a model rather than recorded by a person. These six are a cross-section of the catalog: different accents, different languages, all generated the moment you press play.

Narration is the one job where a voice has to hold up for hours rather than seconds. 163 of the 244 voices here carry the narration tag, the largest group in the catalog, across English, Hindi and nine other Indic languages.

News delivery is judged on clarity before character. These six come from voices carrying both the narration and educational tags, the combination that suits reading information aloud rather than performing it.

Documentary narration works by staying out of the way. The voice carries information the picture cannot, without competing with it. These six are drawn from the 163 narration-tagged voices, chosen for an even, unhurried delivery.

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।

वॉइस एजेंट जवाब देने से पहले होने वाले ठहराव पर ही टिके होते हैं। सिंथेसिस लगभग 200 मिलीसेकंड में शुरू हो जाता है और वास्तविक समय से 3.3 गुना तेजी से चलता है, जिससे बजट वहीं बचता है जहां आमतौर पर इसकी जरूरत होती है: आपके मॉडल पर।

सपोर्ट कॉल उन लोगों तक पहुँचती हैं जो पहले से ही परेशान हैं, और अक्सर ख़राब नेटवर्क लाइन पर होते हैं। ये आवाज़ें चरित्र की तुलना में स्पष्टता को अधिक पसंद करती हैं, अलग-अलग रेंडर में स्थिर रहती हैं, और हिंदी और अंग्रेजी के बीच उसी तरह से बदलती हैं जैसे कॉल करने वाले वास्तव में करते हैं।

Narration is the one job where a voice has to hold up for hours rather than seconds. 163 of the 244 voices here carry the narration tag, the largest group in the catalog, across English, Hindi and nine other Indic languages.

News delivery is judged on clarity before character. These six come from voices carrying both the narration and educational tags, the combination that suits reading information aloud rather than performing it.

Documentary narration works by staying out of the way. The voice carries information the picture cannot, without competing with it. These six are drawn from the 163 narration-tagged voices, chosen for an even, unhurried delivery.

कोर्स का ऑडियो मॉड्यूल दस में भी वैसा ही सुनाई देना चाहिए जैसा मॉड्यूल एक में सुनाई देता है। ये आवाजें सभी सेशन के दौरान एक जैसी बनी रहती हैं, उच्चारण शब्दकोशों (डिक्शनरी) के ज़रिए तकनीकी शब्दावली को संभालती हैं, और अंग्रेजी के साथ-साथ नौ भारतीय भाषाओं को कवर करती हैं।

एक्सप्लेनर (स्पष्टीकरण) स्क्रिप्ट को पहली कट के बाद फिर से लिखा जाता है। लाइन दर लाइन जेनरेट करने का मतलब है कि बाद में किए गए बदलाव पर पूरी री-रिकॉर्डिंग के बजाय केवल एक लाइन का खर्च आता है, और ऑडियो लगभग एक सेकंड में 44.1 kHz पर आ जाता है।

आईवीआर (IVR) आवाज़ों को केवल ब्राउज़र में अच्छा नहीं लगना चाहिए, बल्कि उन्हें कंप्रेस्ड फोन लाइन पर भी सही से काम करना चाहिए। ये सीधे ulaw और alaw आउटपुट देते हैं, लगभग 200 मिलीसेकंड में जेनरेट होते हैं, और एक ही प्रॉम्प्ट में हिंदी और अंग्रेजी दोनों को संभाल सकते हैं।
लहजा

Seven voices carry a German accent, and six of them are here. Markus, Max and Ben are male, Petra, Hanna and Lea female. All sit in the European language family, which covers thirteen languages in total.

Seven voices carry a Russian accent, and six are here. Anastasia, Olga and Ekaterina are female, Maksim, Andrei and Nikolai male. They sit in the European language family alongside twelve other languages.

एक सौ चार आवाजों में भारतीय लहजा है, जो किसी भी अन्य समूह से दोगुने से भी अधिक है। वे बिना अपना स्वर बदले देवनागरी वाक्यों के भीतर अंग्रेजी शब्दों का प्रयोग करते हैं, जो कि वास्तव में भारतीय अंग्रेजी बोलने का सही तरीका है।

बहत्तर आवाजें ग्यारह भारतीय भाषाओं के साथ-साथ अंग्रेजी को कवर करती हैं, इसलिए एक ही आवाज बिना किसी बदलाव के हिंदी कॉलर और तमिल कॉलर दोनों के काम आती है। एक ही वाक्य के भीतर हिंदी और अंग्रेजी बारी-बारी से आ सकती हैं।

सात ब्रिटिश आवाज़ें, जिन्हें चुनने के बजाय पूरा सूचीबद्ध किया गया है। इस्ला, जूलिया और पॉपी महिला आवाज़ें हैं, जबकि एलिस्टेयर, एडवर्ड और नूह पुरुष आवाज़ें हैं। अधिकांश परियोजनाओं के लिए पर्याप्त, और इतनी कम कि पांच मिनट में इनका ऑडिशन लिया जा सके।

तैंतालीस अमेरिकी आवाजें, जो कैटलॉग में सबसे गहरा अंग्रेजी सेट है। इसमें इतनी रेंज है कि एक ही आवाज को बार-बार दोहराने के बजाय पूरे अभियान में अलग-अलग टोन के लिए कलाकारों का चयन किया जा सकता है, क्योंकि कोई अन्य आवाज फिट नहीं बैठती।

पांच ऑस्ट्रेलियाई आवाज़ें, और पांचों यहाँ मौजूद हैं। क्लोई, नयाह और सिएना महिला आवाज़ें हैं, जबकि कूपर और फ्लिन पुरुष आवाज़ें हैं। एक छोटा सा सेट, लेकिन बिना किसी आवाज़ को दोहराए एक प्रोजेक्ट को तैयार करने के लिए पर्याप्त।

तीन कनाडाई आवाज़ें: एरिका, एलिक और विलियम। बस यही पूरा समूह है। यदि आपको उत्तर अमेरिकी लहजे में अधिक विविधता की आवश्यकता है, तो पैंतालीस अमेरिकी आवाज़ें इससे काफी मिलती-जुलती लगती हैं।

Seven voices carry a German accent, and six of them are here. Markus, Max and Ben are male, Petra, Hanna and Lea female. All sit in the European language family, which covers thirteen languages in total.

Seven voices carry a Russian accent, and six are here. Anastasia, Olga and Ekaterina are female, Maksim, Andrei and Nikolai male. They sit in the European language family alongside twelve other languages.

एक सौ चार आवाजों में भारतीय लहजा है, जो किसी भी अन्य समूह से दोगुने से भी अधिक है। वे बिना अपना स्वर बदले देवनागरी वाक्यों के भीतर अंग्रेजी शब्दों का प्रयोग करते हैं, जो कि वास्तव में भारतीय अंग्रेजी बोलने का सही तरीका है।

बहत्तर आवाजें ग्यारह भारतीय भाषाओं के साथ-साथ अंग्रेजी को कवर करती हैं, इसलिए एक ही आवाज बिना किसी बदलाव के हिंदी कॉलर और तमिल कॉलर दोनों के काम आती है। एक ही वाक्य के भीतर हिंदी और अंग्रेजी बारी-बारी से आ सकती हैं।

सात ब्रिटिश आवाज़ें, जिन्हें चुनने के बजाय पूरा सूचीबद्ध किया गया है। इस्ला, जूलिया और पॉपी महिला आवाज़ें हैं, जबकि एलिस्टेयर, एडवर्ड और नूह पुरुष आवाज़ें हैं। अधिकांश परियोजनाओं के लिए पर्याप्त, और इतनी कम कि पांच मिनट में इनका ऑडिशन लिया जा सके।

तैंतालीस अमेरिकी आवाजें, जो कैटलॉग में सबसे गहरा अंग्रेजी सेट है। इसमें इतनी रेंज है कि एक ही आवाज को बार-बार दोहराने के बजाय पूरे अभियान में अलग-अलग टोन के लिए कलाकारों का चयन किया जा सकता है, क्योंकि कोई अन्य आवाज फिट नहीं बैठती।
शैली

एक सौ एक महिला आवाजें, जो छह लहजे के समूहों और सभी बारह अनुशंसित भाषाओं में फैली हुई हैं। उस पैमाने पर, लहजा और भाषा आमतौर पर लिंग की तुलना में कास्टिंग को अधिक सीमित करते हैं।

हर लहजे के समूह और सभी बारह अनुशंसित भाषाओं से एक सौ बीस पुरुष आवाजें। इनमें से अधिकांश में भारतीय भाषाओं की अनुशंसा शामिल है, जो उन कैटलॉग में असामान्य है जो भारतीय भाषाओं को बाद का विचार मानते हैं।

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

शांति आवाज़ से ज़्यादा गति से आती है। गति घटकर 0.5 तक आ जाती है, और ठहराव किसी पैरामीटर के बजाय विराम चिह्नों से आते हैं, इसलिए स्क्रिप्ट उतना ही काम करती है जितना कि कास्टिंग।

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

गति बढ़ाने की तुलना में पढ़ने की गति को धीमा करना अधिक आधिकारिक लगता है। 0.9 के करीब की सेटिंग किसी भी आवाज़ के चुनाव से अधिक काम करती है, और छोटे घोषणात्मक वाक्य योग्यता सूचक वाक्यों की तुलना में अधिक प्रभाव रखते हैं।

एक सौ छियालीस आवाजों को युवा के रूप में टैग किया गया है, जो हर लहजे और सभी बारह अनुशंसित भाषाओं में कैटलॉग का 63 प्रतिशत है। टोन के विपरीत, उम्र एक वास्तविक टैग किया गया फ़ील्ड है, न कि कोई अनुमान।

छियासी आवाज़ों को परिपक्व (मैच्योर) टैग किया गया है, और बीस आवाज़ों में नैरेटिव (कथा) टैग भी है। वह ओवरलैप आमतौर पर ऑडियोबुक्स और डॉक्यूमेंट्री काम के लिए शुरुआती बिंदु होता है, जहाँ निरंतरता सेकंडों के बजाय घंटों तक दिखाई देती है।

इसमें कोई भावना पैरामीटर नहीं है, इसलिए इसकी रेंज आवाज़ से और लाइन कैसे लिखी गई है, उससे तय होती है। चौदह आवाज़ों में कैरेक्टर टैग होता है, और उनमें सबसे विस्तृत डिलीवरी उपलब्ध है।

ध्यान लगाने के लिए केवल दो आवाज़ों को ही उपयुक्त माना गया है, इसलिए इस संग्रह का दायरा बड़ा है और इसे सुनकर चुना गया है। आवाज़ की गति, आवाज़ देने वाले कलाकार की तुलना में अधिक मायने रखती है: लगभग 0.7 की गति अधिकांश सुकून देने वाली सामग्री के लिए सबसे उपयुक्त है।

भारतीय ग्राहकों के सामने काम करने के लिए निर्णायक कारक टोन नहीं बल्कि भाषा है। ये आवाजें वाक्य के बीच में हिंदी और अंग्रेजी के बीच बदलती रहती हैं, जो अकेले किसी भी एक भाषा की तुलना में काफी अधिक प्राकृतिक लगती हैं।

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

There is no tone field in the catalog, so these six were chosen by listening rather than returned by a filter. What they share is an unhurried delivery and a lower placement, which is most of what the word describes.

A gravelly voice is one with audible texture, a roughness in the lower register. Nothing in the catalog records that, so these six were chosen by listening. What they share is weight and an unhurried delivery.

एक सौ एक महिला आवाजें, जो छह लहजे के समूहों और सभी बारह अनुशंसित भाषाओं में फैली हुई हैं। उस पैमाने पर, लहजा और भाषा आमतौर पर लिंग की तुलना में कास्टिंग को अधिक सीमित करते हैं।

हर लहजे के समूह और सभी बारह अनुशंसित भाषाओं से एक सौ बीस पुरुष आवाजें। इनमें से अधिकांश में भारतीय भाषाओं की अनुशंसा शामिल है, जो उन कैटलॉग में असामान्य है जो भारतीय भाषाओं को बाद का विचार मानते हैं।

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

शांति आवाज़ से ज़्यादा गति से आती है। गति घटकर 0.5 तक आ जाती है, और ठहराव किसी पैरामीटर के बजाय विराम चिह्नों से आते हैं, इसलिए स्क्रिप्ट उतना ही काम करती है जितना कि कास्टिंग।

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

एक सौ एक महिला आवाजें, जो छह लहजे के समूहों और सभी बारह अनुशंसित भाषाओं में फैली हुई हैं। उस पैमाने पर, लहजा और भाषा आमतौर पर लिंग की तुलना में कास्टिंग को अधिक सीमित करते हैं।

हर लहजे के समूह और सभी बारह अनुशंसित भाषाओं से एक सौ बीस पुरुष आवाजें। इनमें से अधिकांश में भारतीय भाषाओं की अनुशंसा शामिल है, जो उन कैटलॉग में असामान्य है जो भारतीय भाषाओं को बाद का विचार मानते हैं।

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।
वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें
311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104
एजेंट
दस्तावेज़ीकरण
संसाधन
वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें
311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104
एजेंट
वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें
311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104
एजेंट
दस्तावेज़ीकरण
संसाधन