अभिव्यंजक आवाजें

इसमें कोई भावना पैरामीटर नहीं है, इसलिए इसकी रेंज आवाज़ से और लाइन कैसे लिखी गई है, उससे तय होती है। चौदह आवाज़ों में कैरेक्टर टैग होता है, और उनमें सबसे विस्तृत डिलीवरी उपलब्ध है।

इस उपयोग मामले के लिए आवाजें

इरीनाirina
महिलायुवारूसी
संबितsambit
पुरुषयुवाभारतीय
शंकरshankar
पुरुषयुवाभारतीय
वर्षाvarsha
महिलायुवाभारतीय
वासिलिसvasilis
पुरुषयुवाग्रीक
ज़ोईzoe
महिलायुवाअमेरिकी
Best for अंग्रेज़ीआवाज़ का उपयोग करें

सीमा कास्टिंग और लेखन से आती है

इसमें कोई भावना पैरामीटर नहीं है, इसलिए अभिव्यक्ति को नियंत्रित नहीं किया जा सकता है। यह आपके द्वारा चुनी गई आवाज़ और लाइन को लिखे जाने के तरीके से आता है। यह एक ऐसी वास्तविक सीमा है जिसके बारे में बात की जानी चाहिए, बजाय इसके कि इसका कोई और रास्ता निकाला जाए, क्योंकि इससे यह बदल जाता है कि आपका प्रयास किस दिशा में जा रहा है।

पूरे दृश्य में निरंतरता

अनुरोधों की सीमा 250 वर्णों तक है, इसलिए एक लंबा संवाद कई कॉल्स में विभाजित हो जाता है और उनके बीच प्रदर्शन को स्थिर रखने के लिए कुछ भी नहीं होता है। एक लाइन के बजाय एक पूरा दृश्य तैयार करें और इसके इर्द-गिर्द प्रोडक्शन पाइपलाइन बनाने से पहले जोड़ों (कनेक्शन्स) को ध्यान से सुनें।

कैरेक्टर पूल

चौदह आवाजें कैरेक्टर और एनिमेशन टैग के साथ आती हैं, जो कि सबसे व्यापक डिलीवरी वाला ग्रुप है। जूलिया और कियारा में सबसे अधिक रेंज है, एल्बस और ब्लोफेल्ड में सबसे अधिक वजन है। उन चौदह आवाजों के अलावा, कैटलॉग में ऐसा कुछ भी नहीं है जो अभिव्यक्ति का वर्णन करता हो।

रनटाइम पर जेनरेट किया जा रहा है

खेलों और इंटरैक्टिव काम के लिए, वेबसॉकेट (WebSocket) ट्रांसपोर्ट ऑडियो को रेंडर होते ही स्ट्रीम करता है, ताकि खेल के दौरान अभिव्यंजक संवाद तैयार किया जा सके। इससे हर शाखा को पहले से रेंडर करने की ज़रूरत नहीं पड़ती, जो कि सार्थक विकल्पों वाले खेल में आमतौर पर संपत्तियों (assets) की संख्या को नियंत्रण से बाहर कर देता है।

विनिर्देश

नमूना दर

44.1 kHz मूल, टेलीफोनी के लिए 8 kHz पर पुनः नमूनाकृत (resampled)

विलंबता

~200 ms पहले बाइट तक (p50, वॉर्म रीज़न)

आउटपुट फ़ॉर्मेट

यूलॉ (ulaw), एलॉ (alaw), पीसीएम (PCM) 16-बिट, वेव (WAV), एमपी3 (MP3)

स्ट्रीमिंग ट्रांसपोर्ट्स

वेबसॉकेट (WebSocket), HTTP चंक्ड ट्रांसफर (chunked transfer)

गति सीमा

0.5× – 2.0×, प्रति अनुरोध पर सेट

इसके जैसी आवाज़ें खोजें

अभिव्यंजक आवाजें

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

युवा आवाजें

एक सौ छियालीस आवाजों को युवा के रूप में टैग किया गया है, जो हर लहजे और सभी बारह अनुशंसित भाषाओं में कैटलॉग का 63 प्रतिशत है। टोन के विपरीत, उम्र एक वास्तविक टैग किया गया फ़ील्ड है, न कि कोई अनुमान।

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

गेमिंग और कैरेक्टर आवाज़ों के लिए AI वॉइसेस

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

पॉडकास्ट बनाने के लिए एआई आवाज़ें

पॉडकास्ट प्रोडक्शन पहले से ही सेगमेंट आधारित है, जो शॉर्ट कॉल्स में जनरेशन के लिए अनुकूल है। इंट्रो और विज्ञापन रीड़स एक बार जनरेट होते हैं और कैश हो जाते हैं, और अलग-अलग आवाज़ों को मिलाने से बिना दो लोगों को बुक किए एक टू-हैंडर (दो लोगों का शो) तैयार हो जाता है।

मित्रवत आवाजें

भारतीय ग्राहकों के सामने काम करने के लिए निर्णायक कारक टोन नहीं बल्कि भाषा है। ये आवाजें वाक्य के बीच में हिंदी और अंग्रेजी के बीच बदलती रहती हैं, जो अकेले किसी भी एक भाषा की तुलना में काफी अधिक प्राकृतिक लगती हैं।

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

सुकून देने वाली आवाज़ें

ध्यान लगाने के लिए केवल दो आवाज़ों को ही उपयुक्त माना गया है, इसलिए इस संग्रह का दायरा बड़ा है और इसे सुनकर चुना गया है। आवाज़ की गति, आवाज़ देने वाले कलाकार की तुलना में अधिक मायने रखती है: लगभग 0.7 की गति अधिकांश सुकून देने वाली सामग्री के लिए सबसे उपयुक्त है।

गर्म आवाजें

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

युवा आवाजें

एक सौ छियालीस आवाजों को युवा के रूप में टैग किया गया है, जो हर लहजे और सभी बारह अनुशंसित भाषाओं में कैटलॉग का 63 प्रतिशत है। टोन के विपरीत, उम्र एक वास्तविक टैग किया गया फ़ील्ड है, न कि कोई अनुमान।

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

गेमिंग और कैरेक्टर आवाज़ों के लिए AI वॉइसेस

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

पॉडकास्ट बनाने के लिए एआई आवाज़ें

पॉडकास्ट प्रोडक्शन पहले से ही सेगमेंट आधारित है, जो शॉर्ट कॉल्स में जनरेशन के लिए अनुकूल है। इंट्रो और विज्ञापन रीड़स एक बार जनरेट होते हैं और कैश हो जाते हैं, और अलग-अलग आवाज़ों को मिलाने से बिना दो लोगों को बुक किए एक टू-हैंडर (दो लोगों का शो) तैयार हो जाता है।

ऊर्जावान आवाजें

गति यहाँ सबसे विश्वसनीय साधन है, आवाज़ की शैली (कास्टिंग) नहीं। 1.2 और 1.4 के बीच की सेटिंग्स सूची (कैटलॉग) की लगभग किसी भी आवाज़ को बेहतर बना देती हैं, हालाँकि लंबे वाक्य लगभग 1.5 से आगे बढ़ने पर अस्पष्ट होने लगते हैं।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

युवा आवाजें

एक सौ छियालीस आवाजों को युवा के रूप में टैग किया गया है, जो हर लहजे और सभी बारह अनुशंसित भाषाओं में कैटलॉग का 63 प्रतिशत है। टोन के विपरीत, उम्र एक वास्तविक टैग किया गया फ़ील्ड है, न कि कोई अनुमान।

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

गेमिंग और कैरेक्टर आवाज़ों के लिए AI वॉइसेस

हर ब्रांच को पहले से रेंडर करने का मतलब है हर ब्रांच को डिलीवर करना। इसके बजाय, वेबसॉकेट स्ट्रीमिंग से बातचीत खेल के दौरान ही जेनरेट होती है, जिससे कन्वर्सेशन ट्री की लागत केवल उसी की आती है जो खिलाड़ी वास्तव में सुनते हैं, न कि उसकी जो वे सुन सकते हैं।

पॉडकास्ट बनाने के लिए एआई आवाज़ें

पॉडकास्ट प्रोडक्शन पहले से ही सेगमेंट आधारित है, जो शॉर्ट कॉल्स में जनरेशन के लिए अनुकूल है। इंट्रो और विज्ञापन रीड़स एक बार जनरेट होते हैं और कैश हो जाते हैं, और अलग-अलग आवाज़ों को मिलाने से बिना दो लोगों को बुक किए एक टू-हैंडर (दो लोगों का शो) तैयार हो जाता है।

मित्रवत आवाजें

भारतीय ग्राहकों के सामने काम करने के लिए निर्णायक कारक टोन नहीं बल्कि भाषा है। ये आवाजें वाक्य के बीच में हिंदी और अंग्रेजी के बीच बदलती रहती हैं, जो अकेले किसी भी एक भाषा की तुलना में काफी अधिक प्राकृतिक लगती हैं।

गंभीर आवाजें

अनुपालन और कानूनी पाठ के लिए लक्ष्य यह होता है कि सटीक शब्दों का इस्तेमाल हो, न कि आवाज़ गंभीर सुनाई दे। लगभग 0.9 की गति किसी भी कलाकार के चयन की तुलना में स्पष्टता को अधिक सुधारती है।

अक्सर पूछे जाने वाले प्रश्न

चरित्र और एनीमेशन के लिए टैग की गई चौदह आवाज़ों में से चुनी गई, जिनमें कैटलॉग की सबसे विस्तृत श्रृंखला शामिल है। जूलिया और कियारा, एल्बस और ब्लोफेल्ड ऐसी आवाज़ें हैं जिन्हें पहले सुनना चाहिए। एक सीमा जिसे जानना ज़रूरी है: इसमें कोई भावना (इमोशन) पैरामीटर नहीं है, इसलिए अभिव्यक्ति किसी सेटिंग से नहीं, बल्कि खुद आवाज़ से और स्क्रिप्ट लिखने के तरीके से आती है।

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104