संवादात्मक आवाजें

एक सौ पचानवे आवाज़ें बातचीत के अंदाज़ को दर्शाती हैं, जो पूरे कैटलॉग का 84 प्रतिशत है। स्ट्रीमिंग ही उन्हें लाइव होने का अहसास कराती है: वाक्य का रेंडरिंग पूरा होने से पहले ही ऑडियो बजना शुरू हो जाता है।

इस उपयोग मामले के लिए आवाजें

जसलीनjasleen
FemaleYoungIndian
निकोलाnicolas
MaleYoungFrench
भरतbarath
MaleYoungIndian
फेमकेfemke
FemaleYoungDutch
तमिलसेल्वीtamilselvi
FemaleYoungIndian
मैक्सिमmaxime
MaleYoungFrench

कैटलॉग में सबसे बड़ा टैग

232 आवाज़ों में से 195 आवाज़ों में बातचीत वाला (कन्वर्सेशनल) टैग है, जो कि कैटलॉग का 84 प्रतिशत है। एक फ़िल्टर के रूप में इतनी बड़ी संख्या इसकी कमज़ोरी भी है: लगभग हर आवाज़ इसमें फिट बैठती है, इसलिए अपनी पसंद की सूची को छोटा करने का मतलब आमतौर पर इस टैग के बजाय लहजे (एक्सेंट), भाषा या उम्र का उपयोग करना होता है।

बाकी की लेटेंसी (देरी) कहाँ रहती है

सिंथेसिस (Synthesis) आमतौर पर बातचीत के एक मोड़ (conversational turn) का सबसे छोटा हिस्सा होता है। स्पीच रिकग्निशन और उत्तर जनरेट करने वाले लैंग्वेज मॉडल का हिस्सा आमतौर पर इसमें अधिक होता है। वॉयस लेयर को बेहतर बनाने से पहले पूरे मोड़ को मापना उस काम से बचाता है जो किसी ऐसे नंबर को सुधारता है जिसका कोई इंतजार नहीं कर रहा था।

तकनीकी रूप से संवादात्मक (conversational) होने का क्या अर्थ है

एक रियल-टाइम एप्लिकेशन में इसका मतलब उस ठहराव के भीतर प्रतिक्रिया देना है जिसकी कोई व्यक्ति उम्मीद करता है, जिसके लिए बैच जनरेशन के बजाय स्ट्रीमिंग की आवश्यकता होती है। पहला ऑडियो SSE और WebSocket ट्रांसपोर्ट पर लगभग 200 मिलीसेकंड में आता है। सिंक्रोनस एंडपॉइंट पूरी क्लिप के लिए प्रतीक्षा करता है, और वह देरी संवाद में साफ सुनाई देती है।

विस्तारित बातचीत के लिए कास्टिंग

एक वीडियो में एक बार सुनी गई आवाज़ और बीस मोड़ों वाली बातचीत में सुनी गई आवाज़ को अलग तरह से परखा जाता है। जो चरित्र किसी सैंपल में आकर्षक लगता है, वह पूरे सेशन के दौरान थका देने वाला हो सकता है। केवल एक लाइन के बजाय वास्तविक बातचीत का परीक्षण करना अधिक उपयोगी टेस्ट है।

विनिर्देश

नमूना दर

44.1 kHz मूल, टेलीफोनी के लिए 8 kHz पर पुनः नमूनाकृत (resampled)

विलंबता

~200 ms पहले बाइट तक (p50, वॉर्म रीज़न)

आउटपुट फ़ॉर्मेट

यूलॉ (ulaw), एलॉ (alaw), पीसीएम (PCM) 16-बिट, वेव (WAV), एमपी3 (MP3)

स्ट्रीमिंग ट्रांसपोर्ट्स

वेबसॉकेट (WebSocket), HTTP चंक्ड ट्रांसफर (chunked transfer)

गति सीमा

0.5× – 2.0×, प्रति अनुरोध पर सेट

इसके जैसी आवाज़ें खोजें

संवादात्मक आवाजें

मित्रवत आवाजें

भारतीय ग्राहकों के सामने काम करने के लिए निर्णायक कारक टोन नहीं बल्कि भाषा है। ये आवाजें वाक्य के बीच में हिंदी और अंग्रेजी के बीच बदलती रहती हैं, जो अकेले किसी भी एक भाषा की तुलना में काफी अधिक प्राकृतिक लगती हैं।

गर्म आवाजें

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

पेशेवर आवाजें

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

युवा आवाजें

एक सौ छियालीस आवाजों को युवा के रूप में टैग किया गया है, जो हर लहजे और सभी बारह अनुशंसित भाषाओं में कैटलॉग का 63 प्रतिशत है। टोन के विपरीत, उम्र एक वास्तविक टैग किया गया फ़ील्ड है, न कि कोई अनुमान।

वॉइस चैटबॉट्स के लिए एआई आवाजें

वेब चैट असामान्य है क्योंकि विज़िटर एक ही समय में पढ़ता और सुनता है। ये आवाज़ें इत्मीनान से बोलने के लिए उपयुक्त हैं, वेबसॉकेट (WebSocket) पर लगभग 200 मिलीसेकंड में चलना शुरू हो जाती हैं, और एक ही एकीकरण (integration) से बारह भाषाओं को कवर करती हैं।

वॉयस एजेंट्स के लिए एआई वॉयस

वॉइस एजेंट जवाब देने से पहले होने वाले ठहराव पर ही टिके होते हैं। सिंथेसिस लगभग 200 मिलीसेकंड में शुरू हो जाता है और वास्तविक समय से 3.3 गुना तेजी से चलता है, जिससे बजट वहीं बचता है जहां आमतौर पर इसकी जरूरत होती है: आपके मॉडल पर।

सुकून देने वाली आवाज़ें

ध्यान लगाने के लिए केवल दो आवाज़ों को ही उपयुक्त माना गया है, इसलिए इस संग्रह का दायरा बड़ा है और इसे सुनकर चुना गया है। आवाज़ की गति, आवाज़ देने वाले कलाकार की तुलना में अधिक मायने रखती है: लगभग 0.7 की गति अधिकांश सुकून देने वाली सामग्री के लिए सबसे उपयुक्त है।

शांत आवाजें

शांति आवाज़ से ज़्यादा गति से आती है। गति घटकर 0.5 तक आ जाती है, और ठहराव किसी पैरामीटर के बजाय विराम चिह्नों से आते हैं, इसलिए स्क्रिप्ट उतना ही काम करती है जितना कि कास्टिंग।

हंसमुख आवाजें

कैटलॉग में केवल छह आवाजें ही खुशमिजाज या सकारात्मक संकेत दिखाती हैं, जो कि सबसे हल्की टोन का संकेत है। 1.0 से थोड़ी अधिक गति लगभग किसी भी आवाज को बेहतर बना देती है, जो कि अधिक भरोसेमंद तरीका है।

गहरी आवाजें

साफ़ तौर पर यह कहना ज़रूरी है: कैटलॉग में कुछ भी पिच को रिकॉर्ड नहीं करता है, इसलिए इन छह को फ़िल्टर करने के बजाय कान से सुनकर चुना गया था। इसमें कोई पिच नियंत्रण भी नहीं है, इसलिए गहराई पूरी तरह से कास्टिंग का निर्णय है।

मित्रवत आवाजें

भारतीय ग्राहकों के सामने काम करने के लिए निर्णायक कारक टोन नहीं बल्कि भाषा है। ये आवाजें वाक्य के बीच में हिंदी और अंग्रेजी के बीच बदलती रहती हैं, जो अकेले किसी भी एक भाषा की तुलना में काफी अधिक प्राकृतिक लगती हैं।

गर्म आवाजें

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

पेशेवर आवाजें

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

युवा आवाजें

एक सौ छियालीस आवाजों को युवा के रूप में टैग किया गया है, जो हर लहजे और सभी बारह अनुशंसित भाषाओं में कैटलॉग का 63 प्रतिशत है। टोन के विपरीत, उम्र एक वास्तविक टैग किया गया फ़ील्ड है, न कि कोई अनुमान।

वॉइस चैटबॉट्स के लिए एआई आवाजें

वेब चैट असामान्य है क्योंकि विज़िटर एक ही समय में पढ़ता और सुनता है। ये आवाज़ें इत्मीनान से बोलने के लिए उपयुक्त हैं, वेबसॉकेट (WebSocket) पर लगभग 200 मिलीसेकंड में चलना शुरू हो जाती हैं, और एक ही एकीकरण (integration) से बारह भाषाओं को कवर करती हैं।

वॉयस एजेंट्स के लिए एआई वॉयस

वॉइस एजेंट जवाब देने से पहले होने वाले ठहराव पर ही टिके होते हैं। सिंथेसिस लगभग 200 मिलीसेकंड में शुरू हो जाता है और वास्तविक समय से 3.3 गुना तेजी से चलता है, जिससे बजट वहीं बचता है जहां आमतौर पर इसकी जरूरत होती है: आपके मॉडल पर।

मित्रवत आवाजें

भारतीय ग्राहकों के सामने काम करने के लिए निर्णायक कारक टोन नहीं बल्कि भाषा है। ये आवाजें वाक्य के बीच में हिंदी और अंग्रेजी के बीच बदलती रहती हैं, जो अकेले किसी भी एक भाषा की तुलना में काफी अधिक प्राकृतिक लगती हैं।

गर्म आवाजें

कैटलॉग में कोई टोन (आवाज के लहजे का) फील्ड नहीं है, इसलिए इन्हें फ़िल्टर करने के बजाय सुनकर चुना गया था। वॉर्मथ (आवाज की गर्माहट) आवाज की एक विशेषता है, न कि कोई सेटिंग, जिसके कारण सही आवाज का चयन करना ही सबसे महत्वपूर्ण निर्णय बन जाता है।

पेशेवर आवाजें

कॉरपोरेट नैरेशन (व्याख्यान) को किसी खास टोन की तुलना में सुसंगत शब्दावली की अधिक आवश्यकता होती है। उच्चारण शब्दकोश ब्रांड और उत्पाद के नामों को एक ही बार में सटीक रूप से तय कर देते हैं, जिससे लाइब्रेरी का हर मॉड्यूल पहले मॉड्यूल से मेल खाता है।

युवा आवाजें

एक सौ छियालीस आवाजों को युवा के रूप में टैग किया गया है, जो हर लहजे और सभी बारह अनुशंसित भाषाओं में कैटलॉग का 63 प्रतिशत है। टोन के विपरीत, उम्र एक वास्तविक टैग किया गया फ़ील्ड है, न कि कोई अनुमान।

वॉइस चैटबॉट्स के लिए एआई आवाजें

वेब चैट असामान्य है क्योंकि विज़िटर एक ही समय में पढ़ता और सुनता है। ये आवाज़ें इत्मीनान से बोलने के लिए उपयुक्त हैं, वेबसॉकेट (WebSocket) पर लगभग 200 मिलीसेकंड में चलना शुरू हो जाती हैं, और एक ही एकीकरण (integration) से बारह भाषाओं को कवर करती हैं।

वॉयस एजेंट्स के लिए एआई वॉयस

वॉइस एजेंट जवाब देने से पहले होने वाले ठहराव पर ही टिके होते हैं। सिंथेसिस लगभग 200 मिलीसेकंड में शुरू हो जाता है और वास्तविक समय से 3.3 गुना तेजी से चलता है, जिससे बजट वहीं बचता है जहां आमतौर पर इसकी जरूरत होती है: आपके मॉडल पर।

सुकून देने वाली आवाज़ें

ध्यान लगाने के लिए केवल दो आवाज़ों को ही उपयुक्त माना गया है, इसलिए इस संग्रह का दायरा बड़ा है और इसे सुनकर चुना गया है। आवाज़ की गति, आवाज़ देने वाले कलाकार की तुलना में अधिक मायने रखती है: लगभग 0.7 की गति अधिकांश सुकून देने वाली सामग्री के लिए सबसे उपयुक्त है।

शांत आवाजें

शांति आवाज़ से ज़्यादा गति से आती है। गति घटकर 0.5 तक आ जाती है, और ठहराव किसी पैरामीटर के बजाय विराम चिह्नों से आते हैं, इसलिए स्क्रिप्ट उतना ही काम करती है जितना कि कास्टिंग।

अक्सर पूछे जाने वाले प्रश्न

यह एक वॉयस इंटरफ़ेस है जो किसी व्यक्ति द्वारा की जाने वाली अपेक्षित पॉज़ (विराम) के भीतर ही उत्तर देता है, न कि किसी ध्यान देने योग्य प्रतीक्षा के बाद। एक सौ पचानवे आवाज़ों में बातचीत का टैग लगा है, जो कैटलॉग में सबसे बड़ा समूह है। स्ट्रीमिंग ही इसे लाइव जैसा महसूस कराती है: वाक्य का रेंडरिंग समाप्त होने से पहले ही ऑडियो बजना शुरू हो जाता है।

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104