हमारी सीरीज़ ए फंडिंग (Series A Funding) की घोषणा

हमारी सीरीज़ ए फंडिंग (Series A Funding) की घोषणा

फ़ोन कॉल के लिए टेक्स्ट से स्पीच: लेटेंसी, टेलीफोनी ऑडियो, और बारी-बारी से बोलना

एआई (AI) के साथ सारांशित करें

हमारे साथ अपने संपर्क केंद्रों (कॉन्टैक्ट सेंटर्स) को स्वचालित करें

तेज़ लेटेंसी, मजबूत सुरक्षा और असीमित स्पीच जनरेशन का अनुभव करें।

फ़ोन कॉल के लिए टेक्स्ट से स्पीच: लेटेंसी, टेलीफोनी ऑडियो और टर्न-टेकिंग
फ़ोन कॉल के लिए टेक्स्ट से स्पीच: लेटेंसी, टेलीफोनी ऑडियो और टर्न-टेकिंग

फोन कॉल्स के लिए TTS को एक तेज़ मॉडल से कहीं अधिक की आवश्यकता होती है। इसमें प्रोडक्शन वॉयस एजेंट्स के लिए G.711 ऑडियो, स्ट्रीमिंग, बार्ज-इन कैंसलेशन (barge-in cancellation) और लेटेंसी मापन शामिल है।

फ़ोन कॉल्स के लिए टेक्स्ट टू स्पीच ऐसी सीमाएं पेश करता है जो किसी सामान्य ब्राउज़र डेमो में उतनी प्रमुख नहीं होती हैं। PSTN कोडेक्स, मीडिया गेटवे, पैकेट टाइमिंग, एंडपॉइंटिंग, और प्लेबैक कतारें सभी इस बात को प्रभावित कर सकते हैं कि कोई प्रतिक्रिया तुरंत और स्वाभाविक लगती है या फिर विलंबित और खंडित।

यह प्रोडक्शन-केंद्रित वॉकथ्रू उन टीमों के लिए है जो SIP, Twilio-स्टाइल मीडिया स्ट्रीम्स, वेबसॉकेट्स, WebRTC पर रीयल-टाइम वॉयस AI, या संपर्क केंद्र बुनियादी ढांचे के साथ संवादात्मक फ़ोन कॉल्स के लिए AI वॉयस एजेंट्स बना रही हैं। यह कैप्चर की गई स्पीच से लेकर TTS प्लेबैक और व्यवधान (इंटरप्शन) तक, क्रम में सिग्नल पाथ का अनुसरण करता है।

विषय-सूची

  • प्रोडक्शन वॉयस पाइपलाइन: एक पूर्ण कॉल में TTS कहाँ फिट होता है।

  • लेटेंसी (विलंबता) के तीन अर्थ: मॉडल निष्पादन, पहला ऑडियो, और संवादात्मक विलंब।

  • टेलीफोनी ऑडियो सीमाएं: सैंपल रेट्स, G.711, रीसैंपलिंग, और गुणवत्ता।

  • स्ट्रीमिंग और डिलीवरी: चंकिंग, बफरिंग, नेटवर्किंग, और प्लेबैक।

  • टर्न-टेकिंग और बार्ज-इन: एंडपॉइंटिंग, ठहराव, व्यवधान, और रद्दीकरण।

  • मापन और लेटेंसी बजट: इंस्ट्रूमेंटेशन और व्यावहारिक लक्ष्य।

  • अक्सर पूछे जाने वाले प्रश्न: सामान्य कार्यान्वयन और चयन संबंधी प्रश्न।

  • प्रोडक्शन डिप्लॉयमेंट चेकलिस्ट: वास्तविक कॉलर्स से पहले अंतिम सत्यापन।

प्रोडक्शन वॉयस पाइपलाइन

TTS और STT पाइपलाइन के साथ एक पारंपरिक वॉयस बॉट कुछ इस तरह दिखता है:

कॉलर ऑडियो -> PSTN या SIP -> मीडिया गेटवे -> VAD और एंडपॉइंटिंग -> स्ट्रीमिंग STT -> टर्न मैनेजर -> LLM -> स्ट्रीमिंग TTS -> ऑडियो बफर -> टेलीफोनी प्लेबैक

उस श्रृंखला का प्रत्येक तीर देरी बढ़ा सकता है। मीडिया गेटवे ऑडियो को पैकेट में विभाजित करता है। वॉयस एक्टिविटी डिटेक्शन तय करता है कि स्पीच मौजूद है या नहीं। एंडपॉइंटिंग तय करता है कि टर्न पूरा हुआ है या नहीं। LLM को बोलने योग्य टेक्स्ट तैयार करना होगा, TTS सेवा को ऑडियो वापस करना होगा, और प्लेबैक सिस्टम को उस ऑडियो को उस प्रारूप में बदलना होगा जिसकी कैरियर अपेक्षा करता है।

ज्यादातर टीमें कहाँ गलती करती हैं: वे 700 ms के एंडपॉइंटिंग टाइमआउट और 400 ms के प्लेबैक बफर को छुए बिना केवल TTS इन्फ्रेंस को अनुकूलित करती हैं। कॉल अभी भी धीमी महसूस होती है क्योंकि संवादात्मक लेटेंसी पूरी पाइपलाइन की वजह से होती है।

व्यापक सिस्टम व्यू के लिए, टेलीफोनी के लिए यह रीयल-टाइम वॉयस AI आर्किटेक्चर देखें।

मॉडल लेटेंसी, पहला ऑडियो, और संवादात्मक लेटेंसी

लेटेंसी शब्द जिन्हें कभी भी आपस में मिलाकर रिपोर्ट नहीं किया जाना चाहिए

मीट्रिक

शुरुआत

अंत

यह क्या दर्शाता है

मॉडल लेटेंसी

TTS अनुरोध स्वीकृत

जेनरेशन का महत्वपूर्ण पड़ाव या पूरा होना

मॉडल और सर्विंग प्रदर्शन

पहले ऑडियो तक का समय

TTS अनुरोध भेजा गया

पहला उपयोगी ऑडियो प्राप्त हुआ

कितनी जल्दी स्ट्रीमिंग प्लेबैक शुरू हो सकता है

एंड-टू-एंड संवादात्मक लेटेंसी

यूज़र अपना टर्न समाप्त करता है

कॉलर को प्रतिक्रिया सुनाई देती है

वास्तविक बातचीत का अनुभव

कम लेटेंसी वाले TTS विज्ञापन आम तौर पर पहले ऑडियो तक के समय पर जोर देते हैं। उस संख्या में एंडपॉइंटिंग, LLM कार्य, नेटवर्क ट्रांज़िट, ट्रांसकोडिंग और कतारबद्ध प्लेबैक शामिल नहीं होते हैं। एक प्रदाता पहला हिस्सा (चंक) जल्दी से वापस कर सकता है, जबकि बाद के हिस्से निर्बाध रूप से बोलना जारी रखने के लिए बहुत धीमी गति से आते हैं -- और कॉलर इसे महसूस कर लेगा।

एक व्यावहारिक वॉयस असिस्टेंट लेटेंसी बजट एंडपॉइंटिंग के लिए 200 से 500 ms, प्रारंभिक भाषा जेनरेशन के लिए 100 to 400 ms, TTS पहले ऑडियो के लिए 100 to 300 ms, और ट्रांसपोर्ट, कन्वर्जन व बफरिंग के लिए 40 से 200 ms आवंटित कर सकता है। ये इंजीनियरिंग श्रेणियां हैं, कोई सार्वभौमिक सीमाएं नहीं हैं। भूगोल, प्रॉम्प्ट की जटिलता, कैरियर रूटिंग, और संवादात्मक संदर्भ सभी परिणाम को बदल देते हैं।

सबसे पहले सबसे लंबे और सबसे परिवर्तनशील चरण को अनुकूलित करें। तेज़ AI वॉयस एजेंट बनाने के तरीके पर मार्गदर्शन न्यूरल सिंथेसिस लेटेंसी को अधिक विस्तार से कवर करता है।

टेलीफोनी ऑडियो का अपना ही डिलीवरी एनवायरनमेंट होता है

पारंपरिक नैरोबैंड टेलीफोनी आमतौर पर 8 kHz सैंपलिंग रेट का उपयोग करती है। टेलीफोन नैरोबैंड में, नाममात्र पासबैंड लगभग 300 से 3400 Hz होता है। ITU-T G.711 प्रति सेकंड 8000 सैंपल्स, प्रति सैंपल आठ बिट्स, और A-law या μ-law एन्कोडिंग निर्दिष्ट करता है, जो 64 kbit/s PCM स्ट्रीम के अनुरूप है।

वह सीमा 8 kHz टेलीफोनी ऑडियो को स्वाभाविक रूप से खराब नहीं बनाती है -- इसका मतलब केवल यह है कि उच्च-आवृत्ति विवरण उपलब्ध नहीं है। बैंड-लिमिटिंग, कॉम्पैंडिंग, पैकेट लॉस, और हैंडसेट प्लेबैक के बाद भी आवाजें स्पष्ट रूप से समझने योग्य होनी चाहिए। वाइडबैंड VoIP या WebRTC पाथ अधिक विवरण सुरक्षित रख सकते हैं, लेकिन केवल तभी जब पूरा रूट एंड-टू-एंड व्यापक प्रारूप का समर्थन करता हो।

एक नियंत्रित सीमा पर, एक ही बार रीसैंपल करें

विश्वसनीय टेलीफोनी ऑडियो गुणवत्ता के लिए:

  • जब TTS API और कॉल प्रदाता इसका समर्थन करते हों, तो सीधे आवश्यक प्रारूप में जनरेट करें।

  • अन्यथा, mu-law या A-law में एन्कोड करने से पहले एंटी-एलियास फ़िल्टरिंग वाले प्रोडक्शन रीसैंपलर का उपयोग करें।

  • बार-बार होने वाले कन्वर्जन से बचें जैसे कि 24 kHz PCM से 16 kHz, फिर 8 kHz, फिर वापस 16 kHz में बदलना।

  • वास्तविक कैरियर पाथ के माध्यम से क्लोन की गई आवाज़ों, संख्याओं, नामों और सिबिलेंट्स (sibilants) का परीक्षण करें।

स्टूडियो-गुणवत्ता वाले TTS बेंचमार्क साफ मॉडल आउटपुट का मूल्यांकन करते हैं। वे ट्रांसकोडिंग आर्टिफैक्ट्स, पैकेट टाइमिंग, एकॉस्टिक इको, हैंडसेट स्पीकर्स, या PSTN रूटिंग को कैप्चर नहीं करते हैं। टेलीफोनी TTS का मूल्यांकन न केवल API आउटपुट फ़ाइलों से, बल्कि पूरी हुई कॉल्स को रिकॉर्ड करके करें।

स्ट्रीमिंग जेनरेशन, बफरिंग, और नेटवर्क डिलीवरी

इन्क्रीमेंटल टेक्स्ट और ऑडियो के साथ शुरुआत करें

नॉन-स्ट्रीमिंग जेनरेशन पूरी बात समाप्त होने की प्रतीक्षा करती है, फिर फ़ाइल को संश्लेषित और स्थानांतरित करती है। यह सरल है और निश्चित IVR प्रॉम्प्ट्स के लिए अच्छी तरह काम करता है। रीयल-टाइम टेक्स्ट टू स्पीच को आंशिक टेक्स्ट स्वीकार करना चाहिए और जैसे ही ऑडियो फ़्रेम उपलब्ध हों, उन्हें बजाने योग्य रूप में वापस करना चाहिए, न कि पूरी प्रतिक्रिया तैयार होने के बाद।

स्टार्टअप बफर को छोटा लेकिन मापने योग्य रखें

एक छोटा स्टार्टअप बफर प्लेबैक की देरी को कम कर सकता है लेकिन इससे अंडररन का जोखिम बढ़ जाता है, जबकि एक बड़ा बफर अतिरिक्त लेटेंसी की कीमत पर अधिक जिटर (jitter) को संभाल सकता है। कोई सार्वभौमिक बफर लक्ष्य नहीं है: बफर की गहराई और अंडररन्स को मापें, फिर वास्तविक नेटवर्क स्थितियों के अनुसार ट्यून करें।

भूगोल को आर्किटेक्चर के हिस्से के रूप में मानें

टेलीफोनी इनग्रेस, ऑर्केस्ट्रेशन, और स्पीच सर्विसेज को अनुकूल क्षेत्रों में रखें। नेटवर्क लेटेंसी में प्रोपेगेशन, रूटिंग, कंजेशन, और प्रोटोकॉल ओवरहेड शामिल होते हैं, जैसा कि MDN के नेटवर्क लेटेंसी एक्सप्लेनर द्वारा संक्षेप में बताया गया है। लगातार बने रहने वाले कनेक्शंस बार-बार होने वाले सेटअप खर्चों को हटा देते हैं, लेकिन वे दूरी को समाप्त नहीं करते हैं।

फ़ोन कॉल्स के लिए TTS API का मूल्यांकन करने वाली टीमों के लिए Waves API के माध्यम से Smallest.ai का Lightning TTS एक विकल्प है। खरीद के दौरान आधिकारिक दस्तावेज़ों के आधार पर वर्तमान स्ट्रीमिंग व्यवहार, आउटपुट स्वरूपों, क्षेत्रीय उपलब्धता और दर सीमाओं को सत्यापित करें, न कि यह मान लें कि कोई डेमो कॉन्फ़िगरेशन प्रोडक्शन से मेल खाता है।

टर्न-टेकिंग, एंडपॉइंटिंग, और बार्ज-इन

Turn-taking voice AI with endpointing and barge-in

सही व्यवधान (इंटरप्शन) के लिए समन्वित डिटेक्शन, जेनरेशन रद्दीकरण और प्लेबैक रद्दीकरण की आवश्यकता होती है।

वॉयस एक्टिविटी डिटेक्शन उत्तर देता है, "क्या कोई बोल रहा है?" एंडपॉइंटिंग उत्तर देता है, "क्या यह टर्न समाप्त हो गया है?" टर्न डिटेक्शन यह तय करने के लिए शाब्दिक, सिमेंटिक और प्रोसोडिक साक्ष्य जोड़ता है कि कोई ठहराव पूर्णता का संकेत देता है या झिझक का। यह अंतर महत्वपूर्ण है क्योंकि संवादात्मक फिलर्स, खाता संख्या और आत्म-सुधार सभी में प्राकृतिक ठहराव होते हैं जिन्हें एक साधारण टाइमआउट गलत समझ लेगा।

एक निश्चित साइलेंस टाइमआउट को लागू करना आसान है लेकिन भाषाओं, बोलने की गति और शोर-शराबे वाली कॉल्स में यह खराब प्रदर्शन करता है। एक मजबूत टर्न-टेकिंग वॉयस AI सिस्टम VAD स्थिति, ट्रांसक्रिप्ट स्थिरता, विराम चिह्नों की संभावना, सिमेंटिक पूर्णता और कॉन्फ़िगर करने योग्य टाइमआउट सीमाओं को जोड़ता है। कार्यान्वयन-केंद्रित उदाहरण के लिए, देखें कि AI वॉयस एजेंट्स टर्न-टेकिंग और व्यवधानों को कैसे संभालते हैं। टर्न के अंत के समन्वय और ओवरलैप की जटिलता को गैब्रियल स्कांट्ज़ की 2021 की संवादात्मक प्रणालियों और मानव-रोबोट इंटरैक्शन में टर्न-टेकिंग की समीक्षा में भी प्रलेखित किया गया है।

बार्ज-इन द्वारा संपूर्ण आउटबाउंड पाथ रद्द होना चाहिए

जब एजेंट प्लेबैक के दौरान विश्वसनीय कॉलर स्पीच का पता चलता है:

  • बाधित LLM जेनरेशन को रद्द करें, या उसके शेष आउटपुट का उपयोग करना बंद करें।

  • सक्रिय TTS अनुरोध को रद्द करें या उसके बाद के सभी हिस्सों को छोड़ दें।

  • एप्लिकेशन और कैरियर प्लेबैक कतारों को साफ़ करें।

  • बातचीत की स्थिति को रीसेट करें ताकि मॉडल को पता चल सके कि कॉलर ने वास्तव में क्या सुना है।

  • स्व-व्यवधान से बचने के लिए इको सप्रेशन और एक संक्षिप्त पुष्टिकरण विंडो लागू करें।

TTS जेनरेशन को रोकना प्लेबैक कैंसिलेशन नहीं है। आपके प्रोसेस, मीडिया गेटवे, या कैरियर में पहले से ही कतारबद्ध ऑडियो तब तक बजना जारी रह सकता है जब तक कि हर बफर को स्पष्ट रूप से साफ़ न कर दिया जाए।

प्रोडक्शन में वॉयस एजेंट लेटेंसी को मापना

अपने नियंत्रण वाली प्रत्येक सीमा पर टाइमस्टैम्प रिकॉर्ड करें: अंतिम बार पता चली कॉलर की स्पीच, एंडपॉइंट निर्णय, ट्रांसक्रिप्ट का अंतिम रूप, LLM अनुरोध और पहला टोकन, TTS अनुरोध और पहला ऑडियो, कतारबद्ध किया गया पहला फ्रेम, और कैरियर को भेजा गया पहला फ्रेम। जहाँ संभव हो, एक लूपबैक या रिकॉर्ड की गई-कॉल का परीक्षण करें ताकि यह अनुमान लगाया जा सके कि ऑडियो वास्तव में कब सुनने योग्य बना।

एक व्यावहारिक प्रोडक्शन स्कोरकार्ड

सिग्नल

ट्रैक

लेटेंसी

p50, p95, p99 प्रति चरण और एंड टू एंड

स्ट्रीमिंग हेल्थ

चंक अंतराल, बफर गहराई, अंडररन्स, ड्रॉप किए गए फ्रेम

टर्न व्यवहार

गलत एंडपॉइंट्स, विलंबित एंडपॉइंट्स, व्यवधान की सफलता

ऑडियो

क्लिपिंग, कोडेक बेमेल, रीसैंपलिंग विफलताएं, पैकेट हानि

अनुभव

कार्य पूर्णता, दोहराव, हैंग-अप बिंदु, ट्रांसफर

किसी एक औसत के आधार पर वॉयस एजेंट्स के लिए TTS को मंजूरी न दें। समवर्ती उपयोग (concurrency) के तहत वितरणों की तुलना करें और लंबी संख्याओं, संक्षिप्त रूपों, भावनात्मक भाषण, शोर-शराबे वाले कॉलर्स और टूल-कॉल देरी को शामिल करें। एक वास्तविक लेटेंसी बजट एक बातचीत के बाद तय किया गया सिस्टम लक्ष्य है -- न कि यह दावा कि कोई एक प्रमुख संख्या उपयुक्तता निर्धारित करती है।

फ़ोन कॉल्स के लिए टेक्स्ट टू स्पीच: प्रोडक्शन चेकलिस्ट

लाइव ट्रैफ़िक रूट करने से पहले:

  • केवल मॉडल लेटेंसी ही नहीं, बल्कि एंड-टू-एंड कॉलर-सुनाई देने वाली देरी को मापें।

  • p50, p95, और p99 पर पहले ऑडियो तक का समय और चंक निरंतरता रिकॉर्ड करें।

  • सैंपल रेट, फ्रेम आकार, चैनल संख्या और G.711 mu-law या A-law अपेक्षाओं की पुष्टि करें।

  • एक ही बार रीसैंपल करें और अंतिम कैरियर-डिलीवर सिग्नल का परीक्षण करें।

  • भाषा और उपयोग के मामले के अनुसार VAD, एंडपॉइंटिंग, और प्राकृतिक ठहराव हैंडलिंग को ट्यून करें।

  • बार्ज-इन होने पर LLM आउटपुट, सक्रिय TTS जेनरेशन और प्रत्येक प्लेबैक बफर को रद्द करें।

  • नेटवर्क क्षेत्रों, रीकनेक्ट व्यवहार, पैकेट हानि और समवर्ती उपयोग का परीक्षण करें।

  • स्थिर प्रॉम्प्ट्स के लिए कैश्ड ऑडियो का और गतिशील प्रतिक्रियाओं के लिए स्ट्रीमिंग सिंथेसिस का उपयोग करें।

  • गलत एंडपॉइंट्स, ओवरलैप और दोहराव के लिए ट्रांसक्रिप्ट्स और रिकॉर्डिंग्स की समीक्षा करें।

  • डिप्लॉयमेंट से पहले संपूर्ण फ़ोन कॉल वॉयस AI स्टैक का लोड-टेस्ट करें।

प्रोडक्शन की तैयारी स्पीच, नेटवर्किंग, टेलीफोनी और डायलॉग कंट्रोल के समन्वित इंजीनियरिंग से आती है। कम्पलीट-कॉल मापों का उपयोग करके प्रदाता का चयन करें, फिर मॉडल, प्रॉम्प्ट्स, कैरियर्स और ट्रैफ़िक पैटर्न बदलने पर भी उन मापों को रिलीज़ प्रक्रिया में बनाए रखें।

अक्सर पूछे जाने वाले प्रश्न

अक्सर पूछे जाने वाले प्रश्न

फ़ोन कॉल के लिए टीटीएस (TTS) का पहला ऑडियो आने का सही समय (time to first audio) क्या है?

क्या टेलीफोनी TTS को सीधे 8 kHz ऑडियो जेनरेट करना चाहिए?

क्या टेक्स्ट-टू-स्पीच फ़ोन कॉल्स के लिए स्ट्रीमिंग हमेशा बेहतर होती है?

बीच में टोकने (barge-in) के बाद भी एजेंट बोलना जारी क्यों रखता है?

कन्वर्सेशनल एआई (conversational AI) फोन कॉल्स के लिए टीमों को टीटीएस (TTS) का मूल्यांकन कैसे करना चाहिए?

एआई (AI) के साथ सारांशित करें