पेश है Lightning V3: बाज़ार में सबसे तेज़ टेक्स्ट-टू-स्पीच
Lightning V3.1 अब तक का हमारा सबसे स्वाभाविक आवाज़ वाला TTS मॉडल है, जो तटस्थ तृतीय-पक्ष और ग्राहक मूल्यांकन पर आधारित है। यह 15 भाषाओं का समर्थन करता है: अंग्रेजी।
लाइटनिंग V3.1 निष्पक्ष तृतीय-पक्ष और ग्राहक मूल्यांकन के आधार पर, अब तक का हमारा सबसे स्वाभाविक लगने वाला टीटीएस (TTS) मॉडल है। यह 15 भाषाओं का समर्थन करता है: अंग्रेजी, स्पेनिश, फ्रेंच, इतालवी, डच, स्वीडिश, पुर्तगाली, जर्मन, हिंदी, तमिल, कन्नड़, तेलुगु, मलयालम, मराठी और गुजराती, जिसमें स्वचालित भाषा पहचान और वाक्य के बीच में भाषा बदलने (मिड-सेंटेंस लैंग्वेज स्विचिंग) की सुविधा शामिल है।
लाइटनिंग V3.2 निर्देश-अनुसरण (instruction-following) क्षमता के साथ V3 आर्किटेक्चर का विस्तार करता है। मॉडल भावनात्मक स्तर, पिच परिवर्तन और वॉल्यूम नियंत्रण के लिए स्पष्ट निर्देशों को स्वीकार करता है, जिसमें फुसफुसाहट जैसी कम-ऊर्जा वाली आउटपुट स्थितियां भी शामिल हैं जिन्हें केवल प्रोसोडी मॉडलिंग के माध्यम से प्राप्त करना कठिन होता है।
लाइटनिंग V3 आज हमारी पे-एज-यू-गो (pay-as-you-go) योजना पर उपलब्ध है। आप आज ही इसे निःशुल्क भी शुरू कर सकते हैं।
स्पीच फिडेलिटी (ध्वनि की शुद्धता) और संवादात्मक स्वाभाविकता एक समान नहीं हैं
टीटीएस (TTS) क्षेत्र ने एक विशिष्ट और अच्छी तरह से परिभाषित समस्या को हल करने में वर्षों बिताए हैं: पाठ (text) को समझने योग्य ऑडियो में बदलना। उस पैमाने पर, इसे काफी हद तक सफलता मिली है। अग्रणी मॉडल उच्चारण सटीकता, कम शब्द त्रुटि दर (WER) और उच्च ऑडियो फिडेलिटी पर केंद्रित हो गए हैं। समझने योग्य होना अब बुनियादी बात बन चुका है।
समस्या यह है कि कोई आवाज पाठ को कितनी अच्छी तरह पढ़ती है, इसके लिए अनुकूलन (ऑप्टिमाइज़) करना गलत उद्देश्य है यदि वह एप्लिकेशन एक वॉयस एजेंट है।
संवादात्मक निर्माण में, सिंथेसिस शुरू होने से पहले मॉडल को पूरा कथन प्राप्त नहीं होता है। जैसे-जैसे प्रतिक्रियाएं स्ट्रीम होती हैं, यह वास्तविक समय के अंशों (रियल-टाइम चंक्स) में ऑडियो उत्पन्न करता है, जिसमें हर कदम पर अपूर्ण संदर्भ होता है। स्वाभाविकता ऐसे तरीकों से कम हो जाती है जो एंड-टू-एंड मूल्यांकन में सामने नहीं आ पाती है। और बुनियादी तौर पर, जो आवाज खूबसूरती से पढ़ती है, वह भी बातचीत करने में वास्तव में अरुचिकर हो सकती है।
एक संवादात्मक आवाज को एक साथ चार चीजें करनी होती हैं:
ऐसा लगना कि वह सोच रही है। प्राकृतिक बातचीत में लय, गति और जोर में सूक्ष्म-बदलाव होते हैं जो सक्रिय संज्ञान का संकेत देते हैं। एक मेट्रोनॉमिक रूप से सुसंगत आवाज शांत नहीं लगती; यह पहले से लिखी हुई (स्क्रिप्टेड) लगती है। भाषण का उतार-चढ़ाव मनमाना नहीं होता है। यह वास्तविक समय में विचार उत्पन्न करने के संज्ञानात्मक भार को दर्शाता है। जटिल विचार लंबे ठहराव, अनियमित गति और अधिक विविध जोर उत्पन्न करते हैं। उतार-चढ़ाव कोई शैलीगत विशेषता नहीं है। यह एक संज्ञानात्मक संकेत है। [1]
ऐसा लगना कि वह सुन रही है। बातचीत में आवाज का लहजा (इन्टॉनेशन) प्रतिक्रियाशील होता है। एक स्पष्टीकरण में प्रारंभिक कथन की तुलना में एक अलग प्रोसोडिक प्रोफ़ाइल होती है। एक निराश ग्राहक को दिया जाने वाला उत्तर पहली बार के अभिवादन से भिन्न सुनाई देता है। प्रोसोडी वह तरीका है जिससे भाषण इरादे का संकेत देता है, और बातचीत में, हर मोड़ के साथ इरादा बदल जाता है।
लोग वास्तव में जिस तरह से बोलते हैं, उसे संभालना। वास्तविक बहुभाषी बातचीत में, भाषा साफ-सुथरी पैराग्राफ सीमाओं पर नहीं बदलती है। यह वाक्य के बीच में, शब्द के स्तर पर बदलती है, जिस तरह से वास्तव में विचार चलते हैं। हिंग्लिश या स्पैंगलिश बोलने वालों की सेवा करने वाले वॉयस एजेंट को लगातार इसका सामना करना पड़ता है। यह कोई असाधारण मामला नहीं है।
उपयोगकर्ता को व्यस्त रखना। यह सबसे महत्वपूर्ण, सबसे कम मापने योग्य और हल करने में सबसे कठिन समस्या है। रोबोटिक आवाज न केवल सुनने में अप्रिय लगती है, बल्कि यह दूरी भी पैदा करती है। इसके प्रमाण केवल सुनी-सुनाई बातें नहीं हैं। अनुसंधान लगातार इसे गलत करने की कीमत का दस्तावेजीकरण करता है। वोनेज (Vonage) ने पाया कि 51% अमेरिकी उपभोक्ताओं ने आईवीआर (IVR) मेनू तक पहुंचने के बाद किसी व्यवसाय को पूरी तरह से छोड़ दिया था। आवाज कोई यूएक्स (UX) विवरण नहीं है जो उत्पाद के अनुभव के ऊपर जोड़ा गया हो। कई तैनाती संदर्भों में, यह मुख्य अनुभव है। [2]
लाइटनिंग V3 संवादात्मक टीटीएस के लिए एक नया SOTA स्थापित करता है

एंड-टू-एंड कथन सिंथेसिस में किया गया मूल्यांकन व्यवस्थित रूप से स्ट्रीमिंग अनुप्रयोगों के लिए वास्तविक दुनिया के प्रदर्शन को बढ़ा-चढ़ाकर दिखाता है। हमारा मूल्यांकन विशेष रूप से संवादात्मक निर्माण परिवेश में किया गया था। परीक्षण सेट में Seed-TTS evaluation corpus, के नमूने शामिल थे, जिन्हें एलएलएम-एज़-जज (LLM-as-judge) ढांचे का उपयोग करके स्कोर किया गया था।
इस बेंचमार्क के लिए उपयोग किया गया मूल्यांकन कोड प्रतिकृति (replication) के लिए उपलब्ध है इस लिंक पर।
लाइटनिंग V3 3.89 पर एमओएस (MOS) में अग्रणी है, और सभी प्रतिस्पर्धियों के बीच आवाज के लहजे और प्रोसोडी में सबसे आगे है। वे कोई आकस्मिक जीत नहीं हैं। ये वे विशिष्ट आयाम हैं जिनके लिए मॉडल को डिजाइन किया गया था।
ट्रांसक्रिप्शन की शुद्धता का मूल माप वर्ड एरर रेट (WER) है। लाइटनिंग V3 ने 5.38% का WER हासिल किया है, जो लगभग हर प्रतिस्पर्धी को पीछे छोड़ देता है। क्षेत्र-विशिष्ट शब्दावली के लिए जहां आउट-ऑफ-डिस्ट्रीब्यूशन शब्दावली मॉडल के विश्वास को कम करती है (व्यक्तिवाचक संज्ञा, चिकित्सा शब्दावली, ब्रांड पहचानकर्ता), उच्चारण शब्दकोश एक ओवरराइड लेयर प्रदान करते हैं। सही उच्चारण का अनुमान लगाने के लिए मॉडल पर भरोसा करने के बजाय, ये शब्दकोश अपेक्षित आउटपुट को हार्डकोड करते हैं, जिससे सबसे महत्वपूर्ण शब्दावली पर सुसंगत सटीकता सुनिश्चित होती है।
ओपनएआई (OpenAI) gpt-4o-mini-tts के मुकाबले, लाइटनिंग V3 समग्र स्वाभाविकता पर लगभग 76% की तुलनात्मक जीत दर हासिल करता है। यह संख्या वास्तविक है। इस पर विचार करना भी सार्थक है।
सबसे स्वाभाविक आवाज अक्सर आपकी खुद की होती है
सर्वोत्तम पूर्व-निर्मित आवाज की भी एक सीमा होती है। हमारे मूल्यांकनों में, एक क्लोन की गई आवाज लगातार उससे बेहतर प्रदर्शन करती है।
जब आप किसी आवाज को क्लोन करते हैं (वर्तमान में लाइटनिंग V3.1 पर उपलब्ध है), तो आप उस विशिष्ट अनियमितता को पकड़ रहे होते हैं जो किसी आवाज को एक वास्तविक इंसान जैसा महसूस कराती है। क्लोनिंग जो सुरक्षित रखती है वह न केवल आवाज का रंग (timbre) है, बल्कि अनियमितता भी है: समय, जोर और छोटे दोष जो एक आवाज को प्रदर्शन के बजाय एक वास्तविक इंसान जैसा महसूस कराते हैं।
लाइटनिंग V3.1 ऑडियो के 5 से 15 सेकंड से प्रोडक्शन-ग्रेड प्रतिकृति तैयार करता है।
कोई रिकॉर्डिंग सत्र नहीं, कोई फाइन-ट्यूनिंग पाइपलाइन नहीं। एक छोटा क्लिप एक ऐसी आवाज उत्पन्न करता है जो किसी भी 15 समर्थित भाषाओं में भाषण को संश्लेषित (synthesize) करती है।
पैमाने पर निर्माण करने वाली टीमों के लिए, यह केवल एक सुविधा वाली विशेषता नहीं है। यह उत्पाद संपत्ति के रूप में आवाज के बारे में सोचने का एक मौलिक रूप से अलग तरीका है, क्योंकि क्लोन स्रोत की प्राकृतिक अनियमितता को सुरक्षित रखता है।
वॉयस क्लोनिंग के बारे में यहाँ और जानें
बातचीत सबसे कठिन परीक्षा है, और यह बाकी सब कुछ खोल देती है
यदि कोई आवाज बातचीत में टिकी रहती है, तो वह हर जगह टिकी रहती है। जो स्वाभाविकता हमारे टीटीएस को सपोर्ट कॉल में प्रभावी बनाती है, वही इसे पॉडकास्ट, ऑडियोबुक और डबिंग अनुप्रयोगों के लिए भी समान रूप से प्रभावी बनाती है। संवादात्मक निर्माण सबसे कठिन ध्वनिक संदर्भ है जिसका एक टीटीएस मॉडल सामना कर सकता है: वास्तविक समय का सिंथेसिस, भावनात्मक रूप से विविध संवाद, अप्रत्याशित प्रोसोडिक संदर्भ, और प्रत्येक अंश सीमा पर अपूर्ण जानकारी। इस सेटिंग के लिए डिज़ाइन किए गए मॉडल ने हर दूसरे उपयोग के मामले के सबसे कठिन संस्करण को संबोधित किया है।
लाइटनिंग V3 मूल रूप से 44,100 हर्ट्ज़ पर ऑडियो उत्पन्न करता है, जो संपूर्ण श्रव्य भाषण आवृत्ति रेंज के लिए नाइक्विस्ट सीमा से अधिक है। बैंडविड्थ-बाधित या टेलीफोनी परिनियोजन के लिए, यह सफाई से 8, 16, या 24 किलोहर्ट्ज़ पर डाउनसैंपल करता है।
सेटिंग | विकल्प |
सैंपल दरें | 8,000 / 16,000 / 24,000 / 44,100 हर्ट्ज़ |
आउटपुट स्वरूप | PCM, MP3, WAV, mulaw |
गति नियंत्रण | 0.5x से 2.0x |
भाषा की पहचान | स्पष्ट (ISO 639-1) या स्वतः-पहचान |
तैनाती मोड | HTTP, SSE स्ट्रीमिंग, WebSocket |
तैनाती संदर्भ के आधार पर मॉडल नहीं बदलता है। आउटपुट कॉन्फ़िगरेशन बदलता है। 8 किलोहर्ट्ज़ mulaw पर चलने वाला टेलीफोनी आईवीआर और 44.1 किलोहर्ट्ज़ WAV प्रदान करने वाला पॉडकास्ट टूल एक ही मॉडल को कॉल कर रहे हैं।
व्यक्तित्व-विशिष्ट मूल्यांकन (Persona-Specific Evals) समय की मांग हैं
हम जिस चुनौती का समाधान कर रहे हैं वह है जिसे हम संवादात्मक पर्याप्तता कहते हैं: यह नहीं कि कोई आवाज मानवीय लगती है या नहीं, बल्कि यह कि क्या यह किसी विशिष्ट भूमिका के लिए सही इंसान की तरह लगती है।
वॉयस एआई का मूल्यांकन अब उस व्यक्तित्व के खिलाफ किया जाना चाहिए जिसे अपनाने के लिए इसे डिजाइन किया गया है। एक शांत स्वास्थ्य सेवा एजेंट, एक उच्च ऊर्जा वाले बिक्री प्रतिनिधि और एक नपे-तुले वित्तीय सलाहकार को एक ही प्रोसोडिक आदर्श पर नहीं आंका जाना चाहिए। वे एक ही काम करने की कोशिश नहीं कर रहे हैं। उनकी स्वीकार्य पिच रेंज, ठहराव घनत्व, भाषण दर, सीमा शक्ति, श्वास लेने की क्षमता और लड़खड़ाहट प्रोफ़ाइल भिन्न होती है क्योंकि संवादात्मक लक्ष्य भिन्न होता है। एक आश्वस्त करने वाली आवाज को कोमलता, संयम और सावधानीपूर्वक ठहराव की आवश्यकता हो सकती है। एक आधिकारिक आवाज को अधिक स्थिर गति और कम पिच अस्थिरता की आवश्यकता हो सकती है। एक प्रेरक आवाज को अधिक ऊर्जा की आवश्यकता हो सकती है, लेकिन केवल उस हद तक जहां यह अत्यधिक प्रदर्शन के बजाय अभी भी मानवीय लगे।
एक बेंचमार्क जो जनसंख्या-औसत स्वाभाविकता स्कोर की निकटता को पुरस्कृत करता है, वह व्यवस्थित रूप से उन विचलनों को दंडित करेगा जो किसी आवाज को उसके संदर्भ के लिए उपयुक्त बनाते हैं।
संदर्भ स्कोर बदल देता है।
इस क्षेत्र के पास पहले से ही सबूत हैं कि संदर्भ पेश होने पर मूल्यांकन बदल जाता है। 2025 का रिप्लिकेबिलिटी पेपर सीधे तौर पर तर्क देता है कि आधुनिक सिंथेटिक भाषण का मूल्यांकन एक-आकार-में-सब-फिट (one-size-fits-all) सेटअप में नहीं किया जा सकता है। ब्लिज़ार्ड चैलेंज 2025 की रिपोर्ट ने स्वाभाविकता और उपयुक्तता को अलग से मापा, और कुछ प्रणालियों के लिए उनके बीच महत्वपूर्ण अंतर पाया।
वह अंतर मायने रखता है। यदि श्रोताओं से "यह कितना स्वाभाविक है?" बनाम "यह यहाँ कितना उपयुक्त है?" पूछे जाने पर एक ही नमूने को भौतिक रूप से भिन्न निर्णय प्राप्त होते हैं, तो बेंचमार्क केवल ऑडियो की एक स्थिर संपत्ति को नहीं माप रहा है। यह ऑडियो के साथ-साथ कार्य की उपयुक्तता को भी माप रहा है। यह व्यक्तित्व-अनुकूलित मूल्यांकन का प्रवेश द्वार है। [3][4]
संक्षेप में, एक मॉडल का सामान्य रूप से बेंचमार्क किया जा सकता है, लेकिन किसी आवाज का नहीं। मॉडलों का मूल्यांकन अभी भी सटीकता, मजबूती, नियंत्रणीयता और उच्चारण के लिए किया जाना चाहिए। आवाजों को संदर्भ में डिजाइन और आंका जाना चाहिए: क्या वे उस व्यक्तित्व में फिट बैठते हैं जिसे वे अपनाने के लिए बने हैं, सही सामाजिक संकेत देते हैं, और उस क्षण में विश्वसनीय महसूस करते हैं जिसके लिए उन्हें बनाया गया था।
लाइटनिंग V3.1 अब पे-एज-यू-गो मॉडल पर उपलब्ध है। आप केवल उसी चीज़ के लिए भुगतान करते हैं जिसका आप उपयोग करते हैं। कोई अग्रिम प्रतिबद्धता नहीं, कोई सीट लाइसेंस नहीं, कोई न्यूनतम सीमा नहीं। चाहे आप एक नए वॉयस एजेंट का प्रोटोटाइप बना रहे हों, महीने में लाखों कॉल चला रहे हों, या अपने चैनलों के लिए बहुभाषी सामग्री तैयार कर रहे हों, मूल्य निर्धारण आपके साथ स्केल करता है। क्रेडिट हर महीने समाप्त नहीं होते हैं।
अभी शुरू करने के लिए app.smallest.ai पर जाएं या इस लिंक पर हमारे एपीआई को आजमाएं।
संदर्भ
[1] https://pmc.ncbi.nlm.nih.gov/articles/PMC2131696/ (Prosodic Planning: Effects of Phrasal Length and Complexity on Pause Duration)
[2] https://www.vonage.com/about-us/newsroom/press-releases/Vonage-research-reveals-IVR-horror-costs-businesses-262-per-customer-each-year-09-26-2019/444cff58-7541-43bd-b08b-41d47951117d/ (Vonage research reveals IVR horror costs businesses $262 per customer each year)
[3] https://www.isca-archive.org/interspeech_2025/lemaguer25_interspeech.pdf (Enabling the replicability of speech synthesis perceptual evaluations)
[4] https://www.isca-archive.org/blizzard_2025/do25_blizzard.pdf (The Blizzard Challenge 2025)




