पहले शब्द पर तेज़, सबसे कठिन शब्दों पर सटीक: Speko पर Pulse का बेंचमार्क

पहले शब्द पर तेज़, सबसे कठिन शब्दों पर सटीक: Speko पर Pulse का बेंचमार्क

Speko ने Smallest AI के Pulse STT का परीक्षण किया: पहले टोकन के लिए ~64ms, टर्न के अंत (end-of-turn) के लिए ~180ms, और वास्तविक दुनिया के शोर-शराबे वाले कॉल ऑडियो पर शीर्ष-स्तरीय 9.9% WER। पूरे परिणाम।

स्पीच-टू-टेक्स्ट मॉडल के प्रदर्शन के बारे में आप जो कुछ भी सुनते हैं, उसमें से अधिकांश उस कंपनी से आता है जिसने इसे बनाया है। यही कारण है कि यह बात मायने रखती है जब एक स्वतंत्र वॉयस एआई गेटवे अपना खुद का परीक्षण करता है और स्पेको (Speko) ने अभी Smallest AI के स्ट्रीमिंग + बैच एसटीटी (STT) Pulse पर परीक्षण के कई चरण पूरे किए हैं।

स्पेको Speko वॉयस एआई गेटवे के पीछे की टीम है: वही गेटवे जो अब प्रोडक्शन में पल्स (Pulse) को चलाता है, जिसे एक एकल कॉन्फ़िगरेशन परिवर्तन के साथ प्लेटफॉर्म पर किसी भी वॉयस एजेंट पर भेजा जा सकता है। जब एक ऐसा गेटवे जो अपने भुगतान करने वाले ग्राहकों के लिए लेटेंसी (विलंबता) और सटीकता को लेकर पूरी तरह आश्वस्त होना चाहता है, किसी मॉडल का बेंचमार्क टेस्ट करता है, तो उसके परिणामों का एक अलग ही महत्व होता है। यहाँ बताया गया है कि उन्हें क्या मिला।

पहला चरण: दो घड़ियाँ जो वास्तव में मायने रखती हैं

पल्स पर स्पेको की पहली नज़र "पहले शब्द के लिए तेज़, आख़िरी शब्द के लिए तेज़" शीर्षक के तहत पड़ी। उनके इस दृष्टिकोण को दोहराना महत्वपूर्ण है, क्योंकि यह इस बात के विपरीत काम करता है कि अधिकांश एसटीटी लीडरबोर्ड कैसे काम करते हैं: साफ़, पहले से रिकॉर्ड किए गए ऑडियो पर वर्ड एरर रेट (WER) मानक संख्या है, और यह लाइव वॉयस एजेंट के लिए गलत माप है। एक कॉलर आपके एसटीटी की सटीकता का अनुभव नहीं करता है — वे इसकी लेटेंसी का अनुभव करते हैं। उनके बोलना बंद करने के बाद का मौन। एजेंट द्वारा जवाब देना शुरू करने से ठीक पहले का वह लंबा पल। यही वह अंतराल है जहाँ बातचीत एक बातचीत जैसी लगना बंद हो जाती है।

इसलिए स्पेको ने एक के बजाय दो घड़ियों पर नज़र रखी:


मीट्रिक

Pulse

पहला आंशिक टोकन (First partial token)

~64 ms

टर्न का अंत (भाषण समाप्ति के निर्धारण के साथ)

~180 ms

WER — अंग्रेज़ी (FLEURS, n=50)

5.1%

अधिकांश स्ट्रीमिंग एसटीटी मॉडल इनमें से किसी एक समय चक्र पर अच्छे होते हैं। स्पेको का निष्कर्ष था कि पल्स वह दुर्लभ मॉडल है जो वास्तव में दोनों पर तेज़ है। पहले आंशिक टोकन लगभग 64 मिलीसेकंड में आ जाते हैं — ट्रांसक्रिप्ट पहले से ही स्क्रॉल हो रही होती है जब कॉलर अभी अपनी बात के बीच में ही होता है, जो डाउनस्ट्रीम एलएलएम (LLM) के लिए बहुत मायने रखता है जिसे सोचने की शुरुआत करने के लिए पहले से तैयारी की आवश्यकता होती है। और बातचीत के अंत पर, स्पीच-समाप्ति के निर्धारण के साथ, पल्स कॉलर के बोलना बंद करने के लगभग 180 मिलीसेकंड बाद अपना अंतिम ट्रांसक्रिप्ट सबमिट कर देता है — न कि कई प्रोडक्शन एसटीटी स्टैक से मिलने वाले एक से तीन सेकंड के साइलेंस-टाइमर लैग की तरह। एक लाइव कॉल में, यही वह अंतर है जिससे जवाब तुरंत मिलता है और एजेंट ऐसा नहीं लगता कि वह पीछे छूट रहा है।


स्पेको केवल स्पीड पर ही नहीं रुका। उन्होंने स्पष्ट किया कि स्पीड का महत्व तभी है जब शब्द सही हों — और पल्स ने अंग्रेजी पर 5.1% WER बनाए रखा, जिसे उन्होंने स्थापित नामों के साथ प्रतिस्पर्धी बैंड में रखा, एक ऐसी कीमत पर जिसे उन्होंने अकाट्य बताया।

उनका निष्कर्ष: पल्स अब स्पेको गेटवे में एक रूटेबल एसटीटी के रूप में लाइव है, और यह उन पहले मॉडलों में से एक है जिसे वे उन डेवलपर्स के लिए सुझाएंगे जिनके एजेंटों के लिए प्रतिक्रिया समय (responsiveness) ही मुख्य उत्पाद है।

दूसरा चरण: पांच वास्तविक परिस्थितियों के खिलाफ परीक्षण जो वॉयस एजेंट वास्तव में सुनते हैं

चार दिन बाद, स्पेको और आगे बढ़ा — और यह वह चरण है जो वास्तव में मायने रखता है, क्योंकि यह कोई एकल समीक्षा नहीं है। यह छह स्ट्रीमिंग एसटीटी मॉडलों का आमने-सामने का मुकाबला है, जो सभी एक ही गेटवे के माध्यम से चलाए गए हैं, उन वास्तविक परिस्थितियों पर जो एक वास्तविक फोन कॉल पेश करती है: लहजा (accented speech), टेलीफोन-बैंड ऑडियो, पृष्ठभूमि का शोर, चिकित्सा शब्दावली, और सहज, एक-दूसरे के ऊपर बोली जाने वाली बातचीत। किसी शांत कमरे में ऑडियोबुक ऑडियो नहीं।

परिणाम, उनकी पोस्ट "एक वॉयस एजेंट वास्तव में क्या सुनता है" से:


मॉडल

5 परिस्थितियों में औसत WER

Smallest Pulse

9.9%

Qwen3-ASR

9.9%

ElevenLabs Scribe v2

12.9%

Cartesia Ink-2

13.1%

Deepgram Nova-3

13.5%

Soniox stt-rt-v5

17.2%


पल्स ने लीडरबोर्ड पर शीर्ष स्थान साझा किया, जिसमें Qwen3-ASR — जो कि एक बहुत बड़ा सामान्य-उद्देश्यीय बहुभाषी मॉडल है — उसी स्कोर पर इसके बराबर रहा। स्पेको के अपने विश्लेषण ने विशेष रूप से यह बताया कि दो शीर्ष पर रहने वाले मॉडल "वे नहीं हैं जिनके लॉन्च पोस्ट सबसे अधिक शोर मचाते हैं," और एक प्रतिस्पर्धी जो खुद को नंबर 1 स्ट्रीमिंग WER मॉडल के रूप में विज्ञापित करता है, वह वास्तविक उत्पादन ऑडियो की जटिलताओं पर परीक्षण किए जाने के बाद चौथे स्थान पर आ गया, न कि किसी चुनिंदा लहजे के सेट पर।


सबसे अधिक ध्यान देने वाली बात यह है कि पल्स ने कहाँ खुद को बनाए रखा। स्पेको के विश्लेषण में पाया गया कि आधुनिक स्ट्रीमिंग मॉडलों के लिए टेलीफोनी और पृष्ठभूमि का शोर शायद ही कोई बाधा उत्पन्न करता है — असली कठिनाई विषय-वस्तु (content) है। चिकित्सा शब्दावली और सहज, एक-दूसरे के ऊपर बोली जाने वाली बातचीत वे क्षेत्र हैं जहाँ अंतर साफ दिखाई देता है, और सहज बातचीत पर प्रत्येक मॉडल की त्रुटि दर लगभग दोगुनी हो जाती है। उस सबसे कठिन परिस्थिति पर, स्पेको ने विशेष रूप से पल्स के बारे में कहा कि इसमें क्षेत्र में सबसे सपाट वक्र (flattest curve) था — यानी ऑडियो के व्यवस्थित न होने पर भी इसमें सबसे कम गिरावट देखी गई।

वास्तविक एजेंट बनाने वाले किसी भी व्यक्ति के लिए यही संख्या सबसे अधिक मायने रखती है: यह नहीं कि कोई मॉडल अपने सबसे अच्छे दिन में कैसा प्रदर्शन करता है, बल्कि यह कि सामान्य दिन में वह कितना कम बिखरता है।

यह समीक्षा क्यों सबसे महत्वपूर्ण है

कोई भी अपना बेंचमार्क प्रकाशित कर सकता है। जो बात स्पेको के आंकड़ों को भरोसा करने योग्य बनाती है, वह उनके पीछे की कड़ाई है — जिसमें वह हिस्सा भी शामिल है जिसे अधिकांश बेंचमार्क चुपचाप छिपा देते हैं। जब दो अन्य मॉडल शुरू में उनके सिस्टम में सही काम नहीं कर रहे थे, तो स्पेको ने खराब आंकड़ों को प्रकाशित करके बात खत्म नहीं की। वे वापस गए, प्रत्येक विक्रेता के एपीआई को सीधे कॉल किया, पाया कि बग उनके अपने गेटवे द्वारा स्ट्रीमिंग फ़ाइनल को संभालने में था, इसे ठीक किया, और संशोधित परिणाम फिर से प्रकाशित किए। यह उस तरह की आत्म-समीक्षा है जो "नंबर 1 पर रहने" के दावे को वास्तव में सार्थक बनाती है।

पल्स ने वास्तविक प्रोडक्शन शोर, वास्तविक लहजों, वास्तविक चिकित्सा शब्दों और आपस में बात करने वाले वास्तविक लोगों के सामने उस लीडरबोर्ड पर अपना स्थान अर्जित किया है — जिसका मूल्यांकन एक ऐसी टीम द्वारा किया गया है जिसके पास विक्रेता के दावों (हमारे दावों सहित) पर संदेह करने की हर वजह थी।

पल्स आज स्पेको गेटवे में लाइव है। यदि आप एक ऐसा वॉयस एजेंट बना रहे हैं जहाँ बातचीत की लेटेंसी का हर एक मिलीसेकंड वास्तविक कॉलर द्वारा महसूस किया जाता है, तो इसे आज़माने के लिए यह एक अच्छी जगह है — या हमसे सीधे smallest.ai पर बात करें।

अक्सर पूछे जाने वाले प्रश्न

अक्सर पूछे जाने वाले प्रश्न

अन्य STT मॉडलों की तुलना में पल्स (Pulse) कितना सटीक है?

पल्स कितना तेज़ है?

स्पेको (Speko) का एक स्वतंत्र बेंचमार्क किसी वेंडर के अपने खुद के आंकड़ों की तुलना में अधिक महत्वपूर्ण क्यों है?

पल्स (Pulse) वास्तविक वॉयस एजेंटों के लिए कैसे अनुकूल है?

हमारे साथ अपने संपर्क केंद्रों (Contact Centers) को स्वचालित करें

तेज़ लेटेंसी, मजबूत सुरक्षा और असीमित स्पीच जनरेशन का अनुभव करें।

एआई (AI) के साथ सारांशित करें

हमारे साथ अपने संपर्क केंद्रों (Contact Centers) को स्वचालित करें

तेज़ लेटेंसी, मजबूत सुरक्षा और असीमित स्पीच जनरेशन का अनुभव करें।

लेख सुनें
2:00
लेख सुनें
2:00
लेख सुनें
2:00

एआई (AI) के साथ सारांशित करें

हमारे साथ अपने संपर्क केंद्रों (Contact Centers) को स्वचालित करें

तेज़ लेटेंसी, मजबूत सुरक्षा और असीमित स्पीच जनरेशन का अनुभव करें।

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104