पहले शब्द पर तेज़, सबसे कठिन शब्दों पर सटीक: Speko पर Pulse का बेंचमार्क
स्पीच-टू-टेक्स्ट मॉडल के प्रदर्शन के बारे में आप जो कुछ भी सुनते हैं, वह आमतौर पर उसे बनाने वाली कंपनी से आता है। यही कारण है कि यह बहुत मायने रखता है जब एक स्वतंत्र वॉयस एआई गेटवे अपने खुद के परीक्षण चलाता है और स्पेको (Speko) ने अभी-अभी पल्स (Pulse) पर कई राउंड के परीक्षण पूरे किए हैं, जो कि स्मॉलेस्ट एआई (Smallest AI) का स्ट्रीमिंग + बैच एसटीटी (STT) है।
स्पेको वह टीम है जो स्पेको वॉयस एआई गेटवे के पीछे काम करती है: वही गेटवे जो अब प्रोडक्शन में पल्स चलाता है, जिसे केवल एक कॉन्फ़िगरेशन परिवर्तन के साथ प्लेटफ़ॉर्म पर किसी भी वॉयस एजेंट पर भेजा जा सकता है। जब एक ऐसा गेटवे जो अपने भुगतान करने वाले ग्राहकों के लिए लेटेंसी और सटीकता को लेकर पूरी तरह आश्वस्त होना चाहता है, किसी मॉडल का बेंचमार्क टेस्ट करता है, तो उसके परिणामों का महत्व ही कुछ और होता है। यहाँ बताया गया है कि उन्होंने क्या पाया।
पहला दौर: दो घड़ियाँ जो वास्तव में मायने रखती हैं
पल्स पर स्पेको की पहली नज़र इस शीर्षक के तहत थी "पहले शब्द के लिए तेज़, आख़िरी शब्द के लिए तेज़।" उनका यह नज़रिया दोहराने लायक है, क्योंकि यह अधिकांश एसटीटी लीडरबोर्ड के काम करने के तरीके के विपरीत जाता है: साफ़, पहले से रिकॉर्ड किए गए ऑडियो पर वर्ड एरर रेट (WER) एक मानक आँकड़ा है, लेकिन लाइव वॉयस एजेंट के लिए यह गलत आँकड़ा है। एक कॉलर आपके एसटीटी की सटीकता का अनुभव नहीं करता — वे इसकी लेटेंसी का अनुभव करते हैं। उनके बोलना बंद करने के बाद का सन्नाटा। एजेंट द्वारा प्रतिक्रिया देना शुरू करने से पहले का लंबा अंतराल। यही वह अंतर है जहाँ बातचीत, बातचीत जैसी लगना बंद हो जाती है।
इसलिए स्पेको ने एक के बजाय दो घड़ियों पर ध्यान दिया:
मैट्रिक | पल्स |
पहला आंशिक टोकन | ~64 एमएस |
टर्न का अंत (भाषण के अंत को अंतिम रूप देने के साथ) | ~180 एमएस |
WER — अंग्रेज़ी (FLEURS, n=50) | 5.1% |
अधिकांश स्ट्रीमिंग एसटीटी मॉडल इनमें से किसी एक घड़ी में अच्छे होते हैं। स्पेको का निष्कर्ष था कि पल्स वह दुर्लभ मॉडल है जो दोनों पर वास्तव में तेज़ है। पहला आंशिक टोकन लगभग 64 मिलीसेकंड में आ जाता है — जब कॉलर अभी अपनी बात पूरी कर रहा होता है, तभी ट्रांसक्रिप्ट पहले से ही स्क्रॉल होने लगती है, जो आगे काम करने वाले एलएलएम (LLM) के लिए बेहद महत्वपूर्ण है ताकि उसे सोचना शुरू करने के लिए समय मिल सके। और बातचीत समाप्त होने के बाद, भाषण के अंत को अंतिम रूप देने के साथ, पल्स कॉलर के बोलना बंद करने के लगभग 180 मिलीसेकंड बाद अपनी अंतिम ट्रांसक्रिप्ट सबमिट कर देता है — न कि कई प्रोडक्शन एसटीटी स्टैक से मिलने वाले एक से तीन सेकंड के सन्नाटे वाले टाइमर की देरी के बाद। एक लाइव कॉल में, यह अंतर ठीक उसी पल जवाब देने और एक ऐसे एजेंट के बीच का होता है जो ऐसा लगता है जैसे वह बात को पकड़ने की कोशिश कर रहा हो।

स्पेको सिर्फ गति पर ही नहीं रुका। वे स्पष्ट थे कि गति केवल तभी मायने रखती है जब शब्द सही हों — और पल्स ने अंग्रेज़ी पर 5.1% का वर्ड एरर रेट (WER) बनाए रखा, जिसे उन्होंने स्थापित नामों के साथ प्रतिस्पर्धी श्रेणी में रखा, वह भी एक ऐसी कीमत पर जिसे उन्होंने बहस से परे बताया।
उनका निष्कर्ष: पल्स अब स्पेको गेटवे में एक रूट करने योग्य एसटीटी के रूप में लाइव है, और यह उन पहले मॉडलों में से एक है जिसे वे ऐसे एजेंटों के निर्माण के लिए सुझाएंगे जहाँ त्वरित प्रतिक्रिया ही मुख्य उत्पाद है।
दूसरा दौर: पाँच वास्तविक स्थितियों के विरुद्ध परीक्षण जो एक वॉयस एजेंट वास्तव में सुनता है
चार दिन बाद, स्पेको और आगे बढ़ा — और यह वह दौर है जो वास्तव में मायने रखता है, क्योंकि यह कोई एकल समीक्षा नहीं है। यह छह स्ट्रीमिंग एसटीटी मॉडलों का आमने-सामने का मुकाबला है, जो सभी एक ही गेटवे के माध्यम से चलाए गए, उन स्थितियों में जो एक वास्तविक फोन कॉल में अक्सर सामने आती हैं: अलग उच्चारण वाली बोली (accented speech), टेलीफोन-बैंड ऑडियो, पृष्ठभूमि का शोर, चिकित्सा शब्दावली, और बिना सोचे-समझे एक के ऊपर एक बोली जाने वाली बातचीत। न कि किसी शांत कमरे में ऑडियोबुक का साफ़ ऑडियो।
उनकी पोस्ट से निकला परिणाम "एक वॉयस एजेंट वास्तव में क्या सुनता है":
मॉडल | 5 स्थितियों में औसत WER |
स्मॉलेस्ट पल्स | 9.9% |
Qwen3-ASR | 9.9% |
ElevenLabs Scribe v2 | 12.9% |
Cartesia Ink-2 | 13.1% |
Deepgram Nova-3 | 13.5% |
Soniox stt-rt-v5 | 17.2% |
पल्स ने लीडरबोर्ड पर शीर्ष स्थान हासिल किया, जिसमें Qwen3-ASR — एक बहुत बड़ा सामान्य-उद्देश्य वाला बहुभाषी मॉडल — भी इसी स्कोर के साथ बराबरी पर रहा। स्पेको के अपने दृष्टिकोण ने इस बात पर विशेष ज़ोर दिया कि शीर्ष दो विजेता "वे नहीं हैं जिनके लॉन्च पोस्ट सबसे शोरगुल वाले होते हैं," और एक प्रतिस्पर्धी जो खुद को नंबर 1 स्ट्रीमिंग WER मॉडल के रूप में विज्ञापित करता है, वास्तविक प्रोडक्शन ऑडियो की तमाम गड़बड़ियों पर परीक्षण किए जाने के बाद चौथे स्थान पर आ गया, न कि एक चुनिंदा उच्चारण सेट पर।

सबसे बड़ी बात यह है कि पल्स कहाँ टिका रहा। स्पेको के विश्लेषण में पाया गया कि आधुनिक स्ट्रीमिंग मॉडलों के लिए टेलीफोनी और पृष्ठभूमि का शोर बहुत बड़ी समस्या नहीं हैं — असली कठिनाई सामग्री है। चिकित्सा शब्दावली और बिना तैयारी के बोली जाने वाली बातचीत ऐसी जगहें हैं जहाँ मॉडल पिछड़ जाते हैं, और हर मॉडल की त्रुटि दर बिना तैयारी के बोली जाने वाली बातचीत में लगभग दोगुनी हो जाती है। उस सबसे कठिन स्थिति में, स्पेको ने विशेष रूप से पल्स का उल्लेख किया कि इसका कर्व क्षेत्र में सबसे सपाट है — यानी जब ऑडियो साफ़ नहीं था, तब इसके प्रदर्शन में सबसे कम गिरावट आई।
यही वह आँकड़ा है जो वास्तविक एजेंट बनाने वाले किसी भी व्यक्ति के लिए सबसे अधिक मायने रखता है: यह नहीं कि कोई मॉडल अपने सबसे अच्छे दिन कैसा प्रदर्शन करता है, बल्कि यह कि वह एक सामान्य दिन में कितना कम लड़खड़ाता है।
यह समीक्षा क्यों सबसे अधिक महत्वपूर्ण है
कोई भी अपना खुद का बेंचमार्क प्रकाशित कर सकता है। जो बात स्पेको के आँकड़ों को भरोसेमंद बनाती है, वह है उनके पीछे की निष्पक्षता — जिसमें वह हिस्सा भी शामिल है जिसे अधिकांश बेंचमार्क चुपचाप छिपा देते हैं। जब शुरुआत में दो अन्य मॉडल उनके सेटअप में ठीक से काम नहीं कर रहे थे, तो स्पेको ने खराब आँकड़ों को प्रकाशित करके बात खत्म नहीं की। उन्होंने वापस जाकर सीधे प्रत्येक वेंडर के एपीआई (API) को कॉल किया, पाया कि बग उनके अपने गेटवे द्वारा स्ट्रीमिंग फ़ाइनल को संभालने में था, उसे ठीक किया, और संशोधित परिणाम फिर से प्रकाशित किए। यह आत्म-समीक्षा की वह भावना है जो "नंबर 1 पर बराबरी" के दावे को वास्तव में सार्थक बनाती है।
पल्स ने वास्तविक प्रोडक्शन शोर, वास्तविक उच्चारण, वास्तविक चिकित्सा शब्दों और वास्तविक लोगों की आपस में ओवरलैप होती बातचीत के सामने उस लीडरबोर्ड पर अपनी जगह बनाई है — वह भी एक ऐसी टीम द्वारा आंके जाने पर जिसके पास हमारे दावों सहित सभी वेंडर दावों पर संदेह करने की पूरी वजह थी।
पल्स आज स्पेको गेटवे में लाइव है। यदि आप एक ऐसा वॉयस एजेंट बना रहे हैं जहाँ बातचीत के दौरान आने वाली हर मिलीसेकंड की देरी को एक वास्तविक कॉलर महसूस कर सकता है, तो इसे आज़माने के लिए यह एक बेहतरीन जगह है — या हमसे सीधे यहाँ बात करें smallest.ai।
अन्य STT मॉडलों की तुलना में पल्स (Pulse) कितना सटीक है?
पल्स कितना तेज़ है?
स्पेको (Speko) का एक स्वतंत्र बेंचमार्क किसी वेंडर के अपने खुद के आंकड़ों की तुलना में अधिक महत्वपूर्ण क्यों है?
पल्स (Pulse) वास्तविक वॉयस एजेंटों के लिए कैसे अनुकूल है?




