
यह बेंचमार्क नौ भाषाओं में स्ट्रीमिंग एएसआर (ASR) प्रदर्शन का मूल्यांकन करता है, जिसमें वास्तविक परिस्थितियों का उपयोग करके SmallestAI, Deepgram Nova, और GPT-4o Mini Transcribe की तुलना की गई है।
Lightning ASR सिंहावलोकन
Lightning ASR Smallest AI का स्ट्रीमिंग-फर्स्ट मॉडल है जो 15 से अधिक भाषाओं में 300ms से कम की लेटेंसी (विलंबता) के लिए अनुकूलित है। यह कंप्यूट आवश्यकताओं को कम करते हुए एडाप्टिव नॉइज़ सप्रेशन (अनुकूलनशील शोर दमन), स्पीकर डियराइजेशन और विराम चिह्न बहाली की सुविधा प्रदान करता है
हम यह देखने के लिए कई भाषाओं में स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल का बेंचमार्क किया कि वे वास्तविक दुनिया की, कम-लेटेंसी वाली स्थितियों में कैसा प्रदर्शन करते हैं। ऑफलाइन ट्रांसक्रिप्शन के विपरीत, स्ट्रीमिंग ASR को सटीक और तेज़ होना चाहिए, जिससे यह मूल्यांकन लाइव उपयोग के मामलों के लिए विशेष रूप से महत्वपूर्ण हो जाता है।
Deepgram (पॉलिश के लिए Nova 3, और Nova 2)
OpenAI GPT-4o Mini Transcribe
SmallestAI Lightning ASR
*AssemblyAI के स्ट्रीमिंग मॉडल को बाहर रखा गया था क्योंकि यह वर्तमान में केवल अंग्रेजी का समर्थन करता है।
सभी परीक्षण स्ट्रीमिंग मोड में विभिन्न लहजे, बोलने की शैलियों और शब्दावलियों को कवर करने वाले क्यूरेटेड बहुभाषी डेटासेट के साथ चलाए गए थे।
परिणाम - वर्ड एरर रेट (कम होना बेहतर है)
भाषा | Deepgram Nova | GPT-4o Mini | Lightning ASR |
|---|---|---|---|
de - जर्मन | 11.7% | 13.4% | 7.1% |
es - स्पैनिश | 9.4% | 3.6% | 4.8% |
fr - फ्रेंच | 24.2% | 21.2% | 12.1% |
it - इतालवी | 11.9% | 8.2% | 7.4% |
nl - डच | 16.3% | 9.9% | 9.1% |
pl - पॉलिश | 12.2% | 15.0% | 9.5% |
ru - रूसी | 5.4% | 4.5% | 6.2% |
en - अंग्रेजी | 3.5% | 11.0% | 5.3% |
hi - हिंदी | 23.0% | 24.2% | 16.6% |
श्रेणीवार WER
नोट: श्रेणी-वार विश्लेषण केवल अंग्रेजी डेटा का उपयोग करता है क्योंकि लहजे वाले भाषण के नमूने केवल अंग्रेजी में उपलब्ध हैं, जिससे सभी श्रेणियों में समान तुलना सुनिश्चित होती है।
मॉडल | लहजे वाला (Accented) | तकनीकी | तीव्र भाषण (Rapid Speech) | शोरगुल वाला (Noisy) | मल्टी-स्पीकर |
|---|---|---|---|---|---|
Lightning ASR | 5.1% | 4.6% | 5.3% | 5.8% | 5.7% |
GPT-4o Mini | 10.3% | 10.8% | 10.4% | 12.1% | 11.4% |
Deepgram Nova | 3.8% | 2.9% | 3.0% | 4.1% | 3.7% |
वर्ड एरर रेट वितरण

लेटेंसी (विलंबता)
मॉडल | पहले ट्रांसक्रिप्ट का समय |
|---|---|
Smallest AI | 295ms |
Deepgram | 310ms |
Open AI GPT-4o-Mini | 480ms |
डेटासेट
हमारे मूल्यांकन डेटासेट में 9 भाषाओं के 1,680 ऑडियो नमूने शामिल हैं, जो कुल मिलाकर लगभग 4.5 घंटे की ऑडियो सामग्री (औसत 10 सेकंड प्रति क्लिप) है। वास्तविक दुनिया के स्ट्रीमिंग परिदृश्यों को दर्शाने के लिए कॉल सेंटर की बातचीत, ब्रॉडकास्ट क्लिप, स्टूडियो रिकॉर्डिंग और समाचार खंडों से डेटासेट को आंतरिक रूप से तैयार किया गया था।
नमूनों में भाषण की विभिन्न स्थितियों को शामिल किया गया है, जिसमें भारतीय, विभिन्न यूरोपीय और मध्य पूर्वी लहजे के साथ लहजे वाला भाषण (30%), चिकित्सा, वैज्ञानिक और गणितीय क्षेत्रों में फैले तकनीकी शब्द (22%), टंग ट्विस्टर्स और तीव्र भाषण (8%), सड़क के शोर, ओवरलैपिंग बातचीत और संगीत जैसी पृष्ठभूमि ध्वनियों के साथ शोरगुल वाला ऑडियो (30%), और मल्टी-स्पीकर परिदृश्य (10%) शामिल हैं।
नोट: लहजे वाले भाषण (Accented Speech) का परीक्षण डेटा सभी भाषाओं के लिए उपलब्ध नहीं है और इसलिए यह अंग्रेजी भाषा तक ही सीमित है।
अंग्रेजी ऑडियो उदाहरण:
1. तकनीकी (Technical)
"mitochondrial oxidative phosphorylation generates energy through chemiosmotic coupling driven by proton gradients across the inner membrane and electron transfer"
2. शोरगुल वाला (Noisy)
"this is the history of our universe how it began and how everything around us came to be"
3. लहजे वाला (Accented)
"these take the shape of a long round arch with its path high above and its two ends apparently beyond the horizon"
कार्यप्रणाली
सभी ऑडियो को वॉल्यूम नॉर्मलाइजेशन के साथ 16kHz मोनो में मानकीकृत किया गया था। संदर्भ (reference) और मॉडल दोनों ट्रांसक्रिप्ट को लोअरकेस रूपांतरण, विराम चिह्न हटाने, यूनिकोड नॉर्मलाइजेशन (NFKD), और व्हाइटस्पेस हटाने का उपयोग करके सामान्य किया गया था।
WER की गणना इस प्रकार की गई थी: (प्रतिस्थापन + विलोपन + सम्मिलन) / कुल संदर्भ शब्द। स्ट्रीमिंग में अंतरिम परिणामों के सक्षम होने के साथ 250ms के टुकड़ों (chunks) का उपयोग किया गया। सांख्यिकीय महत्व के लिए प्रत्येक भाषा में न्यूनतम 200 नमूने शामिल हैं।
मुख्य निष्कर्ष
SmallestAI जर्मन, फ्रेंच, इतालवी, डच, पॉलिश और हिंदी में सबसे आगे है, जबकि अन्य भाषाओं में प्रतिस्पर्धी बना हुआ है।
GPT-4o Mini स्पैनिश और रूसी में हावी है।
Deepgram अंग्रेजी में लगातार उत्कृष्ट प्रदर्शन कर रहा है, जो उस क्षेत्र में इसकी परिपक्वता को दर्शाता है।
निष्कर्ष
ये बेंचमार्क दर्शाते हैं कि कैसे विभिन्न ASR मॉडल विभिन्न भाषाओं में उत्कृष्ट प्रदर्शन करते हैं। हालांकि अंग्रेजी ASR काफी संतृप्त है, लेकिन बहुभाषी प्रदर्शन अभी भी एक खुला क्षेत्र है। विभिन्न क्षेत्रों में काम करने वाले उत्पादों के लिए, प्रति भाषा सही ASR मॉडल चुनना एक महत्वपूर्ण अंतर ला सकता है।
परिणाम बताते हैं कि Lightning ASR अत्यधिक प्रतिस्पर्धी बहुभाषी स्ट्रीमिंग ट्रांसक्रिप्शन प्रदान करता है, जो कई प्रमुख भाषाओं में अन्य प्रणालियों को पीछे छोड़ देता है। स्वच्छ और चुनौतीपूर्ण दोनों तरह की ऑडियो स्थितियों में इसका मजबूत प्रदर्शन यह साबित करता है कि अनुकूलित, हल्के (lightweight) ASR मॉडल बड़े सिस्टम को टक्कर दे सकते हैं, जिससे वे वास्तविक समय के बहुभाषी वॉयस अनुप्रयोगों के लिए एक सम्मोहक विकल्प बन जाते हैं।



