वर्ड एरर रेट (शब्द त्रुटि दर) का स्पष्टीकरण: वॉइस एजेंट की गुणवत्ता के लिए यह क्यों महत्वपूर्ण है
जानें कि वर्ड एरर रेट (WER) क्या है, इसकी गणना कैसे की जाती है, और यह महत्वपूर्ण मीट्रिक उच्च प्रदर्शन करने वाले वॉयस एजेंट की गुणवत्ता और उपयोगकर्ता अनुभव की नींव क्यों है।
वर्ड एरर रेट (WER) एक मशीन-जनरेटेड ट्रांसक्रिप्ट और एक सटीक, मानव-जनरेटेड संदर्भ ट्रांसक्रिप्ट के बीच त्रुटियों की कुल संख्या (प्रतिस्थापन, विलोपन और सम्मिलन) को गिनकर स्पीच रिकग्निशन सिस्टम की सटीकता को मापने के लिए एक मानक मीट्रिक है। इस अपरिष्कृत त्रुटि संख्या को फिर संदर्भ में शब्दों की कुल संख्या से विभाजित किया जाता है, जिससे एक प्रतिशत प्राप्त होता है जो यह दर्शाता है कि सिस्टम बोली जाने वाली भाषा को कितनी बार गलत समझता है।
कन्वर्सेशनल एआई बनाने, तैनात करने या उसका मूल्यांकन करने वाले किसी भी व्यक्ति के लिए, WER को समझना बेहद जरूरी है। यह वह आधारशिला है जिस पर संपूर्ण उपयोगकर्ता अनुभव का निर्माण होता है। एक उच्च WER का अर्थ है कि सिस्टम अक्सर उपयोगकर्ता को गलत सुनता है, जिससे गलत कार्रवाइयां होती हैं, निरर्थक प्रतिक्रियाएं मिलती हैं और अत्यधिक निराशा होती है। इसके विपरीत, एक कम WER उच्च वॉइस एजेंट गुणवत्ता प्राप्त करने की दिशा में पहला और सबसे महत्वपूर्ण कदम है, जो सुचारू, प्रभावी और संतोषजनक बातचीत को सक्षम बनाता है।
वर्ड एरर रेट की गणना कैसे की जाती है: गलतफहमी की कार्यप्रणाली
WER गणना लेवेनश्टीन दूरी (Levenshtein distance) का एक सीधा अनुप्रयोग है, जो एक ऐसा एल्गोरिदम है जो दो अनुक्रमों के बीच के अंतर को मापता है। इस मामले में, अनुक्रम ट्रांसक्रिप्ट के शब्द हैं। रेव (2024) सहित कई स्रोतों द्वारा उद्धृत सूत्र इस प्रकार है:
WER = (S + D + I) / N
जहाँ:
S, प्रतिस्थापनों (Substitutions) की संख्या है: यह तब होता है जब ऑटोमैटिक स्पीच रिकग्निशन (ASR) सिस्टम एक सही शब्द को गलत शब्द से बदल देता है। उदाहरण के लिए, उपयोगकर्ता कहता है "ship the package" लेकिन सिस्टम इसे "shop the package" के रूप में ट्रांसक्राइब करता है।
D, विलोपन (Deletions) की संख्या है: यह तब होता है जब ASR सिस्टम बोले गए शब्द को पूरी तरह से छोड़ देता है। उदाहरण के लिए, उपयोगकर्ता कहता है "I need to book a flight for Tuesday" और सिस्टम इसे "I need to book flight for Tuesday" लिखता है।
I, सम्मिलन (Insertions) की संख्या है: यह विलोपन का विपरीत है, जहाँ ASR सिस्टम एक ऐसा शब्द जोड़ देता है जो कभी बोला ही नहीं गया था। उदाहरण के लिए, उपयोगकर्ता कहता है "check my balance" और सिस्टम इसे "check on my balance" के रूप में लिखता है।
N, संदर्भ (Reference) ट्रांसक्रिप्ट (वास्तविक सत्य) में शब्दों की कुल संख्या है।
यहाँ एक ठोस उदाहरण दिया गया है। मान लीजिए कि कोई उपयोगकर्ता कहता है, "Please change my flight to next Tuesday." सटीक संदर्भ ट्रांसक्रिप्ट (N) में 7 शब्द हैं।
संदर्भ: "please change my flight to next tuesday" (N=7)
ASR आउटपुट: "please change flight to the next tuesday"
दोनों की तुलना करके, हम त्रुटियों की पहचान कर सकते हैं:
"my" को हटा दिया गया (1 विलोपन)
"the" को शामिल कर दिया गया (1 सम्मिलन)
इस मामले में, S=0, D=1, और I=1 है। संदर्भ (N) में शब्दों की कुल संख्या 7 है। इसे सूत्र में रखने पर:
WER = (0 + 1 + 1) / 7 = 2 / 7 ≈ 0.2857
वर्ड एरर रेट 28.57% है। यह ध्यान रखना महत्वपूर्ण है कि यदि त्रुटियों की संख्या संदर्भ में शब्दों की संख्या से अधिक है, तो WER 100% से अधिक हो सकता है, जो सम्मिलन (insertions) से भरी बहुत खराब ट्रांसक्रिप्शन के मामले में हो सकता है।
द रिपल इफ़ेक्ट: कैसे उच्च WER वॉइस एजेंट की गुणवत्ता को कम करता है
एक सिंगल ट्रांसक्रिप्शन त्रुटि अलग-थलग काम नहीं करती है। वॉइस एजेंट के जटिल आर्किटेक्चर के भीतर, ASR स्तर पर एक गलती आगे के चरणों में विफलताओं की एक श्रृंखला शुरू कर देती है, जिससे समग्र वॉइस एजेंट गुणवत्ता पर गंभीर प्रभाव पड़ता है। शुरुआती गलत व्याख्या तो समस्या की शुरुआत मात्र है।
नेचुरल लैंग्वेज अंडरस्टैंडिंग (NLU) में विफलता
NLU मॉडल उपयोगकर्ता के भाषण से इरादे (intent) और संस्थाओं (entities) को निकालने के लिए जिम्मेदार है। यदि इसे एक त्रुटिपूर्ण ट्रांसक्रिप्ट मिलती है, तो इस कार्य को करने की इसकी क्षमता से समझौता हो जाता है। एक ASR जो "book" के स्थान पर "look" प्रतिस्थापित करता है, उपयोगकर्ता के इरादे को एक ट्रांजैक्शनल अनुरोध से एक सूचनात्मक अनुरोध में बदल देता है। NLU किसी भी वैध इरादे की पहचान करने में विफल हो सकता है, जिससे एजेंट को एक सामान्य और अप्रभावी "मुझे खेद है, मुझे समझ नहीं आया" के साथ जवाब देने के लिए मजबूर होना पड़ता है। वैकल्पिक रूप से, यह इरादे की गलत पहचान कर सकता है, जिससे उपयोगकर्ता पूरी तरह से गलत बातचीत के रास्ते पर चला जाता है। यही मुख्य कारण है कि अंतर्निहित ASR की गुणवत्ता इतनी महत्वपूर्ण है; कचरा अंदर, कचरा बाहर।
गलत डायलॉग मैनेजमेंट और स्टेट ट्रैकिंग
डायलॉग मैनेजर पूरी प्रक्रिया का मुख्य दिमाग होता है, जो बातचीत की वर्तमान स्थिति के आधार पर यह तय करता है कि एजेंट को आगे क्या कहना या करना चाहिए। जब WER उच्च होता है, तो डायलॉग मैनेजर को गलत इनपुट मिलते हैं। कल्पना कीजिए कि एक उपयोगकर्ता "दो बड़े पिज्जा" ऑर्डर करना चाहता है लेकिन ASR "दो" शब्द को हटा देता है। अब सिस्टम के पास एक महत्वपूर्ण जानकारी (मात्रा) की कमी है और उसे स्पष्टीकरण के लिए प्रश्न पूछना होगा, जिससे परेशानी बढ़ती है और बातचीत का समय लंबा हो जाता है। यह एजेंट को एक दोहराव वाले, अक्षम चक्र में धकेलता है, जिससे यह एक बुद्धिमान सहायक के बजाय एक निराशाजनक फोन ट्री जैसा महसूस होने लगता है।
उपयोगकर्ता के विश्वास में कमी और परित्याग में वृद्धि
अंततः, तकनीकी विफलताएं खराब उपयोगकर्ता अनुभव के रूप में सामने आती हैं। जब किसी उपयोगकर्ता को अपनी बात दोहरानी पड़ती है, एजेंट को सही करना पड़ता है, या अपने अनुरोध को दोबारा समझाना पड़ता है, तो सिस्टम पर उनका विश्वास गिर जाता है। प्रत्येक त्रुटि एक छोटी सी निराशा होती है जो धीरे-धीरे जमा होती जाती है। एक उपयोगकर्ता जिसे बताया जाता है कि उसकी "ऑस्टिन" की उड़ान "बोस्टन" के लिए बुक की गई है, वह केवल असुविधा महसूस नहीं करता; वह यह विश्वास खो देता है कि एजेंट उसके अनुरोध को संभालने के लिए पर्याप्त सक्षम है। इससे कॉल छोड़ने और मानव एजेंटों को ट्रांसफर करने की दर बढ़ जाती है, जिससे पहली बार में वॉइस एजेंट तैनात करने का प्राथमिक उद्देश्य ही विफल हो जाता है। उच्च WER सीधे तौर पर कम उपयोगकर्ता संतुष्टि और खराब ROI में बदल जाता है।
एक 'अच्छा' वर्ड एरर रेट क्या है?
एक "अच्छे" WER की परिभाषा पूरी तरह से संदर्भ पर निर्भर करती है। जो एक अनुप्रयोग के लिए स्वीकार्य है वह दूसरे के लिए पूरी तरह से विफलता हो सकती है। जोखिम, ध्वनिक वातावरण और उपयोगकर्ता की अपेक्षाएं सभी एक महत्वपूर्ण भूमिका निभाती हैं। आईबीएम (2024) के अनुसार, उच्चारण, पृष्ठभूमि का शोर और यहाँ तक कि आवाज की पिच जैसे कारक ASR प्रदर्शन और फलस्वरूप WER को नाटकीय रूप से प्रभावित कर सकते हैं।
सामान्य उद्देश्यों के अनुप्रयोगों के लिए, दीपग्राम (2024) के अनुसार, कई ऑफ-द-शेल्फ एपीआई के लिए 25% का वर्ड एरर रेट लगभग औसत माना जाता है। यह एक अनौपचारिक बैठक को ट्रांसक्राइब करने के लिए पर्याप्त हो सकता है जहाँ मनुष्य कमियों को खुद समझ सकते हैं, लेकिन यह एक मेडिकल डिक्टेशन सिस्टम के लिए विनाशकारी होगा।
अधिक संवेदनशील क्षेत्रों में, त्रुटि की गुंजाइश नाटकीय रूप से कम हो जाती है। टेक्स्ट डिक्टेशन के लिए, 5% से अधिक का WER (या 95% से कम की सटीकता) अक्सर अस्वीकार्य माना जाता है (विकिपीडिया, 2024)। जब कोई वॉइस एजेंट वित्तीय लेनदेन, चिकित्सा जानकारी या कानूनी समझौतों को संभाल रहा होता है, तो 1-2% का WER भी बहुत अधिक हो सकता है यदि त्रुटियां संख्या, नाम या कमांड जैसे महत्वपूर्ण कीवर्ड पर होती हैं। उदाहरण के लिए, "sell one hundred shares" को "sell one thousand shares" के रूप में ट्रांसक्राइब करना एक विनाशकारी विफलता है, भले ही यह समग्र वाक्य के लिए कम WER का प्रतिनिधित्व करता हो।
उच्च गुणवत्ता वाले वॉइस एजेंट के प्रदर्शन का लक्ष्य हमेशा मानव-स्तरीय सटीकता के जितना संभव हो सके उतना करीब होना चाहिए, जिसे अक्सर 4-5% WER के आसपास बताया जाता है। इसे प्राप्त करने के लिए क्षेत्र-विशिष्ट (domain-specific) डेटा पर प्रशिक्षित विशेष मॉडल, मजबूत शोर रद्दीकरण (noise cancellation), और उपयोगकर्ता आधार के विशिष्ट शब्दजाल, लहजे और बोलियों की समझ की आवश्यकता होती है। आधुनिक एजेंटों की बहुभाषी क्षमताओं पर विचार करते समय यह विशेष रूप से प्रासंगिक है, क्योंकि भाषाओं के बीच WER काफी भिन्न हो सकता है।
वर्ड एरर रेट के बारे में सामान्य भ्रांतियां
एक बुनियादी मीट्रिक के रूप में, WER पर अक्सर चर्चा की जाती है लेकिन कभी-कभी इसे गलत समझा जाता है। वॉइस तकनीक के बारे में सूचित निर्णय लेने के लिए इन बिंदुओं को स्पष्ट करना महत्वपूर्ण है।
भ्रांति 1: 0% WER अंतिम लक्ष्य है। हालांकि 0% WER सैद्धांतिक रूप से परिपूर्ण है, व्यावहारिक रूप से यह अप्राप्य है और हमेशा आवश्यक नहीं होता है। मानव-से-मानव बातचीत भी 100% सटीक नहीं होती है; हम गलत सुनते हैं और स्पष्टीकरण मांगते हैं। वॉइस एजेंट का लक्ष्य पूर्ण सटीकता नहीं, बल्कि कार्यात्मक सटीकता है। सिस्टम को इरादे को समझने और कार्य को पूरा करने के लिए भाषण के महत्वपूर्ण हिस्सों पर पर्याप्त रूप से सटीक होना चाहिए। WER को 2% से घटाकर 1% करने के लिए अत्यधिक संसाधनों को खर्च करने से उपयोगकर्ता अनुभव में कोई उल्लेखनीय सुधार नहीं हो सकता है यदि बची हुई त्रुटियां महत्वहीन पूरक शब्दों पर हैं।
भ्रांति 2: वॉइस एजेंट की गुणवत्ता के लिए केवल WER ही एकमात्र मीट्रिक है जो मायने रखती है। यह एक बड़ी अतिसरलीकृत सोच है। WER केवल ट्रांसक्रिप्शन की सटीकता को मापता है। यह ट्रांसक्रिप्शन की गति (लेटेंसी), एजेंट की संश्लेषित (synthesized) आवाज की स्वाभाविकता, या उसकी प्रतिक्रियाओं की बुद्धिमत्ता के बारे में कुछ नहीं कहता। वॉइस एजेंट क्वालिटी इंडेक्स (VAQI) नामक एक हालिया मूल्यांकन ढांचा बातचीत के अनुभव को बेहतर ढंग से कैप्चर करने के लिए एक अधिक समग्र स्कोर की वकालत करता है जिसमें लेटेंसी, रुकावटें और छूटे हुए जवाब शामिल हैं (दीपग्राम, 2025)। कोई उपयोगकर्ता 6% WER वाले उस एजेंट को प्राथमिकता दे सकता है जो तुरंत प्रतिक्रिया देता है, बजाय उस 4% WER वाले एजेंट के जो प्रत्येक प्रतिक्रिया को प्रोसेस करने में पांच सेकंड का समय लेता है। एआई वॉइस-संचालित बातचीत का भविष्य कई गुणवत्ता कारकों के संतुलन पर निर्भर करता है।
भ्रांति 3: सभी त्रुटियां एक जैसी होती हैं। मानक WER सूत्र हर त्रुटि को समान भार (weight) के साथ देखता है। "a" शब्द को हटाना और "not" शब्द को प्रतिस्थापित करना दोनों को समान रूप से दंडित किया जाता है। वास्तव में, त्रुटियों का अर्थ संबंधी (semantic) प्रभाव बेहद भिन्न होता है। उपयोगकर्ता के इरादे को परिभाषित करने वाले एक कीवर्ड पर त्रुटि (जैसे, "cancel" बनाम "confirm") एक पूरक शब्द पर होने वाली त्रुटि की तुलना में कहीं अधिक नुकसानदेह है। यही कारण है कि कुछ टीमें प्रदर्शन का अधिक सूक्ष्म दृष्टिकोण प्राप्त करने के लिए वेटेड (weighted) WER या अन्य अर्थ संबंधी समानता मेट्रिक्स का उपयोग करती हैं जो एजेंट के कार्य करने की क्षमता पर वास्तविक प्रभाव को बेहतर ढंग से दर्शाती हैं।
h2 id="45">WER से आगे: वॉइस एजेंट की गुणवत्ता के लिए एक समग्र दृष्टिकोण
जबकि वर्ड एरर रेट ASR घटक के मूल्यांकन के लिए एक अपरिहार्य उपकरण है, बेहतर वॉइस एजेंट गुणवत्ता प्राप्त करने के लिए व्यापक दृष्टिकोण की आवश्यकता होती है। यह शुरुआती बिंदु है, अंतिम रेखा नहीं। टेक्स्ट-आधारित और वॉइस-आधारित सहायकों के बीच का अंतर, जिसे अक्सर एआई चैटबॉट्स बनाम एआई वॉइस एजेंट्स की तुलना में चर्चा की जाती है, यह स्पष्ट करता है कि वॉइस के लिए बहु-आयामी मूल्यांकन क्यों आवश्यक है।
एक व्यापक मूल्यांकन ढांचा, जैसा कि ब्रेनट्रस्ट (2025) जैसे स्रोतों द्वारा रेखांकित किया गया है, को संपूर्ण बातचीत लूप का आकलन करना चाहिए। WER से परे प्रमुख मेट्रिक्स में शामिल हैं:
प्रमुख संवादात्मक मेट्रिक्स:
लेटेंसी (विलंबता): उपयोगकर्ता के बोलना बंद करने और एजेंट के जवाब देना शुरू करने के बीच का समय अंतराल। उच्च लेटेंसी अजीब खामोशी पैदा करती है और बातचीत को अस्वाभाविक और थकाऊ बनाती है।
रुकावट से निपटना (Barge-in): उपयोगकर्ता द्वारा टोके जाने पर एजेंट द्वारा शालीनता से बोलना बंद करने की क्षमता। एक अच्छा एजेंट बोलते समय सुनता भी है, जिससे अधिक गतिशील और प्राकृतिक बातचीत संभव होती है।
कार्य पूर्णता दर (Task Completion Rate): सफलता का अंतिम पैमाना। क्या उपयोगकर्ता ने अपना लक्ष्य प्राप्त किया? यह मीट्रिक वास्तविक दुनिया की प्रभावशीलता को मापने के लिए तकनीकी विवरणों से परे जाती है।
संवादात्मक सामंजस्य: क्या एजेंट की प्रतिक्रिया तार्किक रूप से उपयोगकर्ता की क्वेरी का अनुसरण करती है? क्या यह बातचीत के पिछले मोड़ों से संदर्भ याद रखती है?
TTS गुणवत्ता: टेक्स्ट-टू-स्पीच आवाज की स्वाभाविकता, स्पष्टता और उपयुक्तता। एक रोबोटिक या कर्कश आवाज उपयोगकर्ता के अनुभव को खराब कर सकती है भले ही अंतर्निहित तर्क परिपूर्ण हो।
एक सफल वॉइस एजेंट बनाने और तैनात करने का अर्थ मेट्रिक्स के इस पूरे सेट को अनुकूलित करना है। इसके लिए सर्वश्रेष्ठ स्पीच-टू-टेक्स्ट एपीआई में से चयन करने की आवश्यकता होती है ताकि एक कम WER की नींव सुनिश्चित हो सके, और फिर एक सुसंगत और प्रभावी अनुभव बनाने के लिए NLU, डायलॉग मैनेजमेंट और TTS घटकों को सावधानीपूर्वक ट्यून किया जा सके। व्यवसायों के लिए, यह सुनिश्चित करना कि आपका सिस्टम एंटरप्राइज़ आवश्यकताओं को संभाल सकता है का अर्थ एकल संख्या से परे देखना और एक ऐसे प्लेटफॉर्म में निवेश करना है जो पूरे संवादात्मक स्टैक में उत्कृष्ट प्रदर्शन करता है। उदाहरण के लिए, उच्च प्रदर्शन करने वाले Smallest.ai वॉइस एजेंट्स को एक बेहतर अंतिम-उपयोगकर्ता अनुभव प्रदान करने के लिए कम-लेटेंसी ASR और परिष्कृत संवादात्मक बुद्धिमत्ता दोनों पर ध्यान केंद्रित करके तैयार किया गया है।
Smallest.ai के साथ शुरुआत करें
यदि आप इन सिद्धांतों को व्यवहार में लाने के लिए तैयार हैं, तो Smallest.ai आपको ऐसे वॉइस एजेंट बनाने के टूल प्रदान करता है जो बिना किसी अतिरिक्त प्रयास के कम WER, न्यूनतम लेटेंसी और प्राकृतिक संवादात्मक अनुभव प्रदान करते हैं। यह प्लेटफॉर्म उन टीमों के लिए डिज़ाइन किया गया है जो सटीकता या प्रदर्शन से समझौता किए बिना प्रोटोटाइप से उत्पादन तक तेजी से जाना चाहती हैं।
शुरुआत करने में केवल कुछ कदम लगते हैं। एक निःशुल्क खाते के लिए साइन अप करें, पहले से बने वॉइस एजेंट टेम्पलेट्स को एक्सप्लोर करें, और API के माध्यम से अपनी खुद की ASR और TTS पाइपलाइनों को कनेक्ट करें। चाहे आप कस्टमर सपोर्ट लाइन बना रहे हों, अपॉइंटमेंट शेड्यूलर, या एक जटिल एंटरप्राइज़ वर्कफ़्लो, यह प्लेटफ़ॉर्म आपकी आवश्यकताओं के साथ स्केल होता है। आप इन-बिल्ट एनालिटिक्स का उपयोग करके अपने एजेंट के प्रदर्शन का परीक्षण कर सकते हैं और उसे बेहतर बना सकते हैं जो वास्तविक समय में WER, लेटेंसी, कार्य पूर्णता और अन्य प्रमुख गुणवत्ता मेट्रिक्स को ट्रैक करता है।
वॉइस एजेंट की गुणवत्ता पर केंद्रित टीमों के लिए, Smallest.ai डोमेन-विशिष्ट मॉडल ट्यूनिंग, बहुभाषी समर्थन और एंटरप्राइज़-ग्रेड विश्वसनीयता प्रदान करता है। उत्पादन के लिए तैयार सिस्टम प्राप्त करने के लिए आपको दर्जनों अलग-अलग वेंडरों को एक साथ जोड़ने की आवश्यकता नहीं है। उच्च गुणवत्ता वाले वॉइस एजेंटों को बनाने, तैनात करने और उनकी निगरानी करने के लिए आवश्यक सभी चीजें एक ही स्थान पर मौजूद हैं।
Smallest.ai के लिए साइन अप करें और आज ही अपना वॉइस एजेंट बनाना शुरू करें।
मुख्य निष्कर्ष
WER एक बुनियादी मीट्रिक है: वर्ड एरर रेट प्रतिस्थापन, विलोपन और सम्मिलन की गणना करके स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शन की सटीकता को मापता है। वॉइस एजेंट की गुणवत्ता का आकलन करने में यह एक महत्वपूर्ण पहला कदम है।
उच्च WER सिस्टम की विफलता का कारण बनता है: ट्रांसक्रिप्शन में त्रुटियों के कारण आगे के चरणों के घटकों जैसे नेचुरल लैंग्वेज अंडरस्टैंडिंग (NLU) और डायलॉग मैनेजमेंट में विफलताएं होती हैं, जिसके परिणामस्वरूप खराब उपयोगकर्ता अनुभव होता है।
संदर्भ 'अच्छे' WER को परिभाषित करता है: एक स्वीकार्य WER अनुप्रयोग के अनुसार भिन्न होता है। जबकि कुछ उपकरणों के लिए 25% WER औसत हो सकता है, डिक्टेशन या वित्तीय लेनदेन जैसे महत्वपूर्ण अनुप्रयोगों के लिए 5% से कम WER की आवश्यकता होती है।
WER सब कुछ नहीं है: वॉइस एजेंट की गुणवत्ता के समग्र दृष्टिकोण में उपयोगकर्ता के संवादात्मक अनुभव को पूरी तरह से कैप्चर करने के लिए लेटेंसी, रुकावट से निपटना, कार्य पूर्णता दर और TTS गुणवत्ता भी शामिल होनी चाहिए।
सभी त्रुटियां एक जैसी नहीं होती हैं: मानक WER सूत्र सभी शब्द त्रुटियों को एक समान मानता है, लेकिन किसी कीवर्ड पर होने वाली त्रुटि का अर्थ संबंधी प्रभाव एक पूरक शब्द की तुलना में कहीं अधिक होता है।
मैं अपने वॉयस एजेंट की वर्ड एरर रेट (शब्द त्रुटि दर) को कैसे सुधार सकता हूं?
क्या वर्ड एरर रेट (Word Error Rate) 100% से अधिक हो सकता है?
WER और कैरेक्टर एरर रेट (CER) के बीच क्या अंतर है?
क्या वॉयस एजेंट की गुणवत्ता मापने के लिए कोई एकल उद्योग मानक है?




