वर्ड एरर रेट (Word Error Rate) क्या है?
वर्ड एरर रेट (WER) यह मापता है कि मशीन द्वारा तैयार किया गया ट्रांसक्रिप्ट किसी संदर्भ (मूल सत्य यानी ग्राउंड ट्रुथ) ट्रांसक्रिप्ट से कितना मेल खाता है। यह स्वचालित वाक् पहचान (ASR) में सबसे व्यापक रूप से उपयोग किया जाने वाला मूल्यांकन मीट्रिक है और इसे मशीन अनुवाद, ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) और अन्य टेक्स्ट-तुलना कार्यों में भी लागू किया जाता है।
WER फॉर्मूला
संदर्भ ट्रांसक्रिप्ट के मुकाबले परिकल्पना (हाइपोथिसिस) ट्रांसक्रिप्ट के संरेखण (अलाइनमेंट) के माध्यम से पहचाने गए तीन प्रकार के शब्द-स्तरीय त्रुटियों का उपयोग करके WER की गणना की जाती है:
प्रतिस्थापन (S) - Substitutions: वे शब्द जिन्हें किसी अन्य शब्द से बदल दिया गया था।
प्रविष्टि (I) - Insertions: वे शब्द जो परिकल्पना में दिखाई देते हैं लेकिन संदर्भ में नहीं।
विलोपन (D) - Deletions: संदर्भ में मौजूद वे शब्द जो परिकल्पना से गायब हैं।
फॉर्मूला है: WER = (S + I + D) / N, जहाँ N संदर्भ ट्रांसक्रिप्ट में शब्दों की कुल संख्या है। परिणाम आमतौर पर प्रतिशत के रूप में व्यक्त किया जाता है। चूंकि प्रविष्टियाँ संदर्भ लंबाई से अधिक शब्द जोड़ सकती हैं, इसलिए अत्यधिक मामलों में WER 100% से अधिक हो सकता है।
कदम-दर-कदम WER की गणना कैसे की जाती है
डायनेमिक स्ट्रिंग अलाइनमेंट (अक्सर लेवेनश्टीन दूरी एल्गोरिदम पर आधारित) का उपयोग करके परिकल्पना ट्रांसक्रिप्ट को संदर्भ ट्रांसक्रिप्ट के साथ संरेखित करें।
प्रतिस्थापन, प्रविष्टि और विलोपन की संख्या की गणना करें।
उन त्रुटियों के योग को संदर्भ के कुल शब्द गणना से विभाजित करें।
कई ओपन-सोर्स लाइब्रेरी इसे आसान बनाती हैं। पायथन (Python) में, jiwer जैसे पैकेज कोड की कुछ ही पंक्तियों के साथ WER की गणना करने के लिए तैयार फ़ंक्शन प्रदान करते हैं।
WER की व्याख्या: "अच्छा" किसे माना जाता है?
किसे एक अच्छा WER माना जाए, यह काफी हद तक उपयोग के मामले और ऑडियो की स्थितियों पर निर्भर करता है। स्पष्ट, पढ़े गए भाषण (जैसे कि ऑडियोबुक नैरेशन) के लिए, आधुनिक ASR सिस्टम 5% से कम WER प्राप्त कर सकते हैं। संवादात्मक या शोर-शराबे वाले ऑडियो में आमतौर पर त्रुटि दर अधिक होती है। सामग्री की संवेदनशील प्रकृति के कारण चिकित्सा या कानूनी ट्रांसक्रिप्शन जैसे विशेष क्षेत्रों में अक्सर बहुत कम WER की आवश्यकता होती है।
WER की सीमाएं
हालांकि WER एक उपयोगी सारांश मीट्रिक है, लेकिन इसकी कुछ उल्लेखनीय सीमाएं हैं:
यह सभी त्रुटियों को समान रूप से देखता है, चाहे वह त्रुटि कोई छोटा सा पूरक शब्द (फिलर वर्ड) हो या कोई महत्वपूर्ण व्यक्तिवाचक संज्ञा (प्रॉपर नाउन)।
यह अर्थ संबंधी समानता (सेमँटिक सिमिलैरिटी) को ध्यान में नहीं रखता है। समान अर्थ वाले लेकिन भिन्न वाक्यांशों वाले दो ट्रांसक्रिप्ट एक उच्च WER उत्पन्न कर सकते हैं।
विराम चिह्न और बड़े अक्षरों (कैपिटलाइजेशन) को आमतौर पर नजरअंदाज कर दिया जाता है, जो डाउनस्ट्रीम अनुप्रयोगों के लिए मायने रख सकते हैं।
इन कारणों से, WER का उपयोग अक्सर कैरेक्टर एरर रेट (CER) जैसे पूरक मीट्रिक के साथ किया जाता है, जो वर्ण (कैरेक्टर) स्तर पर त्रुटियों को मापता है और जटिल आकृति विज्ञान वाली भाषाओं या OCR मूल्यांकन के लिए अधिक जानकारीपूर्ण हो सकता है।