लाइटनिंग-v2 बहुभाषी (Multilingual) टीटीएस मॉडल का मूल्यांकन

लाइटनिंग-v2 बहुभाषी (Multilingual) टीटीएस मॉडल का मूल्यांकन

लाइटनिंग-v2 बहुभाषी (Multilingual) टीटीएस मॉडल का मूल्यांकन

Smallest.ai का Lightning-v2 एक सामान्य-उद्देश्यीय स्ट्रीमिंग बहुभाषी TTS मॉडल है जिसे रीयल-टाइम अनुप्रयोगों के लिए डिज़ाइन किया गया है। Lightning V2 ने खुद को एक बहुमुखी मॉडल साबित किया है, जो 16 भाषाओं का समर्थन करता है और 9 अन्य भाषाएं बीटा परीक्षण में हैं। यह ब्लॉग Eleven Labs के रीयल-टाइम मॉडल (Eleven Flash v2.5) के खिलाफ हमारे Lightning V2 मॉडल के बेंचमार्क परिणाम प्रस्तुत करता है। हमारे मूल्यांकन में, हमने 24 kHz पर ऑडियो सैंपल संश्लेषित किए और स्ट्रीमिंग मोड में मॉडल द्वारा उत्पन्न स्थापित भाषण गुणवत्ता मेट्रिक्स के साथ नौ भाषाओं (जर्मन, अंग्रेजी, स्पेनिश, फ्रेंच, इतालवी, डच, पोलिश, रूसी और अरबी) में उनका मूल्यांकन किया। निम्नलिखित अनुभाग उपयोग किए गए मेट्रिक्स का वर्णन करते हैं, समग्र परिणाम प्रस्तुत करते हैं, और भाषा-दर-भाषा प्रदर्शन का विश्लेषण करते हैं।

मीन ऑपरेटिंग स्कोर का एन्सेम्बल (Ensemble)

मॉडलों द्वारा जनरेट किए गए ऑडियो की गुणवत्ता का विश्वसनीय रूप से मूल्यांकन करने के लिए, हम मीन ऑपरेटिंग स्कोर मॉडलों के एक एन्सेम्बल का उपयोग करते हैं। विभिन्न लेखों के माध्यम से व्यापक शोध के बाद हमने निम्नलिखित चार मैट्रिक्स को चुना है।

इन मैट्रिक्स को मॉडलों का अलग-अलग तरीकों से मूल्यांकन करने के लिए सावधानीपूर्वक चुना गया था, और नीचे इनका विस्तार से वर्णन किया गया है:

  • SIGMOS ICASSP 2024 स्पीच सिग्नल इम्प्रूवमेंट चैलेंज में पेश किया गया एक ऑब्जेक्टिव, नॉन-इंट्रूसिव स्पीच-क्वालिटी मीट्रिक है, यह फुल-बैंड ऑडियो गुणवत्ता का मूल्यांकन करने में सक्षम है—ऐसा कुछ जिसका अधिकांश न्यूरल मेट्रिक्स ने पहले समर्थन नहीं किया था—जो स्पष्टता, प्रतिध्वनि (reverberation), और शोर जैसे सात अवधारणात्मक आयामों (perceptual dimensions) में स्वचालित, मानकीकृत मूल्यांकन को सक्षम बनाता है।

  • NISQA बिना किसी स्पष्ट संदर्भ की आवश्यकता के एक खराब ऑडियो सिग्नल से भाषण की गुणवत्ता का अनुमान लगाता है। यह न केवल एक समग्र MOS (मीन ओपिनियन स्कोर) प्रदान करता है, बल्कि चार अवधारणात्मक आयामों: शोर (noisiness), रंगत (coloration), विच्छिन्नता (discontinuity), और लाउडनेस (loudness) में विस्तृत भविष्यवाणियां भी प्रदान करता है।

  • SHEET-SSQA MOS व्यापक SHEET टूलकिट—एक स्पीच ह्यूमन इवैल्यूएशन एस्टीमेशन टूलकिट—के भीतर एक मॉडल-आधारित मीट्रिक है, जिसे विशेष रूप से SSL-MOS मॉडल के माध्यम से सेल्फ-सुपरवाइज्ड लर्निंग (SSL) रिप्रजेंटेशन का उपयोग करके मानव मीन ओपिनियन स्कोर (MOS) की भविष्यवाणी करने के लिए डिज़ाइन किया गया है।

  • WVMOS, भाषण विश्लेषण के लिए व्यापक रूप से उपयोग किया जाने वाला मीट्रिक है। जो बात इसे अलग बनाती है वह है कई डेटासेट और वक्ताओं में इसकी मजबूती, और व्यक्तिगत मानवीय निर्णयों के साथ निकटता से संरेखित होना, जो इसे TTS और वॉयस कन्वर्सेशन सिस्टम को बेंचमार्क करने के लिए विशेष रूप से उपयोगी बनाता है।

हमने इन मॉडलों का दोहराए जाने योग्य मूल्यांकनों के लिए विश्वसनीय रूप से उपयोग करने के लिए एक इन-हाउस वॉयस इवैल्यूएशन फ्रेमवर्क भी विकसित किया है।

मूल्यांकन प्रक्रिया और समग्र परिणाम

मैट्रिक्स का उपयोग करके मॉडलों का मूल्यांकन करने के लिए, हमने LLMs का उपयोग करके यादृच्छिक रूप से जनरेट किए गए वाक्यों का एक विविध सेट चुना। फिर हमने दोनों मॉडलों की डिफ़ॉल्ट सेटिंग्स का उपयोग करके इन वाक्यों के लिए ऑडियो जनरेट किए, जैसा कि ऑनलाइन उपलब्ध संबंधित दस्तावेज़ों में उल्लेख किया गया है। फिर हमने जनरेट किए गए ऑडियो के लिए इन स्कोर का मूल्यांकन किया जिसे हम नीचे साझा कर रहे हैं।

भाषण जनरेशन की तुलना करने के लिए एक निर्णायक संख्या प्राप्त करने के लिए, हम अपने MOS मॉडल के एन्सेम्बल द्वारा अनुमानित स्कोर के औसत का उपयोग करते हैं


भाषा

Eleven Labs Flash v2.5

Smallest.ai Lightning v2

अरबी

4.048

4.042

जर्मन

4.047

4.036

स्पैनिश

4.226

4.253

फ्रेंच

4.149

4.132

इतालवी

4.174

4.203

डच

4.202

4.239

पोलिश

4.165

4.299

रूसी

4.090

4.169

अंग्रेज़ी

4.264

4.287

समग्र (Overall)

4.152

4.185

हमारे विश्लेषण के माध्यम से, हम यह निष्कर्ष निकालते हैं कि हालांकि कुछ भाषाओं में कड़ी टक्कर थी, लेकिन इस आमने-सामने की तुलना में Lightning v2 आगे है।

भाषा-वार प्रदर्शन विश्लेषण

इस खंड में, हम व्यक्तिगत मेट्रिक्स पर मूल्यांकित भाषाओं के परिणामों का विस्तार से विवरण देते हैं और साथ ही ऐसे नमूने भी पेश करते हैं जो अत्यधिक सुबोध और अभिव्यंजक भाषण जनरेट करने की मॉडल की क्षमता को प्रदर्शित करते हैं।

जर्मन (de): Lightning-v2 से जर्मन आउटपुट मजबूत MOS प्रेडिक्टर स्कोर प्राप्त करते हैं। SSQA (4.51) और NISQA (4.24) संकेत देते हैं कि श्रोताओं को भाषण स्वाभाविक और सुखद लगेगा। कुल मिलाकर, जर्मन आवाज स्पष्ट, स्वाभाविक और समझने में आसान है।

अंग्रेज़ी (en): Lightning-v2 से अंग्रेजी जनरेशन असाधारण रूप से अच्छा प्रदर्शन करती है। उच्च SSQA (4.54) और NISQA (4.47) स्कोर स्वाभाविक लय (prosody) को दर्शाते हैं, और WVMOS (4.26) लगातार स्वाभाविक लगने वाले ऑडियो का सुझाव देता है। एक मजबूत NISQA (3.88) के साथ, ये मेट्रिक्स पुष्टि करते हैं कि अंग्रेजी आउटपुट अत्यधिक स्वाभाविक और आकर्षक हैं।

स्पैनिश (es): Lightning-v2 से स्पैनिश आउटपुट अच्छी तरह से संतुलित हैं। SIGMOS (3.83) और NISQA (4.51) उच्चतम स्तर पर हैं, जो सहज, स्वाभाविक लगने वाले भाषण की ओर इशारा करते हैं। SSQA (4.63) उत्कृष्ट है, जबकि WVMOS (4.04) लगातार स्वाभाविक ऑडियो को इंगित करता है। कुल मिलाकर, स्पैनिश भाषण परिष्कृत और समझने में आसान लगता है।

फ्रेंच (fr): Lightning-v2 से फ्रेंच भाषण उत्कृष्ट सुबोधता के साथ मजबूत अवधारणात्मक गुणवत्ता को जोड़ता है। SSQA (4.64) सभी भाषाओं में सबसे अधिक है, जो NISQA (4.27) और WVMOS (3.89) द्वारा पूरक है। साथ में, ये परिणाम बताते हैं कि फ्रेंच आउटपुट तकनीकी रूप से सटीक हैं और सुनने में बहुत सुखद हैं।

इतालवी (it): Lightning-v2 से इतालवी आउटपुट लगातार मजबूत स्कोर बनाए रखते हैं। NISQA (4.39) अत्यधिक स्वाभाविक आवाज की गुणवत्ता को इंगित करता है, जबकि SSQA (4.63) और WVMOS (4.01) सहज प्रस्तुति और स्पष्टता की पुष्टि करते हैं। ये परिणाम बताते हैं कि इतालवी भाषण स्पष्ट, आकर्षक और श्रोता-अनुकूल है।

डच (nl): Lightning-v2 से डच जनरेशन प्रभावशाली अवधारणात्मक परिणाम दिखाती है। NISQA (4.50) और SSQA (4.55) दोनों बहुत उच्च हैं, जो सहज और स्वाभाविक भाषण को दर्शाते हैं। एक मजबूत WVMOS (4.23) पुष्टि करता है कि आउटपुट विशेष रूप से सुखद और समझने में आसान हैं।

पोलिश (pl): Lightning-v2 से पोलिश भाषण उत्कृष्ट प्रदर्शन प्रदर्शित करता है। NISQA (4.53) और SSQA (4.62) उच्च हैं, जो स्वाभाविकता और स्पष्टता को दर्शाते हैं। एक मजबूत WVMOS (4.47) आगे यह दर्शाता है कि भाषण समझने में आसान और बहुत उच्च कथित गुणवत्ता का है।

रूसी (ru): Lightning-v2 से रूसी आउटपुट लगातार मजबूत अवधारणात्मक मेट्रिक्स प्रदान करते हैं। SIGMOS (3.75) और NISQA (4.57) सहज, स्वाभाविक लगने वाले भाषण का संकेत देते हैं। SSQA (4.59) और अधिक स्पष्टता जोड़ता है, हालांकि दूसरों की तुलना में WVMOS (3.76) थोड़ा कम है। कुल मिलाकर, आउटपुट अत्यधिक सुनने योग्य और स्वाभाविक हैं।

अरबी (ar): Lightning-v2 से अरबी आउटपुट संतुलित गुणवत्ता प्रदर्शित करते हैं। SSQA (4.63) अच्छी स्पष्टता को इंगित करता है, और NISQA (4.13) एक स्वाभाविक आवाज की गुणवत्ता को दर्शाता है। SIGMOS (3.83) सुबोधता की पुष्टि करता है, जबकि कुछ अन्य भाषाओं की तुलना में WVMOS (3.59) कम है। कुल मिलाकर, भाषण स्पष्ट, नपा-तुला और श्रोता-अनुकूल है।

निष्कर्ष

सभी मूल्यांकित भाषाओं में, Lightning-V2 स्वाभाविकता, स्पष्टता और समग्र ऑडियो गुणवत्ता के मेट्रिक्स पर मजबूत प्रदर्शन प्रदर्शित करता है। प्रत्येक भाषा 3.5–4.6 की सीमा में MOS मान प्राप्त करती है, जो मानव-कथित उच्च-गुणवत्ता वाले भाषण के साथ संरेखित होती है। ये परिणाम पुष्टि करते हैं कि Lightning-V2 अंग्रेजी, स्पेनिश, फ्रेंच, इतालवी, डच, पोलिश, रूसी, अरबी और जर्मन में विश्वसनीय रूप से स्वाभाविक, सुबोध और आकर्षक भाषण जनरेट करता है।

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104