
Smallest.ai के Lightning-v2 का बेंचमार्किंग करना एक सामान्य प्रयोजन वाला, स्ट्रीमिंग बहुभाषी TTS मॉडल है जिसे रीयल-टाइम अनुप्रयोगों के लिए डिज़ाइन किया गया है।
Smallest.ai का Lightning-v2 एक सामान्य-उद्देश्य वाला स्ट्रीमिंग बहुभाषी TTS मॉडल है जिसे रीयल-टाइम अनुप्रयोगों के लिए डिज़ाइन किया गया है। Lightning V2 ने खुद को एक बहुमुखी मॉडल साबित किया है, जो 16 भाषाओं का समर्थन करता है और अन्य 9 भाषाएं बीटा परीक्षण में हैं। यह ब्लॉग Eleven Labs के रीयल-टाइम मॉडल (Eleven Flash v2.5) के खिलाफ हमारे Lightning V2 मॉडल के बेंचमार्क परिणाम प्रस्तुत करता है।
हमारे मूल्यांकन में, हमने 24 kHz पर ऑडियो नमूनों को संश्लेषित किया और स्ट्रीमिंग मोड में मॉडल द्वारा उत्पन्न स्थापित भाषण गुणवत्ता मेट्रिक्स के आधार पर नौ भाषाओं (जर्मन, अंग्रेजी, स्पेनिश, फ्रेंच, इतालवी, डच, पोलिश, रूसी और अरबी) में उनका मूल्यांकन किया।
निम्नलिखित अनुभाग उपयोग किए गए मेट्रिक्स का वर्णन करते हैं, समग्र परिणाम प्रस्तुत करते हैं, और भाषा-दर-भाषा प्रदर्शन का विश्लेषण करते हैं।
मीन ऑपरेटिंग स्कोर का एन्सेम्बल
मॉडल द्वारा उत्पन्न ऑडियो की गुणवत्ता का विश्वसनीय रूप से मूल्यांकन करने के लिए, हम मीन ऑपरेटिंग स्कोर मॉडल के एक एन्सेम्बल का उपयोग करते हैं। विभिन्न लेखों के माध्यम से व्यापक शोध के बाद हमने निम्नलिखित चार मेट्रिक्स को चुना है।
इन मेट्रिक्स को विभिन्न तरीकों से मॉडल का मूल्यांकन करने के लिए सावधानीपूर्वक चुना गया था, और नीचे विस्तार से वर्णित किया गया है:
SIGMOS एक वस्तुनिष्ठ, गैर-दखल देने वाला भाषण-गुणवत्ता मेट्रिक्स है जिसे ICASSP 2024 स्पीच सिग्नल इम्प्रूवमेंट चैलेंज में पेश किया गया था, यह फुल-बैंड ऑडियो गुणवत्ता का मूल्यांकन करने में सक्षम है—ऐसा कुछ जिसका अधिकांश न्यूरल मेट्रिक्स ने पहले समर्थन नहीं किया था—जो स्पष्टता, प्रतिध्वनि और शोर जैसे सात अवधारणात्मक आयामों में स्वचालित, मानकीकृत मूल्यांकन को सक्षम बनाता है।
NISQA बिना किसी स्पष्ट संदर्भ की आवश्यकता के एक खराब ऑडियो सिग्नल से भाषण की गुणवत्ता का अनुमान लगाता है। यह न केवल एक समग्र MOS (मीन ओपिनियन स्कोर) प्रदान करता है, बल्कि चार अवधारणात्मक आयामों में विस्तृत भविष्यवाणियां भी करता है: शोर, रंगत, असंततता और लाउडनेस।
SHEET-SSQA MOS व्यापक SHEET टूलकिट—एक स्पीच ह्यूमन इवैल्यूएशन एस्टीमेशन टूलकिट—के भीतर एक मॉडल-आधारित मेट्रिक है, जिसे स्व-पर्यवेक्षित शिक्षण (SSL) अभ्यावेदन का उपयोग करके, विशेष रूप से SSL-MOS मॉडल के माध्यम से मानव मीन ओपिनियन स्कोर (MOS) की भविष्यवाणी करने के लिए डिज़ाइन किया गया है।
WVMOS, भाषण विश्लेषण के लिए व्यापक रूप से उपयोग किया जाने वाला मेट्रिक है। जो बात इसे अलग बनाती है वह है विभिन्न डेटासेट और वक्ताओं में इसकी मजबूती, और यह व्यक्तिगत मानवीय निर्णयों के साथ निकटता से संरेखित है, जो इसे विशेष रूप से TTS और वॉयस कन्वर्शन सिस्टम के बेंचमार्किंग के लिए उपयोगी बनाता है।
हमने दोहराए जाने वाले मूल्यांकनों के लिए इन मॉडलों का विश्वसनीय रूप से उपयोग करने के लिए एक इन-हाउस वॉयस इवैल्यूएशन फ्रेमवर्क भी विकसित किया है।
मूल्यांकन प्रक्रिया और समग्र परिणाम
मेट्रिक्स का उपयोग करके मॉडल का मूल्यांकन करने के लिए, हमने LLMs का उपयोग करके यादृच्छिक रूप से उत्पन्न वाक्यों का एक विविध सेट चुना। फिर हमने ऑनलाइन उपलब्ध संबंधित दस्तावेजों में उल्लिखित दोनों मॉडलों की डिफ़ॉल्ट सेटिंग्स का उपयोग करके इन वाक्यों के लिए ऑडियो उत्पन्न किए। फिर हमने उत्पन्न ऑडियो के लिए इन स्कोर का मूल्यांकन किया जिन्हें हम नीचे साझा कर रहे हैं।
भाषण उत्पादन की तुलना करने के लिए एक निर्णायक संख्या प्राप्त करने के लिए, हम हमारे MOS मॉडल के एन्सेम्बल द्वारा अनुमानित स्कोर के औसत का उपयोग करते हैं
भाषा | Eleven Labs Flash v2.5 | Smallest.ai Lightning v2 |
|---|---|---|
अरबी | 4.048 | 4.042 |
जर्मन | 4.047 | 4.036 |
स्पेनिश | 4.226 | 4.253 |
फ्रेंच | 4.149 | 4.132 |
इतालवी | 4.174 | 4.203 |
डच | 4.202 | 4.239 |
पोलिश | 4.165 | 4.299 |
रूसी | 4.090 | 4.169 |
अंग्रेज़ी | 4.264 | 4.287 |
समग्र | 4.152 | 4.185 |
हमारे विश्लेषण के माध्यम से, हम यह निष्कर्ष निकालते हैं कि हालांकि कुछ भाषाओं में कड़ी टक्कर थी, लेकिन इस कांटे की टक्कर में Lightning v2 आगे है।
ठीक है
भाषा-वार प्रदर्शन विश्लेषण
इस अनुभाग में, हम व्यक्तिगत मेट्रिक्स पर मूल्यांकित भाषाओं के परिणामों का विस्तार से विवरण देते हैं और साथ ही उन नमूनों को प्रस्तुत करते हैं जो अत्यधिक सुबोध और अभिव्यंजक भाषण उत्पन्न करने की मॉडल की क्षमता को प्रदर्शित करते हैं।
जर्मन (de): Lightning-v2 से जर्मन आउटपुट मजबूत MOS प्रेडिक्टर स्कोर प्राप्त करते हैं। SSQA (4.51) और NISQA (4.24) दर्शाते हैं कि श्रोताओं को भाषण स्वाभाविक और सुखद लगेगा। कुल मिलाकर, जर्मन आवाज स्पष्ट, स्वाभाविक और समझने में आसान है।
अंग्रेज़ी (en): Lightning-v2 से अंग्रेजी उत्पादन असाधारण रूप से अच्छा प्रदर्शन करता है। उच्च SSQA (4.54) और NISQA (4.47) स्कोर स्वाभाविक उच्चारण को दर्शाते हैं, और WVMOS (4.26) लगातार स्वाभाविक लगने वाले ऑडियो का सुझाव देता है। एक मजबूत NISQA (3.88) के साथ मिलकर, ये मेट्रिक्स पुष्टि करते हैं कि अंग्रेजी आउटपुट अत्यधिक स्वाभाविक और आकर्षक हैं।
स्पेनिश (es): Lightning-v2 से स्पेनिश आउटपुट अच्छी तरह से संतुलित हैं। SIGMOS (3.83) और NISQA (4.51) उच्चतम स्तर पर हैं, जो सहज, स्वाभाविक लगने वाले भाषण की ओर इशारा करते हैं। SSQA (4.63) उत्कृष्ट है, जबकि WVMOS (4.04) लगातार स्वाभाविक ऑडियो को दर्शाता है। कुल मिलाकर, स्पेनिश भाषण परिष्कृत और समझने में आसान लगता है।
फ्रेंच (fr): Lightning-v2 से फ्रेंच भाषण उत्कृष्ट सुबोधता के साथ मजबूत अवधारणात्मक गुणवत्ता को जोड़ता है। SSQA (4.64) सभी भाषाओं में सबसे अधिक है, जो NISQA (4.27) और WVMOS (3.89) द्वारा पूरक है। साथ में, ये परिणाम बताते हैं कि फ्रेंच आउटपुट तकनीकी रूप से सटीक और सुनने में बहुत सुखद हैं।
इतालवी (it): Lightning-v2 से इतालवी आउटपुट लगातार मजबूत स्कोर बनाए रखते हैं। NISQA (4.39) एक अत्यधिक स्वाभाविक आवाज की गुणवत्ता को दर्शाता है, जबकि SSQA (4.63) और WVMOS (4.01) सहज प्रस्तुति और स्पष्टता की पुष्टि करते हैं। ये परिणाम बताते हैं कि इतालवी भाषण स्पष्ट, आकर्षक और श्रोता-अनुकूल है।
डच (nl): Lightning-v2 से डच उत्पादन प्रभावशाली अवधारणात्मक परिणाम दिखाता है। NISQA (4.50) और SSQA (4.55) दोनों बहुत अधिक हैं, जो सहज और स्वाभाविक भाषण को दर्शाते हैं। एक मजबूत WVMOS (4.23) पुष्टि करता है कि आउटपुट विशेष रूप से सुखद और समझने में आसान हैं।
पोलिश (pl): Lightning-v2 से पोलिश भाषण उत्कृष्ट प्रदर्शन प्रदर्शित करता है। NISQA (4.53) और SSQA (4.62) उच्च हैं, जो स्वाभाविकता और स्पष्टता को दर्शाते हैं। एक मजबूत WVMOS (4.47) आगे यह दर्शाता है कि भाषण समझने में आसान और बहुत उच्च कथित गुणवत्ता का है।
रूसी (ru): Lightning-v2 से रूसी आउटपुट लगातार मजबूत अवधारणात्मक मेट्रिक्स प्रदान करते हैं। SIGMOS (3.75) और NISQA (4.57) सहज, स्वाभाविक लगने वाले भाषण का संकेत देते हैं। SSQA (4.59) और स्पष्टता जोड़ता है, हालांकि दूसरों की तुलना में WVMOS (3.76) थोड़ा कम है। कुल मिलाकर, आउटपुट अत्यधिक सुनने योग्य और स्वाभाविक हैं।
अरबी (ar): Lightning-v2 से अरबी आउटपुट संतुलित गुणवत्ता प्रदर्शित करते हैं। SSQA (4.63) अच्छी स्पष्टता का संकेत देता है, और NISQA (4.13) एक स्वाभाविक आवाज की गुणवत्ता को दर्शाता है। SIGMOS (3.83) सुबोधता की पुष्टि करता है, जबकि WVMOS (3.59) कुछ अन्य भाषाओं की तुलना में कम है। कुल मिलाकर, भाषण स्पष्ट, नपा-तुला और श्रोता-अनुकूल है।
निष्कर्ष
सभी मूल्यांकित भाषाओं में, Lightning-V2 स्वाभाविकता, स्पष्टता और समग्र ऑडियो गुणवत्ता के मेट्रिक्स पर मजबूत प्रदर्शन प्रदर्शित करता है। प्रत्येक भाषा 3.5-4.6 की सीमा में MOS मान प्राप्त करती है, जो मानव-कथित उच्च-गुणवत्ता वाले भाषण के साथ संरेखित होती है। ये परिणाम पुष्टि करते हैं कि Lightning-V2 अंग्रेजी, स्पेनिश, फ्रेंच, इतालवी, डच, पोलिश, रूसी, अरबी और जर्मन में विश्वसनीय रूप से स्वाभाविक, सुबोध और आकर्षक भाषण उत्पन्न करता है।



