बेंचमार्क

वॉइस एआई बेंचमार्क: स्पीच-टू-टेक्स्ट, टेक्स्ट-टू-स्पीच और स्पीच-टू-स्पीच

पल्स, लाइटनिंग और हाइड्रा के लिए वास्तविक दुनिया और सार्वजनिक-मानदंड (पब्लिक-बेंचमार्क) के परिणाम, पूर्ण कार्यप्रणाली और पुनरुत्पादित (रिप्रोड्यूसिबल) स्क्रिप्ट के साथ।

अंतिम बार अपडेट किया गया

19 अगस्त 2026

प्रत्येक परिवर्तन बेंचमार्क इतिहास में लॉग किया जाता है।

अनुभाग 01

तीन संख्याएँ, प्रमाण के तीन स्तर

इस पेज पर मौजूद हर आंकड़े पर एक बैज लगा है, जिसमें इसे मापने वाले का नाम लिखा है। इन तीनों में से केवल एक ही स्वतंत्र रूप से सत्यापित करने योग्य है, और हम ऐसा कहते हैं।

पल्स प्रो · एसटीटी

5.42%

औसत ईएसबी (ESB) शब्द त्रुटि दर

सार्वजनिक ओपन एएसआर (Open ASR) लीडरबोर्ड पर 8 डेटासेट में 86 प्रणालियों में से संयुक्त रूप से दूसरे स्थान पर रहा।

लाइटनिंग v3.1 · टीटीएस

~200ms

पहले बाइट तक का समय (टाइम टू फर्स्ट बाइट)

वेबसॉकेट स्ट्रीमिंग पर एक साथ 40 अनुरोधों पर। एक L40S पर रीयल-टाइम फैक्टर 3.3×।

हाइड्रा · एस2एस

1,624ms

टूल की आवाज़-से-आवाज़ (वॉइस-टू-वॉइस) विलंबता

AIEWF पर 9 प्रोडक्शन मॉडलों का औसत, सबसे तेज़। टूल कॉल के बिना median 864 ms।

हाइड्रा · एस2एस

1,624ms

टूल की आवाज़-से-आवाज़ (वॉइस-टू-वॉइस) विलंबता

AIEWF पर 9 प्रोडक्शन मॉडलों का औसत, सबसे तेज़। टूल कॉल के बिना median 864 ms।

इस पेज पर तुलना किए गए प्रदाता

डीपग्राम

कार्टेशिया

ओपनएआई

असेंबलीएआई

मर्फ

स्पीचमैटिक्स

वेलसैड

सोनियोक्स

ग्लैडिया

एनवीडिया

इलेवनलैब्स

सर्वम

भाग 02

विलंबता की तुलना

एक साझा मिलीसेकंड स्केल पर प्लॉट किया गया है ताकि वास्तविक स्प्रेड दिखाई दे। औसत उन कॉल्स को छुपा देते हैं जो टूटे हुए लगते हैं, इसलिए जहां भी परसेंटाइल मौजूद होते हैं, वे दिखाई देते हैं।

स्पीच-टू-टेक्स्ट, पहले ट्रांसक्रिप्ट तक का समय

सबसे तेज़ पहले के क्रम में व्यवस्थित किया गया। ठोस मार्कर एक बिंदु माप है, कैप्सूल P50 से P90 तक की अवधि है।

स्पीचमैटिक्स फ्लो केवल 1-सेकंड से कम का आंकड़ा प्रकाशित करता है, जो ईमानदारी से प्लॉट करने के लिए बहुत मोटा है।

150 मिलीसेकंड से कम

150 से 300 एमएस (ms)

300 मिलीसेकंड से अधिक

सबसे छोटा मापा गया

स्पेको

टेक्स्ट-टू-स्पीच, पहले ऑडियो तक का समय

सबसे तेज़ वाले को पहले क्रमबद्ध किया गया है। वेंडर की श्रेणियों को उनके पूरे स्पैन में कैप्सूल के रूप में खींचा गया है, न कि मध्यबिंदु पर संकुचित किया गया है।

इन आंकड़ों के अनुसार मर्फ़ (Murf) और कार्टेशिया (Cartesia) लाइटनिंग (Lightning) से अधिक तेज़ हैं। कार्टेशिया का आंकड़ा 90वां पर्सेंटाइल है और वेलसैड (WellSaid) का आंकड़ा प्रति 30 अक्षरों के हिसाब से है, इसलिए इस पूरे सेट को एक समान मापदंड पर नहीं मापा गया है।

200 ms से कम

200 से 300 मिलीसेकंड

400 ms से अधिक

सबसे छोटा मापा गया

हमारे अपने आंकड़े असहमत हैं। आंतरिक स्रोत पल्स के पहले ट्रांसक्रिप्ट के समय को 64 ms और 70 ms दोनों बताते हैं, और डीपग्राम नोवा 3 को 71 ms और 100 ms दोनों बताते हैं। लाइटनिंग हमारे तुलनात्मक पृष्ठों पर एंड-टू-एंड 100 ms और दस्तावेज़ों में पहले बाइट का समय ~200 ms दिखाई देता है, और एंड-टू-एंड इसके अपने पहले बाइट से तेज़ नहीं हो सकता। हमारे लिए रूढ़िवादी आंकड़ा और प्रतिस्पर्धियों के लिए अनुकूल आंकड़ा तब तक प्लॉट किया गया है जब तक कि एक सिंगल रन इसे हल नहीं कर देता।

प्रतिशतक (परसेंटाइल) क्यों, माध्य (मीन) क्यों नहीं

एक वॉयस एजेंट का मूल्यांकन उसके सबसे खराब प्रदर्शन के आधार पर किया जाता है। 200 ms औसत और 2 सेकंड P99 वाला मॉडल, 300 ms औसत और 400 ms P99 वाले मॉडल की तुलना में अधिक बार खराब महसूस होता है, और केवल औसत मान आपको यह नहीं बता सकता कि आपके पास कौन सा मॉडल है। जहाँ हमारे पास प्रतिशतक (percentiles) उपलब्ध हैं, हम उन्हें प्रकाशित करते हैं और जहाँ नहीं हैं, वहाँ अंतर को चिह्नित करते हैं।

अनुभाग 03

हम बेंचमार्क कैसे करते हैं

पैरामीटर पहले ही स्पष्ट रूप से बता दिए गए हैं, न कि किसी खुलासे के पीछे छिपाए गए हैं। सार्वजनिक बेंचमार्क को ओवरफिट और प्रभावित किया जा सकता है, जो कि आपकी कार्यप्रणाली को दिखाने का एक तर्क है, न कि किसी एक संख्या के पीछे छिपने का।

डेटासेट

ईएसबी (ESB) सुइट, 9 डेटासेट, अंग्रेजी। बहुभाषी के लिए फ्लर्स (FLEURS), 26 भाषाएं। खराब रिकॉर्डिंग स्थितियों के लिए वाइल्डएएसआर (WildASR)। आंतरिक अंग्रेजी और हिंदी विरूपण (perturbation) सुइट्स। इमर्जेंटटीटीएस (EmergentTTS), 1,645-नमूनों के सार्वजनिक सेट से लिए गए 1,088 नमूने। एआईईडब्ल्यूएफ (AIEWF), 30 टर्न के 10 रनों में 300 कार्य। साथ ही 44 वास्तविक हिंदी-अंग्रेजी संग्रह कॉल।

सटीकता मीट्रिक

Whisper नॉर्मलाइज़र के तहत शब्द त्रुटि दर (Word error rate), साथ में वर्ण त्रुटि दर (character error rate) भी दी गई है। यह विकल्प महत्वपूर्ण है: एक तीसरे पक्ष के बोर्ड ने पल्स को 8.0% पर रिपोर्ट किया, जहां इनवर्स टेक्स्ट नॉर्मलाइज़ेशन ने शब्दों में लिखे गए नंबरों को त्रुटियों के रूप में गिना, जबकि अन्यथा यह 5.1% था। नंबरों से भरपूर कॉल ऑडियो पर नॉर्मलाइज़र उत्तर को बदल देता है।

विलंबता मीट्रिक

पहले ट्रांसक्रिप्ट का समय भाषण के समाप्त होने से लेकर पूरे ट्रांसक्रिप्ट तक चलता है। पहले बाइट का समय प्राप्त पहला ऑडियो बाइट होता है। वॉयस-टू-वॉयस का मतलब उपयोगकर्ता के भाषण के समाप्त होने से लेकर एजेंट के ऑडियो शुरू होने तक का समय है। इसे P50, P90, P95 और P99 के रूप में रिपोर्ट किया जाता है, जहाँ भी रन ने उन्हें उत्पन्न किया है।

ग्राउंड ट्रुथ (वास्तविक तथ्य)

कॉल बेंचमार्क के लिए मैन्युअल मानव ट्रांसक्रिप्शन। सार्वजनिक डेटासेट अपने स्वयं के प्रकाशित संदर्भों का उपयोग करते हैं, जिनमें कोई संशोधन नहीं किया गया है।

हार्डवेयर

सिंगल L40S, 48 GB पर थ्रूपुट। 16 kHz linear16 पर स्ट्रीमिंग परीक्षण। प्रतिस्पर्धी मॉडल उनके सार्वजनिक प्रोडक्शन API के माध्यम से कॉल किए गए हैं, न कि सेल्फ-होस्टेड।

रीफ़्रेश करने की आवृत्ति

त्रैमासिक रूप से, और तुरंत जैसे ही तुलना सेट में कोई भी मॉडल नया संस्करण शिप करता है। प्रत्येक तालिका की अपनी माप तिथि होती है।

इसे फिर से बनाएं

मूल्यांकन वॉकथ्रू और स्क्रिप्ट सार्वजनिक हैं, और नीचे दिए गए प्रत्येक परिणाम को आपके अपने ऑडियो के साथ फिर से जनरेट किया जा सकता है।

अनुभाग 04

भाषण-से-पाठ (स्पीच-टू-टेक्स्ट)

साफ़ बेंचमार्क ऑडियो और वास्तविक कॉल रिकॉर्डिंग पर समान मॉडल देखने के लिए व्यवस्था (regimes) बदलें।

स्पष्ट बेंचमार्क

असली कॉल ऑडियो

डोमेन के अनुसार ESB सुइट शब्द त्रुटि दर। कम होना बेहतर है, हरा रंग प्रत्येक पंक्ति में सबसे अच्छे मॉडल को दर्शाता है।

डोमेन

ऑडियोबुक, स्पष्ट

ऑडियोबुक, शोरगुल वाली

क्राउडसोर्स्ड

संसद

टेड टॉक्स (TED talks)

पॉडकास्ट

वित्तीय

अर्निंग्स कॉल्स

बैठकें

कुल मिलाकर

डेटासेट

लिब्रीस्पीच क्लीन

लिब्रीस्पीच अदर

कॉमन वॉयस

वॉक्सपॉपुली

टेड-लियम (TED-LIUM)

गीगास्पीच

एसपीजीआईस्पीच (SPGISpeech)

कमाई22

एएमआई

सकल

पल्स

2.46

5.31

10.89

7.16

४.०७

10.43

2.86

12.25

10.58

7.33

असेंबलीएआई

1.65

2.86

6.73

7.28

२.९५

9.12

1.74

11.52

14.60

6.49

डीपग्राम

3.20

6.60

14.22

9.55

3.59

10.05

२.९९

15.79

17.04

9.23

इलेवनलैब्स

1.97

४.४५

9.83

7.91

3.16

9.66

4.40

12.20

12.23

7.31

स्मालेस्ट (Smallest) की पल्स (Pulse) उपलब्धि। पल्स ने संसदीय भाषण और बैठकों में जीत हासिल की है, जो कि दो सबसे कठिन मल्टी-स्पीकर स्थितियां हैं। यह भी ध्यान दें कि पल्स यहां कुल मिलाकर 7.33 पर स्ट्रीम होता है, जबकि 5.42% की मुख्य सुर्खी प्री-रिकॉर्डेड पथ पर पल्स प्रो (Pro) की है। ये अलग-अलग मॉडल हैं। हालांकि असेंबली एआई (Assembly AI) 9 में से 7 डोमेन और कुल योग में आगे है, और इलेवनलैब्स स्क्राइब (ElevenLabs Scribe) कुल मिलाकर पल्स से 0.02 आगे है।

भाषा के आधार पर FLEURS स्ट्रीमिंग वर्ड एरर रेट (WER), डीपग्राम नोवा 3 के मुकाबले पल्स

भाषा

इतालवी

स्पैनिश

अंग्रेज़ी

पुर्तगाली

हिंदी

जर्मन

फ़्रेंच

मराठी

गुजराती

पल्स

4.41

5.99

6.03

8.32

8.30

9.50

10.71

15.68

20.05

डीपग्राम नोवा 3

6.99

7.55

11.21

11.46

15.46

10.15

12.07

समर्थित नहीं है

समर्थित नहीं है

अनुपात

1.6x

1.3x

1.9 गुना

1.4x

1.19

1.1x

1.1x

मराठी और गुजराती में कोई डीपग्राम (Deepgram) कॉलम नहीं है क्योंकि मॉडल उनके अंतर्गत नहीं आता है। कवरेज अपने आप में एक परिणाम है।

सबसे छोटा मापा गया

वाइल्डएएसआर (WildASR) मजबूती, खराब रिकॉर्डिंग स्थितियों में वर्ड एरर रेट (शब्द त्रुटि दर)

स्थिति

स्पष्ट ऑडियो

लहजे वाली आवाज़

फ़ोन कोडेक

पृष्ठभूमि का शोर

गूँज

दूर-क्षेत्र का माइक

क्लिपिंग

कुल मिलाकर

पल्स

5.98

5.82

7.19

8.90

9.06

13.38

14.03

9.63

असेंबलीएआई

3.33

2.80

3.45

४.०४

23.50

26.07

6.59

12.52

डीपग्राम

11.62

7.31

9.13

15.04

२७.२७

62.99

४३.३५

28.17

इलेवनलैब्स

4.24

4.01

4.98

6.30

6.48

7.38

11.20

6.74

ElevenLabs Scribe समग्र रूप से यहाँ सबसे मजबूत मॉडल है। सबसे महत्वपूर्ण निष्कर्ष विफलता के तौर-तरीकों (failure modes) के बारे में है: AssemblyAI साफ ऑडियो पर सबसे सटीक है, फिर भी दूर-दराज की आवाज़ों (far-field) पर यह गिरकर 26.07 और गूँज (reverberation) पर 23.50 तक पहुँच जाता है, जबकि Deepgram दूर-दराज की आवाज़ों पर 62.99 तक पहुँच जाता है। Pulse अधिकांश एकल स्थितियों में पीछे रह जाता है, लेकिन यह कभी भी पूरी तरह से विफल नहीं होता है, और यही बात सबसे महत्वपूर्ण होती है जब आप इस बात को नियंत्रित नहीं कर सकते कि आपके कॉल करने वालों की आवाज़ कैसे रिकॉर्ड की जा रही है।

सबसे छोटा मापा गया

पल्स (Pulse): 21 स्ट्रीमिंग भाषाएं, 26 प्री-रिकॉर्डेड।
पल्स प्रो (Pulse Pro): केवल अंग्रेजी, केवल HTTP, स्ट्रीमिंग वर्कर रोडमैप पर है। 1x L40S पर थ्रूपुट 250-300 गुना वास्तविक समय (real time) है।
मूल्य निर्धारण: हमारी अपनी सामग्री रीयल-टाइम पल्स के लिए प्रति मिनट $0.003, $0.004, $0.005 और $0.008 का उद्धरण देती है। मिलान होने तक यहाँ प्रकाशित नहीं किया जाएगा।

अनुभाग 05

सार्वजनिक बेंचमार्क बनाम आपका वास्तविक ऑडियो

FLEURS पर हमारी हिंदी शब्द त्रुटि दर (word error rate) 8.30% है और वास्तविक कलेक्शन कॉल्स पर 29.1% है। दोनों मापे गए हैं। दोनों में से कोई भी गलत नहीं है।

एक ही मॉडल, एक ही भाषा, दो प्रकार के ऑडियो

शब्द त्रुटि दर (वर्ड एरर रेट)। जितना कम हो उतना बेहतर है।

रीड-स्पीच बेंचमार्क अच्छी परिस्थितियों में रिकॉर्ड किए गए साफ, स्क्रिप्टेड ऑडियो को मापते हैं। प्रोडक्शन कॉल कोड-स्विच्ड, शोरगुल वाली, सहज और टेलीफोनी कोडेक्स द्वारा कंप्रेस्ड होती हैं। हमारे लिए यह अंतर लगभग 3.5× है और सर्वम (Sarvam) के लिए भी 3.5× है, इसलिए यह किसी एक मॉडल के बजाय ऑडियो की विशेषता है।


हम दोनों को प्रकाशित करते हैं क्योंकि एक अकेला नंबर आपको गुमराह कर सकता है। कोई भी वेंडर जो भी आंकड़ा देता है, वह शायद आसान वाला होता है, और एकमात्र नंबर जो आपके प्रोडक्शन की सटीकता का अनुमान लगाता है, वह वह है जिसे आप अपनी खुद की रिकॉर्डिंग पर मापते हैं।

भाग 06

वास्तविक हिंदी-अंग्रेज़ी कॉल ऑडियो

मैन्युअल रूप से तैयार किए गए मानव ट्रांसक्रिप्ट के मुकाबले स्कोर किए गए, 44 वास्तविक कलेक्शन कॉल्स पर पांच प्रदाता। हम छह में से दो श्रेणियों में जीतते हैं। अन्य चार को बिना किसी बदलाव के प्रकाशित किया गया है।

हरा रंग श्रेणी के विजेता को दर्शाता है। रिकॉल स्कोर 0 से 1 तक होते हैं, जितना अधिक हो उतना बेहतर है। जुलाई 2026।

डेटासेट

सबसे छोटा एआई

पल्स

डीपग्राम

नोवा 3

सर्वम एआई

सारस

इलेवनलैब्स

स्क्राइब, मुख्य शब्द

इलेवनलैब्स

मुंशी, मानक

डब्ल्यूईआर

0.291

0.325

0.376

0.460

0.554

ऋण की शर्तें

0.872

०.९१९

0.910

0.902

0.815

भुगतान करने का वादा

0.557

0.509

०.५०२

0.432

0.381

संख्याएँ

0.387

0.282

0.381

0.410

0.389

राशि

0.334

0.280

0.330

०.३४९

0.313

तारीखें

०.५३१

0.510

0.522

0.611

0.485

इससे क्या सीखें

पल्स सबसे सटीक और सबसे सुसंगत ट्रांसक्रिप्ट देता है। लोन से जुड़ी शब्दावली पर डीपग्राम सबसे मजबूत है। इलेवनलैब्स कीटर्म्स वित्तीय संस्थाओं को सबसे अच्छे से कैप्चर करता है लेकिन उनके आसपास ध्यान देने योग्य रूप से खराब ट्रांसक्रिप्ट तैयार करता है। मानक इलेवनलैब्स की तुलना में हमेशा कीटर्म्स को चुनें; यह समान गति और लागत पर हर मीट्रिक में जीतता है।

उद्योग-व्यापी अंतर

सभी पांच प्रदाताओं के मामले में, राशियों और नंबरों को सटीक रूप से याद रखने (रिकॉल) की दर कम रही और कोई भी 0.35 के स्तर को पार नहीं कर पाया। यह किसी एक उत्पाद की कमी होने के बजाय पूरी श्रेणी के लिए एक अनसुलझी समस्या है, और इसका मतलब यह है कि आप चाहे कोई भी एपीआई (API) चुनें, किसी भी राशि-महत्वपूर्ण वर्कफ़्लो के लिए एक सत्यापन चरण (वेरिफिकेशन स्टेप) की आवश्यकता होगी।

दायरा और सीमाएँ। 44 रिकॉर्डिंग, जुलाई 2026, एक ही डोमेन से हिंदी-अंग्रेजी संग्रह और ऋण-सर्विसिंग कॉल। ग्राउंड ट्रुथ मैनुअल मानव ट्रांसक्रिप्शन है। डेटासेट में कोई शोर-स्थिति (noise-condition) लेबल और कोई भाषा-मिश्रण विश्लेषण शामिल नहीं है, इसलिए यहाँ दी गई कोई भी जानकारी विशिष्ट शोर के स्तर या कोड-स्विचिंग अनुपात के बारे में निष्कर्ष का समर्थन नहीं करती है। n=44 पर, आस-पास के मॉडलों के बीच छोटे अंतर महत्वपूर्ण नहीं हो सकते हैं।

भाग 07

एंटिटी-स्तरीय रिकॉल

शब्द त्रुटि दर (वर्ड एरर रेट) हर शब्द को एक समान मानती है। कलेक्शन कॉल में, दस छूटे हुए निरर्थक शब्दों की तुलना में एक छूटा हुआ रुपये का आंकड़ा अधिक मायने रखता है। कोई भी सार्वजनिक लीडरबोर्ड इसे नहीं मापता है, इसलिए हमने इसे परिभाषित किया है।

ऋण की शर्तें

क्या मॉडल ने ऋण शब्दावली जैसे कि ईएमआई (EMI), कार्यकाल और ब्याज को शामिल किया।

भुगतान करने का वादा

क्या इसमें प्रतिबद्धता वाले वाक्यांश जैसे कि "मैं इस तारीख तक भुगतान कर दूँगा" (I will pay by) या "आज ट्रांसफर कर दूँगा" (will transfer today) कैप्चर हुए?

संख्याएँ

क्या इसने बोले गए संख्यात्मक मानों को सही ढंग से ट्रांसक्राइब किया।

धनराशि

क्या इसने बोले गए रुपये के आंकड़ों को कैप्चर किया।

स्कोरिंग

सभी का स्कोर 0 से 1 के बीच रहा और 44 रिकॉर्डिंग्स का औसत निकाला गया। ये सबसे छोटे-परिभाषित (Smallest-defined) मेट्रिक्स हैं। बाहरी टीम द्वारा इन्हें दोबारा तैयार करने से पहले, टर्म लिस्ट और मैचिंग लॉजिक को अभी प्रकाशित किया जाना बाकी है।

भुगतान-का-वादा वापस लेना (प्रॉमिस-टू-पे रिकॉल)

0 से 1 के पूरे पैमाने पर जितना अधिक हो उतना बेहतर है ताकि अंतरालों का वास्तविक आकार दिखाई दे सके।

धनराशि वापसी

टूटी हुई रेखा (डैश वाली रेखा) 0.35 को दर्शाती है। कोई भी प्रदाता इसे पार नहीं कर पाता है।

खंड 08

लिखावट से वाचन

इमर्जेंटटीटीएस (EmergentTTS) बेंचमार्क पर ब्लाइंड हेड-टू-हेड श्रोता प्राथमिकता, और फिर उन्हीं मॉडलों को हर आयाम (डायमेंशन) के आधार पर रेट किया गया।

प्रत्येक प्रतियोगी के खिलाफ लाइटनिंग की जीत की दर

1,088 नमूने। ठोस रेखा 50% को दर्शाती है, जहाँ किसी भी मॉडल को प्राथमिकता नहीं दी गई है।

GPT-4o-mini TTS इस बेंचमार्क पर Lightning को पछाड़ देता है। वह पंक्ति बनी रहेगी। ये 1,088 नमूने सार्वजनिक EmergentTTS सेट के 1,645 नमूनों का एक उपसमुच्चय (subset) हैं।

सबसे छोटा मापा गया

प्राकृतिकता

मीट्रिक

कुल मिलाकर

प्राकृतिकता

स्वर-शैली

स्वर-शैली (Prosody)

लाइटनिंग प्रो

3.16

२.५५

3.06

2.81

जीपीटी-4ओ-मिनी

3.13

2.41

3.06

2.73

ईएल टर्बो v2.5

3.16

2.52

3.07

2.73

सोनिक-3

3.20

2.57

3.12

2.83

अभिव्यक्तिशीलता

कुल मिलाकर

पराभाषिकी

भावनाएं

3.55

3.64

३.४७

3.45

3.60

3.30

3.44

3.59

3.28

3.38

3.56

2.83

एमओएस वी2

औसत MOS

यूटीएमओएस (UTMOS), अनुमानित

डब्ल्यूवी-एमओएस (WV-MOS), अनुमानित

4.22

3.77

5.05

4.16

3.76

४.५५

3.98

३.३७

४.६०

3.76

2.77

4.76

डिलीवरी

प्राकृतिक गति

प्लेसमेंट रोकें

प्राकृतिक सांस लेना

उच्चारण शैली

सीमा निरंतरता

4.72

४.६६

3.82

4.98

४.९६

4.57

4.54

3.06

४.९६

4.94

4.51

४.४९

3.14

4.95

4.93

4.01

४.२८

2.79

४.९६

4.93

प्रदर्शन लाइटनिंग का लाभ अभिव्यक्ति, प्रदायगी और सांस लेने में है, जहां अंतर बड़ा है: प्राकृतिक रूप से सांस लेने पर 2.79 के मुकाबले 3.82। यह ऊपर दिए गए हेड-टू-हेड चार्ट का भी खंडन करता है, जहां 68.3% मामलों में सोनिक-3 की तुलना में लाइटनिंग को प्राथमिकता दी गई थी। ब्लाइंड वरीयता और आयामी रेटिंग विभिन्न चीजों को मापती हैं, और केवल चापलूसी वाली रेटिंग के बजाय दोनों की रिपोर्ट की जाती है। UTMOS और WV-MOS मॉडल द्वारा अनुमानित हैं, न कि मानव रेटिंग।

सिंथेसिस सटीकता, जिसे व्हिस्पर (Whisper) के साथ वापस ट्रांसक्राइब किया गया और इनपुट टेक्स्ट के मुकाबले स्कोर किया गया

मीट्रिक

लाइटनिंग v3.1

लाइटनिंग v3.1 प्रो

वर

1.57%

1.36%

सीईआर

0.67%

0.40%

मतिभ्रम

0.03%

0.00%

हिन्दी, तमिल, कन्नड़, तेलुगु, मलयालम, मराठी और गुजराती सहित 15 भाषाएं, स्वचालित भाषा पहचान और वाक्य के बीच में भाषा बदलने की सुविधा के साथ।
40 समवर्ती स्ट्रीम पर पहले बाइट तक का समय लगभग 200 मिलीसेकंड।
मूल्य निर्धारण: एक ही उत्पाद के लिए हमारी अपनी सामग्रियों में तीन अलग-अलग आंकड़े दिखाई देते हैं, प्रति 10 हजार वर्णों पर $0.05, $0.145 और $0.175। समाधान होने तक यहां प्रकाशित नहीं किया गया है।

अनुभाग 09: बीटा

भाषण-से-भाषण

AIEWF बेंचमार्क पर 9 प्रोडक्शन मॉडलों में वॉयस-टू-वॉयस लेटेंसी (देरी): 300 कार्य, 30 बारी वाले 10 रन

टूल-कॉल वॉइस-टू-वॉइस लेटेंसी, औसत

जितना कम हो उतना बेहतर है। बिंदीदार रेखा (डैश्ड लाइन) 2 सेकंड को दर्शाती है, जहाँ से प्रतिक्रिया धीमी महसूस होने लगती है।

बिना किसी टूल वाले वॉयस-टू-वॉयस का मीडियन 864 मिलीसेकंड है, जो इस सेट में सबसे तेज़ गति के बराबर है। परसेंटाइल डिस्ट्रीब्यूशन अभी तक प्रकाशित नहीं किए गए हैं।

सबसे छोटा मापा गया

कार्य प्रदर्शन, AIEWF सफलता दर और ऑडियो मल्टीचैलेंज

मॉडल

हाइड्रा

अल्ट्रावॉक्स v0.7

जीपीटी रीयलटाइम 1.5

जीपीटी रीयलटाइम

जीपीटी रीयलटाइम 2

डब्ल्यूईआर (WER)

95.9

97.7%

93.3%

86.7%

नहीं चला

ऑडियो मल्टीचैलेंज

35.52%

नहीं चला

34.73%

नहीं चला

37.61%

धारा 10

कार्यप्रणाली और परिवर्तन लॉग

डेटासेट इन्वेंट्री, उत्पत्ति नीति (provenance policy), और वे खुले मामले जिन्हें हमने हल नहीं किया है।

डेटासेट इन्वेंट्री

बेंचमार्क

ईएसबी सूट

फ्लर्स

वाइल्ड एएसआर (WildASR)

इमर्जेंटटीटीएस (EmergentTTS)

एआईईडब्ल्यूएफ (AIEWF)

ऑडियो मल्टी-चैलेंज

हिंदी-अंग्रेज़ी कॉल

पर्टर्बेशन सूट्स

दायरा

9 डेटासेट, अंग्रेजी

26 भाषाएँ, बोली जाने वाली भाषा पढ़ें

7 गिरावट की स्थितियां

1645 नमूनों में से 1,088

300 कार्य, 10x30 बारी

बहु-चरणीय ऑडियो तर्क (Multi-turn audio reasoning)

44 संग्रह रिकॉर्डिंग

अंग्रेजी और हिंदी

में उपयोग किया जाता है

भाग 04

अनुभाग 04, 05

अनुभाग 04

अनुभाग 08

अनुभाग 09

अनुभाग 09

अनुभाग 05, 06, 08

अनुभाग 04

सार्वजनिक रूप से उपलब्ध

हाँ

हाँ

हाँ

हाँ

हाँ

हाँ

नहीं, आंतरिक

नहीं, आंतरिक

धारा 11

अक्सर पूछे जाने वाले प्रश्न

आपके हिंदी के दोनों नंबरों में इतना अंतर क्यों है?

वर्ड एरर रेट (शब्द त्रुटि दर) क्या है?

TTFB, TTFT और वॉइस-टू-वॉइस (voice-to-voice) में क्या अंतर है?

क्या ये संख्याएं स्वतंत्र हैं?

शोरगुल वाले कॉल ऑडियो के लिए मुझे किस मॉडल का उपयोग करना चाहिए?

क्या आप हिंदी और कोड-स्विचिंग (भाषाओं को मिलाना) का समर्थन करते हैं?

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104