शब्दकोश पर वापस जाएँ

वक्ता वर्गीकरण (स्पीकर डायराइजेशन)

वक्ता वर्गीकरण (स्पीकर डायराइजेशन)

त्वरित उत्तर

स्पीकर डायराइजेशन (Speaker diarization) एक ऑडियो स्ट्रीम को इस आधार पर अलग-अलग हिस्सों में बांटने की प्रक्रिया है कि कौन बोल रहा है। यह स्पीकर के बदलावों का पता लगाकर, बोलने वाले के हिसाब से भाषण के हिस्सों को समूहित करके, और प्रत्येक हिस्से को एक स्पीकर टैग देकर "किसने कब बोला" सवाल का जवाब देता है। इसके लिए बोलने वालों की आवाज़ या प्रतिभागियों की संख्या के बारे में पहले से जानकारी होना ज़रूरी नहीं है।

विषय-सूची
No headings found in #article-body

एआई (AI) के साथ सारांशित करें

प्रोडक्शन-रेडी स्पीच AI के साथ निर्माण करें

सिर्फ एक API के साथ अपने ऐप में रीयल-टाइम ट्रांसक्रिप्शन और सजीव आवाज़ जोड़ें।

विषय-सूची
No headings found in #article-body

एआई (AI) के साथ सारांशित करें

प्रोडक्शन-रेडी स्पीच AI के साथ निर्माण करें

सिर्फ एक API के साथ अपने ऐप में रीयल-टाइम ट्रांसक्रिप्शन और सजीव आवाज़ जोड़ें।

स्पीकर डायराइजेशन कैसे काम करता है

स्पीकर डायराइजेशन कई सिग्नल-प्रोसेसिंग और मशीन-लर्निंग चरणों को जोड़ता है ताकि यह निर्धारित किया जा सके कि रिकॉर्डिंग में प्रत्येक बिंदु पर कौन सा स्पीकर सक्रिय है। मुख्य पाइपलाइन में आम तौर पर वॉइस एक्टिविटी डिटेक्शन (VAD), स्पीकर सेगमेंटेशन, एम्बेडिंग एक्सट्रैक्शन और क्लस्टरिंग शामिल होते हैं।

प्रमुख चरण

  • वॉइस एक्टिविटी डिटेक्शन (सक्रियता पहचान): ऑडियो के उन क्षेत्रों की पहचान करता है जिनमें भाषण शामिल है, जिससे मौन और पृष्ठभूमि के शोर को फ़िल्टर किया जा सके।

  • स्पीकर सेगमेंटेशन: निरंतर भाषण को छोटे, सजातीय खंडों में विभाजित करता है जहां केवल एक स्पीकर सक्रिय होता है। चेंज-पॉइंट डिटेक्शन एल्गोरिदम उन सीमाओं का पता लगाते हैं जहां स्पीकर की पहचान बदलती है।

  • एम्बेडिंग एक्सट्रैक्शन: आवाज की विशेषताओं को कैप्चर करने के लिए प्रशिक्षित न्यूरल नेटवर्क का उपयोग करके प्रत्येक खंड को एक निश्चित लंबाई वाले वेक्टर (स्पीकर एम्बेडिंग) में परिवर्तित किया जाता है। सामान्य आर्किटेक्चर में x-वेक्टर और ECAPA-TDNN मॉडल शामिल हैं।

  • क्लस्टरिंग: एम्बेडिंग्स को इस तरह से समूहीकृत किया जाता है कि एक ही स्पीकर के खंड एक क्लस्टर साझा करें। एग्लोमेरेटिव हायरार्जिकल क्लस्टरिंग और स्पेक्ट्रल क्लस्टरिंग व्यापक रूप से उपयोग किए जाने वाले दृष्टिकोण हैं।

स्पीकर सेगमेंटेशन बनाम डायराइजेशन

स्पीकर सेगमेंटेशन विशेष रूप से उन समय सीमाओं का पता लगाने को संदर्भित करता है जहां स्पीकर परिवर्तन होता है। डायराइजेशन एक व्यापक कार्य है जिसमें सेगमेंटेशन के साथ-साथ एक ही व्यक्ति से संबंधित सभी खंडों में एक सुसंगत स्पीकर लेबल का असाइनमेंट शामिल है। सेगमेंटेशन पूर्ण डायराइजेशन पाइपलाइन के भीतर एक घटक है।

रीयल-टाइम स्पीकर डायराइजेशन

रीयल-टाइम (या ऑनलाइन) स्पीकर डायराइजेशन ऑडियो के आने के साथ ही उसका क्रमिक रूप से विश्लेषण करता है, न कि पूरी रिकॉर्डिंग के समाप्त होने का इंतजार करता है। यह लाइव ट्रांसक्रिप्शन (प्रतिलेखन), वर्चुअल मीटिंग्स और संपर्क-केंद्र एनालिटिक्स के लिए आवश्यक है। ऑनलाइन प्रणालियों को अतिरिक्त चुनौतियों का सामना करना पड़ता है जैसे कि लेटेंसी बाधाएं और संपूर्ण ऑडियो इतिहास को फिर से संसाधित किए बिना बीच-बीच में आने वाले नए वक्ताओं को संभालना।

टूल्स और फ्रेमवर्क्स

कई ओपन-सोर्स प्रोजेक्ट्स स्पीकर डायराइजेशन को डेवलपर्स के लिए सुलभ बनाते हैं। पायथन लाइब्रेरी जैसे pyannote.audio (हगिंग फेस पर उपलब्ध) प्री-ट्रेंड पाइपलाइन्स प्रदान करती हैं जिन्हें कस्टम डेटा पर ठीक से ट्यून किया जा सकता है। OpenAI का Whisper मॉडल भाषण पहचान को संभालता है लेकिन स्वाभाविक रूप से डायराइजेशन नहीं करता है; हालाँकि, कम्युनिटी इंटीग्रेशन व्हिस्पर ट्रांसक्रिप्शन को अलग डायराइजेशन मॉड्यूल के साथ जोड़कर स्पीकर-एट्रिब्यूटेड ट्रांसक्रिप्ट तैयार करते हैं। गिटहब पर रिपॉजिटरी एंड-टू-एंड समाधान प्रदान करती हैं और डायराइजेशन एरर रेट (DER) जैसे मेट्रिक्स का उपयोग करके डायराइजेशन सटीकता का मूल्यांकन करने के लिए बेंचमार्क प्रदान करती हैं।

सामान्य अनुप्रयोग

  • मीटिंग ट्रांसक्रिप्शन और सारांशीकरण

  • कॉल-सेंटर एनालिटिक्स और अनुपालन निगरानी

  • मीडिया इंडेक्सिंग और पॉडकास्ट प्रोडक्शन

  • चिकित्सीय दस्तावेजीकरण और अदालत की रिकॉर्डिंग

संबंधित संसाधन

अक्सर पूछे जाने वाले प्रश्न

अक्सर पूछे जाने वाले प्रश्न

स्पीकर डायराइजेशन (speaker diarization) को सक्षम करने का अर्थ है एक स्पीच-प्रोसेसिंग सिस्टम में उस विशेषता को सक्रिय करना जो ऑडियो स्ट्रीम में अलग-अलग बोलने वालों की स्वचालित रूप से पहचान करती है और उन्हें लेबल करती है। सक्षम होने पर, सिस्टम ट्रांसक्रिप्ट के प्रत्येक हिस्से को बोलने वाले की पहचान (स्पीकर आईडी) के साथ टैग करता है ताकि आप देख सकें कि किसने क्या कहा था।

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104