शब्दकोश पर वापस जाएँ

मेल स्पेक्ट्रोग्राम

मेल स्पेक्ट्रोग्राम

त्वरित उत्तर

मेल स्पेक्ट्रोग्राम (mel spectrogram) समय के साथ किसी ऑडियो सिग्नल की आवृत्ति (फ्रीक्वेंसी) सामग्री का एक विज़ुअल प्रतिनिधित्व है, जिसे मेल स्केल पर मैप किया जाता है, जो यह अनुमान लगाता है कि इंसान पिच को कैसे महसूस करते हैं। उच्च आवृत्तियों को संकुचित करके और निचली आवृत्तियों को विस्तारित करके, मेल स्पेक्ट्रोग्राम अवधारणात्मक रूप से महत्वपूर्ण विशेषताओं को कैप्चर करते हैं, जिससे वे स्पीच रिकग्निशन (भाषण पहचान), वॉयस सिंथेसिस (आवाज संश्लेषण) और अन्य ऑडियो मशीन लर्निंग कार्यों के लिए एक मानक इनपुट बन जाते हैं।

विषय-सूची
No headings found in #article-body

एआई (AI) के साथ सारांशित करें

प्रोडक्शन-रेडी स्पीच AI के साथ निर्माण करें

सिर्फ एक API के साथ अपने ऐप में रीयल-टाइम ट्रांसक्रिप्शन और सजीव आवाज़ जोड़ें।

विषय-सूची
No headings found in #article-body

एआई (AI) के साथ सारांशित करें

प्रोडक्शन-रेडी स्पीच AI के साथ निर्माण करें

सिर्फ एक API के साथ अपने ऐप में रीयल-टाइम ट्रांसक्रिप्शन और सजीव आवाज़ जोड़ें।

मेल स्पेक्ट्रोग्राम (Mel Spectrogram) कैसे काम करता है

मेल स्पेक्ट्रोग्राम की शुरुआत एक मानक स्पेक्ट्रोग्राम से होती है, जिसकी गणना ऑडियो सिग्नल पर शॉर्ट-टाइम फूरियर ट्रांसफॉर्म (STFT) लागू करके की जाती है। STFT सिग्नल को छोटे, ओवरलैपिंग समय अंतरालों (टाइम फ्रेम्स) में विभाजित करता है और प्रत्येक फ्रेम की आवृत्ति सामग्री (फ्रीक्वेंसी कंटेंट) की गणना करता है। इसका परिणाम एक द्वि-आयामी (two-dimensional) प्रतिनिधित्व होता है जिसमें एक अक्ष पर समय और दूसरे पर आवृत्ति होती है, जहाँ तीव्रता प्रत्येक समय-आवृत्ति बिंदु पर ऊर्जा को दर्शाती है।

मेल स्पेक्ट्रोग्राम और मानक स्पेक्ट्रोग्राम के बीच मुख्य अंतर आवृत्ति अक्ष (फ्रीक्वेंसी एक्सिस) का है। एक सामान्य स्पेक्ट्रोग्राम रैखिक आवृत्ति पैमाने (लीनियर फ्रीक्वेंसी स्केल) का उपयोग करता है, जबकि मेल स्पेक्ट्रोग्राम मेल स्केल का उपयोग करके आवृत्ति अक्ष को मोड़ देता है। मेल स्केल पिच का एक अवधारणात्मक पैमाना है: यह आवृत्तियों को इस तरह व्यवस्थित करता है कि पैमाने पर समान दूरियाँ पिच में समान महसूस होने वाले अंतर के अनुरूप होती हैं। व्यावहारिक रूप से, इसका अर्थ यह है कि निचली आवृत्तियों को अधिक स्पष्टता (फाइनर रेजोल्यूशन) दी जाती है और उच्च आवृत्तियों को एक साथ संकुचित कर दिया जाता है, जो यह दर्शाता है कि मानव श्रवण प्रणाली कैसे काम करती है।

मेल स्पेक्ट्रोग्राम का सूत्र

मेल स्पेक्ट्रोग्राम बनाने के लिए, प्रत्येक STFT फ्रेम के पावर स्पेक्ट्रम पर ओवरलैपिंग त्रिकोणीय फिल्टर (जिसे मेल फिल्टरबैंक कहा जाता है) का एक समूह लागू किया जाता है। प्रत्येक फिल्टर अपनी आवृत्ति बैंड के भीतर की ऊर्जा को जोड़ता है। हर्ट्ज़ में आवृत्ति f से क्लासिक मेल स्केल रूपांतरण इस प्रकार है:

  • m = 2595 × log10(1 + f / 700)

आउटपुट को आमतौर पर लॉगरिदमिक (डेसिबल) पैमाने में बदल दिया जाता है, जिससे वह बनता है जिसे अक्सर लॉग मेल स्पेक्ट्रोग्राम (log mel spectrogram) कहा जाता है। लॉग कम्प्रेशन मानव की आवाज की तीव्रता (लाउडनेस) के अनुभव से बेहतर मेल खाता है और बाद के मॉडलों की संख्यात्मक स्थिरता में सुधार करता है।

मेल स्पेक्ट्रोग्राम बनाम MFCC

मेल-फ्रीक्वेंसी सेप्सट्रल गुणांक (MFCCs) लॉग मेल फिल्टरबैंक ऊर्जाओं पर डिस्क्रीट कोसाइन ट्रांसफॉर्म (DCT) लागू करके मेल स्पेक्ट्रोग्राम से प्राप्त किए जाते हैं। MFCCs लंबे समय तक वाक् पहचान (स्पीच रिकग्निशन) के लिए डिफ़ॉल्ट विशेषता थे। हालांकि, आधुनिक डीप लर्निंग सिस्टम अक्सर DCT चरण को छोड़ देते हैं और मेल स्पेक्ट्रोग्राम को सीधे न्यूरल नेटवर्क में फीड करते हैं, क्योंकि नेटवर्क अधिक समृद्ध प्रतिनिधित्व से अपने स्वयं के अनुकूलतम रूपांतरण सीख सकते हैं।

स्पीच और वॉइस एआई में अनुप्रयोग

  • ऑटोमैटिक स्पीच रिकग्निशन (ASR): मेल स्पेक्ट्रोग्राम व्हिस्पर (Whisper), कन्फॉर्मर (Conformer) और अन्य एंड-टू-एंड आर्किटेक्चर जैसे मॉडलों के लिए प्राथमिक इनपुट के रूप में कार्य करते हैं।

  • टेक्स्ट-टू-स्पीच (TTS): टैकोट्रॉन (Tacotron) जैसे सिस्टम टेक्स्ट से मेल स्पेक्ट्रोग्राम का अनुमान लगाते हैं, फिर वोकोडर का उपयोग करके उन्हें ऑडियो वेवफॉर्म में बदलते हैं।

  • स्पीकर सत्यापन और वॉइस क्लोनिंग: मेल स्पेक्ट्रोग्राम पहचान मॉडलिंग के लिए उपयोग की जाने वाली वक्ता-विशिष्ट आवाज की विशेषताओं (टिम्ब्रल कैरेक्टरिस्टिक्स) को कैप्चर करते हैं।

  • ऑडियो वर्गीकरण: पर्यावरणीय ध्वनि का पता लगाना और संगीत विश्लेषण भी मेल स्पेक्ट्रोग्राम की विशेषताओं पर निर्भर करते हैं।

पायथन में मेल स्पेक्ट्रोग्राम की गणना करना

librosa जैसी लाइब्रेरी पायथन में मेल स्पेक्ट्रोग्राम की गणना करना आसान बनाती हैं। फ़ंक्शन librosa.feature.melspectrogram() एक ऑडियो सिग्नल को स्वीकार करता है और मेल स्पेक्ट्रोग्राम मैट्रिक्स देता है, जिसमें मेल बैंड की संख्या, FFT विंडो आकार और हॉप लंबाई के पैरामीटर शामिल होते हैं। विज़ुअलाइज़ेशन आमतौर पर matplotlib के साथ librosa.display.specshow() का उपयोग करके किया जाता है।

अक्सर पूछे जाने वाले प्रश्न

अक्सर पूछे जाने वाले प्रश्न

एक नियमित स्पेक्ट्रोग्राम रैखिक पैमाने पर आवृत्ति प्रदर्शित करता है, जबकि एक मेल स्पेक्ट्रोग्राम आवृत्तियों को मेल पैमाने पर मैप करता है, जो मानव पिच धारणा को दर्शाता है। यह मेल स्पेक्ट्रोग्राम को कम आवृत्तियों पर बेहतर रिज़ॉल्यूशन और उच्च आवृत्तियों पर मोटा रिज़ॉल्यूशन देता है, जिससे वे भाषण और ऑडियो प्रोसेसिंग कार्यों के लिए अधिक उपयुक्त हो जाते हैं।

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104