मेल स्पेक्ट्रोग्राम (Mel Spectrogram) कैसे काम करता है
मेल स्पेक्ट्रोग्राम की शुरुआत एक मानक स्पेक्ट्रोग्राम से होती है, जिसकी गणना ऑडियो सिग्नल पर शॉर्ट-टाइम फूरियर ट्रांसफॉर्म (STFT) लागू करके की जाती है। STFT सिग्नल को छोटे, ओवरलैपिंग समय अंतरालों (टाइम फ्रेम्स) में विभाजित करता है और प्रत्येक फ्रेम की आवृत्ति सामग्री (फ्रीक्वेंसी कंटेंट) की गणना करता है। इसका परिणाम एक द्वि-आयामी (two-dimensional) प्रतिनिधित्व होता है जिसमें एक अक्ष पर समय और दूसरे पर आवृत्ति होती है, जहाँ तीव्रता प्रत्येक समय-आवृत्ति बिंदु पर ऊर्जा को दर्शाती है।
मेल स्पेक्ट्रोग्राम और मानक स्पेक्ट्रोग्राम के बीच मुख्य अंतर आवृत्ति अक्ष (फ्रीक्वेंसी एक्सिस) का है। एक सामान्य स्पेक्ट्रोग्राम रैखिक आवृत्ति पैमाने (लीनियर फ्रीक्वेंसी स्केल) का उपयोग करता है, जबकि मेल स्पेक्ट्रोग्राम मेल स्केल का उपयोग करके आवृत्ति अक्ष को मोड़ देता है। मेल स्केल पिच का एक अवधारणात्मक पैमाना है: यह आवृत्तियों को इस तरह व्यवस्थित करता है कि पैमाने पर समान दूरियाँ पिच में समान महसूस होने वाले अंतर के अनुरूप होती हैं। व्यावहारिक रूप से, इसका अर्थ यह है कि निचली आवृत्तियों को अधिक स्पष्टता (फाइनर रेजोल्यूशन) दी जाती है और उच्च आवृत्तियों को एक साथ संकुचित कर दिया जाता है, जो यह दर्शाता है कि मानव श्रवण प्रणाली कैसे काम करती है।
मेल स्पेक्ट्रोग्राम का सूत्र
मेल स्पेक्ट्रोग्राम बनाने के लिए, प्रत्येक STFT फ्रेम के पावर स्पेक्ट्रम पर ओवरलैपिंग त्रिकोणीय फिल्टर (जिसे मेल फिल्टरबैंक कहा जाता है) का एक समूह लागू किया जाता है। प्रत्येक फिल्टर अपनी आवृत्ति बैंड के भीतर की ऊर्जा को जोड़ता है। हर्ट्ज़ में आवृत्ति f से क्लासिक मेल स्केल रूपांतरण इस प्रकार है:
m = 2595 × log10(1 + f / 700)
आउटपुट को आमतौर पर लॉगरिदमिक (डेसिबल) पैमाने में बदल दिया जाता है, जिससे वह बनता है जिसे अक्सर लॉग मेल स्पेक्ट्रोग्राम (log mel spectrogram) कहा जाता है। लॉग कम्प्रेशन मानव की आवाज की तीव्रता (लाउडनेस) के अनुभव से बेहतर मेल खाता है और बाद के मॉडलों की संख्यात्मक स्थिरता में सुधार करता है।
मेल स्पेक्ट्रोग्राम बनाम MFCC
मेल-फ्रीक्वेंसी सेप्सट्रल गुणांक (MFCCs) लॉग मेल फिल्टरबैंक ऊर्जाओं पर डिस्क्रीट कोसाइन ट्रांसफॉर्म (DCT) लागू करके मेल स्पेक्ट्रोग्राम से प्राप्त किए जाते हैं। MFCCs लंबे समय तक वाक् पहचान (स्पीच रिकग्निशन) के लिए डिफ़ॉल्ट विशेषता थे। हालांकि, आधुनिक डीप लर्निंग सिस्टम अक्सर DCT चरण को छोड़ देते हैं और मेल स्पेक्ट्रोग्राम को सीधे न्यूरल नेटवर्क में फीड करते हैं, क्योंकि नेटवर्क अधिक समृद्ध प्रतिनिधित्व से अपने स्वयं के अनुकूलतम रूपांतरण सीख सकते हैं।
स्पीच और वॉइस एआई में अनुप्रयोग
ऑटोमैटिक स्पीच रिकग्निशन (ASR): मेल स्पेक्ट्रोग्राम व्हिस्पर (Whisper), कन्फॉर्मर (Conformer) और अन्य एंड-टू-एंड आर्किटेक्चर जैसे मॉडलों के लिए प्राथमिक इनपुट के रूप में कार्य करते हैं।
टेक्स्ट-टू-स्पीच (TTS): टैकोट्रॉन (Tacotron) जैसे सिस्टम टेक्स्ट से मेल स्पेक्ट्रोग्राम का अनुमान लगाते हैं, फिर वोकोडर का उपयोग करके उन्हें ऑडियो वेवफॉर्म में बदलते हैं।
स्पीकर सत्यापन और वॉइस क्लोनिंग: मेल स्पेक्ट्रोग्राम पहचान मॉडलिंग के लिए उपयोग की जाने वाली वक्ता-विशिष्ट आवाज की विशेषताओं (टिम्ब्रल कैरेक्टरिस्टिक्स) को कैप्चर करते हैं।
ऑडियो वर्गीकरण: पर्यावरणीय ध्वनि का पता लगाना और संगीत विश्लेषण भी मेल स्पेक्ट्रोग्राम की विशेषताओं पर निर्भर करते हैं।
पायथन में मेल स्पेक्ट्रोग्राम की गणना करना
librosa जैसी लाइब्रेरी पायथन में मेल स्पेक्ट्रोग्राम की गणना करना आसान बनाती हैं। फ़ंक्शन librosa.feature.melspectrogram() एक ऑडियो सिग्नल को स्वीकार करता है और मेल स्पेक्ट्रोग्राम मैट्रिक्स देता है, जिसमें मेल बैंड की संख्या, FFT विंडो आकार और हॉप लंबाई के पैरामीटर शामिल होते हैं। विज़ुअलाइज़ेशन आमतौर पर matplotlib के साथ librosa.display.specshow() का उपयोग करके किया जाता है।