SonoEdit: एलएलएम-आधारित टीटीएस में उच्चारण सुधार के लिए शून्य-स्थान प्रतिबंधित ज्ञान संपादन

SonoEdit: एलएलएम-आधारित टीटीएस में उच्चारण सुधार के लिए शून्य-स्थान प्रतिबंधित ज्ञान संपादन

SonoEdit: एलएलएम-आधारित टीटीएस में उच्चारण सुधार के लिए शून्य-स्थान प्रतिबंधित ज्ञान संपादन

आयुष प्रताप सिंह¹, हर्षित सिंह², नित्यानंद माथुर³, अक्षत मंडलोई³, सुदर्शन कामथ³

¹टीयू डार्मस्टैड, ²यूएमडी, ³स्मॉलेस्ट एआई

nityanand@smallest.ai

न्यूरल टेक्स्ट-टू-स्पीच सिस्टम व्यवस्थित रूप से कम-संसाधन वाले व्यक्तिवाचक संज्ञाओं, विशेष रूप से गैर-अंग्रेजी नामों, ब्रांडों और भौगोलिक स्थानों का गलत उच्चारण करते हैं, क्योंकि मुख्य रूप से अंग्रेजी प्रशिक्षण कॉर्पोरा में उनका प्रतिनिधित्व कम होता है। मौजूदा समाधानों के लिए महंगे बहुभाषी डेटा संग्रह या मैन्युअल ध्वन्यात्मक एनोटेशन की आवश्यकता होती है, जिससे विविध भाषाई संदर्भों में टीटीएस की तैनाती सीमित हो जाती है। हम सोनोएडिट (SonoEdit) पेश करते हैं, जो एक मॉडल संपादन तकनीक है जो बिना दोबारा प्रशिक्षण दिए प्री-ट्रेन टीटीएस मॉडल में उच्चारण त्रुटियों को सर्जिकल रूप से ठीक करती है। पारंपरिक रूप से ऐसी त्रुटियों को ठीक करने के लिए महंगे पर्यवेक्षित फाइन-ट्यूनिंग या मैन्युअल फोनीम इंजेक्शन की आवश्यकता होती है। इस कार्य में, हम नल-स्पेस प्रोनन्सिएशन एडिटिंग (Null-Space Pronunciation Editing) का उपयोग करके एक अल्पव्ययी विकल्प प्रस्तुत करते हैं, जो एक सिंगल-शॉट पैरामीटर अपडेट है जो बाकी मॉडल के व्यवहार को प्रमाणित रूप से संरक्षित करते हुए विशिष्ट शब्दों के उच्चारण को संशोधित करता है। हम सबसे पहले टेक्स्ट-टू-प्रोनन्सिएशन मैपिंग को नियंत्रित करने वाली विशिष्ट ट्रांसफॉर्मर परतों की पहचान करने के लिए एकूस्टिक कॉज़ल ट्रेसिंग (Acoustic Causal Tracing) को अनुकूलित करते हैं। फिर हम एक क्लोज्ड-फॉर्म वेट अपडेट की गणना करने के लिए नल-स्पेस कन्सट्रेंड एडिटिंग (Null-Space Constrained Editing) का उपयोग करते हैं जो लक्ष्य उच्चारण को सुधारता है जबकि सामान्य भाषण के मैनिफोल्ड के गणितीय रूप से ऑर्थोगोनल रहता है, जिससे एक कन्सट्रेंड अपडेट बनता है जो मॉडल के ध्वनिक आउटपुट को एक वांछित उच्चारण उदाहरण की ओर ले जाता है और एक संरक्षित कॉर्पस पर शून्य प्रथम-क्रम परिवर्तन सुनिश्चित करता है।

थर्ड कॉन्फ्रेंस ऑन पार्सिमनी एंड लर्निंग (CPAL 2026)।


1. परिचय

आधुनिक न्यूरल टेक्स्ट-टू-स्पीच प्रणालियों ने उल्लेखनीय स्वाभाविकता और अभिव्यक्तित्व हासिल कर लिया है, फिर भी वे लगातार एक बुनियादी चुनौती से जूझ रहे हैं: अपने प्रशिक्षण वितरण के बाहर के शब्दों का सही उच्चारण करना। व्यक्तिवाचक संज्ञा (ब्रांड नाम, व्यक्तिगत नाम, भौगोलिक स्थान), तकनीकी शब्दावली और नवनिर्मित शब्दों का अक्सर गलत उच्चारण किया जाता है, जिससे ग्राहक सेवा, नेविगेशन प्रणाली, शैक्षिक सामग्री और एक्सेसिबिलिटी अनुप्रयोगों जैसे सटीक उच्चारण की आवश्यकता वाले क्षेत्रों में टीटीएस (TTS) की तैनाती सीमित हो जाती है। फोनीम डिक्शनरी [1] के लिए मैन्युअल एनोटेशन की आवश्यकता होती है और वे रूपात्मक विविधताओं पर सामान्यीकृत नहीं हो पाते हैं। टैकोट्रॉन 2 [2] और फास्टस्पीच 2 [3] जैसी पारंपरिक टीटीएस प्रणालियां स्पष्ट फोनीम इनपुट के माध्यम से उच्चारण को संभालती हैं। हालिया कोडेक-आधारित प्रणालियां जैसे VALL-E [4] और VoiceBox [5] अंतर्निहित मैपिंग सीखती हैं लेकिन दुर्लभ शब्दों के साथ संघर्ष करती हैं। वैश्विक रूप से फाइन-ट्यूनिंग करना अत्यधिक महंगा है और इसमें विनाशकारी भूलने (catastrophic forgetting) की संभावना होती है, जहां एक भी उच्चारण को सही करने से स्वरशैली (prosody), वक्ता की पहचान, या अन्य ध्वनिक गुण खराब हो सकते हैं। LoRA और इसी तरह के PEFT तरीके कम्प्यूटेशनल लागत को कम करते हैं लेकिन फिर भी उन्हें कार्य-विशिष्ट प्रशिक्षण की आवश्यकता होती है और सामान्य मॉडल व्यवहार को संरक्षित करने के बारे में स्पष्ट गारंटी की कमी होती है। इसके अलावा, एलएलएम-आधारित टीटीएस के लिए प्रॉम्प्ट इंजीनियरिंग अविश्वसनीय और संदर्भ-निर्भर है। ये सभी चीजें टेक्स्ट-स्पीच संरेखण के संदर्भ में एक बहुत ही महत्वपूर्ण प्रश्न की ओर ले जाती हैं:

एक बड़े भाषा मॉडल (LLM) आधारित टेक्स्ट-टू-स्पीच (TTS) प्रणाली में उच्चारण कहाँ रहता है, और हम अन्य सभी मॉडल व्यवहार को संरक्षित करते हुए विशिष्ट ग्रंथों के लिए इसे सर्जिकल रूप से कैसे संशोधित कर सकते हैं?

SonoEdit तीन प्रमुख विचारों के एक नए संयोजन के माध्यम से इसी समस्या का समाधान करता है:

  1. अकॉस्टिक कॉज़ल ट्रेसिंग के माध्यम से सटीक स्थानीयकरण: मैकेनिस्टिक इंटरप्रिटेबिलिटी साहित्य से कॉज़ल ट्रेसिंग तकनीकों को अपनाकर, हम उन विशिष्ट ट्रांसफार्मर परतों (अक्सर परतों i से j जैसी संकीर्ण श्रृंखला) की पहचान करते हैं जो ग्रैफेम-टू-फोनीम मैपिंग को संभालने के लिए जिम्मेदार हैं। यह स्थानीयकरण परत-वार या मॉड्यूल-स्तरीय हस्तक्षेपों की तुलना में अधिक सटीक है, जिससे हमें सुधारों को ठीक वहीं केंद्रित करने की अनुमति मिलती है जहां उनकी आवश्यकता होती है।

  2. नल-स्पेस बाधित संपादन के माध्यम से ऑर्थोगोनल सुधार: मनमाने ढंग से वजन में बदलाव करने या नए मापदंडों को प्रशिक्षित करने के बजाय, हम एक क्लोज्ड-फॉर्म वेट अपडेट की गणना करते हैं जो सामान्य भाषण के कई गुना (manifold) के गणितीय रूप से ऑर्थोगोनल रहते हुए लक्षित उच्चारण को ठीक करता है। विशेष रूप से, हम सामान्य ध्वनिक विशेषताओं के अनुरूप प्रोजेक्शन ऑपरेटर के नल-स्पेस की पहचान करते हैं, और अपने वेट अपडेट को पूरी तरह से इस नल-स्पेस के भीतर रहने के लिए बाधित करते हैं। यह सुनिश्चित करता है कि सुधार लक्षित उच्चारण के अलावा मॉडल व्यवहार के किसी भी अन्य पहलू को प्रभावित नहीं कर सकता है।

  3. पैरामीटर की किफ़ायत और वन-शॉट सुधार: PEFT विधियों के विपरीत, SonoEdit अतिरिक्त प्रशिक्षण योग्य पैरामीटर पेश नहीं करता है। वेट अपडेट की गणना सरल मैट्रिक्स संचालन के माध्यम से क्लोज्ड-फॉर्म में की जाती है, जिससे यह कम्प्यूटेशनल रूप से कुशल और बिना किसी प्रशिक्षण लूप के वन-शॉट तरीके से लागू होता है। यह तैनात किए गए टीटीएस प्रणालियों के लिए विशेष रूप से मूल्यवान है जहां फिर से प्रशिक्षण देना अव्यवहारिक है।

हमारी सर्वोत्तम जानकारी के अनुसार, न्यूरल टीटीएस प्रणालियों में नल-स्पेस नॉलेज एडिटिंग के अनुप्रयोग का पता लगाने वाला SonoEdit पहला काम है। सटीक स्थानीयकरण, ऑर्थोगोनल बाधाओं और क्लोज्ड-फॉर्म समाधानों को संश्लेषित करके, SonoEdit कम्प्यूटेशनल दक्षता, शुद्धता संरक्षण और पैरामीटर दक्षता के बीच वर्तमान समझौते (trade-off) को दूर करता है। यह एलएलएम-आधारित टीटीएस मॉडल में सर्जिकल, किफ़ायती संशोधनों को सक्षम बनाता है जो न्यूनतम कम्प्यूटेशनल ओवरहेड की आवश्यकता के साथ विनाशकारी भूलने की बीमारी को न लाने की गारंटी देते हैं।

2. संबंधित कार्य

2.1. एलएलएम-आधारित टेक्स्ट-टू-स्पीच मॉडलिंग

न्यूरल टेक्स्ट-टू-स्पीच (TTS) में हालिया प्रगति ने यह प्रदर्शित किया है कि उच्च गुणवत्ता वाले भाषण संश्लेषण के लिए बड़े भाषा मॉडलों (LLMs) का प्रभावी ढंग से पुनरुत्पादन किया जा सकता है। AudioLM [6] ने ऑडियो जनरेशन के लिए भाषा मॉडलिंग का मार्ग प्रशस्त किया, जबकि VALL-E [4] ने इन-कॉन्टेक्स्ट लर्निंग के माध्यम से ज़ीरो-शॉट वॉयस क्लोनिंग का प्रदर्शन किया। SoundStorm [7] ने समानांतर जनरेशन के माध्यम से दक्षता में सुधार किया, और NaturalSpeech 2 [8] ने लेटेंट डिफ्यूजन के माध्यम से मानव-समानता हासिल की। ये प्रणालियां ऑडियो को टोकन में विभाजित करने के लिए EnCodec [9] और SoundStream [10] जैसे न्यूरल कोडेक्स का लाभ उठाती हैं। Orpheus [11] और Sesame [12] जैसे मॉडल पारंपरिक कॉनकैटिनेटिव या यूनिट-चयन विधियों की तुलना में बेहतर स्वरशैली (prosody) के साथ अभिव्यंजक, प्राकृतिक लगने वाली आवाज उत्पन्न करने के लिए प्रीट्रेनिंग के दौरान सीखी गई शब्दार्थ और भाषाई समझ का लाभ उठाते हैं।

ये एलएलएम-आधारित टीटीएस दृष्टिकोण पाठ या अन्य भाषाई अभ्यावेदन से प्राप्त एम्बेडिंग्स पर स्पीच डिकोडर को अनुकूलित करके संचालित होते हैं। इसका मुख्य लाभ यह है कि एलएलएम लंबी दूरी की भाषाई निर्भरताओं और टोनल विविधताओं को कैप्चर करते हैं, जिससे सूक्ष्म स्वरशैली, तनाव पैटर्न और इंटोनेशन कंटूर के साथ भाषण का निर्माण संभव होता है। हालांकि, इन-डिस्ट्रीब्यूशन डेटा पर अपने उल्लेखनीय प्रदर्शन के बावजूद, ये मॉडल एक महत्वपूर्ण विफलता मोड प्रदर्शित करते हैं: दुर्लभ या आउट-ऑफ-डिस्ट्रीब्यूशन व्यक्तिवाचक संज्ञाओं के लिए गलत उच्चारण का मतिभ्रम (hallucination), जो प्रशिक्षण के दौरान शायद ही कभी सामने आए थे। यह घटना विशेष रूप से नेविगेशन सिस्टम, समाचार पढ़ने या बहुभाषी आवाज सहायकों जैसे अनुप्रयोगों में समस्याग्रस्त है, जहां उपयोगकर्ता की समझ के लिए नामित संस्थाओं का सटीक उच्चारण आवश्यक है।

2.2. टीटीएस में शब्द-उच्चारण संबंधों का पता लगाना और उनका संपादन करना

न्यूरल टीटीएस मॉडल के आंतरिक अभ्यावेदन को समझना और संशोधित करना एक महत्वपूर्ण अनुसंधान दिशा है। पूर्व कार्य ने प्रोबिंग क्लासिफायर [13], कॉज़ल ट्रेसिंग [14], और एट्रिब्यूशन पैचिंग [15] के माध्यम से स्थानीयकरण की खोज की है। भाषा मॉडल में परत-वार विश्लेषण [16] से पता चला है कि विभिन्न परतें विभिन्न भाषाई घटनाओं को एनकोड करती हैं।

टीटीएस के संदर्भ में, हाल के काम ने यह पहचानने पर ध्यान केंद्रित किया है कि टोकन-टू-उच्चारण सुविधाओं को संभालने के लिए मॉडल के कौन से घटक जिम्मेदार हैं। कुछ अध्ययनों ने उच्चारण त्रुटियों को ठीक करने के लिए विशिष्ट परतों में सीधे हस्तक्षेप करने की तकनीकों का प्रस्ताव दिया है। हालांकि, ऐसे दृष्टिकोण अक्सर कच्चे संशोधन रणनीतियों को नियोजित करते हैं, जैसे कि साधारण वजन में बदलाव या परत-वार हस्तक्षेप, जिनमें मॉडल की सामान्य ध्वनिक क्षमताओं या वक्ता की पहचान के संरक्षण को खराब किए बिना लक्षित उच्चारणों को संशोधित करने के लिए आवश्यक सटीकता की कमी होती है।

हमारा काम इन अंतर्दृष्टि पर आधारित है: हम G2P मैपिंग को संभालने के लिए जिम्मेदार ट्रांसफार्मर परतों की सटीक पहचान करने के लिए अकॉस्टिक कॉज़ल ट्रेसिंग का उपयोग करते हैं, और फिर यह सुनिश्चित करने के लिए नल-स्पेस बाधित संपादन लागू करते हैं कि सुधार सामान्य भाषण विशेषताओं के कई गुना के ऑर्थोगोनल हैं।

चित्र 1: एक एलएलएम-आधारित भाषण जनरेशन पाइपलाइन को दर्शाने वाला एक योजनाबद्ध आरेख। एक रॉ वेवफॉर्म को पहले एक टोकेनाइज़र द्वारा प्रोसेस किया जाता है ताकि डिस्क्रीट टोकन का एक अनुक्रम तैयार किया जा सके। इन टोकन को फिर एक बड़े भाषा मॉडल (LLM) में इनपुट किया जाता है, जो नए टोकन का एक अनुक्रम उत्पन्न करता है। अंत में, एक डिकोडर नए टोकन को स्पीच वेवफॉर्म में परिवर्तित करता है।

2.3. ज्ञान संपादन (Knowledge Editing)

ज्ञान संपादन न्यूरल नेटवर्क में एनकोड किए गए तथ्यात्मक ज्ञान को बिना विनाशकारी भूलने की क्रिया के संशोधित करने के लिए एक उभरता हुआ प्रतिमान है। हाल के तरीके जैसे ROME (रैंक-वन मॉडल एडिटिंग) [17], MEMIT [18], MEND [19], SERAC [19], और AlphaEdit [20] ने मॉडल की सामान्य क्षमताओं को संरक्षित करते हुए बड़े भाषा मॉडल में तथ्यों को ठीक करने की क्षमता दिखाई है।

इन विधियों का मूल विचार यह है कि न्यूरल नेटवर्क में ज्ञान अक्सर विशिष्ट परतों या उप-स्थानों (subspaces) तक सीमित होता है। इन उप-स्थानों में विशेष रूप से फॉरवर्ड प्रोजेक्शन के नल-स्पेस में कार्य करके, हस्तक्षेपों को मौजूदा मॉडल व्यवहार के ऑर्थोगोनल बनाया जा सकता है, जिससे साइड इफेक्ट्स को कम किया जा सकता है। ROME, उदाहरण के लिए, एलएलएम में तथ्यात्मक संबंधों को ठीक करने के लिए रैंक-वन अपडेट का उपयोग करता है, जिससे वजन में बदलाव की गणना होती है जो मॉडल के शेष आउटपुट वितरण को सुरक्षित रखता है।

यद्यपि ये विधियां मूल रूप से भाषा मॉडल में तथ्यात्मक ज्ञान सुधार के लिए डिज़ाइन की गई थीं, उनके अंतर्निहित सिद्धांत टीटीएस उच्चारण सुधार के लिए अत्यधिक प्रासंगिक हैं। जिस तरह एक भाषा मॉडल स्थानीयकृत, संरचित अभ्यावेदन में तथ्यों को एनकोड करता है, उसी तरह एक टीटीएस मॉडल विशिष्ट परतों में उच्चारण मैपिंग को एनकोड करता है। ज्ञान संपादन साहित्य से कॉज़ल ट्रेसिंग और नल-स्पेस बाधित संपादन तकनीकों को अपनाकर, हम ध्वनिक निष्ठा और वक्ता की पहचान को बनाए रखते हुए उच्चारण त्रुटियों को ठीक करने के लिए सैद्धांतिक, किफ़ायती हस्तक्षेप लागू कर सकते हैं। यह क्रॉस-डोमेन अनुकूलन हमारे काम का एक प्रमुख योगदान है।

2.4. पैरामीटर कुशल फाइन-ट्यूनिंग (Parameter Efficient Fine-tuning)

पूर्ण मॉडल फाइन-ट्यूनिंग कम्प्यूटेशनल रूप से महंगी है और इसमें विनाशकारी भूलने की संभावना होती है, विशेष रूप से मॉडल व्यवहार के विशिष्ट, स्थानीयकृत पहलुओं में त्रुटियों को ठीक करते समय। इसे संबोधित करने के लिए, पैरामीटर-कुशल फाइन-ट्यूनिंग (PEFT) विधियों जैसे LoRA [21], एडेप्टर [22], QLoRA [23], और प्रीफिक्स ट्यूनिंग [24] को व्यापक रूप से अपनाया गया है।

LoRA, जो कि सबसे लोकप्रिय PEFT विधियों में से एक है, यह मानकर चलता है कि वेट अपडेट एक निम्न-रैंक वाले उप-स्थान में निहित हैं। सभी मापदंडों को अपडेट करने के बजाय, LoRA छोटे प्रशिक्षण योग्य मैट्रिसेस A ∈ R^(r×din) और B ∈ R^(dout×r) पेश करता है जहाँ r ≪ din, dout है, और अपडेट की गणना ∆W = BA के रूप में की जाती है। यह मॉडल के प्रदर्शन को सुरक्षित रखते हुए प्रशिक्षण योग्य मापदंडों की संख्या को कम करता है।

हालांकि, उच्चारण सुधार के संदर्भ में LoRA और इसी तरह के PEFT तरीकों की महत्वपूर्ण सीमाएं हैं। सबसे पहले, उन्हें लक्षित उच्चारण त्रुटियों के लिए विशिष्ट प्रशिक्षण डेटा की आवश्यकता होती है, जो हमेशा आसानी से उपलब्ध नहीं हो सकता है। दूसरा, सावधानीपूर्वक हाइपरपैरामीटर ट्यूनिंग के साथ भी, ये विधियां स्थानीय रूप से बाधित सुधारों पर लागू होने पर ध्वनिक गुणवत्ता में सूक्ष्म कलाकृतियां या गिरावट ला सकती हैं। तीसरा, वे सामान्य भाषण की विविधता के प्रति स्पष्ट रूप से ऑर्थोगोनैलिटी लागू नहीं करते हैं, इसलिए सुधार अभी भी अप्रत्यक्ष रूप से मॉडल व्यवहार के अन्य पहलुओं में हस्तक्षेप कर सकते हैं।

इसके विपरीत, हमारा दृष्टिकोण (SonoEdit) सीधे सामान्य भाषण विशेषताओं के नल-स्पेस में काम करता है, यह सुनिश्चित करता है कि उच्चारण सुधार गणितीय रूप से मॉडल की मूल ध्वनिक क्षमताओं के ऑर्थोगोनल होने की गारंटी हैं। नल-स्पेस बाधित संपादन के साथ कॉज़ल ट्रेसिंग को मिलाकर, हम एक अधिक सैद्धांतिक और किफ़ायती समाधान प्राप्त करते हैं जिसके लिए न तो महंगे पुनर्प्रशिक्षण की आवश्यकता होती है और न ही अतिरिक्त मापदंडों की शुरूआत की।

3. कार्यप्रणाली (Methodology)

3.1. प्रारंभिक बातें

भाषण योजना के लिए एलएलएम: हम एलएलएम-आधारित टेक्स्ट-टू-स्पीच (TTS) पर विचार करते हैं जिसमें एक बड़ा भाषा मॉडल (LLM) पाठ और ध्वनिकी (acoustics) के बीच एक मध्यवर्ती योजनाकार के रूप में कार्य करता है। Orpheus जैसी आर्किटेक्चर में, एलएलएम असतत ध्वनिक टोकन का एक समतल अनुक्रम t = [c^(1)_1, . . . , c^(7)_1, c^(1)_2, . . . , c^(7)_N] उत्पन्न करता है, जहां प्रत्येक ध्वनिक फ्रेम को एक न्यूरल ऑडियो कोडेक (SNAC [25]) से प्राप्त 7 पदानुक्रमित टोकन द्वारा दर्शाया जाता है। यहाँ, c^(1)_i फ्रेम i के लिए मोटे सिमेंटिक/अकॉस्टिक टोकन का प्रतिनिधित्व करता है, जो प्राथमिक ध्वन्यात्मक सामग्री को ले जाता है, जबकि c^(2...7)_i पिच कंटूर, वॉयसिंग विशेषताओं और स्पेक्ट्रल बारीक संरचना जैसी महीन ध्वनिक विवरणों का प्रतिनिधित्व करते हैं। जनरेटिव प्रक्रिया को एक अनुक्रमिक भविष्यवाणी कार्य के रूप में औपचारिक रूप दिया जा सकता है जहां एलएलएम सशर्त वितरण का मॉडल तैयार करता है:

p(t | x) = ∏^N_{i=1} ∏^7_{j=1} p(c^(j)i | c{<i}, c^(<j)_i, x) (1)

जहाँ x इनपुट टेक्स्ट को दर्शाता है, c_{<i} पिछले फ्रेम के सभी टोकन को दर्शाता है, और c^(<j)_i स्तर j से पहले के वर्तमान फ्रेम के भीतर के टोकन को दर्शाता है। चूंकि ध्वन्यात्मक योजना के निर्णय मुख्य रूप से मोटे टोकन में एनकोड किए जाते हैं, हम अपने कॉज़ल विश्लेषण और संपादन को मोटे टोकन {c^(1)i}^N{i=1} के उप-स्थान तक सीमित रखते हैं। महत्वपूर्ण बात यह है कि इन प्रणालियों में उच्चारण त्रुटियां डिकोडर से उत्पन्न नहीं होती हैं, बल्कि एलएलएम की मोटी योजना के भीतर बने गलत आंतरिक संबंधों से उत्पन्न होती हैं। इसलिए, उच्चारण को ठीक करने के लिए प्रणाली के ध्वनिक घटकों को फिर से प्रशिक्षित करने या अनुकूलित करने के बजाय एलएलएम के आंतरिक अभ्यावेदन को संशोधित करने की आवश्यकता होती है।

एलएलएम में ज्ञान संपादन: ज्ञान संपादन मॉडल सुधार को आंतरिक मापदंडों के एक लक्षित संशोधन के रूप में तैयार करता है जो अन्य सभी व्यवहारों को संरक्षित करते हुए एक विशिष्ट इनपुट-आउटपुट एसोसिएशन को बदल देता है। मापदंडों W वाले एक मॉडल को देखते हुए, लक्ष्य एक न्यूनतम अपडेट ∆W की गणना करना है ताकि मॉडल किसी विशेष इनपुट के लिए वांछित आउटपुट उत्पन्न करे, बिना किसी अन्य जगह पर इसकी प्रतिक्रियाओं को प्रभावित किए।

∆W* = arg min_{∆W} ∥(W + ∆W)K1 − V1∥²_F + λ ∥(W + ∆W)K0 − V0∥²_F (2)

जहाँ K1, V1 लक्ष्य उच्चारण के लिए कीज़ और वैल्यूज़ का प्रतिनिधित्व करते हैं, और K0, V0 संरक्षित ज्ञान के लिए कीज़ और वैल्यूज़ का प्रतिनिधित्व करते हैं। पैरामीटर λ लक्ष्य को ठीक करने और मौजूदा ज्ञान को संरक्षित करने के बीच संतुलन बनाता है।

हाल के काम ने दिखाया है कि एलएलएम में कई संबंध विशिष्ट परतों और उप-स्थानों तक सीमित होते हैं, जो क्लोज्ड-फॉर्म, वन-शॉट संपादन को सक्षम करते हैं जो विनाशकारी भूलने की बीमारी से बचाते हैं। इस काम में, हम गलत उच्चारणों को एलएलएम के छिपे हुए अभ्यावेदन में एम्बेडेड त्रुटिपूर्ण साहचर्य यादों के रूप में मानते हैं और उन्हें सैद्धांतिक और किफ़ायती तरीके से ठीक करने के लिए ज्ञान संपादन तकनीकों को लागू करते हैं।

3.2. अकॉस्टिक कॉज़ल ट्रेसिंग (Acoustic Causal Tracing)

उच्चारण से संबंधित जानकारी एलएलएम में समान रूप से वितरित नहीं होती है। इसके बजाय, यह ट्रांसफार्मर परतों के एक संकीर्ण उपसमुच्चय में केंद्रित होती है जो ऑर्थोग्राफिक रूपों को लेटेंट ध्वन्यात्मक अभ्यावेदन में मैप करने के लिए जिम्मेदार होती है।

इन परतों की पहचान करने के लिए, हम मेकनिस्टिक इंटरप्रिटेबिलिटी से कॉज़ल ट्रेसिंग तकनीकों को समतल SNAC आर्किटेक्चर में अनुकूलित करते हैं। हम शोर इंजेक्शन के माध्यम से इनपुट अभ्यावेदन को दूषित करके और एक स्वच्छ फॉरवर्ड पास से व्यक्तिगत परत सक्रियणों को चुनिंदा रूप से बहाल करके हस्तक्षेप विश्लेषण करते हैं। विशेष रूप से, हम एक परत ℓ के अकॉस्टिक कॉज़ल प्रभाव को सही मोटे टोकन c* की संभावना में रिकवरी के रूप में परिभाषित करते हैं जब परत के सक्रियण को एक स्वच्छ रन से बहाल किया जाता है:

Impact(ℓ) = P[c* | do(h^(ℓ) = h^(ℓ)_{clean})] − P[c* | corrupted] (3)

जहाँ c* गलत उच्चारण वाले फोनीम के अनुरूप SNAC फ्रेम का पहला (मोटा) टोकन है, h^(ℓ) परत ℓ पर छिपी हुई स्थिति को दर्शाता है, और do(·) ऑपरेटर एक कॉज़ल हस्तक्षेप का प्रतिनिधित्व करता है। कम्प्यूटेशनल दक्षता के लिए, हम मॉडल के लॉजिट्स का उपयोग करके इन संभावनाओं का अनुमान लगाते हैं:

Impact(ℓ) ≈ exp(z^(ℓ){restored}[c*]) / ∑{c'} exp(z^(ℓ){restored}[c']) − exp(z{corrupted}[c*]) / ∑{c'} exp(z{corrupted}[c']) (4)

जहाँ z^(ℓ) परत ℓ के बाद लॉजिट वेक्टर का प्रतिनिधित्व करता है। उच्च प्रभाव स्कोर वाली परतों की पहचान शब्द-उच्चारण मैपिंग के लिए कॉज़ल रूप से जिम्मेदार के रूप में की जाती है। आनुभविक रूप से, हम पाते हैं कि उच्चारण-संवेदनशील अभ्यावेदन मध्य-से-देर वाली ट्रांसफार्मर परतों के एक सन्निहित ब्लॉक में स्थानीयकृत होते हैं (आमतौर पर L परतों वाले मॉडल के लिए परतें L/2 से 3L/4)। यह सटीक स्थानीयकरण हमें बाद के संपादनों को मापदंडों के एक छोटे समूह तक सीमित करने की अनुमति देता है, जिससे सिमेंटिक योजना या ध्वनिक रेंडरिंग के साथ अनावश्यक हस्तक्षेप से बचा जा सकता है।

3.3. नल स्पेस: महत्व और उपयोग

उच्चारण सुधार में एक मुख्य चुनौती यह सुनिश्चित करना है कि संपादन सामान्य भाषण विशेषताओं जैसे स्वरशैली, वक्ता की पहचान, या प्रवाह को खराब न करें। इसे संबोधित करने के लिए, हम स्पष्ट रूप से सामान्य भाषण व्यवहार के अनुरूप उप-स्थान की विशेषता बताते हैं और अपने संपादनों को इसके ऑर्थोगोनल होने के लिए बाधित करते हैं। मान लें कि K0 ∈ R^(d×N) एक विविध भाषण डेटासेट (जैसे, LibriTTS [26]) में मोटे टोकन की भविष्यवाणी के चरणों से एकत्र की गई छिपी हुई स्थितियों (कीज़) का एक मैट्रिक्स है। हम सामान्य भाषण अभ्यावेदन के कई गुना को कैप्चर करने के लिए बिना केंद्रित कोवेरिएंस मैट्रिक्स Σ = K0K^T_0 की गणना करते हैं।

चित्र 2: नल-स्पेस बाधित संपादन का एक चित्रण। उच्चारण सुधार को सामान्य भाषण विशेषताओं का प्रतिनिधित्व करने वाले उप-स्थान के ऑर्थोगोनल दिशाओं में लागू किया जाता है, जिससे गैर-लक्षित व्यवहार की अपरिवर्तनीयता सुनिश्चित होती है।

इस मैनिफोल्ड के नल स्पेस में वे दिशाएं शामिल हैं जो सामान्य भाषण व्यवहार को प्रभावित नहीं करती हैं। हम कोवेरिएंस मैट्रिक्स Σ पर सिंगुलर वैल्यू डीकंपोज़िशन (SVD) का उपयोग करके इस नल स्पेस के ऑर्थोनॉर्मल बेसिस की गणना करते हैं। नल स्पेस पर प्रोजेक्शन मैट्रिक्स P इस प्रकार दिया गया है:

P = I − UU^T (5)

जहाँ U में Σ के प्रमुख ईजेनवेक्टर्स शामिल हैं जो प्रमुख ईजेनvalues ​​(द "स्पीच मैनिफोल्ड") के अनुरूप हैं। ∆W = ∆W P को संतुष्ट करने वाले किसी भी वेट अपडेट ∆W का सामान्य भाषण क्षमताओं पर न्यूनतम प्रभाव होने की गारंटी है, क्योंकि K0 की प्रभावी सीमा में किसी भी k के लिए ∆W k ≈ 0 है।

3.4. नल-स्पेस बाधित ज्ञान संपादन

एक बार उच्चारण-प्रासंगिक परतों और सामान्य भाषण के नल स्पेस की पहचान हो जाने के बाद, हम एक बाधित अनुकूलन उद्देश्य के माध्यम से अंतिम वेट अपडेट की गणना करते हैं। एक लक्षित विषय कुंजी k* ∈ R^d (त्रुटि स्थान पर छिपी हुई स्थिति) और एक लक्षित मान v* ∈ R^d (वह वेक्टर जो सही मोटे टोकन को प्रेरित करता है) को देखते हुए, हम वेट अपडेट ∆W के लिए हल करते हैं जो संरक्षित ज्ञान के ऑर्थोगोनल रहते हुए लक्ष्य पर त्रुटि को न्यूनतम करता है:

min_{∆W} ∥(W + ∆W)k* − v*∥²_2 subject to ∆WK0 = 0 (6)

जहाँ बाधा यह सुनिश्चित करती है कि अपडेट K0 द्वारा दर्शाए गए सामान्य भाषण वितरण पर शून्य गड़बड़ी पैदा करता है। AlphaEdit [20] अनुमानक का उपयोग करते हुए, यह अनुकूलन एक क्लोज्ड-फॉर्म समाधान स्वीकार करता है:

∆W = (v* − W k*) / (k^T_* P k*) (P k*)^T (7)

जहाँ अंश (v*−W k*) अवशिष्ट त्रुटि का प्रतिनिधित्व करता है और हर k^T_* P k* = ∥P k*∥²_2 नल-स्पेस घटक परिमाण द्वारा सामान्य करता है। यह अपडेट सुनिश्चित करता है कि (W + ∆W)k* = v* जबकि नल-स्पेस बाधा ∆WK0 ≈ 0 का कड़ाई से पालन किया जाता है। बाधा संतुष्टि को सत्यापित करने के लिए, हम ध्यान देते हैं कि:

∆WK0 = (v* − W k*) / (k^T_* P k*) (P k*)^T K0 = (v* − W k*) / (k^T_* P k*) k^T_* PK0 ≈ 0 (8)

चूंकि संरचना द्वारा PK0 = (I − U_k U^T_k)K0 ≈ 0 है—K0 के कॉलम मुख्य रूप से U_k के दायरे में आते हैं। परिणामी अपडेट केवल अकॉस्टिक कॉज़ल ट्रेसिंग के माध्यम से पहचानी गई स्थानीयकृत परतों पर लागू किया जाता है, विशेष रूप से परत ℓ ∈ L_edit पर वैल्यू प्रोजेक्शन मैट्रिसेस W^(ℓ)_V या फीड-फॉरवर्ड परतों W^(ℓ)_FF पर।

परिणामस्वरूप, SonoEdit वन-शॉट उच्चारण सुधार को सक्षम बनाता है: एक एकल गणना स्थायी रूप से लक्षित उच्चारण को ठीक करती है जबकि अन्य सभी उच्चारणों, वक्ताओं और स्वर शैली के पैटर्न को अपरिवर्तित छोड़ देती है। इस पूरी प्रक्रिया के लिए कीज़ और वैल्यूज़ निकालने के लिए केवल दो फॉरवर्ड पास की आवश्यकता होती है, एक पूर्व-अभिकलित प्रोजेक्शन मैट्रिक्स P (एकमुश्त SVD के माध्यम से प्राप्त), और रैंक-1 वेट अपडेट के लिए O(d²) संचालन। यह दृष्टिकोण विशेष रूप से तैनात टीटीएस प्रणालियों के लिए उपयुक्त है जहां पुनप्रशिक्षण या पैरामीटर विस्तार अव्यवहारिक है, जिससे मॉडल के क्षरण के बिना तेजी से पोस्ट-डिप्लॉयमेंट सुधार सक्षम होते हैं।

4. प्रयोग

हमारे प्रयोगों का उद्देश्य SonoEdit दृष्टिकोण के लिए मौलिक तीन प्रमुख अनुसंधान प्रश्नों का समाधान करना है: ❶ क्या नल-स्पेस बाधित संपादन विश्वसनीय और सटीक रूप से कम संसाधन वाले व्यक्तिवाचक संज्ञाओं के लिए अकॉस्टिक डिकोडर पुनर्प्रशिक्षण की आवश्यकता के बिना उच्चारण को ठीक कर सकते हैं? ❷ क्या ये संपादन स्वरशैली, शब्दार्थ और प्रवाह के संबंध में Orpheus-TTS के वैश्विक व्यवहार को संरक्षित करते हैं? और ❸ लक्ष्य उच्चारणों को ठीक करने में प्रभावी रहते हुए एक संपादन कितना छोटा और किफ़ायती हो सकता है? इन सवालों की व्यापक जांच करने के लिए, हम अकॉस्टिक डिकोडर के बिना किसी पुनर्प्रशिक्षण के, वन-शॉट संपादन व्यवस्था में सभी प्रयोग करते हैं।

4.1. कार्यान्वयन विवरण

मूल्यांकन मॉडल: हम Orpheus-TTS [11] पर SonoEdit का मूल्यांकन करते हैं, जो सिमेंटिक समझ और भाषण जनरेशन के लिए LLaMA-3B [27] बैकबोन का लाभ उठाता है, और Sesame-TTS पर। SonoEdit को लागू करने के लिए, हम ग्रैफेम-टू-फोनीम मैपिंग के लिए जिम्मेदार विशिष्ट ट्रांसफार्मर परतों की पहचान करने के लिए अकॉस्टिक कॉज़ल ट्रेसिंग को नियोजित करते हैं। इस विश्लेषण से पता चलता है कि परतें 16-22 पाठ-उच्चारण व्यवहार के लिए सबसे अधिक कॉज़ल रूप से जिम्मेदार हैं, जो क्रूड परत-वार हस्तक्षेपों की तुलना में सटीक स्थानीयकरण प्रदान करती हैं। एक बार इन परतों की पहचान हो जाने के बाद, SonoEdit LibriTTS [26] के एक उपसमुच्चय का उपयोग करके नल-स्पेस की गणना करता है। गंभीर रूप से, सभी संपादन एक बार किए जाते हैं, पुनरावृत्ति अनुकूलन के बिना एक क्लोज्ड-फॉर्म मैट्रिक्स अपडेट का उपयोग करके, जो तैनात प्रणालियों में वन-शॉट अनुप्रयोग को सक्षम बनाता है।

मूल्यांकन डेटा: विविध भाषाई संदर्भों में उच्चारण सुधार का कड़ाई से परीक्षण करने के लिए, हम HardNoun-300 का निर्माण करते हैं, जो 300 व्यक्तिवाचक संज्ञाओं (6 भाषाओं में प्रति भाषा 50: अंग्रेजी, स्पेनिश, फ्रेंच, जर्मन, जापानी और हिंदी) का एक सावधानीपूर्वक क्यूरेट किया गया बहुभाषी डेटासेट है जो प्रीट्रेन्ड एलएलएम-आधारित टीटीएस प्रणालियों में लगातार मतिभ्रम पैदा करते हैं। हमारे चयन मानदंड उन शब्दों को प्राथमिकता देते हैं जो (1) बेसलाइन Orpheus मॉडल द्वारा व्यवस्थित रूप से गलत उच्चारण किए जाते हैं जिनकी त्रुटि दर 80% से अधिक है, (2) मूल वक्ताओं द्वारा सत्यापित स्पष्ट ग्राउंड-ट्रुथ उच्चारणों के साथ ध्वन्यात्मक रूप से असंदिग्ध हैं, और (3) बहुभाषी अनुप्रयोगों में वास्तविक दुनिया की तैनाती चुनौतियों के प्रतिनिधि हैं। प्रत्येक भाषा-विशिष्ट उपसमुच्चय चार श्रेणियों में फैला हुआ है: व्यक्तिगत नाम, भौगोलिक स्थान, अंतर्राष्ट्रीय ब्रांड नाम और सांस्कृतिक रूप से महत्वपूर्ण शब्द। 300 लक्षित संज्ञाओं में से प्रत्येक के लिए, हम वाक्यविन्यास स्थिति, सिमेंटिक संदर्भ और स्वर संरचना में भिन्न 10 संदर्भ-विविध वाक्यों का निर्माण करते हैं जिससे कुल 3,000 परीक्षण वाक्य प्राप्त होते हैं। संदर्भ उच्चारण दो पूरक तरीकों के माध्यम से प्राप्त किए जाते हैं: अच्छी तरह से प्रलेखित शब्दों के लिए, हम मैन्युअल रूप से IPA प्रतिलेखन निर्दिष्ट करके और फोनीम-जागरूक टीटीएस प्रणाली के माध्यम से ऑडियो उत्पन्न करके फोनीम-इंजेक्टेड संश्लेषण का उपयोग करते हैं। सांस्कृतिक रूप से संवेदनशील शब्दों के लिए, हम प्रामाणिकता और प्राकृतिक सह-अभिव्यक्ति पैटर्न सुनिश्चित करने के लिए मूल वक्ताओं से रिकॉर्डिंग एकत्र करते हैं।

मूल्यांकन मेट्रिक्स: मूल्यांकन के लिए, हम SonoEdit की प्रभावशीलता का व्यापक आकलन करने के लिए उद्देश्य और व्यक्तिपरक दोनों मेट्रिक्स का उपयोग करते हैं। लक्षित उच्चारण सटीकता को मापने के लिए, हम दो पूरक मेट्रिक्स की गणना करते हैं। टारगेट-WER लक्षित संज्ञा उच्चारण पर वर्ड एरर रेट का मूल्यांकन करता है, जबकि फोनीम एरर रेट (PER) फोर्स्ड एलाइनमेंट के माध्यम से फोनीम-स्तरीय सटीकता का बारीक मूल्यांकन प्रदान करता है। वैश्विक मॉडल संरक्षण का आकलन करने के लिए, ग्लोबल-WER संरक्षण सेट पर वर्ड एरर रेट को मापता है, यह सुनिश्चित करता है कि संपादन असंबंधित बयानों पर मॉडल के प्रदर्शन को खराब न करें। अंत में, हम वक्ता की पहचान और ध्वनिक विशेषताओं को संपादन प्रक्रिया के माध्यम से संरक्षित करने के लिए WavLM [28] स्पीकर एम्बेडिंग्स की कोसाइन समानता के रूप में गणना की गई स्पीकर सिमिलैरिटी (SIM) का उपयोग करते हैं। इसके अतिरिक्त, हम UTMOS [29] का उपयोग करके MOS स्कोर का मूल्यांकन करते हैं जो उद्देश्य मेट्रिक्स से परे अवधारणात्मक ध्वनिक गुणवत्ता को कैप्चर करता है।

4.2. परत संवेदनशीलता विश्लेषण

हम Orpheus-TTS में Llama-3.2-3B-Instruct [27] परतों (कुल 28) में उच्चारण ज्ञान को स्थानीयकृत करते हैं। (1) कॉज़ल मेडिएशन विश्लेषण से इनडायरेक्ट इफेक्ट (IE) जो उच्चारण में कॉज़ल योगदान को मापता है (जितना अधिक हो उतना बेहतर), (2) परत सक्रियणों से फोनीम की भविष्यवाणी करने वाले रैखिक क्लासिफायर से प्रोब सटीकता (उच्चतर स्पष्ट ध्वन्यात्मक एन्कोडिंग को इंगित करता है), और (3) ग्रेडिएंट नॉर्म जो परत मापदंडों के प्रति उच्चारण हानि की संवेदनशीलता को मापता है (उच्चतर मजबूत प्रभाव को इंगित करता है)। परतें 15-21 लगातार तीनों तरीकों में उच्चतम स्कोर दिखाती हैं, जिससे वे सर्जिकल संपादन के लिए उपयुक्त ध्वन्यात्मक-महत्वपूर्ण परतों के रूप में पहचानी जाती हैं। चित्र 3 और तालिका 1 में दिखाए गए अनुसार 3000 परीक्षण बयानों में रिपोर्ट की गई औसत ± मानक विचलन।

चित्र 3: तीन पूरक विश्लेषण विधियां अभिसारी साक्ष्य दिखाती हैं कि परतें 15-21 ध्वन्यात्मक जानकारी को एनकोड करती हैं: कॉज़ल मेडिएशन विश्लेषण (इनडायरेक्ट इफेक्ट, लाल), लीनियर प्रोब वर्गीकरण (प्रोब सटीकता, नीला), और ग्रेडिएंट-आधारित एट्रिब्यूशन (ग्रेडिएंट नॉर्म, हरा)।


तालिका 1: Orpheus-TTS में Llama-3.2-3B-Instruct परतों में ध्वन्यात्मक ज्ञान का स्थानीयकरण और संवेदनशीलता विश्लेषण। परतें 15-21 उच्चतम कॉज़ल प्रभाव, प्रोब सटीकता और ग्रेडिएंट नॉर्म दिखाती हैं, और संपादित होने पर न्यूनतम टारगेट-WER प्राप्त करती हैं।

परत सीमा

इनडायरेक्ट इफेक्ट

प्रोब सटीकता

ग्रेडिएंट नॉर्म

टारगेट-WER ↓

MOS ↑

1-7 (प्रारंभिक)

0.14 ± 0.04

36.8%

0.09

41.2

4.20

8-14 (मध्य)

0.35 ± 0.06

61.2%

0.23

18.7

4.15

15-21 (उत्तरार्द्ध)

0.71 ± 0.08

83.7%

0.56

2.8

4.18

22-28 (आउटपुट)

0.48 ± 0.07

71.4%

0.38

6.5

3.60

4.3. नल स्पेस बाधित संपादन

अनुभाग 4.2 में परत-वार विश्लेषण के आधार पर, हम मॉडल वेट को विशेष रूप से परतों L ∈ [15, 21] के भीतर संपादित करते हैं और इस अनुभाग में संपादनों पर गहन विश्लेषण प्रदान करते हैं

प्रभावकारिता: तालिका 2 मौजूदा तरीकों में सुधार प्रभावकारिता और व्यवहार संरक्षण के बीच एक कड़ा समझौता प्रकट करती है, जिसे SonoEdit नल-स्पेस बाधाओं के माध्यम से हल करता है। फुल फाइन-ट्यूनिंग (FFT) 2.1% टारगेट-WER प्राप्त करता है लेकिन विनाशकारी भूलने से ग्रस्त है, जो बड़बड़ाने और सामान्य शब्दों के गलत उच्चारण के रूप में प्रकट होता है। LoRA इसे कम करके 5.12% ग्लोबल-WER तक लाता है लेकिन फिर भी सामान्य प्रदर्शन को खराब करता है। इसके विपरीत, SonoEdit 3.15% ग्लोबल-WER को बनाए रखते हुए 2.8% टारगेट-WER प्राप्त करता है, जो सांख्यिकीय रूप से मूल मॉडल से अप्रभेद्य है और यह पुष्टि करता है कि नल-स्पेस प्रोजेक्शन गणितीय रूप से सुधारों को संरक्षित ज्ञान से अलग करता है।

तालिका 2: Orpheus-TTS पर संपादन विधियों की तुलना। टारगेट-WER त्रुटि को ठीक करने में सफलता को मापता है (जितना कम हो उतना बेहतर)। ग्लोबल-WER सामान्य ज्ञान को होने वाले नुकसान को मापता है (जितना कम हो उतना बेहतर)। SIM आवाज संरक्षण को मापता है (जितना अधिक हो उतना बेहतर)।

विधि

टारगेट-WER (↓)

ग्लोबल-WER (↓)

स्पीकर SIM (↑)

MOS (↑)

मूल मॉडल

86.4%

3.12%

1.00

4.21

फुल फाइन-ट्यूनिंग (FFT)

2.1%

18.45%

0.82

3.45

LoRA (r = 16)

4.5%

5.12%

0.91

3.98

ROME [17]

8.2%

12.30%

0.76

2.80

SonoEdit (हमारा)

2.8%

3.15%

0.99

4.18

ध्वनिक संरक्षण: टीटीएस संपादन के लिए वक्ता की पहचान को संरक्षित करना महत्वपूर्ण है। ROME के ​​अबाधित अपडेट स्पीकर एम्बेडिंग्स (SIM=0.76) को विकृत करते हैं, जिससे रोबोटिक कलाकृतियां आती हैं। SonoEdit लगभग पूर्ण संरक्षण प्राप्त करता है क्योंकि नल-स्पेस प्रोजेक्शन स्पीकर-एन्कोडिंग मैनिफोल्ड्स के साथ हस्तक्षेप को रोकता है। तालिका 3 दिखाती है कि 91% शुद्धता और मजबूत OOD सामान्यीकरण (88%) के साथ उच्चारण रेटिंग में नाटकीय रूप से सुधार हुआ है, जबकि मेल-स्पेक्ट्रोग्राम दूरी 68-69% तक कम हो गई है। तालिका 4 न्यूनतम प्रोसोडिक बहाव की पुष्टि करती है: WER केवल 0.1% बढ़ता है, F0 RMSE 0.3Hz तक, और MOS स्थिर रहता है, जो अत्यधिक स्थानीयकृत संपादनों को प्रदर्शित करता है जो वैश्विक ध्वनिक गुणों को संरक्षित करते हैं। विभिन्न तकनीकों को नियोजित करने पर मॉडल कैसा व्यवहार करते हैं इसका एक वास्तविक उदाहरण चित्र 4 में प्रदान किया गया है।

चित्र 4: उत्पन्न ऑडियो नमूनों का गुणात्मक तुलनात्मक विवरण।

तालिका 3: इन-डिस्ट्रीब्यूशन और OOD संदर्भों में मजबूती बनाए रखते हुए, नल-स्पेस बाधित अपडेट लागू करने के बाद लक्षित शब्द के उच्चारण में पर्याप्त सुधार होता है। मानव रेटिंग को तीन समीक्षकों के बीच औसत किया गया है।

मैट्रिक

बेसलाइन

संपादन के बाद

सुधार

मानव उच्चारण रेटिंग (1-5)

2.3 ± 0.4

4.4 ± 0.3

+2.1

% शब्द सही आंके गए

42%

91%

+49%

OOD संदर्भ सटीकता

38%

88%

+50%

L1 मेल दूरी ↓

1.00 ± 0.12

0.31 ± 0.08

-69%

DTW मेल दूरी ↓

0.84 ± 0.09

0.27 ± 0.04

-68%

तालिका 4: संरक्षित उदाहरणों पर स्थिरता विश्लेषण। लक्षित उच्चारण संपादन लागू करने के बाद, मॉडल बोधगम्यता, WER और प्रोसोडिक संरचना को सुरक्षित रखता है। ड्रिफ्ट मान न्यूनतम हैं, जो दर्शाते हैं कि अपडेट अत्यधिक स्थानीयकृत है।

मैट्रिक

बेसलाइन

संपादन के बाद

ड्रिफ्ट (∆)

संरक्षित सेट पर WER

4.2%

4.3%

+0.1%

वाक्य बोधगम्यता (MOS)

4.62

4.61

-0.01

F0 RMSE (Hz) ↓

11.8

12.1

+0.3

अवधि भिन्नता ↓

0.028

0.029

+0.001

ऊर्जा RMSE ↓

0.44

0.45

+0.01

4.4. एब्लेशन और दक्षता विश्लेषण

तालिका 5 दर्शाती है कि नल-स्पेस प्रोजेक्शन आवश्यक है: इसे हटाने से ग्लोबल-WER 3.15% से बढ़कर 9.84% हो जाता है और SIM 0.99 से घटकर 0.87 हो जाता है, जिससे यह पुष्टि होती है कि ऑर्थोगोनैलिटी विनाशकारी भूलने से बचाती है न कि केवल कॉस्मेटिक है। तालिका 6 दर्शाती है कि SonoEdit बिना किसी पैरामीटर को पेश किए और बिना किसी प्रशिक्षण लूप के ROME की वन-शॉट दक्षता (सेकंड बनाम FFT के लिए घंटे, LoRA के लिए मिनट) से मेल खाता है, जिससे उत्पादन टीटीएस प्रणालियों के लिए तेजी से तैनाती सक्षम होती है।

तालिका 5: नल-स्पेस बाधा को हटाने का प्रभाव।

संस्करण

टारगेट-WER ↓

ग्लोबल-WER ↓

SIM ↑

MOS ↑

SonoEdit (पूर्ण)

2.8

3.15

0.99

4.18

बिना नल-स्पेस के

2.5

9.84

0.87

3.52


तालिका 6: गणना और पैरामीटर तुलना।

विधि

ट्रेन स्टेप्स

अतिरिक्त पैरामीटर्स

संपादन समय

फुल फाइन-ट्यूनिंग

> 10⁴

सभी वेट

घंटे

LoRA (r = 16)

> 10³

∼1.2M

मिनट

ROME

1

0

सेकंड

SonoEdit

1

0

सेकंड

5. निष्कर्ष

हम SonoEdit पेश करते हैं, जो पुनर्प्रशिक्षण के बिना एलएलएम-आधारित टीटीएस में उच्चारण त्रुटियों को सर्जिकल रूप से ठीक करने का एक ढांचा है। कॉज़ल ट्रेसिंग को अपनाकर, हम उच्चारण को विशिष्ट मध्य-से-देर वाली ट्रांसफार्मर परतों में स्थानीयकृत करते हैं और सामान्य भाषण के नल स्पेस में अपडेट को प्रतिबंधित करने के लिए नल-स्पेस बाधित संपादन लागू करते हैं। यह दृष्टिकोण विनाशकारी भूलने से बचाता है: HardNoun-300 पर प्रयोगों से पता चलता है कि ग्लोबल-WER (3.15%) या वक्ता की पहचान (SIM 0.99) पर नगण्य प्रभाव के साथ 91% सुधार दर प्राप्त होती है, जो अबाधित तरीकों से काफी बेहतर प्रदर्शन करती है। SonoEdit प्राकृतिक स्वरशैली को संरक्षित करते हुए दुर्लभ संस्थाओं को ठीक करने के लिए एक किफ़ायती, वन-शॉट समाधान प्रदान करता है।

यद्यपि यह आशाजनक है, SonoEdit की कुछ सीमाएँ हैं। सबसे पहले, यह एक प्रतिनिधि भाषण कॉर्पस से पूर्व-अभिकलित नल स्पेस पर निर्भर करता है; तैनाती वितरण में बदलाव ऑर्थोगोनैलिटी गारंटी को कमजोर कर सकते हैं। दूसरा, हमारा कॉज़ल ट्रेसिंग मोटे सिमेंटिक टोकन पर केंद्रित है, जिससे संभवतः महीन-बारीक टोकन में एनकोड की गई उप-ध्वन्यात्मक त्रुटियां छूट सकती हैं। तीसरा, बड़े पैमाने पर संपादन बैचों की स्केलेबिलिटी एक खुला प्रश्न बनी हुई है, क्योंकि संचयी अपडेट नल स्पेस को संतृप्त कर सकते हैं। अंत में, SonoEdit विशिष्ट इकाई उच्चारणों को लक्षित करता है और उच्चारण पूर्वाग्रह (accent bias) जैसी वैश्विक व्यवस्थित त्रुटियों को ठीक करने के लिए कम उपयुक्त है।

संदर्भ

[1] John Kominek and Alan W Black. The CMU Arctic speech databases. Fifth ISCA workshop on speech synthesis, 2004.

[2] James Betker. Better speech synthesis through scaling. arXiv preprint arXiv:2305.07243, 2022.

[3] Yi Ren, Chenxu Hu, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, and Tie-Yan Liu. FastSpeech 2: Fast and high-quality end-to-end text to speech. In International Conference on Learning Representations, 2021.

[4] Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, et al. Neural codec language models are zero-shot text to speech synthesizers. arXiv preprint arXiv:2301.02111, 2023.

[5] Matthew Le, Apoorv Vyas, Bowen Shi, Brian Karrer, Leda Sari, Rashel Moritz, Mary Williamson, Vimal Manohar, Yossi Adi, Jay Mahadeokar, et al. Voicebox: Text-guided multilingual universal speech generation at scale. arXiv preprint arXiv:2306.15687, 2023.

[6] Zalán Borsos, Raphaël Marinier, Damien Vincent, Eugene Kharitonov, Olivier Pietquin, Matt Sharifi, Dominik Roblek, Olivier Teboul, David Grangier, Marco Tagliasacchi, et al. AudioLM: A language modeling approach to audio generation. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 31:2523–2533, 2023.

[7] Zalán Borsos, Matt Sharifi, and Marco Tagliasacchi. SoundStorm: Efficient parallel audio generation. arXiv preprint arXiv:2305.09636, 2023.

[8] Kai Shen, Zeqian Ju, Xu Tan, Yanqing Liu, Yichong Leng, Lei He, Tao Qin, Sheng Zhao, and Jiang Bian. NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers. arXiv preprint arXiv:2304.09116, 2023.

[9] Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi. High fidelity neural audio compression. arXiv preprint arXiv:2210.13438, 2022.

[10] Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi. SoundStream: An end-to-end neural audio codec. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:495–507, 2021.

[11] CanopyAI. Orpheus-TTS: Towards human-sounding speech. https://github.com/canopyai/Orpheus-TTS, 2025. Accessed: 2025-12-12.

[12] Sesame AI. Crossing the uncanny valley of conversational voice, February 2025. URL https://www.sesame.com/research/crossing_the_uncanny_valley_of_voice.

[13] Yonatan Belinkov and James Glass. Analysis methods in neural language processing: A survey. Transactions of the Association for Computational Linguistics, 7:49–72, 2019.

[14] Kevin Meng, David Bau, Alex Andonian, and Yonatan Belinkov. Locating and editing factual associations in gpt. Advances in neural information processing systems, 35:17359–17372, 2022.

[15] Atticus Geiger, Zhengxuan Wu, Christopher Potts, Thomas Icard, and Noah D Goodman. Causal abstraction for faithful model interpretation. In International Conference on Machine Learning, pages 11415–11435. PMLR, 2023.

[16] Ian Tenney, Dipanjan Das, and Ellie Pavlick. BERT rediscovers the classical NLP pipeline. In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pages 4593–4601, 2019.

[17] Kevin Meng, David Bau, Alex Andonian, and Yonatan Belinkov. Locating and editing factual associations in gpt. Advances in neural information processing systems, 35:17359–17372, 2022.

[18] Kevin Meng, Arnab Sen Sharma, Alex Andonian, Yonatan Belinkov, and David Bau. Massediting memory in a transformer. arXiv preprint arXiv:2210.07229, 2022.

[19] Eric Mitchell, Charles Lin, Antoine Bosselut, Christopher Manning, and Chelsea Finn. Fast model editing at scale. arXiv preprint arXiv:2110.11309, 2021.

[20] Junfeng Fang, Houcheng Jiang, Kun Wang, Yunshan Ma, Shi Jie, Xiang Wang, Xiangnan He, and Tat-Seng Chua. Alphaedit: Null-space constrained knowledge editing for language models. arXiv preprint arXiv:2410.02355, 2024.

[21] Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen, et al. Lora: Low-rank adaptation of large language models. ICLR, 1(2):3, 2022.

[22] Neil Houlsby, Andrei Giurgiu, Stanislaw Jastrzebski, Bruna Morrone, Quentin De Laroussilhe, Andrea Gesmundo, Mona Attariyan, and Sylvain Gelly. Parameter-efficient transfer learning for NLP. In International Conference on Machine Learning, pages 2790–2799. PMLR, 2019.

[23] Tim Dettmers, Artidoro Pagnoni, Ari Holtzman, and Luke Zettlemoyer. QLoRA: Efficient finetuning of quantized LLMs. arXiv preprint arXiv:2305.14314, 2023.

[24] Xiang Lisa Li and Percy Liang. Prefix-tuning: Optimizing continuous prompts for generation. arXiv preprint arXiv:2101.00190, 2021.

[25] Hubert Siuzdak, Florian Grötschla, and Luca A. Lanzendörfer. SNAC: Multi-Scale Neural Audio Codec. arXiv e-prints, art. arXiv:2410.14411, October 2024. doi: 10.48550/arXiv.2410.14411.

[26] Heiga Zen, Viet Dang, Rob Clark, Yu Zhang, Ron J Weiss, Ye Jia, Zhifeng Chen, and Yonghui Wu. Libritts: A corpus derived from librispeech for text-to-speech. arXiv preprint arXiv:1904.02882, 2019.

[27] Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Alex Vaughan, et al. The llama 3 herd of models. arXiv preprint arXiv:2407.21783, 2024.

[28] Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, et al. WavLM: Large-scale self-supervised pretraining for full stack speech processing. IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022.

[29] Takaaki Saeki, Detai Xin, Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, and Hiroshi Saruwatari. Utmos: Utokyo-sarulab system for voicemos challenge 2022. arXiv preprint arXiv:2204.02152, 2022.

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104