SSML क्या है?
स्पीच सिंथेसिस मार्कअप लैंग्वेज (SSML) एक W3C मानक है जो टेक्स्ट-टू-स्पीच (TTS) आउटपुट को नियंत्रित करने के लिए XML-आधारित सिंटैक्स प्रदान करता है। स्पीच इंजन को रॉ टेक्स्ट पास करने और उसके डिफॉल्ट रेंडरिंग को स्वीकार करने के बजाय, डेवलपर्स SSML टैग का उपयोग करके यह निर्दिष्ट करते हैं कि प्रत्येक शब्द, वाक्यांश या वाक्य कैसा सुनाई देना चाहिए। इसका परिणाम ऐसा सिंथेसाइज्ड भाषण होता है जो अधिक प्राकृतिक, सटीक और अभिव्यंजक होता है।
SSML कैसे काम करता है
एक SSML दस्तावेज़ बोली जाने वाली सामग्री को एक रूट <speak> एलिमेंट के अंदर रैप करता है। उस एलिमेंट के भीतर, आप ऐसे टैग एम्बेड करते हैं जो TTS इंजन द्वारा इसे ऑडियो में बदलने से पहले स्पीच आउटपुट को संशोधित करते हैं। इंजन मार्कअप को पार्स करता है, निर्देशों को लागू करता है, और एक ऑडियो स्ट्रीम (या फ़ाइल) उत्पन्न करता है जो आपकी सेटिंग्स को दर्शाती है।
प्रमुख SSML टैग
<prosody> पिच, गति और वॉल्यूम को नियंत्रित करता है, जिससे आप डिलीवरी को तेज या धीमा कर सकते हैं और टोनल गुणों को समायोजित कर सकते हैं।
<break> एक निर्दिष्ट अवधि का ठहराव (पॉज़) डालता है, जो गति और प्राकृतिक लगने वाले भाषण के लिए उपयोगी है।
<emphasis> अलग-अलग स्तरों (मजबूत, मध्यम, कम) पर किसी शब्द या वाक्यांश पर जोर देता है।
<say-as> इंजन को बताता है कि तारीख, फोन नंबर, मुद्रा, या स्पेल-आउट अक्षरों जैसी सामग्री की व्याख्या कैसे की जाए।
<phoneme> IPA या विक्रेता-विशिष्ट वर्णमाला का उपयोग करके स्पष्ट ध्वन्यात्मक ट्रांसक्रिप्शन के साथ डिफॉल्ट उच्चारण को ओवरराइड करता है।
<sub> प्रदर्शित पाठ के लिए एक उपनाम प्रतिस्थापित करता है, जो संक्षिप्त रूपों या संक्षिप्ताक्षरों के लिए उपयोगी है।
<audio> सिंथेसाइज्ड आउटपुट के भीतर एक पूर्व-रिकॉर्डेड ऑडियो क्लिप को एम्बेड करता है, जिससे मिश्रित-मीडिया अनुभवों को सक्षम किया जा सके।
सभी प्लेटफ़ॉर्म पर SSML
अधिकांश प्रमुख TTS प्लेटफ़ॉर्म SSML का समर्थन करते हैं, हालांकि समर्थन की गहराई अलग-अलग होती है। Azure Cognitive Services, Amazon Polly, और Google Cloud Text-to-Speech जैसी क्लाउड सेवाएँ प्रत्येक SSML इनपुट स्वीकार करती हैं और प्लेटफ़ॉर्म-विशिष्ट एक्सटेंशन प्रदान करती हैं। उदाहरण के लिए, Azure SSML में बेस W3C विनिर्देश से परे आवाज चयन और ऑडियो प्रभावों के लिए अतिरिक्त एलिमेंट शामिल हैं। ElevenLabs जैसे नए AI वॉयस प्लेटफ़ॉर्म भी आउटपुट को बेहतर बनाने के लिए SSML या SSML-जैसे नियंत्रण स्वीकार करते हैं।
सामान्य उपयोग के मामले
वॉयस असिस्टेंट और IVR सिस्टम: SSML यह सुनिश्चित करता है कि संकेत सही गति, जोर और उच्चारण के साथ बोले जाएं।
एक्सेसिबिलिटी टूल्स: स्क्रीन रीडर्स और सहायक उपकरणों को उस मार्कअप से लाभ होता है जो यह स्पष्ट करता है कि सामग्री को जोर से कैसे पढ़ा जाना चाहिए।
सामग्री उत्पादन: SSML जनरेटर और संपादक रचनाकारों को सटीक प्रोसोडिक नियंत्रण के साथ टेक्स्ट को ऑडियो में बदलने की अनुमति देते हैं, जिससे पॉडकास्ट या डबिंग वर्कफ़्लो आसान हो जाते हैं।
SSML उदाहरण
एक साधारण SSML स्निपेट इस तरह दिख सकता है:
यह उदाहरण ग्रीटिंग के बाद आधे सेकंड का ठहराव डालता है और ऑर्डर नंबर को संख्या "बारह हजार तीन सौ पैंतालीस" के बजाय व्यक्तिगत अंकों के रूप में पढ़ता है।