हमीस सईद, अद्वैत जोगलेकर, श्रीनिवासन उमेश
स्प्रिंग लैब, भारतीय प्रौद्योगिकी संस्थान मद्रास
hameessayed71@gmail.com, advaitjoglekar@gmail.com, umeshs@ee.iitm.ac.in
मशीन अनुवाद पर नौवें सम्मेलन की कार्यवाही, पृष्ठ 770-774
15-16 नवंबर, 2024 ©2024 एसोसिएशन फॉर कंप्यूटेशनल लिंग्विस्टिक्स
सार (Abstract)
हम चार कम-संसाधन वाली भारतीय भाषाओं: खासी, मिज़ो, मणिपुरी और असमिया के लिए एक मजबूत अनुवाद मॉडल विकसित कर रहे हैं। हमारे दृष्टिकोण में डेटा संग्रह और प्रीप्रोसेसिंग से लेकर प्रशिक्षण और मूल्यांकन तक एक व्यापक पाइपलाइन शामिल है, जिसमें WMT टास्क डेटासेट, BPCC, PMIndia और OpenLanguageData के डेटा का लाभ उठाया गया है। द्विभाषी डेटा की कमी को दूर करने के लिए, हम मिज़ो और खासी के लिए एकभाषी डेटासेट पर बैक-ट्रांसलेशन तकनीकों का उपयोग करते हैं, जिससे हमारे प्रशिक्षण कॉर्पस का महत्वपूर्ण रूप से विस्तार होता है। हम असमिया, मिज़ो और मणिपुरी के लिए प्री-ट्रेन्ड NLLB 3.3B मॉडल को फाइन-ट्यून करते हैं, जिससे बेसलाइन की तुलना में बेहतर प्रदर्शन प्राप्त होता है। खासी के लिए, जो NLLB मॉडल द्वारा समर्थित नहीं है, हम विशेष टोकन पेश करते हैं और अपने खासी कॉर्पस पर मॉडल को प्रशिक्षित करते हैं। हमारे प्रशिक्षण में मास्क्ड लैंग्वेज मॉडलिंग शामिल है, जिसके बाद अंग्रेजी-से-भारतीय और भारतीय-से-अंग्रेजी अनुवादों के लिए फाइन-ट्यूनिंग की जाती है।
1. परिचय
कम-संसाधन वाली भाषाओं के अनुवाद से प्राकृतिक भाषा प्रसंस्करण में महत्वपूर्ण चुनौतियाँ उत्पन्न होती हैं। हालाँकि उच्च-संसाधन वाली भाषाओं के लिए मशीन अनुवाद मॉडल विकसित करने में काफी प्रगति हुई है, लेकिन कम-संसाधन वाली भाषाएँ अक्सर समानांतर कॉर्पोरा और डिजिटल संसाधनों की कमी से जूझती हैं (हड्डो और अन्य, 2022)। खासी, मिजो, मणिपुरी और असमिया जैसी भाषाएँ इस चुनौती का प्रतिनिधित्व करती हैं, जहाँ सीमित डेटा और अनूठी भाषाई जटिलताएँ मजबूत अनुवाद प्रणालियों के विकास में बाधा बनती हैं।
हाल के वर्षों में, इस अंतर को पाटने के प्रयासों में तेजी आई है, जो भारत पैरेलल कॉर्पस कलेक्शन¹ (बीपीसीसी) (गाला और अन्य, 2023) और सरकारी सहायता प्राप्त परियोजनाओं जैसे पीएमइंडिया (हड्डो और किरेफू, 2020) जैसी पहलों से प्रेरित हैं, जिनका उद्देश्य भारतीय भाषाओं के लिए द्विभाषी डेटा प्रदान करना है। इन प्रयासों के बावजूद, कम-संसाधन वाली भारतीय भाषाओं के अनुवाद मॉडल अभी तक अपने उच्च-संसाधन समकक्षों (सुमन और अन्य, 2023) के तुलनीय प्रदर्शन स्तर हासिल नहीं कर पाए हैं, जिसके लिए मॉडल प्रशिक्षण और डेटा उपयोग के अभिनव तरीकों की आवश्यकता है।
इस काम में, हम चार कम-संसाधन वाली भारतीय भाषाओं: खासी, मिजो, मणिपुरी और असमिया के लिए एक मजबूत अनुवाद मॉडल विकसित कर रहे हैं। हमारे दृष्टिकोण में डेटा संग्रह, प्रीप्रोसेसिंग, प्रशिक्षण और मूल्यांकन शामिल है। हम डब्ल्यूएमटी, बीपीसीसी, पीएमइंडिया और ओपनलैंग्वेजडेटा² (मेलार्ड और अन्य, 2023) के डेटासेट का उपयोग करते हैं, और बैक-ट्रांसलेशन (एडु नोव और अन्य, 2018) तकनीकों के माध्यम से द्विभाषी डेटा को बढ़ाते हैं, विशेष रूप से मिजो और खासी के लिए, जिससे हमारे प्रशिक्षण कॉर्पस का महत्वपूर्ण रूप से विस्तार होता है।
हम मेटा के डेटा प्रीप्रोसेसिंग मानकों का पालन करते हैं और कम मापदंडों के साथ दक्षता और प्रदर्शन में सुधार करने के लिए एनएलएलबी (और अन्य, 2022) 3.3बी मॉडल पर लोरा (लो-रैंक एडाप्टेशन) (हू और अन्य, 2021) फाइन-ट्यूनिंग का उपयोग करते हैं। हमारा मॉडल शुरू में अंग्रेजी से भारतीय भाषाओं में एकतरफा अनुवाद पर ध्यान केंद्रित करता है, फिर रिवर्स अनुवाद (डाबरे और अन्य, 2019) पर। इसके परिणाम बेसलाइन की तुलना में बेहतर प्रदर्शन दिखाते हैं, विशेष रूप से खासी के लिए, जहाँ हम प्री-ट्रेन्ड मॉडल समर्थन में कमियों को दूर करते हैं।
¹ https://ai4bharat.iitm.ac.in/bpcc/
² https://github.com/openlanguagedata/seed
³ https://censusindia.gov.in/
2. डेटासेट
इस अध्ययन में, हम 'लो रिसोर्स इंडिक लैंग्वेजेस शेयर्ड टास्क' में शामिल चार कम-संसाधन वाली भारतीय भाषाओं पर ध्यान केंद्रित करते हैं: खासी, मिजो, मणिपुरी और असमिया। यह खंड प्रत्येक भाषा के महत्व को उजागर करता है, जिसमें उनके संबंधित क्षेत्रों में उनकी भूमिका, उनका भाषाई और सांस्कृतिक महत्व और उपयोग किए गए डेटासेट का विवरण शामिल है। भाषा बोलने वालों से संबंधित आंकड़े 2011 की भारतीय जनगणना³ के अनुसार हैं।
तालिका 1: प्रत्येक भाषा के लिए डेटा स्रोतों और वॉल्यूम का विवरण। "OLD" ओपनलैंग्वेजडेटा को संदर्भित करता है। "बैक-ट्रांसलेटेड" डेटा शुरू में एकभाषी WMT टास्क डेटा से पहले 500k वर्णों के लिए Google Translate⁴ का उपयोग करके तैयार किया गया था, जिसके बाद के पुनरावृत्तियों में प्रशिक्षित मॉडल का उपयोग करके डेटा आकार बढ़ाया गया।
भाषा | ISO-693-3 | WMT पैरेलल | BPCC | PMIndia | OLD | बैक-ट्रांसलेटेड | कुल |
|---|---|---|---|---|---|---|---|
असमिया | asm | 50,000 | 35,354 | 9,732 | 0 | 0 | 95,086 |
मणिपुरी | mni | 21,687 | 0 | 7,419 | 6,193 | 0 | 35,036 |
खासी | kha | 24,000 | 0 | 0 | 0 | 102,070 | 126,070 |
मिजो | lus | 50,000 | 0 | 0 | 0 | 30,164 | 80,164 |
⁴ https://google.translate.com/
2.1. भाषाएँ
असमिया (असमिया) एक इंडो-आर्यन भाषा है जो मुख्य रूप से पूर्वोत्तर भारतीय राज्य असम में बोली जाती है, जहाँ यह एक आधिकारिक भाषा और क्षेत्रीय संपर्क भाषा के रूप में कार्य करती है। 1.5 करोड़ से अधिक मूल भाषियों के साथ, यह इस क्षेत्र में सबसे व्यापक रूप से बोली जाने वाली भाषाओं में से एक है। ऐतिहासिक रूप से, असमिया अहोम साम्राज्य की दरबारी भाषा थी। यह असमिया लिपि में लिखी जाती है, जो एक अबुगिडा प्रणाली है, जो अपने अनूठे मुद्रण आकृतियों (typographic ligatures) के लिए जानी जाती है।
मणिपुरी (मेइतेइलोन) एक प्रमुख तिब्बती-बर्मन भाषा है जो मुख्य रूप से मणिपुर, भारत में बोली जाती है, जहाँ यह एक आधिकारिक भाषा है और यह भारतीय गणराज्य की संवैधानिक रूप से अनुसूचित आधिकारिक भाषाओं में से एक है। 17.6 लाख वक्ताओं के साथ, यह भारत में सबसे व्यापक रूप से बोली जाने वाली तिब्बती-बर्मन भाषा है और हिंदी तथा कश्मीरी के बाद भारत की सबसे तेजी से बढ़ने वाली भाषाओं में तीसरे स्थान पर है। यह अपनी मेइतेइ लिपि के साथ-साथ बंगाली लिपि में भी लिखी जाती है।
खासी (का कतिएन खासी) एक ऑस्ट्रोएशियाटिक भाषा है जो मुख्य रूप से मेघालय, भारत में खासी लोगों द्वारा बोली जाती है, जिसके 2011 की जनगणना के अनुसार लगभग 10 लाख मूल भाषी हैं। मेघालय के कुछ जिलों में इस भाषा को सह-आधिकारिक दर्जा प्राप्त है। खासी लैटिन लिपि में लिखी जाती है। खासी की सबसे करीबी भाषाएँ खासी समूह की अन्य भाषाएँ हैं, जैसे प्नार और वार।
मिजो (मिजो तावंग) चीन-तिब्बती भाषा परिवार से संबंधित है, जो मुख्य रूप से भारत के मिजोरम राज्य में बोली जाती है, जिसके लगभग 8 लाख वक्ता हैं। मिजो भाषा, जिसे लुशाई के नाम से भी जाना जाता है, का एक समृद्ध मौखिक इतिहास है और इसे पहली बार 19वीं सदी के अंत में लैटिन लिपि का उपयोग करके लिखा गया था। मिजो को मिजोरम की आधिकारिक भाषा के रूप में मान्यता प्राप्त है और इसका उपयोग शिक्षा, सरकार और मीडिया में किया जाता है।
3. कार्यप्रणाली
यह खंड उपयोग किए गए प्रीप्रोसेसिंग चरणों और प्रशिक्षण विधियों को शामिल करता है, जिसमें डेटासेट तैयार करना और मेटा के बहुभाषी एनएलएलबी 3.3बी बेस प्री-ट्रेन्ड मॉडल का फाइन-ट्यूनिंग शामिल है। डेटा वितरण पर विस्तृत आंकड़े तालिका 1 में प्रस्तुत किए गए हैं।
3.1. प्रीप्रोसेसिंग
प्रीप्रोसेसिंग चरण में, हमने यह सुनिश्चित करने के लिए कई चरणों का पालन किया कि मॉडल प्रशिक्षण से पहले पाठ डेटा साफ और सुसंगत हो। हमने मोसेस (कोहेन और अन्य, 2007) का उपयोग करके विराम चिह्नों को सामान्य करके शुरुआत की, जो अनुवाद मॉडल के प्रीप्रोसेसिंग, प्रशिक्षण और परीक्षण के लिए डिज़ाइन किया गया एक ओपन-सोर्स टूलकिट है। यह चरण पाठ डेटा में निरंतरता बनाए रखने में मदद करता है, जो मजबूत मॉडल के प्रशिक्षण के लिए महत्वपूर्ण है।
गैर-मुद्रण योग्य वर्ण, जो अक्सर पाठ प्रसंस्करण में हस्तक्षेप करते हैं, उन्हें एक स्पेस से बदल दिया गया। यह निर्णय यह सुनिश्चित करता है कि कोई भी अदृश्य या गैर-मानक वर्ण टोकनीकरण प्रक्रिया को बाधित न करे और पाठ मानक मुद्रण योग्य वर्णों से बना हो।
हमने पात्रों को उनके विहित रूपों में बदलने के लिए यूनिकोड सामान्यीकरण (NFKC) का भी उपयोग किया, जिससे विभिन्न यूनिकोड प्रस्तुतियों में पाठ अधिक सुसंगत हो गया।
ये प्रीप्रोसेसिंग चरण मेटा द्वारा उनके बहुभाषी मॉडल के लिए उल्लिखित चरणों के अनुरूप हैं, और अधिक विवरण उनके गिटहब⁵ पर पाए जा सकते हैं। यह दृष्टिकोण सुनिश्चित करता है कि प्रशिक्षण के लिए उपयोग किया जाने वाला पाठ डेटा साफ, सुसंगत और मॉडलिंग आवश्यकताओं के अनुकूल है।
⁵ https://github.com/facebookresearch/stopes/blob/main/stopes/pipelines/monolingual/monolingual_line_processor.py
3.2. प्रशिक्षण
मॉडल प्रशिक्षण के लिए, हमने मेटा के एनएलएलबी (नो लैंग्वेज लेफ्ट बिहाइंड) 3.3बी पैरामीटर मॉडल का उपयोग किया, जो 200 से अधिक भाषाओं का समर्थन करने के लिए बनाया गया एक अत्याधुनिक बहुभाषी मशीन अनुवाद मॉडल है, जो इसे कम-संसाधन वाली भाषाओं से जुड़े कार्यों के लिए आदर्श बनाता है (त्रान और अन्य, 2021; यांग और अन्य, 2021)।
एनएलएलबी 3.3बी मॉडल 3.3 बिलियन पैरामीटर वाले ट्रांसफार्मर (वासवानी और अन्य, 2023) आर्किटेक्चर पर आधारित है, जिसमें एक डेंस एनकोडर-डिकोडर डिज़ाइन है। इसमें निम्नलिखित हाइपरपैरामीटर शामिल हैं:
तालिका 2: बेसलाइन प्री-ट्रेन्ड मॉडल के लिए हाइपरपैरामीटर। 24 एनकोडर और 24 डिकोडर परतें।
हाइपरपैरामीटर्स | |
|---|---|
एम्बेड आकार | 2048 |
ffn आकार | 8192 |
attn हेड्स | 16 |
enc/dec परतें | 48 |
मॉडल को फाइन-ट्यून करने के लिए, हमने LoRA का उपयोग किया, जो एक ऐसी तकनीक है जो मॉडल के मापदंडों के केवल एक छोटे से उपसमुच्चय को अनुकूलित करके कम्प्यूटेशनल मांगों और प्रशिक्षण समय को काफी कम कर देती है। LoRA को पारंपरिक फाइन-ट्यूनिंग विधियों के प्रदर्शन से मेल खाते हुए दिखाया गया है, जबकि ट्रेन करने योग्य मापदंडों की संख्या को 50 गुना कम किया गया है (एल्वेस और अन्य, 2023)। यह दृष्टिकोण मेटा के एनएलएलबी 3.3बी जैसे बड़े पैमाने के मॉडल के लिए विशेष रूप से प्रभावी है, जिससे प्रदर्शन से समझौता किए बिना कुशल अनुकूलन की अनुमति मिलती है।
3.3. मापदंड
प्रशिक्षण प्रक्रिया तीन चरणों में आयोजित की गई थी: पहला, एकभाषी डेटा का लाभ उठाकर लक्षित भाषा की समझ को बढ़ाने के लिए मॉडल को मास्क्ड लैंग्वेज मॉडलिंग (डेवलिन और अन्य, 2019) पर प्रशिक्षित किया गया था। इसके बाद, इसे अंग्रेजी-से-भारतीय अनुवादों के लिए फाइन-ट्यून किया गया, जिसके बाद भारतीय-से-अंग्रेजी अनुवादों के लिए और फाइन-ट्यूनिंग की गई। खासी के मामले में, जो एनएलएलबी मॉडल द्वारा मूल रूप से समर्थित नहीं थी, खासी भाषा को समायोजित करने के लिए टोकेनाइज़र की शब्दावली में विशेष टोकन जोड़े गए थे। इसके बाद इस भाषा के उचित प्रबंधन और एकीकरण को सुनिश्चित करने के लिए मॉडल को खासी कॉर्पस पर प्रशिक्षित किया गया था।
प्रशिक्षण 4 एनवीडिया ए6000 जीपीयू पर किया गया था। इन सेटिंग्स ने हमें कम्प्यूटेशनल दक्षता का प्रबंधन करते हुए मॉडल के प्रदर्शन को अनुकूलित करने की अनुमति दी।
तालिका 3: एनएलएलबी 3.3बी मॉडल को फाइन-ट्यून करने के लिए उपयोग किए जाने वाले प्रशिक्षण तर्क और लोरा कॉन्फ़िगरेशन।
प्रशिक्षण तर्क | |
|---|---|
ऑप्टिमाइज़र | adafactor |
लर्निंग रेट | 1e-5 |
इपोक्स (epochs) | 8 |
परिशुद्धता | bf16 |
pmask | 0.15 |
peft प्रकार | lora |
रैंक | 128 |
लोरा अल्फा | 256 |
लोरा ड्रॉपआउट | 0.1 |
लक्षित मॉड्यूल | all linear |
3.4. इंफ्रेंस (अनुमान)
इंफ्रेंस के लिए, प्रशिक्षित एडॉप्टर को एनएलएलबी 3.3बी मॉडल पर लोड किया गया था। अनुवादों की विविधता और गुणवत्ता में सुधार करने के लिए मॉडल ने 10 बीम के साथ बीम सर्च रणनीति और 2.5 के दोहराव पेनल्टी का उपयोग करके भविष्यवाणियां उत्पन्न कीं। हमने विभिन्न बीम और पेनल्टी कॉन्फ़िगरेशन के साथ प्रयोग किया, अंततः यह पाया कि इस विशेष सेटअप ने सबसे सटीक और भाषाई रूप से सुसंगत परिणाम दिए।
4. परिणाम
विभिन्न भाषा युग्मों और दिशाओं में हमारे अनुवाद मॉडल का मूल्यांकन तालिका 4 में दिखाया गया है, जिसमें प्रदर्शन का आकलन BLEU (पपिनीनी और अन्य, 2002), ट्रांसलेशन एरर रेट (स्नोवर और अन्य, 2006), RIBES (इसोज़ाकी और अन्य, 2010), METEOR (बनर्जी और लावी, 2005), और chrF (पोपोविक, 2015) मेट्रिक्स का उपयोग करके किया गया है। हमने पाया कि अंग्रेजी-से-मणिपुरी और अंग्रेजी-से-मिजो दिशा में स्कोर हमारे प्रशिक्षण में उपयोग किए गए बैक-ट्रांसलेटेड डेटा की खराब गुणवत्ता के कारण प्रभावित हुए।
अंग्रेजी-असमिया मॉडल ने अपेक्षाकृत अच्छा प्रदर्शन किया, जिसमें अंग्रेजी-से-असमिया के लिए BLEU स्कोर 27.26 और असमिया-से-अंग्रेजी के लिए 26.69 था।
अंग्रेजी-मणिपुरी मॉडल ने मणिपुरी-से-अंग्रेजी (20.88) की तुलना में अंग्रेजी-से-मणिपुरी (2.7) के लिए कम BLEU स्कोर दिखाया। अंग्रेजी-से-मणिपुरी के लिए TER स्कोर अधिक था, जो इस दिशा में अधिक अनुवाद त्रुटियों को दर्शाता है।
अंग्रेजी-खासी खासी के लिए, BLEU स्कोर अंग्रेजी-से-खासी के लिए 12.12 और खासी-से-अंग्रेजी के लिए 10.47 था।
अंग्रेजी-मिजो प्रदर्शन मिश्रित था, जिसमें अंग्रेजी-से-मिजो के लिए BLEU स्कोर 6.6 और मिजो-से-अंग्रेजी के लिए 18.49 था। TER स्कोर अंग्रेजी-से-मिजो के लिए उच्च त्रुटि दर को दर्शाता है, जबकि METEOR और ChrF स्कोर दोनों दिशाओं में अपेक्षाकृत संतुलित थे।
तालिका 4: अंतिम मूल्यांकन में रिपोर्ट किए गए हमारे एमटी सिस्टम के अनुवाद प्रदर्शन मेट्रिक्स।
भाषा युग्म | परीक्षण सेट | BLEU | TER | RIBES | METEOR | ChrF |
|---|---|---|---|---|---|---|
अंग्रेजी-असमिया | en_to_as_contrastive | 27.26 | 52.79 | 0.3032 | 0.513 | 65.2 |
as_to_en_contrastive | 26.69 | 39.08 | 0.3308 | 0.7066 | 60.48 | |
अंग्रेजी-मणिपुरी | en_to_mn_contrastive | 2.7 | 84.6 | 0.1185 | 0.1567 | 44.28 |
mn_to_en_contrastive | 20.88 | 48.77 | 0.3031 | 0.61 | 53.64 | |
अंग्रेजी-खासी | en_to_kh_contrastive | 12.12 | 63.31 | 0.1864 | 0.4453 | 44.55 |
kh_to_en_contrastive | 10.47 | 61.43 | 0.2172 | 0.5042 | 42.71 | |
अंग्रेजी-मिजो | en_to_mz_contrastive | 6.6 | 66.06 | 0.1746 | 0.495 | 49.79 |
mz_to_en_contrastive | 18.49 | 53.19 | 0.2684 | 0.588 | 50.44 |
5. निष्कर्ष
इस काम में, हमने कम-संसाधन वाली भारतीय भाषाओं और अंग्रेजी के बीच अनुवाद को बढ़ाने के लिए मेटा के एनएलएलबी 3.3बी मॉडल, जो 3.3 बिलियन मापदंडों वाला एक बड़े पैमाने का बहुभाषी ट्रांसफार्मर है, का उपयोग किया। प्रशिक्षण प्रक्रिया में मास्क्ड लैंग्वेज मॉडलिंग शामिल थी, जिसके बाद अंग्रेजी-से-भारतीय और भारतीय-से-अंग्रेजी अनुवाद शामिल थे। खासी के लिए विशेष टोकन जोड़े गए, और कम्प्यूटेशनल दक्षता को अनुकूलित करने और प्रशिक्षण समय को कम करने के लिए LoRA (लो-रैंक एडाप्टेशन) का उपयोग किया गया।
4 NVIDIA A6000 GPUs पर संचालित, हमारा दृष्टिकोण प्रदर्शित करता है कि बड़े पैमाने पर बहुभाषी मॉडल, जब LoRA के साथ संयुक्त होते हैं, विविध भाषाई पैटर्न को प्रभावी ढंग से कैप्चर करते हैं और अनुवाद क्षमताओं को आगे बढ़ाते हैं।
6. सीमाएं
इस अध्ययन में, हमें कई सीमाओं का सामना करना पड़ा जिन्होंने हमारी अनुवाद प्रणाली की समग्र प्रभावशीलता को प्रभावित किया। एक बड़ी चुनौती कम्प्यूटेशनल संसाधन सीमाओं के कारण हमारे डेटासेट का सीमित आकार था। सीमित डेटासेट आकार ने मॉडल की सामान्यीकरण करने की क्षमता में बाधा डाली होगी, विशेष रूप से कम-संसाधन वाली भाषाओं के लिए जहाँ बड़े और अधिक विविध डेटासेट फायदेमंद होते।
एक और समस्या जिसका हमें सामना करना पड़ा, वह थी बैक-ट्रांसलेटेड डेटा की गुणवत्ता। मशीन अनुवाद के माध्यम से डेटासेट को बढ़ाने की प्रक्रिया के परिणामस्वरूप अक्सर कम गुणवत्ता वाला डेटा प्राप्त हुआ, जिसने मॉडल के प्रदर्शन को नकारात्मक रूप से प्रभावित किया। यह भविष्य के काम में अधिक मजबूत डेटा पीढ़ी तकनीकों की आवश्यकता पर प्रकाश डालता है।
हमने उन अनुवादों के बीच एक स्पष्ट प्रदर्शन अंतर भी देखा जहाँ अंग्रेजी लक्षित भाषा थी और जहाँ एक भारतीय भाषा लक्षित भाषा थी। यह सुझाव देता है कि यद्यपि मॉडल भारतीय भाषाओं के रूपात्मक पहलुओं को समझ सकता है, लेकिन वह इन भाषाओं में सटीक अनुवाद उत्पन्न करने के लिए संघर्ष करता है। यह सीमा भारतीय भाषा निर्माण की जटिलताओं को संभालने में और अधिक सुधार की आवश्यकता को रेखांकित करती है।
अंत में, हमारे प्रशिक्षण डेटा और वास्तविक दुनिया के अनुप्रयोगों के बीच संभावित डोमेन बेमेल ने एक महत्वपूर्ण चुनौती पेश की। प्रशिक्षण डेटा व्यावहारिक परिदृश्यों में पाए जाने वाले भाषाई और प्रासंगिक बारीकियों को पूरी तरह से कैप्चर नहीं कर सकता है, जिससे वास्तविक उपयोग के मामलों में प्रदर्शन कम हो जाता है। मॉडल की वास्तविक दुनिया में प्रयोज्यता में सुधार के लिए भविष्य के काम में इस मुद्दे का समाधान करना महत्वपूर्ण होगा।
संदर्भ
दुआर्टे एम. अल्वेस, नूनो एम. गुएरेइरो, जोआओ अल्वेस, जोस पोम्बल, रिकार्डो री, जोस जी. सी. डी सूजा, पियरे कोलंबो, और आंद्रे एफ. टी. मार्टिंस। 2023. फाइन-ट्यूनिंग और इन-कॉन्टेक्स्ट लर्निंग के साथ मशीन अनुवाद के लिए बड़े भाषा मॉडल का संचालन। प्रीप्रिंट, arXiv:2310.13448.
सतनजीव बनर्जी और अलोन लावी। 2005. METEOR: मानव निर्णयों के साथ बेहतर सहसंबंध के साथ एमटी मूल्यांकन के लिए एक स्वचालित मीट्रिक। मशीन अनुवाद और/या संक्षेपीकरण के लिए आंतरिक और बाह्य मूल्यांकन उपायों पर एसीएल कार्यशाला की कार्यवाही में, पृष्ठ 65-72, एन आर्बर, मिशिगन। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
राज डाबरे, अत्सुशी फुजिता, और चेनहुई चू। 2019. कम संसाधन वाले न्यूरल मशीन अनुवाद के लिए बहु-चरणीय फाइन-ट्यूनिंग के माध्यम से बहुभाषावाद का दोहन। प्राकृतिक भाषा प्रसंस्करण में अनुभवजन्य तरीकों पर 2019 सम्मेलन और प्राकृतिक भाषा प्रसंस्करण पर 9वीं अंतर्राष्ट्रीय संयुक्त सम्मेलन (EMNLP-IJCNLP) की कार्यवाही में, पृष्ठ 1410-1416, हांगकांग, चीन। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
जैकब डेवलिन, मिंग-वेई चांग, केंटन ली, और क्रिस्टीना टौटानोवा। 2019. बर्ट: भाषा की समझ के लिए गहरे द्विदिश ट्रांसफार्मर का पूर्व-प्रशिक्षण। प्रीप्रिंट, arXiv:1810.04805.
सेर्गेई एडु नोव, मायले ओट, माइकल ऑली, और डेविड ग्रैंगियर। 2018. पैमाने पर बैक-ट्रांसलेशन को समझना। प्रीप्रिंट, arXiv:1808.09381.
एनएलएलबी टीम और अन्य। 2022. कोई भाषा पीछे नहीं छूटी: मानव-केंद्रित मशीन अनुवाद का पैमाना बढ़ाना। प्रीप्रिंट, arXiv:2207.04672.
जय गाला, प्रांजल ए. चिताले, राघवन एके, वरुण गुम्मा, सुमंत डोड्डापनेनी, असवंत कुमार, जानकी नवाले, अनुपमा सुजाता, रतीश पुदुपल्ली, विवेक राघवन, प्रत्युष कुमार, मितेश एम. खापड़ा, राज डाबरे, और अनूप कुंचुकुट्टन। 2023. इंडिकट्रांस2: सभी 22 अनुसूचित भारतीय भाषाओं के लिए उच्च गुणवत्ता वाले और सुलभ मशीन अनुवाद मॉडल की ओर। प्रीप्रिंट, arXiv:2305.16307.
बैरी हेडौ, राहेल बॉडेन, एंटोनियो वैलेरियो मिसेली बैरोन, जिंद्रिच हेलकल, और एलेक्जेंड्रा बिर्च। 2022. कम संसाधन वाले मशीन अनुवाद का सर्वेक्षण। कम्प्यूटेशनल भाषाविज्ञान, 48(3):673–732.
बैरी हेडौ और फहीम किरेफू। 2020. पीएमइंडिया – भारत की भाषाओं के समानांतर कॉर्पोरा का एक संग्रह। प्रीप्रिंट, arXiv:2001.09907.
एडवर्ड जे. हू, येलोंग शेन, फिलिप वालिस, ज़ेयुआन एलन-झू, युआनज़ी ली, श्यान वांग, लू वांग, और वेइज़ू चेन। 2021. लोरा: बड़े भाषा मॉडल का लो-रैंक अनुकूलन। प्रीप्रिंट, arXiv:2106.09685.
हिदेकी इसोज़ाकी, त्सुतोमु हिराओ, केविन डह, कत्सुहितो सुदौ, और हाजिमे त्सुकादा। 2010. दूर के भाषा युग्मों के लिए अनुवाद गुणवत्ता का स्वचालित मूल्यांकन। प्राकृतिक भाषा प्रसंस्करण में अनुभवजन्य तरीकों पर 2010 सम्मेलन की कार्यवाही में, पृष्ठ 944-952, कैंब्रिज, एमए। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
फिलिप कोहेन, हियू होआंग, एलेक्जेंड्रा बिर्च, क्रिस कॉलिसन-बर्च, मार्सेलो फेडेरिको, निकोला बर्टोल्डी, ब्रुक कोवान, वेड शेन, क्रिस्टीन मोरन, रिचर्ड ज़ेंस, क्रिस डायर, ओन्ड्रेज बोजार, एलेक्जेंड्रा कॉन्स्टेंटिन, और इवान हर्बस्ट। 2007. मोसेस: सांख्यिकीय मशीन अनुवाद के लिए ओपन सोर्स टूलकिट। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन की 45वीं वार्षिक बैठक की कार्यवाही में डेमो और पोस्टर सत्रों की साथी वॉल्यूम कार्यवाही, पृष्ठ 177-180, प्राग, चेक गणराज्य। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
जीन मेलार्ड, सिंथिया गाओ, इलाहे कलबस्ती, कौशिक राम सदागोपन, वेदानुज गोस्वामी, फिलिप कोहेन, एंजेला फैन, और फ्रांसिस्को गुज़मैन। 2023. छोटा डेटा, बड़ा प्रभाव: प्रभावी मशीन अनुवाद के लिए न्यूनतम डेटा का लाभ उठाना। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन की 61वीं वार्षिक बैठक की कार्यवाही में (वॉल्यूम 1: लॉन्ग पेपर्स), पृष्ठ 2740-2756, टोरंटो, कनाडा। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
पार्थ पाकराई, शांतनु पाल, अद्वैत वेतागिरी, रेड्डी मोहना कृष्णा, अर्नब कुमार माजी, संदीप कुमार दाश, लेनिन लैतोंजम, लिंगदोह सारा, और रियांका मन्ना। 2024. कम संसाधन वाली भारतीय भाषाओं के अनुवाद पर wmt 2024 साझा कार्य के निष्कर्ष। मशीन अनुवाद पर नौवें सम्मेलन की कार्यवाही में (WMT).
शांतनु पाल, पार्थ पाकराई, सहिनूर रहमान लस्कर, लेनिन लैतोंजम, वनलालमुआनसांगी खेंगलाव्ट, सुनीता वारजरी, पंकज कुंदन दादुरे, और संदीप कुमार दाश। 2023. कम संसाधन वाली भारतीय भाषाओं के अनुवाद पर wmt 2023 साझा कार्य के निष्कर्ष। मशीन अनुवाद पर आठवें सम्मेलन की कार्यवाही में, पृष्ठ 682–694.
किशोर पपिनीनी, सलीम रूकोस, टॉड वार्ड, और वेई-जिंग झू। 2002. BLEU: मशीन अनुवाद के स्वचालित मूल्यांकन के लिए एक विधि। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन की 40वीं वार्षिक बैठक की कार्यवाही में, पृष्ठ 311–318, फिलाडेल्फिया, पेंसिल्वेनिया, यूएसए। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
माजा पोपोविक। 2015. chrF: स्वचालित एमटी मूल्यांकन के लिए कैरेक्टर n-gram F-स्कोर। सांख्यिकीय मशीन अनुवाद पर दसवें कार्यशाला की कार्यवाही में, पृष्ठ 392–395, लिस्बन, पुर्तगाल। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
मैथ्यू स्नोवर, बोनी डोर, रिच श्वार्ट्ज, लिनिया मिकिउला, और जॉन मखौल। 2006. लक्षित मानव एनोटेशन के साथ अनुवाद संपादन दर का एक अध्ययन। अमेरिका में मशीन अनुवाद के लिए एसोसिएशन के 7वें सम्मेलन की कार्यवाही में: तकनीकी पत्र, पृष्ठ 223–231, कैंब्रिज, मैसाचुसेट्स, यूएसए। अमेरिका में मशीन अनुवाद के लिए एसोसिएशन।
धैर्य सुमन, अतनु मंडल, शांतनु पाल, और सुदीप नस्कर। 2023. IACS-LRILT: कम संसाधन वाली भारतीय भाषाओं के लिए मशीन अनुवाद। मशीन अनुवाद पर आठवें सम्मेलन की कार्यवाही में, पृष्ठ 972–977, सिंगापुर। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।
चौ त्रान, श्रुति भोसले, जेम्स क्रॉस, फिलिप कोहेन, सेर्गेई एडु नोव, और एंजेला फैन। 2021. फेसबुक एआई wmt21 समाचार अनुवाद कार्य प्रस्तुत करना। प्रीप्रिंट, arXiv:2108.03265.
आशीष वासवानी, नोम शज़ीर, निकी परमार, जैकब उसज़कोरेइट, ल्लियन जोन्स, एडन एन. गोमेज़, लुकास कैसर, और इलिया पोलोसुखिन। 2023. ध्यान ही सब कुछ है जिसकी आपको आवश्यकता है। प्रीप्रिंट, arXiv:1706.03762.
जियन यांग, शुमिंग मा, हाओयांग हुआंग, डोंगडोंग झांग, ली डोंग, शाओहान हुआंग, एलेक्जेंड्रे मुजियो, सक्षम सिंघल, हानी हसन, शिया सॉन्ग, और फुरु वेई। 2021. WMT21 साझा कार्य के लिए Microsoft से बहुभाषी मशीन अनुवाद प्रणालियाँ। मशीन अनुवाद पर छठे सम्मेलन की कार्यवाही में, पृष्ठ 446–455, ऑनलाइन। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।