निम्न संसाधन वाली भारतीय भाषाओं के अनुवाद का साझा कार्य

निम्न संसाधन वाली भारतीय भाषाओं के अनुवाद का साझा कार्य

निम्न संसाधन वाली भारतीय भाषाओं के अनुवाद का साझा कार्य

हमीस सईद, अद्वैत जोगलेकर, श्रीनिवासन उमेश

स्प्रिंग लैब, भारतीय प्रौद्योगिकी संस्थान मद्रास

hameessayed71@gmail.com, advaitjoglekar@gmail.com, umeshs@ee.iitm.ac.in

मशीन अनुवाद पर नौवें सम्मेलन की कार्यवाही, पृष्ठ 770-774

15-16 नवंबर, 2024 ©2024 एसोसिएशन फॉर कंप्यूटेशनल लिंग्विस्टिक्स

सार (Abstract)

हम चार कम-संसाधन वाली भारतीय भाषाओं: खासी, मिज़ो, मणिपुरी और असमिया के लिए एक मजबूत अनुवाद मॉडल विकसित कर रहे हैं। हमारे दृष्टिकोण में डेटा संग्रह और प्रीप्रोसेसिंग से लेकर प्रशिक्षण और मूल्यांकन तक एक व्यापक पाइपलाइन शामिल है, जिसमें WMT टास्क डेटासेट, BPCC, PMIndia और OpenLanguageData के डेटा का लाभ उठाया गया है। द्विभाषी डेटा की कमी को दूर करने के लिए, हम मिज़ो और खासी के लिए एकभाषी डेटासेट पर बैक-ट्रांसलेशन तकनीकों का उपयोग करते हैं, जिससे हमारे प्रशिक्षण कॉर्पस का महत्वपूर्ण रूप से विस्तार होता है। हम असमिया, मिज़ो और मणिपुरी के लिए प्री-ट्रेन्ड NLLB 3.3B मॉडल को फाइन-ट्यून करते हैं, जिससे बेसलाइन की तुलना में बेहतर प्रदर्शन प्राप्त होता है। खासी के लिए, जो NLLB मॉडल द्वारा समर्थित नहीं है, हम विशेष टोकन पेश करते हैं और अपने खासी कॉर्पस पर मॉडल को प्रशिक्षित करते हैं। हमारे प्रशिक्षण में मास्क्ड लैंग्वेज मॉडलिंग शामिल है, जिसके बाद अंग्रेजी-से-भारतीय और भारतीय-से-अंग्रेजी अनुवादों के लिए फाइन-ट्यूनिंग की जाती है।

1. परिचय

कम-संसाधन वाली भाषाओं के अनुवाद से प्राकृतिक भाषा प्रसंस्करण में महत्वपूर्ण चुनौतियाँ उत्पन्न होती हैं। हालाँकि उच्च-संसाधन वाली भाषाओं के लिए मशीन अनुवाद मॉडल विकसित करने में काफी प्रगति हुई है, लेकिन कम-संसाधन वाली भाषाएँ अक्सर समानांतर कॉर्पोरा और डिजिटल संसाधनों की कमी से जूझती हैं (हड्डो और अन्य, 2022)। खासी, मिजो, मणिपुरी और असमिया जैसी भाषाएँ इस चुनौती का प्रतिनिधित्व करती हैं, जहाँ सीमित डेटा और अनूठी भाषाई जटिलताएँ मजबूत अनुवाद प्रणालियों के विकास में बाधा बनती हैं।

हाल के वर्षों में, इस अंतर को पाटने के प्रयासों में तेजी आई है, जो भारत पैरेलल कॉर्पस कलेक्शन¹ (बीपीसीसी) (गाला और अन्य, 2023) और सरकारी सहायता प्राप्त परियोजनाओं जैसे पीएमइंडिया (हड्डो और किरेफू, 2020) जैसी पहलों से प्रेरित हैं, जिनका उद्देश्य भारतीय भाषाओं के लिए द्विभाषी डेटा प्रदान करना है। इन प्रयासों के बावजूद, कम-संसाधन वाली भारतीय भाषाओं के अनुवाद मॉडल अभी तक अपने उच्च-संसाधन समकक्षों (सुमन और अन्य, 2023) के तुलनीय प्रदर्शन स्तर हासिल नहीं कर पाए हैं, जिसके लिए मॉडल प्रशिक्षण और डेटा उपयोग के अभिनव तरीकों की आवश्यकता है।

इस काम में, हम चार कम-संसाधन वाली भारतीय भाषाओं: खासी, मिजो, मणिपुरी और असमिया के लिए एक मजबूत अनुवाद मॉडल विकसित कर रहे हैं। हमारे दृष्टिकोण में डेटा संग्रह, प्रीप्रोसेसिंग, प्रशिक्षण और मूल्यांकन शामिल है। हम डब्ल्यूएमटी, बीपीसीसी, पीएमइंडिया और ओपनलैंग्वेजडेटा² (मेलार्ड और अन्य, 2023) के डेटासेट का उपयोग करते हैं, और बैक-ट्रांसलेशन (एडु नोव और अन्य, 2018) तकनीकों के माध्यम से द्विभाषी डेटा को बढ़ाते हैं, विशेष रूप से मिजो और खासी के लिए, जिससे हमारे प्रशिक्षण कॉर्पस का महत्वपूर्ण रूप से विस्तार होता है।

हम मेटा के डेटा प्रीप्रोसेसिंग मानकों का पालन करते हैं और कम मापदंडों के साथ दक्षता और प्रदर्शन में सुधार करने के लिए एनएलएलबी (और अन्य, 2022) 3.3बी मॉडल पर लोरा (लो-रैंक एडाप्टेशन) (हू और अन्य, 2021) फाइन-ट्यूनिंग का उपयोग करते हैं। हमारा मॉडल शुरू में अंग्रेजी से भारतीय भाषाओं में एकतरफा अनुवाद पर ध्यान केंद्रित करता है, फिर रिवर्स अनुवाद (डाबरे और अन्य, 2019) पर। इसके परिणाम बेसलाइन की तुलना में बेहतर प्रदर्शन दिखाते हैं, विशेष रूप से खासी के लिए, जहाँ हम प्री-ट्रेन्ड मॉडल समर्थन में कमियों को दूर करते हैं।

¹ https://ai4bharat.iitm.ac.in/bpcc/

² https://github.com/openlanguagedata/seed

³ https://censusindia.gov.in/

2. डेटासेट

इस अध्ययन में, हम 'लो रिसोर्स इंडिक लैंग्वेजेस शेयर्ड टास्क' में शामिल चार कम-संसाधन वाली भारतीय भाषाओं पर ध्यान केंद्रित करते हैं: खासी, मिजो, मणिपुरी और असमिया। यह खंड प्रत्येक भाषा के महत्व को उजागर करता है, जिसमें उनके संबंधित क्षेत्रों में उनकी भूमिका, उनका भाषाई और सांस्कृतिक महत्व और उपयोग किए गए डेटासेट का विवरण शामिल है। भाषा बोलने वालों से संबंधित आंकड़े 2011 की भारतीय जनगणना³ के अनुसार हैं।

तालिका 1: प्रत्येक भाषा के लिए डेटा स्रोतों और वॉल्यूम का विवरण। "OLD" ओपनलैंग्वेजडेटा को संदर्भित करता है। "बैक-ट्रांसलेटेड" डेटा शुरू में एकभाषी WMT टास्क डेटा से पहले 500k वर्णों के लिए Google Translate⁴ का उपयोग करके तैयार किया गया था, जिसके बाद के पुनरावृत्तियों में प्रशिक्षित मॉडल का उपयोग करके डेटा आकार बढ़ाया गया।

भाषा

ISO-693-3

WMT पैरेलल

BPCC

PMIndia

OLD

बैक-ट्रांसलेटेड

कुल

असमिया

asm

50,000

35,354

9,732

0

0

95,086

मणिपुरी

mni

21,687

0

7,419

6,193

0

35,036

खासी

kha

24,000

0

0

0

102,070

126,070

मिजो

lus

50,000

0

0

0

30,164

80,164

⁴ https://google.translate.com/

2.1. भाषाएँ

असमिया (असमिया) एक इंडो-आर्यन भाषा है जो मुख्य रूप से पूर्वोत्तर भारतीय राज्य असम में बोली जाती है, जहाँ यह एक आधिकारिक भाषा और क्षेत्रीय संपर्क भाषा के रूप में कार्य करती है। 1.5 करोड़ से अधिक मूल भाषियों के साथ, यह इस क्षेत्र में सबसे व्यापक रूप से बोली जाने वाली भाषाओं में से एक है। ऐतिहासिक रूप से, असमिया अहोम साम्राज्य की दरबारी भाषा थी। यह असमिया लिपि में लिखी जाती है, जो एक अबुगिडा प्रणाली है, जो अपने अनूठे मुद्रण आकृतियों (typographic ligatures) के लिए जानी जाती है।

मणिपुरी (मेइतेइलोन) एक प्रमुख तिब्बती-बर्मन भाषा है जो मुख्य रूप से मणिपुर, भारत में बोली जाती है, जहाँ यह एक आधिकारिक भाषा है और यह भारतीय गणराज्य की संवैधानिक रूप से अनुसूचित आधिकारिक भाषाओं में से एक है। 17.6 लाख वक्ताओं के साथ, यह भारत में सबसे व्यापक रूप से बोली जाने वाली तिब्बती-बर्मन भाषा है और हिंदी तथा कश्मीरी के बाद भारत की सबसे तेजी से बढ़ने वाली भाषाओं में तीसरे स्थान पर है। यह अपनी मेइतेइ लिपि के साथ-साथ बंगाली लिपि में भी लिखी जाती है।

खासी (का कतिएन खासी) एक ऑस्ट्रोएशियाटिक भाषा है जो मुख्य रूप से मेघालय, भारत में खासी लोगों द्वारा बोली जाती है, जिसके 2011 की जनगणना के अनुसार लगभग 10 लाख मूल भाषी हैं। मेघालय के कुछ जिलों में इस भाषा को सह-आधिकारिक दर्जा प्राप्त है। खासी लैटिन लिपि में लिखी जाती है। खासी की सबसे करीबी भाषाएँ खासी समूह की अन्य भाषाएँ हैं, जैसे प्नार और वार।

मिजो (मिजो तावंग) चीन-तिब्बती भाषा परिवार से संबंधित है, जो मुख्य रूप से भारत के मिजोरम राज्य में बोली जाती है, जिसके लगभग 8 लाख वक्ता हैं। मिजो भाषा, जिसे लुशाई के नाम से भी जाना जाता है, का एक समृद्ध मौखिक इतिहास है और इसे पहली बार 19वीं सदी के अंत में लैटिन लिपि का उपयोग करके लिखा गया था। मिजो को मिजोरम की आधिकारिक भाषा के रूप में मान्यता प्राप्त है और इसका उपयोग शिक्षा, सरकार और मीडिया में किया जाता है।

3. कार्यप्रणाली

यह खंड उपयोग किए गए प्रीप्रोसेसिंग चरणों और प्रशिक्षण विधियों को शामिल करता है, जिसमें डेटासेट तैयार करना और मेटा के बहुभाषी एनएलएलबी 3.3बी बेस प्री-ट्रेन्ड मॉडल का फाइन-ट्यूनिंग शामिल है। डेटा वितरण पर विस्तृत आंकड़े तालिका 1 में प्रस्तुत किए गए हैं।

3.1. प्रीप्रोसेसिंग

प्रीप्रोसेसिंग चरण में, हमने यह सुनिश्चित करने के लिए कई चरणों का पालन किया कि मॉडल प्रशिक्षण से पहले पाठ डेटा साफ और सुसंगत हो। हमने मोसेस (कोहेन और अन्य, 2007) का उपयोग करके विराम चिह्नों को सामान्य करके शुरुआत की, जो अनुवाद मॉडल के प्रीप्रोसेसिंग, प्रशिक्षण और परीक्षण के लिए डिज़ाइन किया गया एक ओपन-सोर्स टूलकिट है। यह चरण पाठ डेटा में निरंतरता बनाए रखने में मदद करता है, जो मजबूत मॉडल के प्रशिक्षण के लिए महत्वपूर्ण है।

गैर-मुद्रण योग्य वर्ण, जो अक्सर पाठ प्रसंस्करण में हस्तक्षेप करते हैं, उन्हें एक स्पेस से बदल दिया गया। यह निर्णय यह सुनिश्चित करता है कि कोई भी अदृश्य या गैर-मानक वर्ण टोकनीकरण प्रक्रिया को बाधित न करे और पाठ मानक मुद्रण योग्य वर्णों से बना हो।

हमने पात्रों को उनके विहित रूपों में बदलने के लिए यूनिकोड सामान्यीकरण (NFKC) का भी उपयोग किया, जिससे विभिन्न यूनिकोड प्रस्तुतियों में पाठ अधिक सुसंगत हो गया।

ये प्रीप्रोसेसिंग चरण मेटा द्वारा उनके बहुभाषी मॉडल के लिए उल्लिखित चरणों के अनुरूप हैं, और अधिक विवरण उनके गिटहब⁵ पर पाए जा सकते हैं। यह दृष्टिकोण सुनिश्चित करता है कि प्रशिक्षण के लिए उपयोग किया जाने वाला पाठ डेटा साफ, सुसंगत और मॉडलिंग आवश्यकताओं के अनुकूल है।

⁵ https://github.com/facebookresearch/stopes/blob/main/stopes/pipelines/monolingual/monolingual_line_processor.py

3.2. प्रशिक्षण

मॉडल प्रशिक्षण के लिए, हमने मेटा के एनएलएलबी (नो लैंग्वेज लेफ्ट बिहाइंड) 3.3बी पैरामीटर मॉडल का उपयोग किया, जो 200 से अधिक भाषाओं का समर्थन करने के लिए बनाया गया एक अत्याधुनिक बहुभाषी मशीन अनुवाद मॉडल है, जो इसे कम-संसाधन वाली भाषाओं से जुड़े कार्यों के लिए आदर्श बनाता है (त्रान और अन्य, 2021; यांग और अन्य, 2021)।

एनएलएलबी 3.3बी मॉडल 3.3 बिलियन पैरामीटर वाले ट्रांसफार्मर (वासवानी और अन्य, 2023) आर्किटेक्चर पर आधारित है, जिसमें एक डेंस एनकोडर-डिकोडर डिज़ाइन है। इसमें निम्नलिखित हाइपरपैरामीटर शामिल हैं:

तालिका 2: बेसलाइन प्री-ट्रेन्ड मॉडल के लिए हाइपरपैरामीटर। 24 एनकोडर और 24 डिकोडर परतें।

हाइपरपैरामीटर्स


एम्बेड आकार

2048

ffn आकार

8192

attn हेड्स

16

enc/dec परतें

48

मॉडल को फाइन-ट्यून करने के लिए, हमने LoRA का उपयोग किया, जो एक ऐसी तकनीक है जो मॉडल के मापदंडों के केवल एक छोटे से उपसमुच्चय को अनुकूलित करके कम्प्यूटेशनल मांगों और प्रशिक्षण समय को काफी कम कर देती है। LoRA को पारंपरिक फाइन-ट्यूनिंग विधियों के प्रदर्शन से मेल खाते हुए दिखाया गया है, जबकि ट्रेन करने योग्य मापदंडों की संख्या को 50 गुना कम किया गया है (एल्वेस और अन्य, 2023)। यह दृष्टिकोण मेटा के एनएलएलबी 3.3बी जैसे बड़े पैमाने के मॉडल के लिए विशेष रूप से प्रभावी है, जिससे प्रदर्शन से समझौता किए बिना कुशल अनुकूलन की अनुमति मिलती है।

3.3. मापदंड

प्रशिक्षण प्रक्रिया तीन चरणों में आयोजित की गई थी: पहला, एकभाषी डेटा का लाभ उठाकर लक्षित भाषा की समझ को बढ़ाने के लिए मॉडल को मास्क्ड लैंग्वेज मॉडलिंग (डेवलिन और अन्य, 2019) पर प्रशिक्षित किया गया था। इसके बाद, इसे अंग्रेजी-से-भारतीय अनुवादों के लिए फाइन-ट्यून किया गया, जिसके बाद भारतीय-से-अंग्रेजी अनुवादों के लिए और फाइन-ट्यूनिंग की गई। खासी के मामले में, जो एनएलएलबी मॉडल द्वारा मूल रूप से समर्थित नहीं थी, खासी भाषा को समायोजित करने के लिए टोकेनाइज़र की शब्दावली में विशेष टोकन जोड़े गए थे। इसके बाद इस भाषा के उचित प्रबंधन और एकीकरण को सुनिश्चित करने के लिए मॉडल को खासी कॉर्पस पर प्रशिक्षित किया गया था।

प्रशिक्षण 4 एनवीडिया ए6000 जीपीयू पर किया गया था। इन सेटिंग्स ने हमें कम्प्यूटेशनल दक्षता का प्रबंधन करते हुए मॉडल के प्रदर्शन को अनुकूलित करने की अनुमति दी।

तालिका 3: एनएलएलबी 3.3बी मॉडल को फाइन-ट्यून करने के लिए उपयोग किए जाने वाले प्रशिक्षण तर्क और लोरा कॉन्फ़िगरेशन।

प्रशिक्षण तर्क


ऑप्टिमाइज़र

adafactor

लर्निंग रेट

1e-5

इपोक्स (epochs)

8

परिशुद्धता

bf16

pmask

0.15

peft प्रकार

lora

रैंक

128

लोरा अल्फा

256

लोरा ड्रॉपआउट

0.1

लक्षित मॉड्यूल

all linear

3.4. इंफ्रेंस (अनुमान)

इंफ्रेंस के लिए, प्रशिक्षित एडॉप्टर को एनएलएलबी 3.3बी मॉडल पर लोड किया गया था। अनुवादों की विविधता और गुणवत्ता में सुधार करने के लिए मॉडल ने 10 बीम के साथ बीम सर्च रणनीति और 2.5 के दोहराव पेनल्टी का उपयोग करके भविष्यवाणियां उत्पन्न कीं। हमने विभिन्न बीम और पेनल्टी कॉन्फ़िगरेशन के साथ प्रयोग किया, अंततः यह पाया कि इस विशेष सेटअप ने सबसे सटीक और भाषाई रूप से सुसंगत परिणाम दिए।

4. परिणाम

विभिन्न भाषा युग्मों और दिशाओं में हमारे अनुवाद मॉडल का मूल्यांकन तालिका 4 में दिखाया गया है, जिसमें प्रदर्शन का आकलन BLEU (पपिनीनी और अन्य, 2002), ट्रांसलेशन एरर रेट (स्नोवर और अन्य, 2006), RIBES (इसोज़ाकी और अन्य, 2010), METEOR (बनर्जी और लावी, 2005), और chrF (पोपोविक, 2015) मेट्रिक्स का उपयोग करके किया गया है। हमने पाया कि अंग्रेजी-से-मणिपुरी और अंग्रेजी-से-मिजो दिशा में स्कोर हमारे प्रशिक्षण में उपयोग किए गए बैक-ट्रांसलेटेड डेटा की खराब गुणवत्ता के कारण प्रभावित हुए।

अंग्रेजी-असमिया मॉडल ने अपेक्षाकृत अच्छा प्रदर्शन किया, जिसमें अंग्रेजी-से-असमिया के लिए BLEU स्कोर 27.26 और असमिया-से-अंग्रेजी के लिए 26.69 था।

अंग्रेजी-मणिपुरी मॉडल ने मणिपुरी-से-अंग्रेजी (20.88) की तुलना में अंग्रेजी-से-मणिपुरी (2.7) के लिए कम BLEU स्कोर दिखाया। अंग्रेजी-से-मणिपुरी के लिए TER स्कोर अधिक था, जो इस दिशा में अधिक अनुवाद त्रुटियों को दर्शाता है।

अंग्रेजी-खासी खासी के लिए, BLEU स्कोर अंग्रेजी-से-खासी के लिए 12.12 और खासी-से-अंग्रेजी के लिए 10.47 था।

अंग्रेजी-मिजो प्रदर्शन मिश्रित था, जिसमें अंग्रेजी-से-मिजो के लिए BLEU स्कोर 6.6 और मिजो-से-अंग्रेजी के लिए 18.49 था। TER स्कोर अंग्रेजी-से-मिजो के लिए उच्च त्रुटि दर को दर्शाता है, जबकि METEOR और ChrF स्कोर दोनों दिशाओं में अपेक्षाकृत संतुलित थे।

तालिका 4: अंतिम मूल्यांकन में रिपोर्ट किए गए हमारे एमटी सिस्टम के अनुवाद प्रदर्शन मेट्रिक्स।

भाषा युग्म

परीक्षण सेट

BLEU

TER

RIBES

METEOR

ChrF

अंग्रेजी-असमिया

en_to_as_contrastive

27.26

52.79

0.3032

0.513

65.2


as_to_en_contrastive

26.69

39.08

0.3308

0.7066

60.48

अंग्रेजी-मणिपुरी

en_to_mn_contrastive

2.7

84.6

0.1185

0.1567

44.28


mn_to_en_contrastive

20.88

48.77

0.3031

0.61

53.64

अंग्रेजी-खासी

en_to_kh_contrastive

12.12

63.31

0.1864

0.4453

44.55


kh_to_en_contrastive

10.47

61.43

0.2172

0.5042

42.71

अंग्रेजी-मिजो

en_to_mz_contrastive

6.6

66.06

0.1746

0.495

49.79


mz_to_en_contrastive

18.49

53.19

0.2684

0.588

50.44

5. निष्कर्ष

इस काम में, हमने कम-संसाधन वाली भारतीय भाषाओं और अंग्रेजी के बीच अनुवाद को बढ़ाने के लिए मेटा के एनएलएलबी 3.3बी मॉडल, जो 3.3 बिलियन मापदंडों वाला एक बड़े पैमाने का बहुभाषी ट्रांसफार्मर है, का उपयोग किया। प्रशिक्षण प्रक्रिया में मास्क्ड लैंग्वेज मॉडलिंग शामिल थी, जिसके बाद अंग्रेजी-से-भारतीय और भारतीय-से-अंग्रेजी अनुवाद शामिल थे। खासी के लिए विशेष टोकन जोड़े गए, और कम्प्यूटेशनल दक्षता को अनुकूलित करने और प्रशिक्षण समय को कम करने के लिए LoRA (लो-रैंक एडाप्टेशन) का उपयोग किया गया।

4 NVIDIA A6000 GPUs पर संचालित, हमारा दृष्टिकोण प्रदर्शित करता है कि बड़े पैमाने पर बहुभाषी मॉडल, जब LoRA के साथ संयुक्त होते हैं, विविध भाषाई पैटर्न को प्रभावी ढंग से कैप्चर करते हैं और अनुवाद क्षमताओं को आगे बढ़ाते हैं।

6. सीमाएं

इस अध्ययन में, हमें कई सीमाओं का सामना करना पड़ा जिन्होंने हमारी अनुवाद प्रणाली की समग्र प्रभावशीलता को प्रभावित किया। एक बड़ी चुनौती कम्प्यूटेशनल संसाधन सीमाओं के कारण हमारे डेटासेट का सीमित आकार था। सीमित डेटासेट आकार ने मॉडल की सामान्यीकरण करने की क्षमता में बाधा डाली होगी, विशेष रूप से कम-संसाधन वाली भाषाओं के लिए जहाँ बड़े और अधिक विविध डेटासेट फायदेमंद होते।

एक और समस्या जिसका हमें सामना करना पड़ा, वह थी बैक-ट्रांसलेटेड डेटा की गुणवत्ता। मशीन अनुवाद के माध्यम से डेटासेट को बढ़ाने की प्रक्रिया के परिणामस्वरूप अक्सर कम गुणवत्ता वाला डेटा प्राप्त हुआ, जिसने मॉडल के प्रदर्शन को नकारात्मक रूप से प्रभावित किया। यह भविष्य के काम में अधिक मजबूत डेटा पीढ़ी तकनीकों की आवश्यकता पर प्रकाश डालता है।

हमने उन अनुवादों के बीच एक स्पष्ट प्रदर्शन अंतर भी देखा जहाँ अंग्रेजी लक्षित भाषा थी और जहाँ एक भारतीय भाषा लक्षित भाषा थी। यह सुझाव देता है कि यद्यपि मॉडल भारतीय भाषाओं के रूपात्मक पहलुओं को समझ सकता है, लेकिन वह इन भाषाओं में सटीक अनुवाद उत्पन्न करने के लिए संघर्ष करता है। यह सीमा भारतीय भाषा निर्माण की जटिलताओं को संभालने में और अधिक सुधार की आवश्यकता को रेखांकित करती है।

अंत में, हमारे प्रशिक्षण डेटा और वास्तविक दुनिया के अनुप्रयोगों के बीच संभावित डोमेन बेमेल ने एक महत्वपूर्ण चुनौती पेश की। प्रशिक्षण डेटा व्यावहारिक परिदृश्यों में पाए जाने वाले भाषाई और प्रासंगिक बारीकियों को पूरी तरह से कैप्चर नहीं कर सकता है, जिससे वास्तविक उपयोग के मामलों में प्रदर्शन कम हो जाता है। मॉडल की वास्तविक दुनिया में प्रयोज्यता में सुधार के लिए भविष्य के काम में इस मुद्दे का समाधान करना महत्वपूर्ण होगा।

संदर्भ

दुआर्टे एम. अल्वेस, नूनो एम. गुएरेइरो, जोआओ अल्वेस, जोस पोम्बल, रिकार्डो री, जोस जी. सी. डी सूजा, पियरे कोलंबो, और आंद्रे एफ. टी. मार्टिंस। 2023. फाइन-ट्यूनिंग और इन-कॉन्टेक्स्ट लर्निंग के साथ मशीन अनुवाद के लिए बड़े भाषा मॉडल का संचालन। प्रीप्रिंट, arXiv:2310.13448.

सतनजीव बनर्जी और अलोन लावी। 2005. METEOR: मानव निर्णयों के साथ बेहतर सहसंबंध के साथ एमटी मूल्यांकन के लिए एक स्वचालित मीट्रिक। मशीन अनुवाद और/या संक्षेपीकरण के लिए आंतरिक और बाह्य मूल्यांकन उपायों पर एसीएल कार्यशाला की कार्यवाही में, पृष्ठ 65-72, एन आर्बर, मिशिगन। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

राज डाबरे, अत्सुशी फुजिता, और चेनहुई चू। 2019. कम संसाधन वाले न्यूरल मशीन अनुवाद के लिए बहु-चरणीय फाइन-ट्यूनिंग के माध्यम से बहुभाषावाद का दोहन। प्राकृतिक भाषा प्रसंस्करण में अनुभवजन्य तरीकों पर 2019 सम्मेलन और प्राकृतिक भाषा प्रसंस्करण पर 9वीं अंतर्राष्ट्रीय संयुक्त सम्मेलन (EMNLP-IJCNLP) की कार्यवाही में, पृष्ठ 1410-1416, हांगकांग, चीन। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

जैकब डेवलिन, मिंग-वेई चांग, केंटन ली, और क्रिस्टीना टौटानोवा। 2019. बर्ट: भाषा की समझ के लिए गहरे द्विदिश ट्रांसफार्मर का पूर्व-प्रशिक्षण। प्रीप्रिंट, arXiv:1810.04805.

सेर्गेई एडु नोव, मायले ओट, माइकल ऑली, और डेविड ग्रैंगियर। 2018. पैमाने पर बैक-ट्रांसलेशन को समझना। प्रीप्रिंट, arXiv:1808.09381.

एनएलएलबी टीम और अन्य। 2022. कोई भाषा पीछे नहीं छूटी: मानव-केंद्रित मशीन अनुवाद का पैमाना बढ़ाना। प्रीप्रिंट, arXiv:2207.04672.

जय गाला, प्रांजल ए. चिताले, राघवन एके, वरुण गुम्मा, सुमंत डोड्डापनेनी, असवंत कुमार, जानकी नवाले, अनुपमा सुजाता, रतीश पुदुपल्ली, विवेक राघवन, प्रत्युष कुमार, मितेश एम. खापड़ा, राज डाबरे, और अनूप कुंचुकुट्टन। 2023. इंडिकट्रांस2: सभी 22 अनुसूचित भारतीय भाषाओं के लिए उच्च गुणवत्ता वाले और सुलभ मशीन अनुवाद मॉडल की ओर। प्रीप्रिंट, arXiv:2305.16307.

बैरी हेडौ, राहेल बॉडेन, एंटोनियो वैलेरियो मिसेली बैरोन, जिंद्रिच हेलकल, और एलेक्जेंड्रा बिर्च। 2022. कम संसाधन वाले मशीन अनुवाद का सर्वेक्षण। कम्प्यूटेशनल भाषाविज्ञान, 48(3):673–732.

बैरी हेडौ और फहीम किरेफू। 2020. पीएमइंडिया – भारत की भाषाओं के समानांतर कॉर्पोरा का एक संग्रह। प्रीप्रिंट, arXiv:2001.09907.

एडवर्ड जे. हू, येलोंग शेन, फिलिप वालिस, ज़ेयुआन एलन-झू, युआनज़ी ली, श्यान वांग, लू वांग, और वेइज़ू चेन। 2021. लोरा: बड़े भाषा मॉडल का लो-रैंक अनुकूलन। प्रीप्रिंट, arXiv:2106.09685.

हिदेकी इसोज़ाकी, त्सुतोमु हिराओ, केविन डह, कत्सुहितो सुदौ, और हाजिमे त्सुकादा। 2010. दूर के भाषा युग्मों के लिए अनुवाद गुणवत्ता का स्वचालित मूल्यांकन। प्राकृतिक भाषा प्रसंस्करण में अनुभवजन्य तरीकों पर 2010 सम्मेलन की कार्यवाही में, पृष्ठ 944-952, कैंब्रिज, एमए। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

फिलिप कोहेन, हियू होआंग, एलेक्जेंड्रा बिर्च, क्रिस कॉलिसन-बर्च, मार्सेलो फेडेरिको, निकोला बर्टोल्डी, ब्रुक कोवान, वेड शेन, क्रिस्टीन मोरन, रिचर्ड ज़ेंस, क्रिस डायर, ओन्ड्रेज बोजार, एलेक्जेंड्रा कॉन्स्टेंटिन, और इवान हर्बस्ट। 2007. मोसेस: सांख्यिकीय मशीन अनुवाद के लिए ओपन सोर्स टूलकिट। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन की 45वीं वार्षिक बैठक की कार्यवाही में डेमो और पोस्टर सत्रों की साथी वॉल्यूम कार्यवाही, पृष्ठ 177-180, प्राग, चेक गणराज्य। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

जीन मेलार्ड, सिंथिया गाओ, इलाहे कलबस्ती, कौशिक राम सदागोपन, वेदानुज गोस्वामी, फिलिप कोहेन, एंजेला फैन, और फ्रांसिस्को गुज़मैन। 2023. छोटा डेटा, बड़ा प्रभाव: प्रभावी मशीन अनुवाद के लिए न्यूनतम डेटा का लाभ उठाना। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन की 61वीं वार्षिक बैठक की कार्यवाही में (वॉल्यूम 1: लॉन्ग पेपर्स), पृष्ठ 2740-2756, टोरंटो, कनाडा। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

पार्थ पाकराई, शांतनु पाल, अद्वैत वेतागिरी, रेड्डी मोहना कृष्णा, अर्नब कुमार माजी, संदीप कुमार दाश, लेनिन लैतोंजम, लिंगदोह सारा, और रियांका मन्ना। 2024. कम संसाधन वाली भारतीय भाषाओं के अनुवाद पर wmt 2024 साझा कार्य के निष्कर्ष। मशीन अनुवाद पर नौवें सम्मेलन की कार्यवाही में (WMT).

शांतनु पाल, पार्थ पाकराई, सहिनूर रहमान लस्कर, लेनिन लैतोंजम, वनलालमुआनसांगी खेंगलाव्ट, सुनीता वारजरी, पंकज कुंदन दादुरे, और संदीप कुमार दाश। 2023. कम संसाधन वाली भारतीय भाषाओं के अनुवाद पर wmt 2023 साझा कार्य के निष्कर्ष। मशीन अनुवाद पर आठवें सम्मेलन की कार्यवाही में, पृष्ठ 682–694.

किशोर पपिनीनी, सलीम रूकोस, टॉड वार्ड, और वेई-जिंग झू। 2002. BLEU: मशीन अनुवाद के स्वचालित मूल्यांकन के लिए एक विधि। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन की 40वीं वार्षिक बैठक की कार्यवाही में, पृष्ठ 311–318, फिलाडेल्फिया, पेंसिल्वेनिया, यूएसए। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

माजा पोपोविक। 2015. chrF: स्वचालित एमटी मूल्यांकन के लिए कैरेक्टर n-gram F-स्कोर। सांख्यिकीय मशीन अनुवाद पर दसवें कार्यशाला की कार्यवाही में, पृष्ठ 392–395, लिस्बन, पुर्तगाल। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

मैथ्यू स्नोवर, बोनी डोर, रिच श्वार्ट्ज, लिनिया मिकिउला, और जॉन मखौल। 2006. लक्षित मानव एनोटेशन के साथ अनुवाद संपादन दर का एक अध्ययन। अमेरिका में मशीन अनुवाद के लिए एसोसिएशन के 7वें सम्मेलन की कार्यवाही में: तकनीकी पत्र, पृष्ठ 223–231, कैंब्रिज, मैसाचुसेट्स, यूएसए। अमेरिका में मशीन अनुवाद के लिए एसोसिएशन।

धैर्य सुमन, अतनु मंडल, शांतनु पाल, और सुदीप नस्कर। 2023. IACS-LRILT: कम संसाधन वाली भारतीय भाषाओं के लिए मशीन अनुवाद। मशीन अनुवाद पर आठवें सम्मेलन की कार्यवाही में, पृष्ठ 972–977, सिंगापुर। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

चौ त्रान, श्रुति भोसले, जेम्स क्रॉस, फिलिप कोहेन, सेर्गेई एडु नोव, और एंजेला फैन। 2021. फेसबुक एआई wmt21 समाचार अनुवाद कार्य प्रस्तुत करना। प्रीप्रिंट, arXiv:2108.03265.

आशीष वासवानी, नोम शज़ीर, निकी परमार, जैकब उसज़कोरेइट, ल्लियन जोन्स, एडन एन. गोमेज़, लुकास कैसर, और इलिया पोलोसुखिन। 2023. ध्यान ही सब कुछ है जिसकी आपको आवश्यकता है। प्रीप्रिंट, arXiv:1706.03762.

जियन यांग, शुमिंग मा, हाओयांग हुआंग, डोंगडोंग झांग, ली डोंग, शाओहान हुआंग, एलेक्जेंड्रे मुजियो, सक्षम सिंघल, हानी हसन, शिया सॉन्ग, और फुरु वेई। 2021. WMT21 साझा कार्य के लिए Microsoft से बहुभाषी मशीन अनुवाद प्रणालियाँ। मशीन अनुवाद पर छठे सम्मेलन की कार्यवाही में, पृष्ठ 446–455, ऑनलाइन। कम्प्यूटेशनल भाषाविज्ञान के लिए एसोसिएशन।

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104