AI में ट्रांसफॉर्मर्स क्या हैं?
ट्रांसफॉर्मर एक न्यूरल नेटवर्क आर्किटेक्चर है जिसने इनपुट और आउटपुट के बीच वैश्विक निर्भरता को दर्शाने के लिए पूरी तरह से अटेंशन मैकेनिज्म (ध्यान तंत्र) पर भरोसा करके पिछले सीक्वेंस-टू-सीक्वेंस मॉडल (जैसे रिकरेंट न्यूरल नेटवर्क) की जगह ले ली। 2017 के पेपर "Attention Is All You Need" में पेश किए गए ट्रांसफॉर्मर्स नेचुरल लैंग्वेज प्रोसेसिंग (प्राकृतिक भाषा प्रसंस्करण), स्पीच रिकग्निशन और जनरेटिव एआई में प्रमुख आर्किटेक्चर बन गए हैं।
ट्रांसफॉर्मर्स कैसे काम करते हैं
सेल्फ-अटेंशन मैकेनिज्म
इसका मुख्य नवाचार सेल्फ-अटेंशन है, जो मॉडल को एक सीक्वेंस में टोकन के प्रत्येक जोड़े के बीच संबंधों का समानांतर रूप से मूल्यांकन करने की अनुमति देता है। प्रत्येक टोकन के लिए, मॉडल तीन वेक्टर की गणना करता है: एक क्वेरी, एक की (कुंजी), और एक वैल्यू (मान)। अटेंशन स्कोर की गणना क्वेरीज़ की तुलना कीज़ से करके की जाती है, फिर इसका उपयोग वैल्यूज़ का एक भारित योग (वेटेड सम) उत्पन्न करने के लिए किया जाता है। यह मॉडल को एक-एक करके टोकन प्रोसेस किए बिना लंबी दूरी की निर्भरताओं को कैप्चर करने की अनुमति देता है।
एन्कोडर-डिकोडर संरचना
मूल ट्रांसफॉर्मर एन्कोडर-डिकोडर लेआउट का उपयोग करता है:
एन्कोडर: पूरे इनपुट सीक्वेंस को पढ़ता है और प्रत्येक टोकन के लिए प्रासंगिक प्रतिनिधित्व (कॉन्टेक्स्टुअल रिप्रेजेंटेशन) तैयार करता है।
डिकोडर: एक बार में एक आउटपुट टोकन जेनरेट करता है, जो पहले से जेनरेट किए गए टोकन और एन्कोडर आउटपुट दोनों पर ध्यान देता है।
कई आधुनिक सिस्टम केवल एक हिस्से का उपयोग करते हैं। केवल-एन्कोडर वाले मॉडल (जैसे BERT) वर्गीकरण (क्लासिफिकेशन) और समझ से जुड़े कार्यों में उत्कृष्ट हैं, जबकि केवल-डिकोडर वाले मॉडल (जैसे GPT) टेक्स्ट जनरेशन में उत्कृष्ट हैं।
पोज़िशनल एन्कोडिंग
चूंकि ट्रांसफॉर्मर्स क्रमिक रूप से काम करने के बजाय सभी टोकन को समानांतर रूप से प्रोसेस करते हैं, इसलिए उन्हें मॉडल में टोकन क्रम के बारे में जानकारी डालने के लिए पोज़िशनल एन्कोडिंग की आवश्यकता होती है।
स्पीच टेक्नोलॉजी में ट्रांसफॉर्मर्स
वॉयस एआई में, ट्रांसफॉर्मर्स ऑटोमैटिक स्पीच रिकग्निशन (ASR) और टेक्स्ट-टू-स्पीच (TTS) दोनों सिस्टम को संचालित करते हैं। ASR मॉडल ऑडियो फीचर्स को टेक्स्ट में बदलने के लिए ट्रांसफॉर्मर एन्कोडर का उपयोग करते हैं, जबकि TTS सिस्टम टेक्स्ट इनपुट से प्राकृतिक लगने वाली स्पीच जेनरेट करने के लिए ट्रांसफॉर्मर डिकोडर का उपयोग करते हैं। लंबी दूरी के संदर्भ को मॉडल करने की इस आर्किटेक्चर की क्षमता इसे संश्लेषित भाषण (सिंथेसाइज्ड स्पीच) में सुसंगत, प्राकृतिक लय उत्पन्न करने के लिए विशेष रूप से प्रभावी बनाती है।
ट्रांसफॉर्मर्स क्यों महत्वपूर्ण हैं
समानांतरता (पैरेललिज्म): RNN के विपरीत, ट्रांसफॉर्मर्स एक साथ पूरे सीक्वेंस को प्रोसेस करते हैं, जिससे आधुनिक GPU पर तेजी से प्रशिक्षण संभव होता है।
स्केलेबिलिटी: जैसे-जैसे मॉडल का आकार और प्रशिक्षण डेटा बढ़ता है, प्रदर्शन में अनुमानित रूप से सुधार होता है।
बहुमुखी प्रतिभा (वर्सेटिलिटी): यही मुख्य आर्किटेक्चर टेक्स्ट, ऑडियो, इमेज और मल्टीमॉडल कार्यों पर लागू होता है।