सबसे छोटा एआई (Smallest AI)
कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) में हालिया प्रगति अनुभवजन्य स्केलिंग नियमों से प्रेरित रही है, जो प्रदर्शन में सुधार को मॉडल के पैरामीटर्स, डेटा और कंप्यूट की वृद्धि से जोड़ते हैं। इन परिणामों ने इस व्यापक धारणा को बढ़ावा दिया है कि कृत्रिम सामान्य बुद्धिमत्ता (AGI) मुख्य रूप से बड़े भाषा मॉडल (LLMs) के निरंतर स्केलिंग के माध्यम से उभरेगी। इस शोध पत्र में, हम यह तर्क देते हैं कि यह धारणा बेंचमार्क प्रदर्शन को बुद्धिमत्ता के साथ मिला देती है और वर्तमान मॉडलों की मौलिक ढांचागत सीमाओं की अनदेखी करती है। हम एक वैकल्पिक ढांचे के रूप में कृत्रिम विशेष बुद्धिमत्ता (ASI) का प्रस्ताव करते हैं: बुद्धिमत्ता जो छोटे, विशिष्ट मॉडलों के संग्रह से उत्पन्न होती है जो अतुल्यकालिक (asynchronously) रूप से कार्य करते हैं, लगातार सीखते हैं, और बड़े पैमाने पर बाहरी मेमोरी के साथ बातचीत करते हैं। मशीन लर्निंग, न्यूरोसाइंस और संज्ञानात्मक विज्ञान के साक्ष्यों का सहारा लेते हुए, हम तर्क देते हैं कि बुद्धिमत्ता को केवल पैरामीटर की संख्या के बजाय संरचनात्मक विशेषताओं—जैसे विशिष्टता, कंप्यूट और मेमोरी का पृथक्करण, और जीवनभर सीखने की प्रक्रिया—द्वारा बेहतर ढंग से परिभाषित किया जा सकता है।
1. परिचय
समकालीन एआई अनुसंधान में प्रमुख प्रतिमान स्केलिंग नियमों पर आधारित है, जो मॉडल आकार, डेटासेट आकार और कंप्यूट बजट के कार्य के रूप में भाषा मॉडलिंग हानि और डाउनस्ट्रीम कार्य प्रदर्शन में अनुमानित सुधार प्रदर्शित करते हैं [1, 2]। इन निष्कर्षों ने तेजी से बड़े फाउंडेशन मॉडल के निर्माण और इस धारणा को प्रेरित किया है कि सामान्य बुद्धिमत्ता पैमाने के बहिर्वेशन के रूप में उभरेगी।
हालाँकि, स्केलिंग नियम एक निश्चित वास्तुशिल्प परिवार के भीतर अनुभवजन्य प्रवृत्तियों का वर्णन करते हैं; वे बुद्धिमत्ता का सिद्धांत नहीं बनाते हैं। नाटकीय लाभ के बावजूद, बड़े भाषा मॉडल वितरण संबंधी बदलाव के तहत नाजुक बने हुए हैं, उनमें कारण और प्रतितथ्यात्मक तर्क की कमी है, और वे दीर्घकालिक योजना और अमूर्तन के साथ संघर्ष करते हैं [3, 4, 5]। ये सीमाएँ अत्यधिक पैमाने पर भी बनी रहती हैं, जो बताती हैं कि ये प्रकृति में पैरामीट्रिक होने के बजाय वास्तुशिल्प हैं।
2. कृत्रिम सामान्य बुद्धिमत्ता की सीमाएँ
कृत्रिम सामान्य बुद्धिमत्ता (एजीआई) की अवधारणा डोमेन भर में व्यापक रूप से सक्षम व्यवहार में सक्षम एकल प्रणाली की वांछनीयता को मानती है। हालाँकि, अपनी सटीक परिचालन परिभाषा की कमी से परे, एजीआई दक्षता की परवाह किए बिना क्षमता की चौड़ाई के लिए परोक्ष रूप से अनुकूलित करता है। आम तौर पर सक्षम मॉडल के लिए समकालीन प्रशिक्षण प्रतिमान समग्र कार्य कवरेज और बेंचमार्क प्रदर्शन को प्राथमिकता देते हैं, जबकि नमूना दक्षता, कंप्यूट दक्षता, ऊर्जा खपत और अनुकूलन लागत पर बाधाओं की काफी हद तक अनदेखी करते [1, 2] हैं।
यह उद्देश्य जैविक और सामाजिक बुद्धिमत्ता के विपरीत है। जबकि, सिद्धांत रूप में, अधिकांश मनुष्यों के पास कौशल की एक विस्तृत श्रृंखला सीखने की क्षमता होती है, समाज सार्वभौमिक रूप से सामान्य एजेंटों की ओर अभिसरण नहीं करते हैं। इसके बजाय, वे विशेषज्ञता की ओर विकसित होते हैं, जहां व्यक्ति संकीर्ण डोमेन पर ध्यान केंद्रित करते हैं और साझा ज्ञान और स्मृति के माध्यम से समन्वय करते हैं। शास्त्रीय आर्थिक सिद्धांत श्रम के विभाजन के रूप में इस घटना को औपचारिक रूप देता है, यह दर्शाता है कि विशेषज्ञता संसाधन बाधाओं के तहत उच्च सामूहिक उत्पादकता प्रदान करती [6] है। गेम-थ्योरेटिक परिप्रेक्ष्य से, विशेषज्ञता एक स्थिर संतुलन के रूप में उभरती है जो अनावश्यक सीखने को कम करती है और संसाधन आवंटन को अनुकूलित करती [7] है।
संज्ञानात्मक विज्ञान के अनुभवजन्य साक्ष्य इस दृष्टिकोण का और समर्थन करते हैं: मानव विशेषज्ञता डोमेन-विशिष्ट है, जिसमें कौशल अधिग्रहण मजबूत स्थानीयता और हस्तांतरण सीमाओं को प्रदर्शित करता [8, 9] है। भले ही सामान्य सीखने की क्षमता मौजूद हो, निरंतर प्रदर्शन के लिए विशेषज्ञता सबसे कुशल रणनीति बनी हुई है। इस प्रकार सामाजिक स्तर पर बुद्धिमत्ता सार्वभौमिक सामान्यता से नहीं, बल्कि साझा स्मृति और समन्वय तंत्र पर काम करने वाले वितरित, विशिष्ट एजेंटों से उत्पन्न होती है।
इसलिए दक्षता के बिना सामान्यता के लिए कृत्रिम प्रणालियों को अनुकूलित करना जैविक मिसाल और तर्कसंगत प्रणाली डिजाइन दोनों के साथ गलत संरेखित होता है। अखंड सामान्य मॉडल किसी भी दिए गए कार्य के लिए अप्रासंगिक जानकारी की विशाल मात्रा को आंतरिक करते हैं, उच्च प्रशिक्षण और अनुमान लागत वहन करते हैं, और वर्तमान रहने के लिए बार-बार वैश्विक अपडेट की आवश्यकता होती है। इसके विपरीत, विशिष्ट घटकों से बनी प्रणालियाँ कंप्यूट को चुनिंदा रूप से आवंटित कर सकती हैं, ज्ञान को स्थानीय रूप से अपडेट कर सकती हैं, और पैरामीटर वृद्धि के बजाय समन्वय के माध्यम से क्षमताओं को बढ़ा सकती हैं [10, 4]।
ये विचार बताते हैं कि दक्षता एक द्वितीयक चिंता नहीं बल्कि बुद्धिमत्ता का एक परिभाषित गुण है। एक बुद्धिमान प्रणाली को ज्ञान प्राप्त करने, बनाए रखने और लागू करने के लिए आवश्यक संसाधनों को कम करना चाहिए। बुद्धिमत्ता को पूरी तरह से सामान्यता के संदर्भ में तैयार करना इस आवश्यकता को अस्पष्ट करता है और अक्षमता की ओर वास्तुकला को पक्षपातपूर्ण बनाता है। यह एजीआई से फ्रेमवर्क की ओर बदलाव को और प्रेरित करता है—जैसे कि कृत्रिम विशिष्ट बुद्धिमत्ता—जो स्पष्ट रूप से विशेषज्ञता, समन्वय और कंप्यूट और मेमोरी के कुशल उपयोग के लिए अनुकूलित होती है।
3. कृत्रिम विशिष्ट बुद्धिमत्ता
3.1. परिभाषा
परिभाषा (कृत्रिम विशिष्ट बुद्धिमत्ता)। कृत्रिम विशिष्ट बुद्धिमत्ता (एएसआई) कृत्रिम प्रणालियों के एक वर्ग को संदर्भित करती है जो कई विशिष्ट मॉडलों से बनी होती है, जिनमें से प्रत्येक को कार्यों के एक संकीर्ण सेट के लिए अनुकूलित किया जाता है, जो सामूहिक रूप से समन्वय, साझा स्मृति और निरंतर सीखने के माध्यम से अनुकूली, बुद्धिमान व्यवहार प्रदर्शित करते हैं।
औपचारिक रूप से, एक एएसआई प्रणाली में शामिल हैं:
सीमित क्षमता वाले विशिष्ट कम्प्यूटेशनल मॉड्यूल का एक सेट {Mi},
स्थायी और विस्तार योग्य भंडारण के साथ एक साझा मेमोरी सब्सट्रेट M,
सूचना प्रवाह, सीखने और कार्रवाई को नियंत्रित करने वाले समन्वय तंत्र,
सीखने की गतिशीलता जो समय के साथ निरंतर अनुकूलन का समर्थन करती है।
बुद्धिमत्ता, इस ढांचे के तहत, मॉडल सामान्यता के बजाय सिस्टम संरचना और अंतःक्रिया का एक उभरता हुआ गुण है।
3.2. प्रेरणा
विशेषज्ञता सख्त आगमनात्मक पूर्वाग्रहों, बेहतर नमूना दक्षता और तेजी से अनुकूलन को सक्षम बनाती है। अनुभवजन्य परिणाम तेजी से दिखाते हैं कि छोटे, कार्य-विशिष्ट मॉडल वास्तविक दुनिया, विलंबता- और लागत-विवश सेटिंग्स [11, 12, 13] में बड़े सामान्यतावादी मॉडलों से बेहतर प्रदर्शन कर सकते हैं। उद्योग और शिक्षाविदों के हालिया काम से यह भी पता चलता है कि भविष्य की एजेंट प्रणालियाँ एकल फाउंडेशन मॉडल [14] के बजाय छोटे मॉडलों के पहनावे पर निर्भर करेंगी।
4. कंप्यूट और मेमोरी का पृथक्करण
वर्तमान एलएलएम की एक बुनियादी सीमा एक ही पैरामीटर स्थान के भीतर गणना और मेमोरी का उलझना है। सभी ज्ञान—प्रक्रियात्मक, घोषणात्मक, क्षणिक और अप्रचलित—मॉडल के भार में एन्कोड किया गया है, जिससे अपडेट महंगे हो जाते हैं और विशेषज्ञता कठिन हो जाती है।
इसके विपरीत, जैविक प्रणालियाँ तेज, विशिष्ट गणना और बड़े पैमाने पर, निरंतर स्मृति के बीच एक स्पष्ट पृथक्करण प्रदर्शित करती हैं। पूरक शिक्षण प्रणाली सिद्धांत इस अंतर को औपचारिक रूप देता है, तेजी से अधिग्रहण को धीमी समेकन प्रक्रियाओं से अलग करता [15] है। कृत्रिम प्रणालियों में समान पृथक्करण—पुनर्प्राप्ति-संवर्धित पीढ़ी, बाहरी मेमोरी, या प्रतीकात्मक स्टोर के माध्यम से—छोटे मॉडलों को प्रभावी रूप से असीमित जानकारी [16, 17, 18] तक पहुँचने के दौरान अनुकूली बने रहने की अनुमति देता है।
5. अतुल्यकालिक संज्ञान
वर्तमान बड़े भाषा मॉडल (एलएलएम) समकालिक रूप से काम करते हैं: सभी तर्क अनुमान समय पर होते हैं, एक बाहरी संकेत द्वारा ट्रिगर होते हैं, और आंतरिक स्थिति को बाद में छोड़ दिया जाता है [19, 17]। इसके विपरीत, मानव संज्ञान अतुल्यकालिक और भविष्य कहनेवाला है। मनुष्य पूरी प्रासंगिक जानकारी प्राप्त करने से पहले तर्क और योजना बनाना शुरू कर देते हैं, नए सबूत आने पर परिकल्पनाओं को लगातार अपडेट करते [20, 21] हैं। यह कार्य करने या सोचने से पहले पूर्ण संदर्भ की प्रतीक्षा करने के बजाय अग्रिम अनुमान, तेजी से अनुकूलन और संज्ञानात्मक संसाधनों के कुशल आवंटन की अनुमति देता है।
भविष्य कहनेवाला प्रसंस्करण सिद्धांत मानते हैं कि मस्तिष्क लगातार दुनिया के एक भविष्य कहनेवाला मॉडल को उत्पन्न और अद्यतन करता है, अपनी अपेक्षाओं को ठीक करने के लिए आने वाले संवेदी संकेतों का उपयोग करता [22] है। इसी तरह, लेकन ने तर्क दिया है कि स्वायत्त बुद्धिमत्ता के लिए एजेंटों को अपने पर्यावरण का एक आंतरिक भविष्य कहनेवाला प्रतिनिधित्व बनाने की आवश्यकता होती है, जिससे वे संवेदी इनपुट [19] के समानांतर और अतुल्यकालिक रूप से कार्यों और परिणामों का मूल्यांकन कर सकें। यह भविष्य कहनेवाला, अतुल्यकालिक गणना एजेंटों को योजना बनाने, संभावित परिणामों का अनुकरण करने और दीर्घकालिक स्थितिजन्य जागरूकता बनाए रखने में सक्षम बनाती है।
समकालीन एआई में अतुल्यकालिक, भविष्य कहनेवाला तंत्र की अनुपस्थिति दीर्घकालिक रणनीतियों को बनाने, आंतरिक अभ्यावेदन को परिष्कृत करने और समय के साथ ज्ञान संचित करने की एजेंट की क्षमता को सीमित करती है। उनके बिना, मॉडलों को इनपुट को क्रमिक रूप से संसाधित करना होगा और प्रत्येक अनुमान को पूरी तरह से प्रासंगिक बनाना होगा, जिससे विलंबता बढ़ जाती है, अनुकूलन क्षमता कम हो जाती है, और निरंतर पृष्ठभूमि सीखने को रोकता है। इसलिए मानव-जैसे अनुकूली व्यवहार तक पहुँचने के लिए इवेंट लूप, प्रेडिक्टिव वर्ल्ड मॉडल और स्व-निर्देशित गणना का समर्थन करने वाले आर्किटेक्चर आवश्यक हैं।
भविष्य कहनेवाला, अतुल्यकालिक संज्ञान को शामिल करना एआई प्रणालियों को आंशिक जानकारी पर काम करने, मान्यताओं को क्रमिक रूप से अपडेट करने और स्मृति समेकन के साथ इंटरलीव गणना करने में सक्षम बनाता है, जो बुद्धिमत्ता की एक संरचनात्मक संपत्ति को दर्शाता है जिसकी वर्तमान अखंड एलएलएम में कमी है।
6. निरंतर और आजीवन सीखना
पारंपरिक तंत्रिका मॉडल, जिसमें अधिकांश एलएलएम शामिल हैं, तैनाती के दौरान स्टेटलेस होते हैं: सभी सीखना प्रशिक्षण के दौरान ऑफ़लाइन होता है, और मॉडल का भार अनुमान समय [1, 2] पर तय रहता है। यह दृष्टिकोण अनुकूलन क्षमता को सीमित करता है और गतिशील वातावरण में एजेंटों को नाजुक बनाता है, क्योंकि नए पैटर्न या कार्यों को बिना फिर से प्रशिक्षित किए शामिल नहीं किया जा सकता है।
इसके विपरीत, मानव बुद्धिमत्ता निरंतर, स्टेटफुल अनुकूलन प्रदर्शित करती है। मनुष्य नए अवलोकनों, अनुभवों और संदर्भों को वास्तविक समय में अपने आंतरिक मॉडलों में एकीकृत करते हैं, जिससे पूर्ण रूप से पुनः सीखने [23, 24] के बिना व्यवहार और भविष्यवाणियों के तेजी से समायोजन की अनुमति मिलती है। इस संपत्ति का एआई में अनुवाद करने के लिए ऐसे मॉडल या एजेंटों की आवश्यकता होती है जो बातचीत के दौरान स्थिति बनाए रखते हैं, अनुमान-समय सीखने को सक्षम करते हैं—अर्थात, पूर्ण ढाल-आधारित पुनर्शिक्षण के बिना नए डेटा आने पर आंतरिक अभ्यावेदन, मेमोरी या नीतियों को क्रमिक रूप से अद्यतन करते हैं।
कई आर्किटेक्चर इस सिद्धांत का समर्थन करते हैं:
मेमोरी-संवर्धित नेटवर्क [17, 18] बाहरी मेमोरी को बनाए रखते हैं जिसे अनुमान के दौरान लिखा और पढ़ा जा सकता है, जिससे सिस्टम नए तथ्यों को गतिशील रूप से शामिल कर सकता है।
मेटा-लर्निंग दृष्टिकोण [25, 26] तैनाती पर कम संख्या में अवलोकनों के आधार पर मॉडल मापदंडों के तेजी से अनुकूलन को सक्षम करते हैं।
निरंतर सीखने के एल्गोरिदम [24, 23] विनाशकारी भूलने की बीमारी को कम करते हैं, पूर्व क्षमता को संरक्षित करते हुए कार्य-विशिष्ट घटकों में क्रमिक अपडेट का समर्थन करते हैं।
भविष्यवाणी-संचालित राज्य अद्यतन (भविष्य कहनेवाला कोडिंग) [22, 19] एजेंटों को प्रेक्षित परिणामों के साथ अपेक्षाओं की तुलना करके आंतरिक मॉडल को लगातार परिष्कृत करने की अनुमति देते हैं।
स्टेटफुल, अनुमान-समय सीखना पारंपरिक स्थैतिक मॉडलों की तुलना में कई लाभ प्रदान करता है:
अनुकूलनशीलता: एजेंट वास्तविक समय में वितरण संबंधी बदलावों या नए कार्यों का जवाब दे सकते हैं।
दक्षता: केवल प्रासंगिक सबमॉड्यूल ही अपडेट किए जाते हैं, जिससे कंप्यूट और ऊर्जा ओवरहेड कम हो जाता है।
आधारभूतता: मॉडल एक सुसंगत आंतरिक स्थिति बनाए रखते हैं जिसे बातचीत के दौरान पूछताछ और तर्क दिया जा सकता है, जो दीर्घकालिक योजना और स्मृति-निर्देशित अनुमान का समर्थन करता है।
व्यावहारिक रूप से अनुमान-समय सीखने को लागू करने में मॉड्यूलर आर्किटेक्चर शामिल हो सकते हैं जहां विशिष्ट सबमॉडल स्थानीय मापदंडों या मेमोरी स्लॉट को अपडेट करते हैं, जो मेटा-लर्नड अनुकूलन नियमों या त्रुटि-संचालित संकेतों द्वारा निर्देशित होते हैं। अतुल्यकालिक और भविष्य कहनेवाला संज्ञान के साथ संयुक्त, यह एआई एजेंटों को स्टेटफुल, लगातार और स्वायत्त रूप से संचालित करने में सक्षम बनाता है, जिससे वे जैविक बुद्धिमत्ता के अनुकूली गुणों के करीब आते हैं।
7. आउटलुक: व्यावहारिक कृत्रिम विशिष्ट बुद्धिमत्ता की ओर
पूर्वगामी विश्लेषण से पता चलता है कि बुद्धिमत्ता कच्चे पैरामीटर गणना द्वारा कम और संरचनात्मक गुणों द्वारा अधिक परिभाषित होती है जो अनुकूली, कुशल और जमीनी तर्क को सक्षम बनाती है। अतुल्यकालिक संज्ञान एजेंटों को आंशिक जानकारी को संसाधित करने और भविष्य की स्थितियों [20, 21, 19] का अनुमान लगाने की अनुमति देता है, निरंतर और स्टेटफुल लर्निंग अनुमान समय [23, 24, 17] पर वृद्धिशील अनुकूलन की अनुमति देता है, और कंप्यूट और मेमोरी का पृथक्करण यह सुनिश्चित करता है कि सक्रिय तर्क प्रक्रिया [15, 16, 14] को बिना अधिक बोझ किए विशेष ज्ञान सुलभ रहे।
साथ में, ये गुण कृत्रिम विशिष्ट बुद्धिमत्ता (एएसआई) के लिए सबसे प्रशंसनीय सब्सट्रेट के रूप में एक मॉड्यूलर, छोटे-मॉडल प्रतिमान की ओर इशारा करते हैं। एकल अखंड मॉडल में सभी ज्ञान को एनकोड करने का प्रयास करने के बजाय, बुद्धिमत्ता विशिष्ट, कार्य-संरेखित सबमॉडल के संग्रह से उभरती है जिन्हें लगातार अपडेट किया जा सकता है, साझा मेमोरी के माध्यम से समन्वयित किया जा सकता है, और अतुल्यकालिक रूप से निष्पादित किया जा सकता है। यह वास्तुकला जैविक मिसाल दोनों के साथ संरेखित होती है—जहां मानव संज्ञान वितरित और विशिष्ट होता है—और कम्प्यूटेशनल दक्षता: बड़े अखंड प्रणालियों की तुलना में छोटे मॉडल अपडेट करने में सस्ते, अनुकूलित करने में आसान और गतिशील वातावरण के लिए अधिक मजबूत होते हैं।
इस दृष्टिकोण के आधार पर, हम निम्नलिखित शोध परिकल्पनाओं और भविष्य की दिशाओं का प्रस्ताव करते हैं:
विशेषज्ञता मौलिक है: छोटे, कार्य-संरेखित मॉडल समकक्ष रूप से पैरामीट्रिज्ड अखंड मॉडलों की तुलना में अधिक अनुकूली दक्षता प्राप्त कर सकते हैं।
कम्प्यूट और मेमोरी का पृथक्करण आधारभूतता को बढ़ाता है: सक्रिय तर्क को केंद्रित रखते हुए बाहरी मेमोरी में अप्रासंगिक या दीर्घकालिक जानकारी को ऑफलोड करना बेहतर सामान्यीकरण और संदर्भ-संवेदनशील अनुमान को सक्षम बनाता है।
अतुल्यकालिक, भविष्य कहनेवाला प्रसंस्करण योजना और प्रत्याशा में सुधार करता है: आंशिक इनपुट के आधार पर आंतरिक भविष्यवाणियां बनाने में सक्षम एजेंट गतिशील वातावरण में कड़ाई से समकालिक मॉडलों से बेहतर प्रदर्शन करेंगे।
अनुमान-समय, निरंतर सीखना विनाशकारी भूलने की बीमारी को कम करता है और दीर्घकालिक अनुकूलन का समर्थन करता है: जो एजेंट लगातार स्थिति को अपडेट करते हैं वे गैर-स्थिर वातावरण में प्रासंगिकता बनाए रख सकते हैं।
मूल्यांकन और बेंचमार्किंग: भविष्य के काम को बेंचमार्क परिभाषित करना चाहिए जो बदलते संदर्भों के तहत दीर्घकालिक अनुकूलन, मेमोरी उपयोग, कार्य दक्षता और मजबूती को मापते हैं।
सामूहिक रूप से, ये विचार एएसआई के लिए एक सैद्धांतिक ढांचा प्रदान करते हैं और अनुकूली बुद्धिमत्ता के भविष्य के रूप में छोटे, विशिष्ट मॉडलों के लिए मजबूत औचित्य प्रदान करते हैं। वास्तुशिल्प संरचना, राज्यशीलता और गतिशील सीखने पर ध्यान केंद्रित करके, यह दृष्टिकोण अखंड स्केलिंग की सीमाओं से परे जाता है और तैनाती योग्य, कुशल और अनुकूली एआई प्रणालियों की ओर इशारा करता है।
संदर्भ
[1] जेरेड कपलान, सैम मैककैंडलिश, टॉम हेनिघन, टॉम ब्राउन, बेंजामिन चेस, रेवोन चाइल्ड, स्कॉट ग्रे, एलेक रेडफोर्ड, जेफ वू और डारियो अमोदेई। तंत्रिका भाषा मॉडल के लिए स्केलिंग नियम। arXiv प्रीप्रिंट arXiv:2001.08361, 2020।
[2] जॉर्डन हॉफमैन, सेबस्टियन बोर्गॉड, आर्थर मेन्श, ऐलेना बुचात्स्काया, ट्रेवर काई, एलिज़ा रदरफोर्ड, डिएगो डी लास कैसास, लिसा ऐन हेंड्रिक्स, जोहान्स वेल्ब्ल, एडन क्लार्क, आदि। कंप्यूट-इष्टतम बड़े भाषा मॉडल का प्रशिक्षण। arXiv प्रीप्रिंट arXiv:2203.15556, 2022।
[3] एमिली एम. बेंडर, टिमनीट गेब्रू, एंजेलिना मैकमिलन-मेजर और श्मार्गेट श्मिटशेल। स्टोकेस्टिक तोतों के खतरों पर: क्या भाषा मॉडल बहुत बड़े हो सकते हैं? निष्पक्षता, जवाबदेही और पारदर्शिता पर 2021 एसीएम सम्मेलन की कार्यवाही में, 2021।
[4] ब्रेंडन एम. लेक, तोमर डी. उलमैन, जोशुआ बी. टेनेनबाम और सैमुअल जे. गर्शमैन। लोगों की तरह सीखने और सोचने वाली मशीनों का निर्माण। व्यवहार और मस्तिष्क विज्ञान, 40, 2017।
[5] गैरी मार्कस और अर्नेस्ट डेविस। रिबूटिंग एआई: आर्टिफिशियल इंटेलिजेंस का निर्माण जिस पर हम भरोसा कर सकें। पेंथियन बुक्स, 2019।
[6] एडम स्मिथ। राष्ट्रों के धन की प्रकृति और कारणों की जांच। डब्ल्यू स्ट्रैहन और टी कैडेल, 1776।
[7] फ्रेडरिक ए. हायेक। समाज में ज्ञान का उपयोग। द अमेरिकन इकोनॉमिक रिव्यू, 35(4):519-530, 1945।
[8] मिशेलिन टी.एच. ची, पॉल जे. फेल्टोविच और रॉबर्ट ग्लेसर। विशेषज्ञों और नौसिखियों द्वारा भौतिकी की समस्याओं का वर्गीकरण और प्रतिनिधित्व। संज्ञानात्मक विज्ञान, 5(2):121-152, 1981।
[9] के. एंडर्स एरिक्सन, राल्फ थ। क्रैम्पे और क्लेमेंस टेस्च-रोमर। विशेषज्ञ प्रदर्शन के अधिग्रहण में जानबूझकर अभ्यास की भूमिका, खंड 100. 1993।
[10] जेरी ए. फोडोर। मन की मॉड्यूलरिटी। एमआईटी प्रेस, 1983।
[11] विक्टर सान्ह, लिसैंड्रे डेब्यू, जूलियन चौमंड और थॉमस वुल्फ। डिस्टिलबर्ट, बर्ट का एक डिस्टिल्ड संस्करण: छोटा, तेज़, सस्ता और हल्का। arXiv प्रीप्रिंट arXiv:1910.01108, 2019।
[12] यी ते, मुस्तफा देहघानी, समीरा अबनार, यिकांग शेन, दारा बहरी, फिलिप फाम, जिनफेंग राव, लियू यांग, सेबस्टियन रूडर और डोनाल्ड मेट्ज़लर। कुशल ट्रांसफार्मर: एक सर्वेक्षण। एसीएम कंप्यूटिंग सर्वेक्षण, 2022।
[13] टिम डेटमर्स, आर्टिडोरो पैगनोनी, एरी होल्ट्ज़मैन और ल्यूक ज़ेटलेमoyer। क्युलोरा: क्वांटाइज़्ड एलएलएम का कुशल फाइनट्यूनिंग। arXiv प्रीप्रिंट arXiv:2305.14314, 2023।
[14] एनवीडिया रिसर्च। छोटे भाषा मॉडल एजेंटिक एआई का भविष्य हैं। तकनीकी रिपोर्ट, एनवीडिया, 2024।
[15] जेम्स एल. मैक्क्लीलैंड, ब्रूस एल. मैकनॉटन और रैंडल सी. ओ'रेली। हिप्पोकैम्पस और नियोकोर्टेक्स में पूरक सीखने की प्रणालियाँ क्यों हैं। मनोवैज्ञानिक समीक्षा, 102(3):419-457, 1995।
[16] पैट्रिक लुईस, एथन पेरेज़, एलेक्जेंड्रा पिक्टस, फैबियो पेट्रोनी, व्लादिमीर कार्पुखिन, नमन गोयल, हेनरिक कुटलर, माइक लुईस, वेन-ताउ यिह, टिम रॉकटैशल, आदि। ज्ञान-गहन एनएलपी कार्यों के लिए पुनर्प्राप्ति-संवर्धित पीढ़ी। arXiv प्रीप्रिंट arXiv:2005.11401, 2020।
[17] एलेक्स ग्रेव्स, ग्रेग वेन और इवो डैनिहेल्का। न्यूरल ट्यूरिंग मशीनें। arXiv प्रीप्रिंट arXiv:1410.5401, 2014।
[18] जेसन वेस्टन, सुमित चोपड़ा और एंटोनी बोर्डेस। मेमोरी नेटवर्क। arXiv प्रीप्रिंट arXiv:1410.3916, 2014।
[19] यैन लेकन। स्वायत्त मशीन बुद्धिमत्ता की ओर एक मार्ग। arXiv प्रीप्रिंट arXiv:2202.09449, 2022।
[20] दाना एच. बैलार्ड। संज्ञान के अवतार के लिए डाइक्टिक कोड। व्यवहार और मस्तिष्क विज्ञान, 20(4):723-742, 1997।
[21] जेफरी एल. एल्मन। समय में संरचना ढूँढना। संज्ञानात्मक विज्ञान, 14(2):179-211, 1990।
[22] कार्ल फ्रिस्टन। मुक्त-ऊर्जा सिद्धांत: एक एकीकृत मस्तिष्क सिद्धांत? नेचर रिव्यू न्यूरोसाइंस, 11:127-138, 2010।
[23] जर्मन आई. पेरिसी, रोनाल्ड केमकर, जोस पार्ट, क्रिस्टोफर कनान और स्टीफन वर्मटर। तंत्रिका नेटवर्क के साथ निरंतर आजीवन सीखना: एक समीक्षा। तंत्रिका नेटवर्क, 113:54-71, 2019।
[24] जेम्स किर्कपैट्रिक, रजवान पास्कानु, नील राबिनोविट्ज़, जोएल वेनेस, गिलाउम डेसजार्डिन्स, आंद्रेई ए. रुसू, कीरन मिलन, जॉन क्वान, टियागो रामलहो, एग्निस्का ग्रैब्सका-बारविंस्का, आदि। तंत्रिका नेटवर्क में विनाशकारी भूलने की बीमारी पर काबू पाना। नेशनल एकेडमी ऑफ साइंसेज की कार्यवाही, 114(13):3521-3526, 2017।
[25] चेल्सी फिन, पीटर एब्बील और सर्गेई लेविन। गहरे नेटवर्क के तेजी से अनुकूलन के लिए मॉडल-अज्ञेयवादी मेटा-लर्निंग। arXiv प्रीप्रिंट arXiv:1703.03400, 2017।
[26] एलेक्स निकोल और जॉन शुलमैन। प्रथम-क्रम मेटा-लर्निंग एल्गोरिदम। arXiv प्रीप्रिंट arXiv:1803.02999, 2018।