आवाज के लिए वर्ल्ड मॉडल्स

आवाज के लिए वर्ल्ड मॉडल्स

आवाज के लिए वर्ल्ड मॉडल्स

आवाज में मानव-स्तर की रीयल-टाइम बुद्धिमत्ता को अनलॉक करना

अतुल्यकालिक इनपुट, आउटपुट तंत्र और निरंतर अव्यक्त सोच के माध्यम से

प्रस्तावना: आवाज वास्तविक है, पाठ नहीं

आवाज एक भौतिक संकेत (सिग्नल) है। यह वास्तविक दुनिया में हवा के माध्यम से प्रसारित होने वाली दबाव तरंगों के रूप में मौजूद है, जिसे कान द्वारा ग्रहण किया जाता है और तंत्रिका गतिविधि (neural activity) में बदला जाता है। यह निरंतर, एनालॉग और मौलिक रूप से समयबद्ध है: हर शब्दांश, हर ठहराव, पिच में हर बदलाव अपने साथ ऐसा अर्थ लिए होता है जिसे इस बात से अलग नहीं किया जा सकता कि वह कब घटित होता है। इंसानों ने संवाद करने, बातचीत करने, सिखाने और तर्क करने के लिए आवाज का ही विकास किया। यह बुद्धिमत्ता (इंटेलिजेंस) के लिए सबसे पुराना और सबसे स्वाभाविक इंटरफ़ेस है।

इसके विपरीत, पाठ (टेक्स्ट) भौतिक दुनिया में मौजूद नहीं है। पाठ एक मानवीय आविष्कार है, एक विशिष्ट प्रतीकात्मक एन्कोडिंग प्रणाली जिसे समय और स्थान के पार भाषण (स्पीच) को सुरक्षित रखने के लिए बनाया गया है। गंभीर बात यह है कि पाठ को दृष्टि के माध्यम से ग्रहण किया जाता है, श्रवण के माध्यम से नहीं। जब आप कोई वाक्य पढ़ते हैं, तो आपकी आँखें किसी सतह पर प्रतीकों को स्कैन करती हैं; आपका विजुअल कॉर्टेक्स आकृतियों और पैटर्नों को संसाधित करता है। पाठ का कोई समय क्षेत्र नहीं होता है। किसी पृष्ठ पर लिखा "हैलो" शब्द 400 मिलीसेकंड का समय नहीं लेता है, जैसा कि बोले जाने वाले शब्द में होता है। इसमें कोई स्वर-शैली (prosody), कोई जोर, कोई भावनात्मक रंग नहीं होता है। यह एक अमूर्तता (abstraction) है, उस समृद्ध, निरंतर और समय से बंधे संकेत का एक नुकसानदेह संपीड़न (lossy compression) है जो कि आवाज है।

सभी वास्तविक भौतिक संकेत निरंतर होते हैं और उनका अपना एक अंतर्निहित समय क्षेत्र होता है। ध्वनि, प्रकाश, स्पर्श, प्रोप्रायोसेप्शन: ये वे संकेत हैं जिनके माध्यम से जैविक बुद्धिमत्ता दुनिया के साथ जुड़ती है। कोई भी प्रणाली जो मानव-स्तरीय संवादात्मक बुद्धिमत्ता की आकांक्षा रखती है, उसे आवाज को उसी रूप में देखना चाहिए जो वह है: एक वास्तविक, निरंतर, समयबद्ध संकेत। इसे आवाज को पाठ में नहीं बदलना चाहिए, उस पाठ को संसाधित नहीं करना चाहिए और फिर पाठ को वापस आवाज में विस्तारित नहीं करना चाहिए। वह पाइपलाइन उन्हीं गुणों (निरंतरता, समयबद्धता, पारालिंग्विस्टिक समृद्धि) को छोड़ देती है जो आवाज को वह माध्यम बनाते हैं जो वह है।

हालाँकि, स्पीच-टू-स्पीच मॉडल बनाने के लिए केवल मध्यवर्ती परतों को आपस में जोड़कर पाठ को हटा देना ही पर्याप्त नहीं है। हमें इस बात से पीछे की ओर सोचना होगा कि मानव मस्तिष्क कैसे काम करता है और एक ऐसा आर्किटेक्चर बनाना होगा जो बातचीत करते समय मनुष्यों की तरह व्यवहार करने में सक्षम हो, यानी ट्यूरिंग टेस्ट पास कर सके [ट्यूरिंग, 1950]।

यह थीसिस आवाज आर्किटेक्चर के एक नए वर्ग के लिए एक सकारात्मक मामला प्रस्तुत करती है, जो संपीड़ित गुप्त प्रस्तुतियों (compressed latent representations) पर काम करने वाले एसिंक्रोनस वर्ल्ड मॉडल हैं, जो आवाज एजेंटों के निर्माण के मार्ग के रूप में वास्तविक समय की बोली जाने वाली बातचीत में ट्यूरिंग टेस्ट को वास्तविक रूप से पास कर सकते हैं। हम यह जांच कर शुरू करते हैं कि मनुष्य आवाज को कैसे संसाधित करते हैं, तीन समवर्ती क्षमताओं (सुनना, सोचना और बोलना, साथ ही समवर्ती क्रिया) की पहचान करते हैं जो प्राकृतिक बातचीत को परिभाषित करती हैं। फिर हम हाइड्रा प्रस्तुत करते हैं, जो इन क्षमताओं को दोहराने के लिए बुनियादी सिद्धांतों से तैयार किया गया एक आर्किटेक्चर है। अंत में, हम यह पता लगाते हैं कि यह प्रतिमान कुशल, अनुकूलनीय बुद्धिमत्ता के भविष्य की ओर कैसे इशारा करता है।

हमारा रुख हर जगह संरचना और पैमाने (स्ट्रक्चर एंड स्केल) पर है, न कि केवल पैमाने पर: आवाज बुद्धिमत्ता के लिए उस पैमाने की आवश्यकता होती है जो कच्चे ऑडियो पर स्व-पर्यवेक्षित शिक्षण (self-supervised learning) प्रदान करता है, लेकिन साथ ही उस संरचना की भी आवश्यकता होती है जिसे संज्ञानात्मक विज्ञान (cognitive science) ने दिखाया है कि मनुष्य वास्तव में उपयोग करते हैं। एक आर्किटेक्चर जो केवल पैमाने के लिए प्रतिबद्ध है, वह बातचीत के बारे में पहले से ज्ञात चीज़ों को पुनर्प्राप्त करने के लिए एक स्केलिंग कर का भुगतान करता है; एक आर्किटेक्चर जो संरचना को सीधे बनाता है वह कई गुना छोटा हो सकता है।

इस दावे का वैज्ञानिक आधार कि मानव बातचीत में कई कम्प्यूटेशनल स्तरों पर संरचना होती है, एक साथी पेपर [स्मॉलेस्ट एआई रिसर्च, 2026] में विस्तार से विकसित किया गया है, जो व्यवहारिक, इलेक्ट्रोफिजियोलॉजिकल, इंट्राक्रैनियल और कम्प्यूटेशनल अध्ययनों से संज्ञानात्मक-विज्ञान और तंत्रिका विज्ञान के साक्ष्यों की समीक्षा करता है। वर्तमान पेपर उस साक्ष्य को पृष्ठभूमि के रूप में लेता है और वॉयस एआई के लिए आर्किटेक्चरल परिणामों पर ध्यान केंद्रित करता है।

संबंधित कार्य: मूल वॉयस आर्किटेक्चर की ओर विकास

पाइपलाइन ऑर्केस्ट्रेशन। वॉयस एजेंटों के लिए सबसे व्यापक दृष्टिकोण अलग-अलग, स्वतंत्र रूप से प्रशिक्षित मॉडलों को एक अनुक्रमिक पाइपलाइन में शामिल करता है। व्हिस्पर [रेडफोर्ड एट अल., 2022] जैसी स्वचालित भाषण पहचान (ASR) प्रणाली आने वाले ऑडियो को पाठ में ट्रांसक्राइब करती है। GPT-4 [OpenAI, 2023] या LLaMA [टौवरॉन एट अल., 2023] जैसा एक बड़ा भाषा मॉडल ट्रांसक्रिप्ट को संसाधित करता है और एक टेक्स्ट प्रतिक्रिया उत्पन्न करता है। एक टेक्स्ट-टू-स्पीच इंजन प्रतिक्रिया टेक्स्ट से ऑडियो संश्लेषित करता है। एक वॉयस एक्टिविटी डिटेक्शन मॉड्यूल यह निर्धारित करता है कि उपयोगकर्ता ने कब बोलना बंद कर दिया है ताकि पाइपलाइन प्रसंस्करण शुरू कर सके। इस प्रतिमान में इंजीनियरिंग प्रयास विलंबता (latency) में कमी लाने पर केंद्रित है: स्ट्रीमिंग एएसआर, सट्टा डिकोडिंग (speculative decoding) और स्ट्रीमिंग टीटीएस [रेन एट अल., 2020]। चाहे इन अनुकूलनों को कितनी भी आक्रामक तरीके से लागू किया जाए, आर्किटेक्चर सख्त अनुक्रमिक निर्भरताओं को लागू करता है जो विलंबता पर एक कठिन सीमा लगाती हैं और एएसआर-टू-टेक्स्ट सीमा पर पारालिंग्विस्टिक जानकारी को नष्ट कर देती हैं।

फ्यूज्ड स्पीच-टू-स्पीच मॉडल। वॉयस आर्किटेक्चर की दूसरी पीढ़ी पाइपलाइन को एक एकल मॉडल में जोड़कर सूचना के नुकसान को संबोधित करने का प्रयास करती है। ऑडियोपीएएलएम [रुबिनस्टीन एट अल., 2023], स्पीचजीपीटी [झेंग एट अल., 2023], और स्पिरिट-एलएम [गुयेन एट अल., 2024] जैसे दृष्टिकोण टर्मिनल परतों को हटाते हैं और साझा मध्यवर्ती प्रस्तुतियों के माध्यम से भाषण एनकोडर और डिकोडर को जोड़ते हैं, जिससे चरणों के बीच भावनात्मक और स्वर-शैली संबंधी जानकारी के हस्तांतरण को सक्षम किया जा सके। यह संलयन पारालिंग्विस्टिक निष्ठा में सुधार करता है, लेकिन मौलिक प्रसंस्करण मॉडल सिंक्रोनस और अनुक्रमिक बना रहता है। सिस्टम अभी भी उपयोगकर्ता के बोलना समाप्त करने की प्रतीक्षा करता है, पूरी बात को संसाधित करता है, और फिर एक पूर्ण प्रतिक्रिया उत्पन्न करता है। बातचीत का पैटर्न अभी भी बारी-बारी पर आधारित है और सिस्टम सोचते या बोलते समय अभी भी बहरा रहता है।

साझा विरासत: एक ऑनलाइन दुनिया में ऑफलाइन मॉडल। दोनों पीढ़ियों की वॉयस तकनीक की वंशावली समान है: वे पाठ के ऑफ़लाइन, बैच प्रसंस्करण के लिए डिज़ाइन किए गए मॉडलों से उत्पन्न हुए हैं [वासवानी एट अल., 2017, ब्राउन एट अल., 2020]। बड़े भाषा मॉडलों को बिना किसी समय आयाम के स्थिर कॉर्पोरा पर प्रशिक्षित किया गया था। भाषण पहचान मॉडलों को पूरी हो चुकी बातों को ट्रांसक्राइब करने के लिए प्रशिक्षित किया गया था। भाषण संश्लेषण मॉडलों को पूर्ण वाक्यों को प्रस्तुत करने के लिए प्रशिक्षित किया गया था। जब इन मॉडलों को वास्तविक समय की आवाज बातचीत के लिए पुन: उपयोग किया जाता है, तो उन्हें एक ऐसे प्रतिमान में काम करने के लिए कहा जाता है जो मौलिक रूप से उस प्रतिमान से भिन्न होता है जिसके लिए उन्हें डिज़ाइन किया गया था। अगली पीढ़ी को प्रेरित करने वाली समझ यह नहीं है कि ये प्रणालियाँ विफल हैं (उन्होंने व्यावसायिक रूप से उपयोगी उत्पाद तैयार किए हैं और अत्याधुनिक स्तर को उन्नत किया है) बल्कि यह है कि मानव बातचीत में विशिष्ट गुण होते हैं जिनके लिए एक मौलिक रूप से भिन्न वास्तुशिल्प (architectural) आधार की आवश्यकता होती है।

उभरता हुआ वर्ल्ड-मॉडल प्रतिमान। वॉयस एआई के समानांतर, व्यापक मशीन लर्निंग समुदाय ने तेजी से वर्ल्ड मॉडल की शक्ति को मान्यता दी है: ऐसी प्रणालियाँ जो अपने पर्यावरण के संपीड़ित आंतरिक प्रतिनिधित्व को बनाए रखती हैं और कच्चे संवेदी डेटा के बजाय उन प्रतिनिधित्वों पर विचार करती हैं। सुदृढीकरण सीखने (reinforcement learning) के लिए वर्ल्ड मॉडल पर हा और श्मिटह्यूबर [2018] के मूलभूत काम से लेकर हैफनर एट अल. [2020, 2023] के ड्रीमर आर्किटेक्चर और वर्ल्ड मॉडल्स पर आधारित स्वायत्त मशीन इंटेलिजेंस के लिए लेकन की दृष्टि [लेकन, 2022] तक, पैटर्न सुसंगत है: वे प्रणालियाँ जो गुप्त प्रतिनिधित्व (latent representations) पर विचार करती हैं, वे कच्चे अवलोकनों पर काम करने वाली प्रणालियों की तुलना में बेहतर सामान्यीकरण, दक्षता और अनुकूलनशीलता प्राप्त करती हैं। हाइड्रा इस प्रतिमान को आवाज तक विस्तारित करता है।

मानव बातचीत को क्या मानवीय बनाता है

एक ऐसा वॉयस एजेंट बनाने के लिए जो ट्यूरिंग टेस्ट पास करे, हमें यह सटीक रूप से समझना होगा कि उसे किस चीज़ को दोहराने की आवश्यकता है। मानव संवादात्मक आवाज प्रसंस्करण को तीन समवर्ती क्षमताओं द्वारा परिभाषित किया जाता है जो एक साथ और स्वतंत्र रूप से काम करती हैं - सुनते समय सोचना, सुनते समय कार्य करना और सुनते समय बोलना [पिकरिंग और गैरोड, 2004, लेविंसन, 2016]। साथ मिलकर, वे उस तरल, उत्तरदायी, भावनात्मक रूप से अनुकूलित अनुभव का निर्माण करते हैं जिसे हम प्राकृतिक बातचीत के रूप में पहचानते हैं। इन क्षमताओं के लिए संज्ञानात्मक-विज्ञान के साक्ष्य, इस व्यापक दावे के साथ कि मानव बातचीत को उप-शब्दांश इकाइयों से लेकर वक्ता की मानसिक स्थिति तक सात कम्प्यूटेशनल स्तरों पर अलग-अलग संरचनाओं के इर्द-गिर्द व्यवस्थित किया गया है, साथी पेपर [स्मॉलेस्ट एआई रिसर्च, 2026] में समीक्षा की गई है।

चित्र 1: एक ही उपयोगकर्ता प्रश्न पर पाइपलाइन आर्किटेक्चर बनाम समवर्ती (concurrent) आर्किटेक्चर। दोनों पैनलों का समय अक्ष (time axis) एक ही है और समान आदान-प्रदान है: उपयोगकर्ता एक पैकेज-ट्रैकिंग प्रश्न पूछता है और एजेंट उत्तर देता है। शीर्ष पैनल: एक पाइपलाइन आर्किटेक्चर आदान-प्रदान को चरणों के एक सख्त अनुक्रम के रूप में संसाधित करता है (आवाज-गतिविधि पहचान, स्वचालित भाषण पहचान, भाषा-मॉडल अनुमान, टूल कॉल, भाषा-मॉडल जनरेशन, टेक्स्ट-टू-स्पीच), प्रत्येक पिछले चरण के पूरा होने की प्रतीक्षा करता है।

एजेंट का उत्तर उपयोगकर्ता का प्रश्न समाप्त होने के 3.8 सेकंड बाद शुरू होता है। निचला पैनल: समवर्ती आर्किटेक्चर एक साझा गुप्त स्थिति (shared latent state) पर गैर-अवरुद्ध प्रक्रियाओं (non-blocking processes) के एक सेट के रूप में काम करता है। सुनना लगातार चलता रहता है; बातचीत के बीच में एक बैकचैनल (“मंहू”) उत्पन्न होता है; उपयोगकर्ता के बोलना समाप्त करने से पहले टूल कॉल सक्रिय हो जाती है, क्योंकि गुप्त स्थिति पर अनुमान ने पहले ही संदर्भ और इरादे को पहचान लिया है; उत्तर उपयोगकर्ता के अंतिम शब्द के लगभग 200 मिलीसेकंड बाद शुरू होता है।

प्रतिक्रिया शुरू होने का कुल समय 0.2 सेकंड है, जो बहुत तेज़ है, और बातचीत का पैटर्न संरचनात्मक रूप से मानव बातचीत के बराबर है। वास्तुशिल्प गुण जो निचले पैनल को संभव बनाते हैं (समवर्ती निष्पादन, साझा गुप्त स्थिति, द्विदिश अनुमान) अनुभाग 4 में विकसित किए गए हैं और चित्र 2 में चित्रित किए गए हैं।

सुनते समय सोचना। एक मानव श्रोता भाषण के आते ही प्रसंस्करण, व्याख्या और प्रतिक्रियाएँ तैयार करना शुरू कर देता है, न कि वक्ता के समाप्त होने के बाद [पिकरिंग और गैरोड, 2004]। समझ एक निरंतर, स्ट्रीमिंग प्रक्रिया है जो श्रवण इनपुट के समानांतर चलती है। जब तक कोई वक्ता वाक्य के अंत तक पहुँचता है, तब तक श्रोता ने पहले ही उसके प्रक्षेप पथ का अनुमान लगा लिया होता है, निष्कर्ष निकाल लिया होता है, और अक्सर प्रतिक्रिया तैयार कर ली होती है। यही समवर्ती संज्ञान (concurrent cognition) उप-सेकंड प्रतिक्रिया विलंबता को सक्षम बनाता है जो प्राकृतिक बातचीत की विशेषता है। एक आर्किटेक्चर जो सुनते समय सोचने का समर्थन करता है, उसे अपनी तर्क प्रक्रिया को अपनी इनपुट प्रक्रिया से पूरी तरह से अलग करना चाहिए।

सुनते समय कार्य करना। मनुष्य सुनते रहने के दौरान नियमित रूप से क्रियाएं (चीजें खोजना, नोट्स लेना, गणना करना) करते हैं [साल्वुची और टाटगेन, 2008]। कॉलर का खाता नंबर प्राप्त करने वाला एक ग्राहक सहायता एजेंट कॉलर के भाषण पर अपना ध्यान रोके बिना, पहले कुछ अंक सुनते ही सिस्टम में खोजना शुरू कर देता है। एक आर्किटेक्चर जो सुनते समय कार्य करने का समर्थन करता है, उसे अपनी सुनने या सोचने की प्रक्रियाओं को निलंबित किए बिना बाहरी उपकरणों को लागू करना चाहिए और उनके परिणामों को संसाधित करना चाहिए। टूल कॉल गैर-अवरुद्ध (non-blocking) होने चाहिए।

सुनते समय बोलना: फुल-डुप्लेक्स संचार। मानव बातचीत फुल-डुप्लेक्स है: भाषण उत्पादन और ग्रहण एक साथ होते हैं [लेविंसन, 2016, सैक्स एट अल., 1974]। बैकचैनलिंग, "मंहू," "सही," "हाँ," का निरंतर प्रवाह वक्ता को बाधित किए बिना जुड़ाव का संकेत देता है। अतिव्यापी भाषण, रुकावटें, और सहयोगात्मक वाक्य पूरा करना बातचीत की सामान्य विशेषताएं हैं। इनपुट और आउटपुट एक-दूसरे पर निर्भर नहीं हैं; वे एसिंक्रोनस हैं। वर्तमान में हर वॉयस आर्किटेक्चर हाफ-डुप्लेक्स मोड में काम करता है, और ट्यूरिंग टेस्ट में विफल होने के लिए केवल यही पर्याप्त है, क्योंकि हाफ-डुप्लेक्स बातचीत तुरंत गैर-मानवीय के रूप में पहचानी जा सकती है।

हाइड्रा: वर्ल्ड मॉडल्स के माध्यम से एसिंक्रोनस वॉयस इंटेलिजेंस

हाइड्रा स्मॉलेस्ट एआई में विकसित एक आर्किटेक्चर है जो डिजाइन द्वारा इन तीनों आवश्यकताओं को पूरा करता है। यह मौजूदा दृष्टिकोणों का अनुकूलन नहीं है बल्कि एक नया आधार है, जो इस अंतर्दृष्टि के इर्द-गिर्द बनाया गया है कि आवाज बुद्धिमत्ता के लिए संपीड़ित प्रस्तुतियों पर एसिंक्रोनस, समवर्ती प्रसंस्करण की आवश्यकता होती है।

चित्र 2 हाइड्रा के आर्किटेक्चर को दर्शाता है।


चित्र 2: हाइड्रा का एसिंक्रोनस आर्किटेक्चर, जो एक संवादात्मक भौतिकी इंजन के इर्द-गिर्द व्यवस्थित है। केंद्रीय घटक एक संरचित गुप्त स्थिति (structured latent state) है जो बातचीत को एक भौतिक दृश्य के रूप में प्रस्तुत करती है: कौन बोल रहा है, क्या कहा गया, प्रत्येक वक्ता क्या मानता है, सामान्य आधार में क्या है, कौन से संवाद कार्य चल रहे हैं, और बातचीत वर्तमान में टर्न-टेकिंग चक्र में कहाँ स्थित है।

इसकी तुलना गेम फिजिक्स इंजनों से की जा सकती है, जो वस्तुओं, वेगों और बलों की विश्व स्थिति को बनाए रखते हैं और रेंडरर या इनपुट हैंडलर जो कुछ भी कर रहा है, उसकी परवाह किए बिना लगातार आगे का सिमुलेशन चलाते हैं; यहाँ इंजन एक संवादात्मक विश्व स्थिति बनाए रखता है और लगातार भविष्य कहने वाला सिमुलेशन चलाता है, चाहे सुनने, बोलने या टूल-कॉलिंग सबसिस्टम कुछ भी कर रहे हों। चार प्रक्रियाएं (सुनना, सोचना, बोलना, टूल कॉल) स्वतंत्र, एक साथ निष्पादित होने वाले लूप के रूप में काम करती हैं जो अच्छी तरह से परिभाषित इंटरफेस के माध्यम से साझा इंजन स्थिति से पढ़ती और लिखती हैं। उनके बीच कोई पाइपलाइन क्रम नहीं है और कोई भी किसी अन्य को अवरुद्ध नहीं करता है।

संज्ञानात्मक-विज्ञान का यह प्रमाण कि मानव संवादात्मक तर्क बिल्कुल इसी प्रकार के संरचित, द्विदिश, जनरेटिव इंजन के रूप में कार्य करता है, साथी पेपर में समीक्षा की गई है।


एसिंक्रोनस प्रक्रिया आर्किटेक्चर। हाइड्रा का मुख्य नवाचार आर्किटेक्चरल है: सुनना, सोचना, बोलना और टूल-कॉलिंग स्वतंत्र, एक साथ निष्पादित होने वाली प्रक्रियाओं के रूप में काम करते हैं जो साझा गुप्त स्थिति के माध्यम से संवाद करते हैं। कोई पाइपलाइन नहीं है, कोई अनुक्रमिक निर्भरता नहीं है, और कोई बारी-बारी आधारित इंटरैक्शन मॉडल नहीं है। सुनने की प्रक्रिया लगातार ऑडियो ग्रहण करती है और साझा गुप्त स्थिति को अपडेट करती है। सोचने की प्रक्रिया उस स्थिति पर लगातार विचार करती है, चाहे सुनना सक्रिय हो या न हो। बोलने की प्रक्रिया सोचने की स्थिति से आउटपुट ऑडियो उत्पन्न करती है, चाहे नया इनपुट आ रहा हो या नहीं। टूल-कॉलिंग प्रक्रियाएं पृष्ठभूमि में निष्पादित होती हैं और किसी अन्य प्रक्रिया को अवरुद्ध किए बिना परिणामों को साझा स्थिति में वापस लाती हैं। यह एसिंक्रोनस डिज़ाइन सीधे मानव बातचीत के तीन गुणों को दर्शाता है। सिस्टम सुनते समय सोचता है क्योंकि सोचना और सुनना स्वतंत्र प्रक्रियाएं हैं। यह सुनते समय कार्य करता है क्योंकि टूल कॉल गैर-अवरुद्ध हैं। यह सुनते समय बोलता है क्योंकि भाषण उत्पादन और स्वागत अलग-अलग हैं। इसका परिणाम एक ऐसी प्रणाली है जिसकी संवादात्मक गतिशीलता पहली बार संरचनात्मक रूप से मानव बातचीत के बराबर है।

लेटेंट-स्पेस वर्ल्ड मॉडल। हाइड्रा मूल रूप से आवाज के लिए एक वर्ल्ड मॉडल है। जैसे ही निरंतर ऑडियो इनपुट आता है, हाइड्रा इसे एक घने गुप्त स्थान (dense latent space) में संपीड़ित करता है जो भाषण संकेत की पूरी समृद्धि को सुरक्षित रखता है: न केवल शाब्दिक सामग्री, बल्कि स्वर-शैली, भावना, हिचकिचाहट के पैटर्न, बोलने की दर, जोर और सूक्ष्म-समय। यह गुप्त प्रतिनिधित्व संवादात्मक दुनिया का सिस्टम का आंतरिक मॉडल है: संवाद में जो कुछ भी हो रहा है उसका एक निरंतर अद्यतन, संपीड़ित प्रतिनिधित्व। फिर एक ऑटोरेग्रैसिव मॉडल इस गुप्त स्थान पर काम करता है, बातचीत की अगली स्थितियों की भविष्यवाणी और उत्पादन करता है। क्योंकि बुद्धिमत्ता परत उच्च-आयामी अलग टोकनों के बजाय कॉम्पैक्ट गुप्त प्रस्तुतियों पर विचार करती है, हाइड्रा असाधारण पैरामीटर दक्षता प्राप्त करता है। संवादात्मक क्षमता का वही स्तर जिसके लिए टोकन-आधारित भाषा मॉडल में सैकड़ों अरबों मापदंडों की आवश्यकता होगी, एक गुप्त-स्थान विश्व मॉडल में प्राप्त किया जा सकता है जो सौ से एक हजार गुना छोटा है। यह कोई मामूली दक्षता लाभ नहीं है; यह एक संरचनात्मक बदलाव है जो वॉयस एआई के अर्थशास्त्र और तैनाती परिदृश्य को पूरी तरह से बदल देता है।

क्यों गुप्त स्थान वास्तविक आवाज की समझ को सक्षम बनाता है। गुप्त प्रस्तुतियों पर काम करने का विकल्प केवल दक्षता अनुकूलन नहीं है: यह वास्तविक आवाज की समझ की कुंजी है। जब आवाज को पाठ में ट्रांसक्राइब किया जाता है, तो ट्रांसक्रिप्शन भाषण संकेत द्वारा दी जाने वाली अधिकांश जानकारी को छोड़ देता है। समान शब्दों वाले लेकिन अलग स्वर-शैली, समय और भावनात्मक स्वर वाले दो कथन एक ही ट्रांसक्रिप्ट तैयार करेंगे। एक पाठ-आधारित मॉडल सचमुच उनमें अंतर नहीं कर सकता। एक लेटेंट-स्पेस वर्ल्ड मॉडल इस जानकारी को सुरक्षित रखता है क्योंकि गुप्त प्रतिनिधित्व सीधे कच्चे ऑडियो से प्राप्त होता है, न कि किसी पाठ मध्यस्थ से। मॉडल इस बात पर विचार करता है कि क्या कहा गया था, इसे कैसे कहा गया था, और यह कब कहा गया था: संपूर्ण संवादात्मक कार्य, न कि केवल उसकी पाठ्य छाया। गुप्त स्थान असंरचित नहीं है; यह एक सीखा हुआ संपीड़न है जो बातचीत की श्रेणीबद्ध संरचना (ध्वन्यात्मक इकाइयाँ, स्वर-शैली श्रेणियां, संवाद कार्य, बारी लेने की घटनाएं, सामान्य-आधार स्थिति) को सुरक्षित रखता है जिसे संज्ञानात्मक विज्ञान ने स्वतंत्र रूप से कम्प्यूटेशनल स्तर पर पहचाना है [स्मॉलेस्ट एआई रिसर्च, 2026]।

बुद्धिमत्ता के दो दृष्टिकोण: सब कुछ सहेजें या संपीड़ित करें और अनुकूलित करें

केंद्रीय डिज़ाइन प्रश्न संरचना और पैमाने के बीच संबंध है। आधुनिक बड़े भाषा मॉडल एक उत्तर का प्रतिनिधित्व करते हैं: पैमाने के प्रति प्रतिबद्ध होना, मापदंडों में सब कुछ सहेजना, और यह विश्वास करना कि दुनिया की संरचना पर्याप्त डेटा और पर्याप्त कंप्यूट की एक उभरती हुई विशेषता के रूप में पुनर्प्राप्त हो जाएगी। हाइड्रा एक अलग उत्तर का प्रतिनिधित्व करता है: दोनों के प्रति प्रतिबद्ध होना। संरचना को सीधे अंदर बनाएं, पैमाने का उपयोग वहां करें जहां इसकी आवश्यकता है (अनुभवात्मक परत, गुप्त संपीड़न, भविष्य कहने वाली गतिशीलता), और संरचना को वह काम करने दें जो केवल पैमाना कुशलता से नहीं कर सकता। यह संरचना और पैमाना है, केवल पैमाना नहीं, और यही वह डिज़ाइन सिद्धांत है जिस पर हाइड्रा बनाया गया है।

चित्र 3 वर्तमान विकल्पों के सापेक्ष संरचना-और-पैमाने के डिजाइन क्षेत्र में हाइड्रा को स्थापित करता है।



चित्र 3: आवाज और संवादात्मक एआई प्रणालियों के लिए संरचना-और-पैमाना डिजाइन क्षेत्र। क्षैतिज अक्ष पैमाने (पैरामीटर गणना, प्रशिक्षण-डेटा मात्रा) का प्रतिनिधित्व करता है; लंबवत अक्ष डिज़ाइन किए गए संरचनात्मक आगमनात्मक पूर्वाग्रह (inductive bias) की डिग्री का प्रतिनिधित्व करता है (जिस सीमा तक प्रणाली का आर्किटेक्चर उन प्रस्तुतियों के लिए प्रतिबद्ध है जो संज्ञानात्मक विज्ञान मानव संवादात्मक तर्क को देता है)। समकालीन फाउंडेशन मॉडल नीचे-दाएं चतुर्थांश, बड़े पैमाने, कम डिज़ाइन की गई संरचना पर कब्जा करते हैं, जिसमें जो भी संवादात्मक संरचना मौजूद है उसे प्रशिक्षण की एक उभरती हुई विशेषता के रूप में पुनर्प्राप्त करने के लिए छोड़ दिया जाता है। हाइड्रा ऊपरी-बाएँ क्षेत्र पर कब्जा करता है: चित्र 2 का संवादात्मक भौतिकी इंजन डिज़ाइन द्वारा संरचनात्मक रूप से प्रतिबद्ध है, और पैमाना वहीं केंद्रित है जहाँ इसकी आवश्यकता है (अनुभवात्मक परत, गुप्त संपीड़न, भविष्य कहने वाली गतिशीलता) न कि पूरे सिस्टम में फैला हुआ है। टूटी हुई तीरें एक ही प्रारंभिक बिंदु से दो डिज़ाइन पथों को दिखाती हैं। यह वह स्थिति है जिसे संरचना और पैमाने के रूप में संक्षेपित किया गया है, केवल पैमाना नहीं: पैमाने की अस्वीकृति नहीं बल्कि एक दावा कि संरचना को इसके साथ होना चाहिए।

दृष्टिकोण एक: मॉडल में सब कुछ सहेजें। पहला दृष्टिकोण, जिसका उदाहरण समकालीन बड़े भाषा मॉडल हैं [OpenAI, 2023, Touvron et al., 2023, Vaswani et al., 2017, Brown et al., 2020], वास्तविक दुनिया के टोकन पर प्रशिक्षण देना और मॉडल के मापदंडों में जितनी संभव हो उतनी जानकारी सहेजना है। मॉडल याद रखता है कि दुनिया में क्या हुआ है (तथ्य, पैटर्न, प्रक्रियाएं, संबंध) और इन सभी को अपने भार (weights) में कूटबद्ध करता है। इस दृष्टिकोण का लाभ व्यापकता है: पर्याप्त रूप से बड़े डेटासेट पर प्रशिक्षित एक पर्याप्त रूप से बड़ा मॉडल असाधारण विषयों के बारे में प्रश्नों का उत्तर दे सकता है। उदाहरण के लिए, जब पूछा जाए कि आईफोन के सटीक आयाम क्या हैं, तो एक एलएलएम शायद सटीक उत्तर दे सकता है यदि यह जानकारी प्रशिक्षण डेटा में मौजूद थी। नुकसान मौलिक है: दुनिया हर सेकंड नई जानकारी उत्पन्न करती है, और कोई भी निश्चित आकार का पैरामीटर स्थान इसके साथ तालमेल नहीं रख सकता है। यदि आप मॉडल परतों में सभी जानकारी सहेजते रहेंगे, तो अंततः आपके पास जगह समाप्त हो जाएगी। अधिक ज्ञान को समायोजित करने के लिए मॉडल को स्केल करने से प्रत्येक अनुमान की कम्प्यूटेशनल लागत भी बढ़ जाती है, भले ही संग्रहीत ज्ञान का बड़ा हिस्सा कार्य के लिए प्रासंगिक न हो।

दृष्टिकोण दो: संपीड़ित करें और जो महत्वपूर्ण है उसे याद रखें। दूसरा दृष्टिकोण, जिसे हाइड्रा साकार करता है, उसमें शामिल है (ए) जानकारी को संपीड़ित करना और केवल उसी पर विचार करना जो दुनिया की स्थिति की भविष्यवाणी करने और कार्यों के वितरण को अधिक कुशलता से करने के लिए आवश्यक है; और (बी) केवल वही याद रखना जो हाथ में काम के लिए प्रासंगिक है और बाकी सब चीजों के लिए दीर्घकालिक स्मृति पर भरोसा करना। इसके साथ, दुनिया को पूरी तरह से याद रखने के बजाय, मॉडल उन संपीड़ित प्रस्तुतियों को बनाना सीखता है जो इसके इनपुट डोमेन की आवश्यक संरचना और गतिशीलता को पकड़ती हैं। यह तर्क करने, निष्कर्ष निकालने, भविष्यवाणी करने के तर्क को संग्रहीत करता है, लेकिन दुनिया के बारे में तथ्यों की समग्रता को नहीं। यह मानव मस्तिष्क की बारीकी से नकल करता है। एक सॉफ्टवेयर इंजीनियर को शायद हाइड्रोजन और ऑक्सीजन की प्रतिक्रिया की दर याद नहीं होगी; हालाँकि, यह देखते हुए कि एक सॉफ्टवेयर इंजीनियर एसटीईएम (STEM) पृष्ठभूमि से आता है, वह प्रेरित होने पर, स्कूल की सही रसायन विज्ञान की पाठ्यपुस्तक का संदर्भ ले सकेगा और प्रश्न का उत्तर दे सकेगा। दूसरा उदाहरण तब है जब आईफोन के सटीक आयामों जैसे कि ऊंचाई, चौड़ाई और लंबाई के बारे में पूछा जाए: अधिकांश मनुष्य उत्तर देने में सक्षम नहीं होंगे, हालांकि वे प्रेरित होने पर, मापने वाला टेप ला सकते हैं और पता लगा सकते हैं। इन तथ्यों को मस्तिष्क के अंदर संग्रहीत करना अक्षम है और मानव की दैनिक दिनचर्या के लिए अनावश्यक है। बुद्धिमत्ता के दोनों दृष्टिकोणों के वैध फायदे हैं, और कोई भी दोनों दिशाओं में ट्रेडऑफ़ पर बहस कर सकता है। हालाँकि, जो स्केलेबल है और लंबी अवधि में मानव बुद्धिमत्ता के करीब है, वह स्पष्ट है: आपको संपीड़ित प्रस्तुतियों पर प्रशिक्षण देना होगा और आपको केवल वही याद रखना होगा जो प्रासंगिक है, क्योंकि दुनिया में हर गुजरते सेकंड के साथ अनंत जानकारी उत्पन्न हो रही है और आप सब कुछ याद नहीं रख सकते। यह अधिक सामान्य स्थिति का एक विशिष्ट उदाहरण है जिसका साथी पेपर [स्मॉलेस्ट एआई रिसर्च, 2026] में बचाव किया गया है: संरचना और पैमाना, केवल पैमाना नहीं। फिर सबसे कठिन चुनौती उत्तर देना है: क्या याद रखना है और क्या भूलना है?

स्मृति से बुद्धिमत्ता का पृथक्करण। यह समझ स्वाभाविक रूप से एक सिद्धांत की ओर ले जाती है जिसे हम स्मृति से बुद्धिमत्ता का पृथक्करण कहते हैं। हाइड्रा की बुद्धिमत्ता परतें तर्क के लिए समर्पित हैं: कैसे विचार करना है, कैसे निष्कर्ष निकालना है, बातचीत कैसे करनी है, यह कैसे पहचानना है कि बाहरी जानकारी की आवश्यकता कब है, और इसे कैसे पुनः प्राप्त करना है। तथ्यात्मक ज्ञान एक बाहरी मेमोरी सिस्टम (पुनर्प्राप्ति-संवर्धित डेटाबेस, टूल एपीआई, डोमेन-विशिष्ट ज्ञान आधार) में रहता है जिसे मॉडल सीखे गए टूल-कॉलिंग व्यवहार के माध्यम से एक्सेस करता है। बुद्धिमत्ता जानती है कि कैसे सोचना है; स्मृति जानती है कि किस बारे में सोचना है। यह अलगाव ही कॉम्पैक्ट, कुशल मॉडल को न केवल संभव बल्कि संरचनात्मक रूप से इष्टतम बनाता है।

इनफॉरेंस-टाइम अनुकूलन और विशेषज्ञता का मार्ग

स्मृति से बुद्धिमत्ता का पृथक्करण एक स्वाभाविक प्रश्न उठाता है: तैनाती के दौरान हाइड्रा कैसे सीखता है और अनुकूलन करता है? यही वह जगह है जहां हाइड्रा के सबसे विशिष्ट गुणों में से एक उभरता है।

गुप्त तत्वों पर समय-श्रृंखला हानि (Time-series loss on latents)। क्योंकि हाइड्रा संपीड़ित गुप्त प्रस्तुतियों पर एक विश्व मॉडल के रूप में काम करता है, इसका मुख्य कार्य भविष्यवाणी करना है: दी गई वर्तमान गुप्त स्थिति के आधार पर, संवादात्मक दुनिया की अगली स्थिति की भविष्यवाणी करना। गुप्त तत्व अनिवार्य रूप से दुनिया का एक भविष्य कहने वाला दृष्टिकोण हैं, जो बातचीत में आगे क्या होगा इसका एक संपीड़ित पूर्वानुमान है। जब भविष्यवाणी गलत होती है, जब वास्तविक अगली स्थिति अनुमानित स्थिति से भिन्न होती है, तो हाइड्रा विसंगति को मापने और ठीक करने के लिए गुप्त स्थान पर समय-श्रृंखला हानि फ़ंक्शन लागू कर सकता है। यह पारंपरिक भाषा मॉडलों में उपयोग किए जाने वाले टोकन-स्तरीय क्रॉस-एन्ट्रॉपी हानि से मौलिक रूप से भिन्न सीखने का संकेत है। गुप्त तत्वों पर समय-श्रृंखला हानि बातचीत की लौकिक गतिशीलता (विषयों का उतार-चढ़ाव, भावनात्मक स्थितियों का विकास, बारी लेने की लय) को अमूर्तता के स्तर पर पकड़ती है जो टोकन-स्तरीय भविष्यवाणी की तुलना में समृद्ध और अधिक कॉम्पैक्ट दोनों है। यह हाइड्रा को वास्तविक समय की बातचीत की संरचना से सीखने में सक्षम बनाता है जिस तरह से पाठ-आधारित मॉडल संरचनात्मक रूप से नहीं कर सकते।

इनफॉरेंस-टाइम लर्निंग। गुप्त तत्वों पर समय-श्रृंखला हानि वास्तविक समय में तैनाती के दौरान अनुकूलन और सुधार करने की क्षमता यानी इनफॉरेंस-टाइम लर्निंग का मार्ग खोलती है। जैसे ही हाइड्रा वास्तविक बातचीत को संसाधित करता है, दुनिया के उसके भविष्य कहने वाले मॉडल का लगातार वास्तविकता के खिलाफ परीक्षण किया जाता है। जब भविष्यवाणियां विफल हो जाती हैं, तो सिस्टम भविष्य की भविष्यवाणियों को बेहतर बनाने के लिए अपने आंतरिक भार को समायोजित करता है। यह वही बुनियादी तंत्र है जिसके माध्यम से मनुष्य बातचीत से सीखते हैं; हम अपेक्षाएं बनाते हैं, परिणाम देखते हैं, और तदनुसार दुनिया के अपने मॉडल अपडेट करते हैं [क्लार्क, 2013]। हालांकि इनफॉरेंस-टाइम लर्निंग पूरी तरह से हल नहीं हुई है, हमने शुरुआती परिणाम देखे हैं जो उत्साहजनक हैं, और हमारा दृढ़ विश्वास है कि भविष्य गुप्त प्रस्तुतियों पर समय-श्रृंखला हानि कार्यों में निहित है। यह तंत्र बुद्धिमत्ता को स्मृति से वास्तविक रूप से अलग करने में सक्षम बनाता है: बुद्धिमत्ता परतें भविष्यवाणी करना और तर्क करना सीखती हैं, जबकि मेमोरी सिस्टम विशिष्ट भविष्यवाणियों के लिए आवश्यक तथ्य और संदर्भ प्रदान करता है। इनफॉरेंस-टाइम लर्निंग हाइड्रा को यह याद रखने की अनुमति देती है कि हाथ में काम के लिए क्या महत्वपूर्ण है और जो नहीं है उसे छोड़ दे।

कृत्रिम विशेष बुद्धिमत्ता (Artificial Special Intelligence)। एसिंक्रोनस आर्किटेक्चर, गुप्त-स्थान तर्क, बुद्धिमत्ता-स्मृति अलगाव, और इनफॉरेंस-टाइम लर्निंग का संयोजन एक नई क्षमता की ओर ले जाता है जिसे हम कृत्रिम विशेष बुद्धिमत्ता (ASI) कहते हैं। विशेष बुद्धिमत्ता से हमारा तात्पर्य ऐसे मॉडलों से नहीं है जो विशिष्ट, स्थिर प्रणालियाँ हैं जो एक संकीर्ण क्षेत्र के लिए सूक्ष्म-ट्यून की गई हैं। हमारा तात्पर्य ऐसे मॉडलों से है जिनमें वास्तविक समय में तेजी से विशेषज्ञता हासिल करने की क्षमता है, और जिनके लिए विशेषज्ञता अत्यधिक कुशल है। यह कुशल बुद्धिमत्ता है, उसी तरह जैसे मानव बुद्धिमत्ता कुशल है। एक ठोस उदाहरण पर विचार करें: एक वित्तीय उद्यम में ग्राहक सहायता के लिए तैनात एक वॉयस एजेंट। एजेंट सामान्य प्रयोजन तर्क क्षमताओं और डोमेन-प्रासंगिक उपकरणों और ज्ञान आधारों तक पहुंच के साथ आता है। जैसे ही यह वास्तविक बातचीत को संसाधित करता है, यह तेजी से सीखता है कि कौन से पैटर्न, तथ्य और टूल-कॉलिंग रणनीतियाँ इसके संचालन डोमेन के लिए सबसे प्रासंगिक हैं। कम संख्या में इंटरैक्शन चक्रों के भीतर, मॉडल एक विशेषज्ञ बन जाता है, इसलिए नहीं कि किसी ने इसे सूक्ष्म-ट्यून किया है, बल्कि इसलिए कि इसने उपयोग के माध्यम से खुद को विशेषज्ञ बनाना सीख लिया है। अप्रासंगिक जानकारी को प्राथमिकता से हटा दिया जाता है। मॉडल अपने विशेष कार्य में कुशल हो जाता है। यही वह अर्थ है जिसमें छोटे मॉडल शक्तिशाली बन जाते हैं। एक कॉम्पैक्ट तर्क कोर जो किसी भी तैनाती संदर्भ में जल्दी और कुशलता से अनुकूलित हो सकता है, संरचनात्मक रूप से एक विशाल मॉडल से बेहतर है जो हर क्षेत्र में अपनी क्षमता को कम करता है। क्षमता का माप कुल पैरामीटर गणना नहीं बल्कि तर्क कोर की दक्षता और अनुकूलनशीलता है [लेक एट अल., 2017]।


हाइड्रा, आवाज का भविष्य

अब हम पूरी तस्वीर को एक साथ ला सकते हैं कि कैसे हाइड्रा का आर्किटेक्चर वॉयस एआई में, और अधिक व्यापक रूप से, खुद बुद्धिमत्ता में एक नए युग की ओर इशारा करता है।

आवाज मानव बुद्धिमत्ता का मूल तौर-तरीका है: एक वास्तविक, निरंतर, समयबद्ध भौतिक संकेत। वॉयस एआई के लिए वर्तमान दृष्टिकोण, पाइपलाइन ऑर्केस्ट्रेशन और फ्यूज्ड स्पीच-टू-स्पीच मॉडल दोनों, आवाज को पाठ प्रसंस्करण के चारों ओर एक आवरण के रूप में मानते हैं, जो उनके पाठ-केंद्रित विरासत के अनुक्रमिक, बारी-बारी, हाफ-डुप्लेक्स बाधाओं को विरासत में प्राप्त करते हैं। ये प्रणालियाँ मूल्यवान रही हैं और क्षेत्र को आगे बढ़ाया है, लेकिन वे मानव बातचीत की समवर्ती, एसिंक्रोनस, फुल-डुप्लेक्स प्रकृति को दोहरा नहीं सकती हैं।

हाइड्रा एक मौलिक रूप से भिन्न आधार प्रदान करता है। आवाज को मूल तौर-तरीके के रूप में मानकर, इसे एक गुप्त स्थान में संपीड़ित करके, और एक एसिंक्रोनस आर्किटेक्चर के साथ उन संपीड़ित प्रस्तुतियों पर विचार करके जहां सुनना, सोचना, बोलना और कार्य करना सभी स्वतंत्र प्रक्रियाएं हैं, हाइड्रा पहली बार ऐसी संवादात्मक गतिशीलता प्राप्त करता है जो संरचनात्मक रूप से मानव बातचीत के बराबर है।

हाइड्रा के मूल में स्थित लेटेंट-स्पेस वर्ल्ड मॉडल टोकन-आधारित मॉडलों की तुलना में सौ से एक हजार गुना अधिक पैरामीटर दक्षता लाभ सक्षम बनाता है, जिससे वास्तविक समय की आवाज बुद्धिमत्ता को एज हार्डवेयर और उपभोक्ता जीपीयू पर तैनात किया जा सकता है। स्मृति से बुद्धिमत्ता के अलगाव का मतलब है कि मॉडल की क्षमताएं उसके मेमोरी सिस्टम के साथ स्केल होती हैं, न कि उसकी पैरामीटर गणना के साथ। और गुप्त तत्वों पर समय-श्रृंखला हानि के माध्यम से इनफॉरेंस-टाइम लर्निंग तीव्र, कुशल विशेषज्ञता को सक्षम बनाती है, जो कृत्रिम विशेष बुद्धिमत्ता का आधार है।

यद्यपि गुप्त प्रस्तुतियों पर इनफॉरेंस-टाइम लर्निंग अनुसंधान का एक सक्रिय क्षेत्र है, और अनुकूलन की गतिशीलता, सीखी गई प्रस्तुतियों की स्थिरता, और इनफॉरेंस समय पर क्या सीखा जा सकता है बनाम प्रशिक्षण के दौरान क्या सीखा जाना चाहिए, इसकी सीमाओं के बारे में कई खुले प्रश्न बने हुए हैं, हमने शुरुआती परिणाम देखे हैं जो इस दिशा को मान्य करते हैं, और हमारा दृढ़ विश्वास है कि यह कुशल बुद्धिमत्ता का भविष्य है: कॉम्पैक्ट तर्क कोर जो सोचना सीखते हैं, उन्हें जो जानने की आवश्यकता है उसे एक्सेस करते हैं, और वास्तविक समय में काम के अनुकूल होते हैं। वास्तविक समय की आवाज में ट्यूरिंग टेस्ट पास करने का मार्ग कभी बड़े मॉडलों या कभी तेज़ पाइपलाइनों से होकर नहीं गुजरता। यह उन आर्किटेक्चर से होकर गुजरता है जो प्रतिबिंबित करते हैं कि बुद्धिमत्ता वास्तव में कैसे काम करती है: समवर्ती, एसिंक्रोनस, समयबद्ध, और सही संरचनात्मक आधार पर निर्मित। यह संरचना और पैमाना है, केवल पैमाना नहीं; यही हाइड्रा है, और वॉयस एआई इसी दिशा में जा रहा है।


भविष्य की दिशाएं

कृत्रिम विशेष बुद्धिमत्ता को बेंचमार्क करना। पारंपरिक बेंचमार्क निश्चित कार्यों पर स्थिर क्षमताओं को मापते हैं। कृत्रिम विशेष बुद्धिमत्ता के लिए नई मूल्यांकन पद्धतियों की आवश्यकता होती है जो अनुकूलन गति को मापती हैं: एक मॉडल कितनी जल्दी एक नए क्षेत्र में विशेषज्ञता प्राप्त करता है, एन वास्तविक बातचीत के बाद प्रदर्शन में कितना सुधार होता है, यह डोमेन बहाव को कितनी शालीनता से संभालता है, और यह अप्रासंगिक जानकारी को कितनी कुशलता से भूल जाता है। प्रगति पर नज़र रखने और वास्तुशिल्प निर्णयों का मार्गदर्शन करने के लिए इन बेंचमार्क को विकसित करना महत्वपूर्ण है।

मेमोरी आर्किटेक्चर और टूल इंटीग्रेशन। बुद्धिमत्ता-स्मृति अलगाव के लिए परिष्कृत मेमोरी आर्किटेक्चर की आवश्यकता होती है जो कुशल पुनर्प्राप्ति, प्रतिकूल प्रश्नों के तहत शालीन गिरावट, और इनफॉरेंस-टाइम लर्निंग गतिशीलता के साथ कड़े एकीकरण का समर्थन करते हैं। पुनर्प्राप्ति रणनीतियों, मेमोरी इंडेक्सिंग, अपडेट तंत्र और मेमोरी-तर्क इंटरफ़ेस में अनुसंधान मुख्य मॉडल आर्किटेक्चर में प्रगति के लिए एक आवश्यक साथी है।

एक ट्यूरिंग टेस्ट मूल्यांकन प्रोटोकॉल। इस क्षेत्र को वास्तविक समय की आवाज बातचीत के लिए विशेष रूप से डिज़ाइन किए गए एक कठोर मूल्यांकन प्रोटोकॉल की आवश्यकता है। मौजूदा ट्यूरिंग टेस्ट फॉर्मूलेशन पाठ-आधारित संवाद को लक्षित करते हैं [ट्यूरिंग, 1950] और उन लौकिक, स्वर-शैली और पारालिंग्विस्टिक आयामों को नहीं पकड़ते जो आवाज के केंद्र में हैं। एक आवाज-विशिष्ट प्रोटोकॉल को सामग्री की गुणवत्ता के साथ-साथ प्रतिक्रिया समय, भावनात्मक उपयुक्तता, रुकावट से निपटने, बैकचैनलिंग व्यवहार और बारी लेने की गतिशीलता की स्वाभाविकता का मूल्यांकन करना चाहिए।

एंड-टू-एंड व्यावसायिक प्रक्रिया स्वचालन को मापना। अंततः, वॉयस एआई का व्यावहारिक परीक्षण यह है कि क्या यह एंड-टू-एंड व्यावसायिक प्रक्रियाओं को पूरी तरह से स्वचालित कर सकता है जिन्हें वर्तमान में मानव एजेंटों द्वारा आवाज पर संभाला जाता है। ग्राहक सहायता, बिक्री, शेड्यूलिंग, ट्राइएज, ऑनबोर्डिंग, अनुपालन: ये ऐसे क्षेत्र हैं जहां एक वॉयस एजेंट को न केवल स्वाभाविक रूप से बातचीत करनी चाहिए बल्कि टूल कॉल, सिस्टम इंटीग्रेशन, डिसीजन ट्री और नियामक बाधाओं से जुड़े जटिल वर्कफ़्लो को भी निष्पादित करना चाहिए। यह मापना कि क्या एआई इन प्रक्रियाओं को बिना किसी मानवीय हस्तक्षेप के पहले संपर्क से लेकर समाधान तक पूरी तरह से स्वचालित कर सकता है, इस थीसिस में वर्णित क्षमताओं के लिए निश्चित वास्तविक दुनिया का बेंचमार्क है।


संदर्भ

ब्राउन, टी. बी., एट अल. (2020). भाषा मॉडल कम-शॉट सीखने वाले होते हैं। तंत्रिका सूचना प्रसंस्करण प्रणालियों में प्रगति, 33.

क्लार्क, ए. (2013). आगे जो भी हो? भविष्य कहने वाले मस्तिष्क, स्थित एजेंट और संज्ञानात्मक विज्ञान का भविष्य। व्यवहारिक और मस्तिष्क विज्ञान, 36(3), 181-204.

हा, डी., और श्मिटह्यूबर, जे. (2018). वर्ल्ड मॉडल्स। तंत्रिका सूचना प्रसंस्करण प्रणालियों में प्रगति, 31. arXiv:1803.10122.

हैफनर, डी., लिलिक्रैप, टी., बा, जे., और नोरूज़ी, एम. (2020). नियंत्रण का सपना: गुप्त कल्पना द्वारा व्यवहार सीखना। सीखने की प्रस्तुतियों पर अंतर्राष्ट्रीय सम्मेलन 2020.

हैफनर, डी., एट अल. (2023). वर्ल्ड मॉडल्स के माध्यम से विविध क्षेत्रों में महारत हासिल करना। arXiv:2301.04104.

लेक, बी. एम., उलमैन, टी. डी., टेनेनबाम, जे. बी., और गर्शमैन, एस. जे. (2017). ऐसी मशीनें बनाना जो लोगों की तरह सीखती और सोचती हैं। व्यवहारिक और मस्तिष्क विज्ञान, 40, e253.

लेकन, वाई. (2022). स्वायत्त मशीन इंटेलिजेंस की ओर एक मार्ग। ओपनरिव्यू प्रीप्रिंट।

लेविंसन, एस. सी. (2016). मानव संचार में बारी लेना: भाषा प्रसंस्करण के लिए उत्पत्ति और निहितार्थ। संज्ञानात्मक विज्ञान में रुझान, 20(1), 6-14.

गुयेन, टी. ए., एट अल. (2024). स्पिरिट-एलएम: इंटरलीव्ड बोली जाने वाली और लिखित भाषा मॉडल। arXiv:2402.05755.

OpenAI. (2023). GPT-4 तकनीकी रिपोर्ट। arXiv:2303.08774.

पिकरिंग, एम. जे., और गैरोड, S. (2004). संवाद के एक यांत्रिक मनोविज्ञान की ओर। व्यवहारिक और मस्तिष्क विज्ञान, 27(2), 169-190.

रेडफोर्ड, ए., किम, जे. डब्ल्यू., जू, टी., ब्रॉकमैन, जी., मैक्लीवी, सी., और सुतस्केवर, आई. (2022). बड़े पैमाने पर कमजोर पर्यवेक्षण के माध्यम से मजबूत भाषण पहचान। arXiv:2212.04356.

रेन, वाई., एट अल. (2020). फास्टस्पीच 2: तेज और उच्च गुणवत्ता वाली एंड-टू-एंड टेक्स्ट टू स्पीच। arXiv:2006.04558.

रुबिनस्टीन, पी. के., एट अल. (2023). ऑडियोपीएएलएम: एक बड़ा भाषा मॉडल जो बोल और सुन सकता है। arXiv:2306.12925.

सैक्स, एच., शेग्लॉफ, ई. ए., और जेफरसन, जी. (1974). बातचीत के लिए बारी लेने के संगठन के लिए एक सरल व्यवस्थित तरीका। भाषा, 50(4), 696-735.

साल्वुची, डी. डी., और टाटगेन, एन. ए. (2008). थ्रेडेड कॉग्निशन: समवर्ती मल्टीटास्किंग का एक एकीकृत सिद्धांत। मनोवैज्ञानिक समीक्षा, 115(1), 101-130.

स्मॉलेस्ट एआई रिसर्च (2026). द कन्वर्सेशन इंजन: बोली जाने वाली बातचीत के लिए प्रतीकात्मक वर्ल्ड मॉडल्स पर एक स्थिति। साथी पेपर।

टौवरॉन, एच., एट अल. (2023). LLaMA: खुले और कुशल बुनियादी भाषा मॉडल। arXiv:2302.13971.

ट्यूरिंग, ए. एम. (1950). कंप्यूटिंग मशीनरी और इंटेलिजेंस। माइंड, 59(236), 433-460.

वासवानी, ए., एट अल. (2017). अटेंशन इज ऑल यू नीड। तंत्रिका सूचना प्रसंस्करण प्रणालियों में प्रगति, 30.

झेंग, डी., एट अल. (2023). स्पीचजीपीटी: आंतरिक क्रॉस-मोडल संवादात्मक क्षमताओं के साथ बड़े भाषा मॉडलों को सशक्त बनाना। arXiv:2305.11000.

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉइस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104