
अधिकांश समय, एक एआई कोडिंग एजेंट एक महाशक्ति (सुपरपावर) की तरह महसूस होता है। आप जो चाहते हैं उसका वर्णन करते हैं, और कुछ ही सेकंड में कोड सामने आ जाता है। इसलिए जब आप किसी को जोड़ने के लिए कहते हैं।
वॉइस APIs के साथ आपके कोडिंग एजेंट की समस्या
जब आप Claude Code या Cursor को अपने एप्लिकेशन में टेक्स्ट-टू-स्पीच जोड़ने के लिए कहते हैं, तो यह आमतौर पर कुछ ऐसा लिखता है जो सही लगता है।
फिर आप इसे चलाते हैं और 404 त्रुटि प्राप्त करते हैं।
ऐसा क्यों?
क्योंकि उसने जिस एंडपॉइंट का उपयोग किया था, उसे छह महीने पहले ही बंद (deprecated) कर दिया गया था।
AI कोडिंग एजेंटों को इंटरनेट के स्नैपशॉट पर प्रशिक्षित किया जाता है, और APIs मॉडल प्रशिक्षण चक्रों की तुलना में बहुत तेजी से विकसित होते हैं। Smallest AI के एकीकृत /waves/v1/tts एंडपॉइंट ने पुराने प्रति-मॉडल रूट्स को बदल दिया है। मॉडल के नाम बदल गए हैं। अनुशंसित सैंपल दरें बदल गई हैं। सर्वोत्तम अभ्यास बदल गए हैं।
पुराने प्रशिक्षण डेटा पर भरोसा करने वाला एक एजेंट अक्सर ऐसा कोड जनरेट करता है जो कभी काम ही नहीं करने वाला था। आप अपना उत्पाद बनाने के बजाय दोपहर भर जनरेट किए गए कोड को डीबग करने में बिता देते हैं।
एक बेहतर तरीका है।
पेश है Smallest AI Agent Skills
आज, हम Smallest AI Agent Skills संग्रह को ओपन-सोर्स कर रहे हैं:
GitHub रिपॉजिटरी: https://github.com/smallest-inc/skills
Agent Skills एक खुला मानक है जिसे मूल रूप से Anthropic द्वारा विकसित किया गया था और अब Claude Code, Cursor, GitHub Copilot, Gemini CLI, और दर्जनों अन्य AI कोडिंग टूल्स द्वारा समर्थित है।
स्किल्स कोडिंग एजेंटों को किसी विशिष्ट डोमेन के लिए विशेष, अद्यतित ज्ञान प्रदान करते हैं। प्रत्येक स्किल को SKILL.md फ़ाइल के रूप में पैकेज किया जाता है। जब आपका एजेंट किसी प्रासंगिक कार्य का पता लगाता है, तो यह स्वचालित रूप से संबंधित स्किल को संदर्भ में लोड कर लेता है।
परिणाम:
कोई काल्पनिक (hallucinated) एंडपॉइंट नहीं
कोई अप्रचलित मॉडल नाम नहीं
कोई पुराने उदाहरण नहीं
कोई API अनुमान लगाने की आवश्यकता नहीं
बस काम करने वाला कोड।
एक लाइन में इंस्टॉल करें
संपूर्ण स्किल संग्रह इंस्टॉल करें:
या केवल वही स्किल्स इंस्टॉल करें जिनकी आपको आवश्यकता है:
Claude Code, Cursor, GitHub Copilot (VS Code), Gemini CLI, Kiro और Agent Skills मानक का समर्थन करने वाले किसी भी एजेंट के साथ काम करता है।
छह स्किल्स, सब कुछ शामिल
setup-api-key
अपनी API कुंजी को कॉन्फ़िगर और सत्यापित करें। यहाँ से शुरू करें।
इस स्किल का उपयोग करें:
प्रमाणीकरण (authentication) कॉन्फ़िगर करने के लिए
API कनेक्टिविटी सत्यापित करने के लिए
क्रेडेंशियल्स को मान्य करने के लिए
सेटअप समस्याओं का निवारण करने के लिए
उदाहरण प्रॉम्प्ट:
"मेरी Smallest AI API कुंजी सेट अप करें और सत्यापित करें कि मैं सफलतापूर्वक अनुरोध कर सकता हूँ।"
एजेंट सेटअप स्किल लोड करता है और नवीनतम ऑनबोर्डिंग प्रवाह का उपयोग करके प्रमाणीकरण प्रक्रिया को पूरा करता है।
text-to-speech
Lightning v3.1 और Lightning v3.1 Pro (टेक्स्ट-टू-स्पीच मॉडल) के लिए आवश्यक सब कुछ।
शामिल हैं:
HTTP जनरेशन
SSE स्ट्रीमिंग
WebSocket स्ट्रीमिंग
वॉइस क्लोनिंग
वॉइस/मॉडल अनुकूलता नियम
समर्थित आउटपुट फ़ॉर्मेट
अनुशंसित सैंपल दरें
उदाहरण प्रॉम्प्ट:
"Smallest AI का उपयोग करके 'आपका ऑर्डर कन्फर्म हो गया है।' से स्पीच जनरेट करें। Magnus आवाज़ का उपयोग करें, इसे WAV के रूप में 24000 Hz पर स्ट्रीम करें, और इसे output.wav में सहेजें।"
एजेंट टेक्स्ट-टू-स्पीच स्किल लोड करता है और सही एंडपॉइंट, पैरामीटर, ऑथेंटिकेशन हेडर और स्ट्रीमिंग कॉन्फ़िगरेशन का उपयोग करके कोड जनरेट करता है।
speech-to-text
Pulse और Pulse Pro (स्पीच-टू-टेक्स्ट मॉडल) के लिए आवश्यक सब कुछ।
शामिल हैं:
पहले से रिकॉर्ड किए गए ऑडियो का ट्रांसक्रिप्शन
HTTP अपलोड
रीयल-टाइम WebSocket स्ट्रीमिंग
शब्द-स्तरीय टाइमस्टैम्प
स्पीकर डायराइजेशन (Diarization)
स्वचालित भाषा पहचान
उदाहरण प्रॉम्प्ट:
"Smallest AI का उपयोग करके recording.mp3 को ट्रांसक्राइब करें। शब्द-स्तरीय टाइमस्टैम्प लौटाएं और स्पीकर परिवर्तनों की पहचान करें।"
एजेंट स्पीच-टू-टेक्स्ट स्किल लोड करता है और नवीनतम API पैटर्न का उपयोग करके सही ट्रांसक्रिप्शन वर्कफ़्लो जनरेट करता.
speech-to-speech
Hydra (स्पीच-टू-स्पीच मॉडल) के साथ रीयल-टाइम वॉइस अनुभव बनाएं।
शामिल हैं:
WebSocket सत्र प्रबंधन
टर्न डिटेक्शन (Turn detection)
बीच में बोलने (Barge-in) को संभालना
टूल कॉलिंग
एंड-टू-एंड वॉइस पाइपलाइन के उदाहरण
उदाहरण प्रॉम्प्ट:
"Hydra का उपयोग करके एक रीयल-टाइम ग्राहक सहायता वॉइस एजेंट बनाएं जो उपयोगकर्ता के बोलना शुरू करने पर खुद को रोक सके और आवश्यकता पड़ने पर बाहरी टूल कॉल कर सके।"
एजेंट स्पीच-टू-स्पीच स्किल लोड करता है और सही सत्र और टर्न-हैंडलिंग लॉजिक के साथ एक पूर्ण रीयल-टाइम वॉइस पाइपलाइन जनरेट करता है।
llm-electron
OpenAI-संगत इंटरफ़ेस का उपयोग करके Electron के साथ निर्माण करें।
शामिल हैं:
चैट पूर्णता (Chat completions)
स्ट्रीमिंग प्रतिक्रियाएं
फ़ंक्शन कॉलिंग
OpenAI मॉडल से माइग्रेशन के लिए मार्गदर्शन
उदाहरण प्रॉम्प्ट:
"मेरे OpenAI GPT-4o कॉल को Smallest AI के Electron मॉडल से बदलें। वही संदेश ऐरे और स्ट्रीमिंग सेटअप रखें, बस बेस URL और मॉडल का नाम बदल दें।"
एजेंट Electron स्किल लोड करता है और नवीनतम मॉडल नामों और API कॉन्फ़िगरेशन का उपयोग करके माइग्रेशन करता है।
voice-agents
Atoms पर प्रोडक्शन वॉइस एजेंट बनाएं।
शामिल हैं:
एजेंट निर्माण
एजेंट क्रू (Agent crews)
आउटबाउंड कॉलिंग
अभियान प्रबंधन
ज्ञान कोष (Knowledge base) एकीकरण
कॉल एनालिटिक्स
उदाहरण प्रॉम्प्ट:
"अपॉइंटमेंट रिमाइंडर के लिए एक आउटबाउंड कॉलिंग अभियान बनाएं और मुझे कॉल के परिणामों और एनालिटिक्स की निगरानी के लिए कोड दें।"
एजेंट Voice Agents स्किल लोड करता है और सही Atoms API एकीकरण जनरेट करता है।
शुरू करना
विस्तृत इंस्टॉलेशन निर्देश, स्किल दस्तावेज़ और उदाहरण प्रॉम्प्ट दस्तावेज़ीकरण में उपलब्ध हैं।
स्किल्स रिपॉजिटरी पूरी तरह से ओपन सोर्स है। यदि आपको कोई समस्या मिलती है, अतिरिक्त उदाहरण चाहते हैं, या सुधारों में योगदान देना चाहते हैं, तो पुल अनुरोधों (pull requests) का स्वागत है।
तेजी से निर्माण करें। कार्यशील एकीकरण वितरित करें। अपने कोडिंग एजेंट को अद्यतित रहने दें।
संसाधन:
मैं क्लॉड कोड (Claude Code) में स्किल्स कैसे जोड़ूं या इंस्टॉल करूं?
मैं क्लॉड कोड (Claude Code) में स्किल्स (skills) का उपयोग कैसे करूँ?
क्या मैं अपने खुद के कस्टम स्किल्स (custom skills) बना सकता हूँ?
एआई (AI) कोडिंग एजेंट टूटे हुए या अप्रचलित एपीआई (API) कोड क्यों जेनरेट करते हैं?



