स्मॉलेस्ट एआई + पाइपकेट: वो वॉयस स्टैक जिसका आप निर्माण करने के लिए इंतजार कर रहे थे।

Fastest TTS APIs for low-latency voice agents

रीयल-टाइम वॉयस एआई अब बहुत अधिक तेज़ हो गया है। लाइटनिंग टीटीएस (Lightning TTS) और पल्स एसटीटी (Pulse STT) अब सीधे पाइपकेट (Pipecat) से जुड़ते हैं, और प्रोडक्शन के लिए तैयार वॉयस एजेंट बनाना पहले से कहीं आसान हो गया है।

हम काफी समय से इस दिशा में काम कर रहे हैं।

वॉयस एआई (Voice AI) इस समय काफी चर्चा में है, लेकिन इसके आस-पास के अधिकांश टूल्स अभी भी बिखरे हुए हैं। आप यहाँ एक ट्रांसक्रिप्शन सर्विस जोड़ते हैं, वहाँ एक टीटीएस (TTS) प्रोवाइडर, अपनी खुद की इंटरप्शन हैंडलिंग तैयार करते हैं, अपने खुद के वेबसॉकेट (WebSocket) कनेक्शन मैनेज करते हैं, और जब तक आपके पास एंड-टू-एंड काम करने वाला कुछ तैयार होता है, तब तक आपने प्रोडक्ट से ज़्यादा इंफ्रास्ट्रक्चर लिख लिया होता है।

इसी समस्या को हल करने के लिए Pipecat को बनाया गया था। और यही कारण है कि हम इस इंटीग्रेशन में गहराई से जुड़े हैं।

हमें यह घोषणा करते हुए गर्व हो रहा है कि Smallest AI को Pipecat में नेटिव सपोर्ट मिला है। लाइटनिंग टीटीएस (Lightning TTS) और पल्स एसटीटी (Pulse STT) इस फ्रेमवर्क में फर्स्ट-क्लास सर्विसेज़ हैं- जिसका अर्थ है कि आपको केवल एक pip इंस्टॉल और कुछ लाइनों के कोड के साथ पूरी तरह से इंटरप्टिबल, लो-लेटेंसी, रियल-टाइम वॉयस इन और वॉयस आउट मिलता है।

कोई कस्टम रैपर्स नहीं। कोई ग्लू कोड नहीं। पहिये का दोबारा आविष्कार करने की कोई आवश्यकता नहीं।

Pipecat क्या है?

यदि आप अभी तक इससे रूबरू नहीं हुए हैं, तो Pipecat रियल-टाइम वॉयस और मल्टीमॉडल कन्वर्सेशनल एआई एजेंट्स बनाने के लिए एक ओपन-सोर्स पायथन (Python) फ्रेमवर्क है।

जो चीज़ इसे आपकी खुद की एसिंक पाइपलाइन बनाने से अलग बनाती है, वह है इसका फ्रेम-बेस्ड आर्किटेक्चर। Pipecat पाइपलाइन से बहने वाला डेटा का हर हिस्सा — ऑडियो चंक्स, ट्रांसक्रिप्शंस, एलएलएम (LLM) टोकन्स, सिंथेसाइज्ड स्पीच, एक टाइप्ड फ्रेम है। सर्विसेज़ फ्रेम्स को ग्रहण करती हैं, उन्हें प्रोसेस करती हैं, और डाउनस्ट्रीम में नए फ्रेम्स जारी करती हैं। यह आपको एक साफ, कंपोज़ेबल सिस्टम देता है जहाँ हर कॉम्पोनेंट का एक अच्छी तरह से परिभाषित कॉन्ट्रैक्ट होता है।

इससे भी महत्वपूर्ण बात यह है कि Pipecat रियल-टाइम वॉयस के वास्तव में कठिन हिस्सों को संभालता है: टर्न डिटेक्शन, इंटरप्शन हैंडलिंग, वीएडी (VAD) इंटीग्रेशन, ट्रांसपोर्ट मैनेजमेंट। वे चीज़ें जिन्हें स्क्रैच से बनाते समय सही करने में हफ़्तों लग जाते हैं- Pipecat ने उन्हें पहले ही सुलझा लिया है।

हमने साथ मिलकर क्या बनाया

हमने Pipecat में दो नेटिव सर्विसेज़ शिप की हैं। 

SmallestSTTService — हमारे रियल-टाइम स्पीच-टू-टेक्स्ट इंजन, पल्स (Pulse) द्वारा संचालित, जो एक परसिस्टेंट वेबसॉकेट (WebSocket) कनेक्शन पर 64ms TTFT पर ट्रांसक्रिप्शन प्रदान करता है।

SmallestTTSService — हमारे स्ट्रीमिंग टीटीएस (TTS) इंजन, लाइटनिंग (Lightning) द्वारा संचालित, जो वेबसॉकेट पर न्यूनतम लेटेंसी के साथ ऑडियो को सिंथेसाइज़ करता है और यूज़र तक स्ट्रीम करता है।

दोनों सर्विसेज़ Pipecat इकोसिस्टम में फर्स्ट-क्लास सिटिजन्स हैं। वे फ्रेमवर्क में हर दूसरी सर्विस की तरह ही पैटर्न का पालन करती हैं, जिसका अर्थ है कि वे हर दूसरी चीज़ के साथ सफाई से कंपोज़ होती हैं - ट्रांसपोर्ट के लिए Daily, एलएलएम के लिए OpenAI, वीएडी के लिए Silero, और जो कुछ भी आप अपनी पाइपलाइन में लाना चाहते हैं।

यह कैसे काम करता है

इंस्टॉल करें

smallest एक्स्ट्रा एक ही बार में दोनों सर्विसेज़ को इंस्टॉल करता है:

bash

pip install "pipecat-ai[smallest]"
pip install "pipecat-ai[smallest]"
pip install "pipecat-ai[smallest]"

ट्रांसपोर्ट, एलएलएम और वीएडी के साथ एक पूरे वॉयस एजेंट के लिए:

bash

pip install "pipecat-ai[smallest,daily,openai,silero,runner]"
pip install "pipecat-ai[smallest,daily,openai,silero,runner]"
pip install "pipecat-ai[smallest,daily,openai,silero,runner]"

अपना एनवायरनमेंट सेट अप करें

SMALLEST_API_KEY=...
DAILY_API_KEY=...
OPENAI_API_KEY=...
SMALLEST_API_KEY=...
DAILY_API_KEY=...
OPENAI_API_KEY=...
SMALLEST_API_KEY=...
DAILY_API_KEY=...
OPENAI_API_KEY=...

एसटीटी (STT) को कनेक्ट करें

पल्स हमारे रियल-टाइम वेबसॉकेट एंडपॉइंट से जुड़ता है और पाइपलाइन से ऑडियो फ्रेम्स स्ट्रीम करता है, जिससे आपके बोलते ही ट्रांसक्रिप्शन वापस मिलता है:

python

from pipecat.services.smallest.stt import SmallestSTTService
from pipecat.transcriptions.language import Language

stt = SmallestSTTService(
    api_key=os.getenv("SMALLEST_API_KEY"),
    settings=SmallestSTTService.Settings(
        language=Language.EN,),)
from pipecat.services.smallest.stt import SmallestSTTService
from pipecat.transcriptions.language import Language

stt = SmallestSTTService(
    api_key=os.getenv("SMALLEST_API_KEY"),
    settings=SmallestSTTService.Settings(
        language=Language.EN,),)
from pipecat.services.smallest.stt import SmallestSTTService
from pipecat.transcriptions.language import Language

stt = SmallestSTTService(
    api_key=os.getenv("SMALLEST_API_KEY"),
    settings=SmallestSTTService.Settings(
        language=Language.EN,),)

टीटीएस (TTS) को कनेक्ट करें

जैसे ही एलएलएम से टोकन्स आना शुरू होते हैं, लाइटनिंग सिंथेसाइज़्ड ऑडियो को वेबसॉकेट पर तुरंत वापस स्ट्रीम करता है:

python


from pipecat.services.smallest.tts import SmallestTTSService

tts = SmallestTTSService(
    api_key=os.getenv("SMALLEST_API_KEY"),
    settings=SmallestTTSService.Settings(
        voice="sophia",),)
from pipecat.services.smallest.tts import SmallestTTSService

tts = SmallestTTSService(
    api_key=os.getenv("SMALLEST_API_KEY"),
    settings=SmallestTTSService.Settings(
        voice="sophia",),)
from pipecat.services.smallest.tts import SmallestTTSService

tts = SmallestTTSService(
    api_key=os.getenv("SMALLEST_API_KEY"),
    settings=SmallestTTSService.Settings(
        voice="sophia",),)

बस यही पूरा सेटअप है। बाकी सब कुछ, जैसे इंटरप्शन हैंडलिंग, वीएडी, टर्न मैनेजमेंट पहले से ही Pipecat द्वारा संभाल लिया गया है।


वह हिस्सा जो हर कोई गलत कर देता है: इंटरप्शन्स (बाधाएं)

यहाँ एक ऐसा परिदृश्य है जिससे आप शायद गुज़रे होंगे।

आप एक वॉयस बॉट बनाते हैं। डेमो अच्छा चलता है — आप इससे एक सवाल पूछते हैं, यह जवाब देता है, सब कुछ अच्छे से चलता है। फिर टीम में से कोई इसे बीच वाक्य में टोकने की कोशिश करता है। बॉट बोलता रहता है। वे फिर कोशिश करते हैं। फिर भी बोलता रहता है। जब तक यह आखिरकार रुकता है, तब तक यह एक ऐसे जवाब में तीन वाक्य गहरे जा चुका होता है जो कोई नहीं चाहता था, और यह पूरी चीज़ लिफ्ट पर चिल्लाने जैसी महसूस होती है।

यह कोई छोटा-मोटा एक्सेप्शनल केस नहीं है। यही वह चीज़ है जो एक वॉयस बॉट को वॉयस कन्वर्सेशन से अलग करती है। और इसे सही करना वास्तव में कठिन है — इसलिए नहीं कि कॉन्सेप्ट जटिल है, बल्कि इसलिए कि रियल-टाइम ऑडियो काफी संवेदनशील होता है। आप मिलीसेकंड में काम कर रहे हैं। यूज़र के बोलना शुरू करने और उस पर पाइपलाइन की प्रतिक्रिया के बीच के किसी भी अंतर को तुरंत महसूस किया जाता है। इसे छिपाया नहीं जा सकता।

Pipecat इसे फ्रेमवर्क लेवल पर संभालता है। Silero VAD आपकी पाइपलाइन के साथ लगातार चलता रहता है, और जैसे ही यह वॉयस एक्टिविटी का पता लगाता है, एक इंटरप्शन इवेंट सिस्टम के माध्यम से प्रसारित होता है। ऑडियो रुक जाता है। एलएलएम दोबारा सक्रिय हो जाता है। यूज़र एक्सपीरियंस बरकरार रहता है। आपको इनमें से किसी को कॉन्फ़िगर करने की आवश्यकता नहीं है — Pipecat बस इसी तरह काम करता है।


हमने इसे क्यों बनाया

2026 में, वॉयस एजेंट्स बनाना अभी भी उतना ही कठिन है जितना इसे नहीं होना चाहिए। 

एआई वाला हिस्सा नहीं, वह काफी हद तक हल हो चुकी समस्या है। कठिन हिस्सा इसके आस-पास की हर चीज़ है। हर इंटीग्रेशन बाउंड्री पर जो मिलीसेकंड आप खो देते हैं। इंटरप्शन लॉजिक जो स्टेजिंग में काम करता है और प्रोडक्शन में फेल हो जाता है। वेबसॉकेट कनेक्शन जो रात 2 बजे ड्रॉप हो जाता है और आपकी पूरी पाइपलाइन को अपने साथ ले जाता है। तीन दिन जो आप ऑडियो बफरिंग समस्याओं को डीबग करने में बिताते हैं जिनका उस चीज़ से कोई लेना-देना नहीं है जिसे आप वास्तव में बनाने की कोशिश कर रहे हैं।

यह इंटीग्रेशन इसलिए अस्तित्व में है क्योंकि हम अच्छी टीमों को उस इंफ्रास्ट्रक्चर पर हफ़्तों गंवाते हुए देखकर थक गए थे जो सामान्य रूप से उपलब्ध होना चाहिए। पल्स और लाइटनिंग तेज़ हैं- 64ms TTFT कोई मार्केटिंग नंबर नहीं है, यह वही है जो रियल-टाइम बातचीत के लिए वास्तव में आवश्यक है। और इन्हें चलाने के लिए Pipecat सही फ्रेमवर्क है, क्योंकि इसे उन लोगों द्वारा बनाया गया था जो समझते हैं कि वॉयस में कठिन समस्याएं मॉडल्स नहीं हैं, बल्कि उनका कनेक्शन (प्लंबिंग) हैं।

इन्हें एक साथ लाएं और आपको एक ऐसा स्टैक मिलता है जहाँ लेटेंसी वास्तव में कम होती है, इंटरप्शन्स वास्तव में काम करते हैं, और आप एक दोपहर में शून्य से एक बात करने वाले बॉट तक पहुँच सकते हैं। यही इसका पूरा उद्देश्य है।


एक संपूर्ण वॉयस एजेंट, एंड टू एंड

यहाँ देखें कि पूरा स्टैक कैसा दिखता है:

  • Smallest AI Pulse STT — 64ms TTFT पर ट्रांसक्रिप्शन

  • OpenAI — बातचीत के लिए एलएलएम (LLM)

  • Smallest AI Lightning TTS — स्ट्रीमिंग ऑडियो सिंथेसिस

  • Silero VAD — वॉयस एक्टिविटी डिटेक्शन और इंटरप्शन हैंडलिंग

  • Daily — ऑडियो रूम्स के लिए WebRTC ट्रांसपोर्ट

पूरा काम करने वाला उदाहरण Pipecat रिपॉजिटरी में मौजूद है:


bash


git clone https://github.com/pipecat-ai/pipecat.git
cd pipecat/examples/voice
python voice-smallest.py -t daily
git clone https://github.com/pipecat-ai/pipecat.git
cd pipecat/examples/voice
python voice-smallest.py -t daily
git clone https://github.com/pipecat-ai/pipecat.git
cd pipecat/examples/voice
python voice-smallest.py -t daily

http://localhost:7860 खोलें। रनर ऑटोमैटिकली एक Daily रूम शुरू कर देता है। आप कनेक्ट हो चुके हैं।

त्वरित परीक्षण के लिए वेब सर्वर को छोड़ना पसंद करते हैं:

bash


python voice-smallest.py -d
python voice-smallest.py -d
python voice-smallest.py -d

रूम URL आपके टर्मिनल पर प्रिंट हो जाएगा। इसे खोलें और शुरू करें।


शुरू करें

डॉक्यूमेंट्स (Docs)docs.smallest.ai

GitHubpipecat-ai/pipecat — voice-smallest.py

सवाल हैं? हमें Discord पर खोजें या Pipecat रिपो में एक इश्यू (issue) ओपन करें।

Smallest AI इंटरनेट पर सबसे तेज़ स्पीच इंफ्रास्ट्रक्चर बनाता है। Lightning TTS और Pulse STT आज API के माध्यम से उपलब्ध हैं।


लेख सुनें
2:00
लेख सुनें
2:00

एआई (AI) के साथ सारांशित करें

पाइपकैट (Pipecat) के साथ आज ही वॉयस एआई (Voice AI) बनाएं

डेवलपर्स के लिए निर्मित

एआई (AI) के साथ सारांशित करें

पाइपकैट (Pipecat) के साथ आज ही वॉयस एआई (Voice AI) बनाएं

डेवलपर्स के लिए निर्मित

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104

वॉयस एजेंट ऑर्केस्ट्रेशन के भविष्य का निर्माण करें

311 कैलिफ़ोर्निया स्ट्रीट, सुइट 320
सैन फ्रांसिस्को, सीए 94104