Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking EmpirioLabs पर उपलब्ध हैं. दोनों रीयलटाइम वॉयस मॉडल हैं: आप एक WebSocket खोलते हैं, माइक्रोफ़ोन ऑडियो स्ट्रीम करते हैं, और बोले गए जवाब उसी कनेक्शन पर वापस स्ट्रीम होते हैं.
मिथुन 3.8 लाइव वॉयस एजेंटों और लाइव संवाद के लिए कम-विलंबता विकल्प है। यह ऑडियो के साथ लाइव वीडियो फ्रेम स्वीकार करता है, बातचीत के दौरान आपके कार्यों को कॉल करता है, और कॉल करने वाला जिस भाषा में बोलता है उसी में उत्तर देता है।
मिथुन 3.8 लाइव विस्तारित सोच पृष्ठभूमि में कारण जब यह बात करता है, तो उन प्रश्नों के लिए जिनके त्वरित उत्तर से अधिक की आवश्यकता होती है। आप सेट करते हैं कि यह कितना कारण है तर्क effort।.
Playground में या तो प्रयास करें: मिथुन 3.8 लाइव या विस्तारित सोच को जियो. कोई आवाज चुनें, सत्र शुरू करें और बात करें पर क्लिक करें.
कनेक्ट करना
प्लेटफ़ॉर्म पर प्रत्येक रीयलटाइम मॉडल एक समापन बिंदु का उपयोग करता है, जिसे इसके साथ चुना जाता है मॉडल क्वेरी पैरामीटर पर टैप करें. अपनी EmpirioLabs एपीआई कुंजी से हैंडशेक को प्रमाणित करें:
wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live प्राधिकरण: वाहक YOUR_EMPIRIOLABS_API_KEY
प्रोटोकॉल व्यापक रूप से उपयोग किए जाने वाले रीयलटाइम ईवेंट प्रारूप का अनुसरण करता है। सत्र को कॉन्फ़िगर करें session.update इससे पहले कि आप पहला ऑडियो भेजें, माइक्रोफ़ोन ऑडियो को इसके साथ जोड़ें input_audio_buffer.append, और से उत्तर पढ़ें प्रतिक्रिया.ऑडियो.डेल्टा, इसके प्रतिलेख के साथ response.audio_transcript.डेल्टा।.
{"type": "session.update", "session": { "voice": "Kore", "instructions": "आप एक संक्षिप्त यात्रा सहायक हैं। }}
ऑडियो दोनों दिशाओं में 16-बिट पीसीएम है: आपके माइक्रोफ़ोन से 16 kHz, या 24 kHz के साथ input_audio_format पर सेट करें पीसीएम24, और उत्तर के लिए 24 kHz। आवाज गतिविधि का पता लगाना शुरू से ही चालू है, इसलिए जब कॉल करने वाला बोलना बंद कर देता है तो मॉडल जवाब देता है, और उत्तर पर बोलना इसे बाधित करता है।
वीडियो फ्रेम
दोनों मॉडल देख सकते हैं कि कॉल करने वाला उन्हें क्या दिखाता है। कैमरे या स्क्रीन से फ्रेम को अपने स्वयं के बफर में बेस64 जेपीईजी या पीएनजी छवियों के रूप में भेजें, और उसी मोड़ में उनके बारे में पूछें:
{"प्रकार": "input_image_buffer.append", "छवि": "<base64 JPEG या PNG>"}
फ़ंक्शन कॉलिंग
में फ़ंक्शंस घोषित करें session.update JSON स्कीमा पैरामीटर के साथ। जब मॉडल एक को कॉल करता है, तो आपको प्राप्त होता है response.function_call_arguments.done के साथ call_id, फ़ंक्शन का नाम और उसके तर्क। परिणाम को एक के रूप में लौटाएं function_call_output आइटम और मॉडल इसके साथ बात करना जारी रखता है।
विस्तारित सोच पर तर्क
{"प्रकार": "session.update", "सत्र": {"reasoning_effort": "उच्च"}}
तर्क effort स्वीकार करता है संख्या आदि, मध्यम (डिफ़ॉल्ट) या उच्च. मॉडल अक्सर पहले एक प्रश्न को स्वीकार करता है और फिर दूसरी प्रतिक्रिया में उत्तर देता है, इसलिए पहले के बाद सुनते रहें प्रतिक्रिया.किया गया।.
मूल्य निर्धारण
दोनों मॉडल मॉडल रिपोर्ट के उपयोग से प्रत्येक पूर्ण मोड़ को बिल करते हैं, दोनों दिशाओं में ऑडियो टोकन और टेक्स्ट टोकन के लिए अलग-अलग दरों के साथ। वीडियो फ्रेम इनपुट टोकन के रूप में बिल करते हैं, और आउटपुट टोकन के रूप में रीजनिंग बिल। एक्सटेंडेड थिंकिंग हर मोड़ पर अधिक इनपुट टोकन की रिपोर्ट करता है, इसलिए लाइव की तुलना में एक ही बातचीत की लागत उस पर अधिक होती है। वर्तमान दरें पर हैं मिथुन 3.8 लाइव तथा विस्तारित सोच को जियो मॉडल पेज और पर मूल्य निर्धारण पृष्ठ।.
आपके पहले सत्र से पहले जानने लायक बातें
- बोलने से पहले सत्र निर्धारित करें। बातचीत शुरू होने के बाद आवाज, निर्देश, टर्न डिटेक्शन, उपकरण, तापमान और तर्क प्रयास ठीक हो जाते हैं। बाद में उन्हें बदलने से एक त्रुटि मिलती है; इसके बजाय एक नया सत्र खोलें।
- 30 सूचीबद्ध आवाज़ों में से एक का उपयोग करें। पक डिफ़ॉल्ट है। किसी भी अन्य मान को त्रुटि के साथ अस्वीकार कर दिया जाता है।
- कोई भाषा सेटिंग नहीं है। मॉडल कॉल करने वाले द्वारा बोलने वाली भाषा में उत्तर देता है।
- कॉल करने वाले के रुकने के बाद थोड़ी देर के लिए स्ट्रीमिंग करते रहें। वॉयस एक्टिविटी डिटेक्शन को यह तय करने के लिए एक छोटी सी चुप्पी की आवश्यकता होती है कि टर्न खत्म हो गया है, इसलिए एक क्लाइंट जो अंतिम शब्द पर ऑडियो काटता है, उत्तर की प्रतीक्षा करता है।
- एक नया सॉकेट एक नई बातचीत है। यदि किसी पुनः कनेक्ट करने वाले क्लाइंट को पहले के संदर्भ की आवश्यकता है तो अपनी स्वयं की प्रतिलेख रखें।
इवेंट टेबल, वॉयस सूची और ऑडियो प्रारूप रीयलटाइम वॉयस एपीआई डॉक्स। एक ही परिवार के text-to-speech के लिए, देखें जेमिनी 3.8 फ्लैश टीटीएस और फ्लैश-लाइट टीटीएस का उपयोग कैसे करें. दोनों लाइव मॉडल अब उपलब्ध हैं।
प्रकटीकरण: यह लेख एआई सहायता के साथ लिखा गया था और EmpirioLabs AI द्वारा समीक्षा की गई थी।.



