
आवाज वार्तालाप जो पृष्ठभूमि में कारण बताते रहते हुए 30 आवाजों, लाइव वीडियो इनपुट, टूल कॉलिंग और समायोज्य तर्क प्रयास के साथ बात करती रहती है।
आवाज वार्तालाप जो पृष्ठभूमि में कारण बताते रहते हुए 30 आवाजों, लाइव वीडियो इनपुट, टूल कॉलिंग और समायोज्य तर्क प्रयास के साथ बात करती रहती है।
सत्र के साथ कॉन्फ़िगर किया गया है session.update इवेंट के बजाय अनुरोध पैरामीटर पर सॉकेट पर। पाठ और ऑडियो टोकन बिल अलग-अलग दरों पर।
इस नाम से भी जाना जाता है Gemini Live Extended Thinking, Google Gemini 3.8 Live Extended Thinking
gemini-3-8-live-extended-thinking/v1/realtimegemini-3.8-live-extended-thinkinggoogle/gemini-3.8-live-extended-thinkingEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Gemini 3.8 Live Extended Thinking HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking पर एक WebSocket के ज़रिए लाइव बातचीत करता है। मॉडल id gemini-3-8-live-extended-thinking के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। ऑडियो दोनों दिशाओं में base64 16-bit PCM के रूप में जाता है। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())EmpirioLabs पर Gemini 3.8 Live Extended Thinking API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| voice | enum | Puck | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | सत्र के लिए बोलने वाली आवाज़। बातचीत शुरू होने से पहले इसे session.update के साथ सेट करें; यह बाद में नहीं बदल सकता। |
| instructions | string | - | - | मॉडल कैसे व्यवहार करता है और बोलता है, इसके लिए सिस्टम मार्गदर्शन। बातचीत शुरू होने से पहले इसे session.update के साथ सेट करें। |
| reasoning_effort | enum | medium | low, medium, high | बात करते समय मॉडल पृष्ठभूमि में कितना कारण बताता है। उच्च प्रयास अधिक आउटपुट टोकन का उपयोग करता है। बातचीत शुरू होने से पहले इसे सेट करें। |
| temperature | number | - | 0 से 2 | नमूना तापमान 0 से 2 तक। कम मान उत्तरों को अधिक सुसंगत बनाते हैं। बातचीत शुरू होने से पहले इसे सेट करें। |
| input_audio_format | enum | pcm16 | pcm16, pcm24 | आपके द्वारा इनपुट बफर में जोड़े गए ऑडियो की एन्कोडिंग: pcm16 16 kHz पर बेस 64 16-बिट PCM है, और pcm24 24 kHz पर समान है। |
| output_audio_format | enum | pcm24 | pcm24 | ऑडियो की एन्कोडिंग मॉडल वापस स्ट्रीम करता है: 24 kHz पर 16-बिट पीसीएम। |
| turn_detection | string | {"type":"server_vad"} | - | सर्वर-साइड वॉयस एक्टिविटी डिटेक्शन। यह तय करता है कि आपने कब बोलना बंद कर दिया है और मॉडल को जवाब देना चाहिए। यह डिफ़ॉल्ट रूप से चालू है; प्रत्येक मोड़ को समाप्त... |
कनेक्ट करना wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking पर एक वेबसॉकेट पर पूर्ण-डुप्लेक्स आवाज, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। पहला ऑडियो भेजने से पहले सत्र को session.update के साथ कॉन्फ़िगर करें: आवाज, निर्देश, टर्न डिटेक्शन और टूल। बातचीत शुरू होने के बाद ये सेटिंग्स ठीक हो जाती हैं। ऑडियो और वीडियो भेजना - माइक्रोफ़ोन ऑडियो को input_audio_buffer.append ईवेंट के रूप में जोड़ें: 16-बिट पीसीएम 16 किलोहर्ट्ज़ पर, या 24 किलोहर्ट्ज़ पर input_audio_format pcm24 पर सेट करें। - लाइव वीडियो फ़्रेम को input_image_buffer.append ईवेंट के रूप में, बेस 64 जेपीईजी या पीएनजी छवियों के रूप में जोड़ें। - आवाज गतिविधि का पता लगाना डिफ़ॉल्ट रूप से चालू है, इसलिए भाषण समाप्त होने के बाद लगभग एक सेकंड तक स्ट्रीमिंग जारी रखें। प्रत्येक मोड़ को input_audio_buffer.commit के साथ समाप्त करने के लिए turn_detection को शून्य पर सेट करें। आवाज़ें और भाषा - voice सूची में 30 आवाज़ों में से एक का उपयोग करें, उदाहरण के लिए पक, कोरे या चारोन। किसी अन्य मूल्य को अस्वीकार कर दिया जाता है। - मॉडल आपके द्वारा बोली जाने वाली भाषा में उत्तर देता है। उत्तर देता है - भाषण response.audio.delta घटनाओं के रूप में स्ट्रीम होता है, 16-बिट पीसीएम 24 kHz पर, शब्दों के साथ session.update 0__ घटनाओं के रूप में। आपका अपना भाषण भी लिखित है। - मॉडल के उत्तर के दौरान बोलना इसे बाधित करता है। तर्क session.update 1__ यह निर्धारित करता है कि बात करते समय मॉडल पृष्ठभूमि में कितना कारण बताता है: निम्न, मध्यम (डिफ़ॉल्ट) या उच्च। बातचीत शुरू होने से पहले इसे सेट करें। - मॉडल अक्सर पहले एक प्रश्न को स्वीकार करता है और दूसरे मोड़ में उत्तर देता है। प्रत्येक मोड़ को अपने आप बिल किया जाता है। उपकरण - JSON स्कीमा मापदंडों के साथ फ़ंक्शन कॉलिंग। प्रत्येक परिणाम को उसके session.update 3__ के साथ एक session.update 2__ आइटम के रूप में लौटाएं। बिलिंग ऑडियो और टेक्स्ट टोकन की कीमत दोनों दिशाओं में अलग-अलग होती है, वीडियो फ्रेम बिल इनपुट टोकन के रूप में और रीजनिंग टोकन बिल आउटपुट टोकन के रूप में होती है। प्रत्येक पूर्ण मोड़ को मॉडल द्वारा रिपोर्ट किए गए उपयोग से अपने आप बिल किया जाता है, जिसमें आपके द्वारा बाधित उत्तर भी शामिल होता है।
EmpirioLabs पर Gemini 3.8 Live Extended Thinking का बिल उपयोग के अनुसार बनता है: इनपुट: ऑडियो $7.80 प्रति 1M ऑडियो इनपुट टोकन; इनपुट $2.60 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $11.70 प्रति 1M जेनरेट किए गए टोकन; आउटपुट: ऑडियो $31.20 प्रति 1M जनरेट किए गए ऑडियो टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Gemini 3.8 Live Extended Thinking 128K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 65,536 आउटपुट टोकन के साथ।
Gemini 3.8 Live Extended Thinking api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। Gemini 3.8 Live Extended Thinking अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id gemini-3-8-live-extended-thinking के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।