
एक सॉकेट पर कम-विलंबता वाली आवाज वार्तालाप, 30 आवाजों, लाइव वीडियो इनपुट, टूल कॉलिंग और उत्तरों के साथ आप बोलते समय बाधित कर सकते हैं।
एक सॉकेट पर कम-विलंबता वाली आवाज वार्तालाप, 30 आवाजों, लाइव वीडियो इनपुट, टूल कॉलिंग और उत्तरों के साथ आप बोलते समय बाधित कर सकते हैं।
सत्र के साथ कॉन्फ़िगर किया गया है session.update इवेंट के बजाय अनुरोध पैरामीटर पर सॉकेट पर। पाठ और ऑडियो टोकन बिल अलग-अलग दरों पर।
इस नाम से भी जाना जाता है Gemini Live, Google Gemini 3.8 Live
gemini-3-8-live/v1/realtimegemini-3.8-livegoogle/gemini-3.8-liveEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Gemini 3.8 Live HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live पर एक WebSocket के ज़रिए लाइव बातचीत करता है। मॉडल id gemini-3-8-live के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। ऑडियो दोनों दिशाओं में base64 16-bit PCM के रूप में जाता है। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())EmpirioLabs पर Gemini 3.8 Live API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| voice | enum | Puck | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | सत्र के लिए बोलने वाली आवाज़। बातचीत शुरू होने से पहले इसे session.update के साथ सेट करें; यह बाद में नहीं बदल सकता। |
| instructions | string | - | - | मॉडल कैसे व्यवहार करता है और बोलता है, इसके लिए सिस्टम मार्गदर्शन। बातचीत शुरू होने से पहले इसे session.update के साथ सेट करें। |
| temperature | number | - | 0 से 2 | नमूना तापमान 0 से 2 तक। कम मान उत्तरों को अधिक सुसंगत बनाते हैं। बातचीत शुरू होने से पहले इसे सेट करें। |
| input_audio_format | enum | pcm16 | pcm16, pcm24 | आपके द्वारा इनपुट बफर में जोड़े गए ऑडियो की एन्कोडिंग: pcm16 16 kHz पर बेस 64 16-बिट PCM है, और pcm24 24 kHz पर समान है। |
| output_audio_format | enum | pcm24 | pcm24 | ऑडियो की एन्कोडिंग मॉडल वापस स्ट्रीम करता है: 24 kHz पर 16-बिट पीसीएम। |
| turn_detection | string | {"type":"server_vad"} | - | सर्वर-साइड वॉयस एक्टिविटी डिटेक्शन। यह तय करता है कि आपने कब बोलना बंद कर दिया है और मॉडल को जवाब देना चाहिए। यह डिफ़ॉल्ट रूप से चालू है; प्रत्येक मोड़ को समाप्त... |
कनेक्ट करना wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live पर एक वेबसॉकेट पर पूर्ण-डुप्लेक्स आवाज, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। पहला ऑडियो भेजने से पहले सत्र को session.update के साथ कॉन्फ़िगर करें: आवाज, निर्देश, टर्न डिटेक्शन और टूल। बातचीत शुरू होने के बाद ये सेटिंग्स ठीक हो जाती हैं। ऑडियो और वीडियो भेजना - माइक्रोफ़ोन ऑडियो को input_audio_buffer.append ईवेंट के रूप में जोड़ें: 16-बिट पीसीएम 16 किलोहर्ट्ज़ पर, या 24 किलोहर्ट्ज़ पर input_audio_format pcm24 पर सेट करें। - लाइव वीडियो फ़्रेम को input_image_buffer.append ईवेंट के रूप में, बेस 64 जेपीईजी या पीएनजी छवियों के रूप में जोड़ें। - आवाज गतिविधि का पता लगाना डिफ़ॉल्ट रूप से चालू है, इसलिए भाषण समाप्त होने के बाद लगभग एक सेकंड तक स्ट्रीमिंग जारी रखें। प्रत्येक मोड़ को input_audio_buffer.commit के साथ समाप्त करने के लिए turn_detection को शून्य पर सेट करें। आवाज़ें और भाषा - voice सूची में 30 आवाज़ों में से एक का उपयोग करें, उदाहरण के लिए पक, कोरे या चारोन। किसी भी अन्य मूल्य को अस्वीकार कर दिया जाता है। - मॉडल आपके द्वारा बोली जाने वाली भाषा में उत्तर देता है। उत्तर - भाषण response.audio.delta घटनाओं के रूप में स्ट्रीम होता है, 16 kHz पर 24-बिट PCM, शब्दों के साथ session.update 0__ घटनाओं के रूप में। आपका अपना भाषण भी लिखित है। - मॉडल के उत्तर के दौरान बोलना इसे बाधित करता है। उपकरण - JSON स्कीमा मापदंडों के साथ फ़ंक्शन कॉलिंग। प्रत्येक परिणाम को उसके session.update 2__ के साथ एक session.update 1__ आइटम के रूप में लौटाएं। बिलिंग ऑडियो और टेक्स्ट टोकन की कीमत दोनों दिशाओं में अलग-अलग होती है, वीडियो फ्रेम बिल इनपुट टोकन के रूप में, और रीजनिंग टोकन बिल आउटपुट टोकन के रूप में। प्रत्येक पूर्ण मोड़ को मॉडल रिपोर्ट के उपयोग से अपने आप बिल किया जाता है, जिसमें आपके द्वारा बाधित उत्तर भी शामिल है।
EmpirioLabs पर Gemini 3.8 Live का बिल उपयोग के अनुसार बनता है: इनपुट: ऑडियो $7.80 प्रति 1M ऑडियो इनपुट टोकन; इनपुट $2.60 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $11.70 प्रति 1M जेनरेट किए गए टोकन; आउटपुट: ऑडियो $31.20 प्रति 1M जनरेट किए गए ऑडियो टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Gemini 3.8 Live 128K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 65,536 आउटपुट टोकन के साथ।
Gemini 3.8 Live api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। Gemini 3.8 Live अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id gemini-3-8-live के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।