Gemini 3.8 Live एपीआई

एक सॉकेट पर कम-विलंबता वाली आवाज वार्तालाप, 30 आवाजों, लाइव वीडियो इनपुट, टूल कॉलिंग और उत्तरों के साथ आप बोलते समय बाधित कर सकते हैं।

Googleऑडियो जनरेशन128K कॉन्टेक्स्टरिलीज 15 सित॰ 2026स्वामित्व वाला एंडपॉइंटनया

Gemini 3.8 Live के बारे में

एक सॉकेट पर कम-विलंबता वाली आवाज वार्तालाप, 30 आवाजों, लाइव वीडियो इनपुट, टूल कॉलिंग और उत्तरों के साथ आप बोलते समय बाधित कर सकते हैं।

सत्र के साथ कॉन्फ़िगर किया गया है session.update इवेंट के बजाय अनुरोध पैरामीटर पर सॉकेट पर। पाठ और ऑडियो टोकन बिल अलग-अलग दरों पर।

इस नाम से भी जाना जाता है Gemini Live, Google Gemini 3.8 Live

realtimespeech to speechaudio inaudio outvideofunction callingmultilingual

Gemini 3.8 Live की विशेषताएं

मॉडल ID
gemini-3-8-live
निर्माता
Google
श्रेणी
ऑडियो जनरेशन
रिलीज
15 सित॰ 2026
कॉन्टेक्स्ट विंडो
128K टोकन
अधिकतम आउटपुट
65,536 टोकन
इनपुट
ऑडियोटेक्स्टवीडियो
आउटपुट
ऑडियोटेक्स्ट
एंडपॉइंट
WEBSOCKET/v1/realtime
वैकल्पिक मॉडल ID
gemini-3.8-livegoogle/gemini-3.8-live

Gemini 3.8 Live API की कीमतें

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
इनपुट: ऑडियो
प्रति 1M ऑडियो इनपुट टोकन
$7.80
इनपुट
प्रति 1M प्रॉम्प्ट टोकन
$2.60
उत्पादन
प्रति 1M जेनरेट किए गए टोकन
$11.70
आउटपुट: ऑडियो
प्रति 1M जनरेट किए गए ऑडियो टोकन
$31.20
पूरे कीमत पेज पर तुलना करें

Gemini 3.8 Live API को कैसे कॉल करें

Gemini 3.8 Live HTTP एंडपॉइंट के बजाय wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live पर एक WebSocket के ज़रिए लाइव बातचीत करता है। मॉडल id gemini-3-8-live के साथ कनेक्ट करें और हैंडशेक पर अपनी EmpirioLabs API key को Authorization: Bearer हेडर के रूप में भेजें। ऑडियो दोनों दिशाओं में base64 16-bit PCM के रूप में जाता है। ब्राउज़र WebSocket पर हेडर सेट नहीं कर सकता, इसलिए यह कनेक्शन अपने सर्वर से खोलें और ऑडियो को अपने सॉकेट के ज़रिए ब्राउज़र तक पहुँचाएँ। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Gemini 3.8 Live API का पूरा संदर्भ

Gemini 3.8 Live API के पैरामीटर

EmpirioLabs पर Gemini 3.8 Live API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
voiceenumPuckZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...सत्र के लिए बोलने वाली आवाज़। बातचीत शुरू होने से पहले इसे session.update के साथ सेट करें; यह बाद में नहीं बदल सकता।
instructionsstring--मॉडल कैसे व्यवहार करता है और बोलता है, इसके लिए सिस्टम मार्गदर्शन। बातचीत शुरू होने से पहले इसे session.update के साथ सेट करें।
temperaturenumber-0 से 2नमूना तापमान 0 से 2 तक। कम मान उत्तरों को अधिक सुसंगत बनाते हैं। बातचीत शुरू होने से पहले इसे सेट करें।
input_audio_formatenumpcm16pcm16, pcm24आपके द्वारा इनपुट बफर में जोड़े गए ऑडियो की एन्कोडिंग: pcm16 16 kHz पर बेस 64 16-बिट PCM है, और pcm24 24 kHz पर समान है।
output_audio_formatenumpcm24pcm24ऑडियो की एन्कोडिंग मॉडल वापस स्ट्रीम करता है: 24 kHz पर 16-बिट पीसीएम।
turn_detectionstring{"type":"server_vad"}-सर्वर-साइड वॉयस एक्टिविटी डिटेक्शन। यह तय करता है कि आपने कब बोलना बंद कर दिया है और मॉडल को जवाब देना चाहिए। यह डिफ़ॉल्ट रूप से चालू है; प्रत्येक मोड़ को समाप्त...

जानने योग्य

कनेक्ट करना wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live पर एक वेबसॉकेट पर पूर्ण-डुप्लेक्स आवाज, साधारण प्राधिकरण वाहक हेडर के साथ प्रमाणित। पहला ऑडियो भेजने से पहले सत्र को session.update के साथ कॉन्फ़िगर करें: आवाज, निर्देश, टर्न डिटेक्शन और टूल। बातचीत शुरू होने के बाद ये सेटिंग्स ठीक हो जाती हैं। ऑडियो और वीडियो भेजना - माइक्रोफ़ोन ऑडियो को input_audio_buffer.append ईवेंट के रूप में जोड़ें: 16-बिट पीसीएम 16 किलोहर्ट्ज़ पर, या 24 किलोहर्ट्ज़ पर input_audio_format pcm24 पर सेट करें। - लाइव वीडियो फ़्रेम को input_image_buffer.append ईवेंट के रूप में, बेस 64 जेपीईजी या पीएनजी छवियों के रूप में जोड़ें। - आवाज गतिविधि का पता लगाना डिफ़ॉल्ट रूप से चालू है, इसलिए भाषण समाप्त होने के बाद लगभग एक सेकंड तक स्ट्रीमिंग जारी रखें। प्रत्येक मोड़ को input_audio_buffer.commit के साथ समाप्त करने के लिए turn_detection को शून्य पर सेट करें। आवाज़ें और भाषा - voice सूची में 30 आवाज़ों में से एक का उपयोग करें, उदाहरण के लिए पक, कोरे या चारोन। किसी भी अन्य मूल्य को अस्वीकार कर दिया जाता है। - मॉडल आपके द्वारा बोली जाने वाली भाषा में उत्तर देता है। उत्तर - भाषण response.audio.delta घटनाओं के रूप में स्ट्रीम होता है, 16 kHz पर 24-बिट PCM, शब्दों के साथ session.update 0__ घटनाओं के रूप में। आपका अपना भाषण भी लिखित है। - मॉडल के उत्तर के दौरान बोलना इसे बाधित करता है। उपकरण - JSON स्कीमा मापदंडों के साथ फ़ंक्शन कॉलिंग। प्रत्येक परिणाम को उसके session.update 2__ के साथ एक session.update 1__ आइटम के रूप में लौटाएं। बिलिंग ऑडियो और टेक्स्ट टोकन की कीमत दोनों दिशाओं में अलग-अलग होती है, वीडियो फ्रेम बिल इनपुट टोकन के रूप में, और रीजनिंग टोकन बिल आउटपुट टोकन के रूप में। प्रत्येक पूर्ण मोड़ को मॉडल रिपोर्ट के उपयोग से अपने आप बिल किया जाता है, जिसमें आपके द्वारा बाधित उत्तर भी शामिल है।

Gemini 3.8 Live API: आम सवाल

Gemini 3.8 Live API की कीमत कितनी है?

EmpirioLabs पर Gemini 3.8 Live का बिल उपयोग के अनुसार बनता है: इनपुट: ऑडियो $7.80 प्रति 1M ऑडियो इनपुट टोकन; इनपुट $2.60 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $11.70 प्रति 1M जेनरेट किए गए टोकन; आउटपुट: ऑडियो $31.20 प्रति 1M जनरेट किए गए ऑडियो टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

Gemini 3.8 Live की context window कितनी है?

Gemini 3.8 Live 128K टोकन की context window समर्थित करता है, प्रति उत्तर अधिकतम 65,536 आउटपुट टोकन के साथ।

Gemini 3.8 Live कौन सा endpoint उपयोग करता है?

Gemini 3.8 Live api.empiriolabs.ai पर WEBSOCKET /v1/realtime के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में Gemini 3.8 Live आज़मा सकता हूं?

EmpirioLabs playground खोलें और Start session दबाकर इसे अपने ब्राउज़र में आज़माएँ। Gemini 3.8 Live अनुरोध और प्रतिक्रिया के बजाय WebSocket पर चलता है, इसलिए इसे जोड़ने के लिए रियलटाइम वॉइस क्विकस्टार्ट से शुरू करें। अपनी EmpirioLabs API key और मॉडल id gemini-3-8-live के साथ अपने सर्वर से कनेक्ट करें, फिर दोनों दिशाओं में ऑडियो स्ट्रीम करें।

Gemini 3.8 Live की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।