
Sprachgespräche, die weitersprechen, während sie im Hintergrund argumentiert, mit 30 Stimmen, Live-Video, Werkzeuganrufen und anpassbarem Denken.
Sprachgespräche, die weitersprechen, während sie im Hintergrund argumentiert, mit 30 Stimmen, Live-Video, Werkzeuganrufen und anpassbarem Denken.
Die Sitzung ist mit session.update-Ereignissen über den Socket konfiguriert, anstatt mit Anfrageparametern. Text- und Audio-Tokens werden zu getrennten Sätzen abgerechnet.
Auch bekannt als Gemini Live Extended Thinking, Google Gemini 3.8 Live Extended Thinking
gemini-3-8-live-extended-thinking/v1/realtimegemini-3.8-live-extended-thinkinggoogle/gemini-3.8-live-extended-thinkingLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Gemini 3.8 Live Extended Thinking führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID gemini-3-8-live-extended-thinking und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())Request-Parameter, die die Gemini 3.8 Live Extended Thinking API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| voice | enum | Puck | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Sprechstimme für die Sitzung. Setze sie mit session.update, bevor das Gespräch beginnt; danach kann sie sich nicht mehr ändern. |
| instructions | string | - | - | Systemanleitung, wie sich das Modell verhält und spricht. Setze es mit session.update, bevor das Gespräch beginnt. |
| reasoning_effort | enum | medium | low, medium, high | Wie viel das Modell im Hintergrund argumentiert, während es spricht. Höherer Aufwand erfordert mehr Output-Tokens. Stelle es ein, bevor das Gespräch beginnt. |
| temperature | number | - | 0 bis 2 | Sampling-Temperatur von 0 bis 2. Niedrigere Werte machen die Antworten konsistenter. Stelle es ein, bevor das Gespräch beginnt. |
| input_audio_format | enum | pcm16 | pcm16, pcm24 | Codierung des Audios, das du dem Eingangspuffer anhängst: pcm16 ist base64 16-Bit-PCM bei 16 kHz, und pcm24 ist dasselbe mit 24 kHz. |
| output_audio_format | enum | pcm24 | pcm24 | Codierung des Audios, das das Modell zurückstreamt: 16-Bit-PCM bei 24 kHz. |
| turn_detection | string | {"type":"server_vad"} | - | Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell sollte antworten. Sie ist standardmäßig aktiviert; stelle... |
Verbinden Vollduplex-Stimme über einen WebSocket auf wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking, authentifiziert mit dem üblichen Authorization Bearer-Header. Konfigurieren Sie die Sitzung mit session.update vor dem Senden des ersten Audios: Sprache, Anweisungen, Zugerkennung und Tools. Diese Einstellungen werden nach Beginn des Gesprächs behoben. Audio und Video senden - Mikrofonaudio als input_audio_buffer.append Ereignisse anhängen: 16-Bit-PCM bei 16 kHz oder bei 24 kHz mit input_audio_format auf pcm24 eingestellt. - Live-Videoframes als input_image_buffer.append Ereignisse, als Base64 JPEG- oder PNG-Bilder anhängen. - Spracherkennung ist standardmäßig aktiviert, also streamen Sie etwa eine Sekunde nach Ende der Sprache weiter. Stellen Sie turn_detection auf null, um jeden Zug selbst mit input_audio_buffer.commit zu beenden. Stimmen und Sprache – Verwenden Sie eine der 30 Stimmen in der voice Liste, zum Beispiel Puck, Kore oder Charon. Alle anderen Werte werden abgelehnt. - Das Modell antwortet in der von Ihnen gesprochenen Sprache. Antwortet - Sprachströme werden als response.audio.delta Ereignisse abgegeben, 16-Bit-PCM bei 24 kHz, mit den Wörtern als session.update 0__ Ereignisse. Ihre eigene Sprache wird ebenfalls transkribiert. - Sprechen, während das Modell antwortet, unterbricht sie. Reasoning session.update 1__ legt fest, wie viel das Modell im Hintergrund während des Sprechens argumentiert: niedrig, mittel (der Standard) oder hoch. Stellen Sie dies ein, bevor das Gespräch beginnt. - Das Modell erkennt oft zuerst eine Frage an und beantwortet in einer zweiten Runde. Jede Runde wird einzeln abgerechnet. Tools – Funktionsaufruf mit JSON-Schema-Parametern. Geben Sie jedes Ergebnis als session.update 2__ Element mit seinem session.update 3__ zurück. Billing Audio- und Texttoken werden in beide Richtungen separat bepreist, Videoframes als Eingabetoken und Reasoning-Token als Ausgabetoken. Jeder abgeschlossene Zug wird eigenständig aus der vom Modell gemeldeten Nutzung abgerechnet, einschließlich einer Antwort, die Sie unterbrechen.
Auf EmpirioLabs wird Gemini 3.8 Live Extended Thinking nach Verbrauch abgerechnet: Eingang: Audio $7.80 pro 1M Audio-Eingangstoken; Eingabe $2.60 pro 1M Prompt-Token; Output $11.70 pro 1 Million generierter Token; Ausgabe: Audio $31.20 pro 1M generierten Audio-Tokens. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Gemini 3.8 Live Extended Thinking unterstützt ein Kontextfenster von 128K Token mit bis zu 65.536 Ausgabe-Token pro Antwort.
Gemini 3.8 Live Extended Thinking wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Gemini 3.8 Live Extended Thinking läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID gemini-3-8-live-extended-thinking und streamen Sie dann Audio in beide Richtungen.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.