Gemini 3.8 Live Extended Thinking API

Sprachgespräche, die weitersprechen, während sie im Hintergrund argumentiert, mit 30 Stimmen, Live-Video, Werkzeuganrufen und anpassbarem Denken.

GoogleAudiogeneration128K KontextVeröffentlicht 15. Sept. 2026Proprietärer EndpointNeu

Über Gemini 3.8 Live Extended Thinking

Sprachgespräche, die weitersprechen, während sie im Hintergrund argumentiert, mit 30 Stimmen, Live-Video, Werkzeuganrufen und anpassbarem Denken.

Die Sitzung ist mit session.update-Ereignissen über den Socket konfiguriert, anstatt mit Anfrageparametern. Text- und Audio-Tokens werden zu getrennten Sätzen abgerechnet.

Auch bekannt als Gemini Live Extended Thinking, Google Gemini 3.8 Live Extended Thinking

realtimespeech to speechaudio inaudio outvideofunction callingreasoningmultilingual

Gemini 3.8 Live Extended Thinking Spezifikationen

Modell-ID
gemini-3-8-live-extended-thinking
Autor
Google
Kategorie
Audiogeneration
Veröffentlicht
15. Sept. 2026
Kontextfenster
128K Token
Max. Ausgabe
65.536 Token
Eingabe
AudioTextVideo
Ausgabe
AudioText
Endpoints
WEBSOCKET/v1/realtime
Alternative Modell-IDs
gemini-3.8-live-extended-thinkinggoogle/gemini-3.8-live-extended-thinking

Gemini 3.8 Live Extended Thinking API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingang: Audio
pro 1M Audio-Eingangstoken
$7.80
Eingabe
pro 1M Prompt-Token
$2.60
Ausgabe
pro 1 Million generierter Token
$11.70
Ausgabe: Audio
pro 1M generierten Audio-Tokens
$31.20
Auf der vollständigen Preisseite vergleichen

So rufst du die Gemini 3.8 Live Extended Thinking API auf

Gemini 3.8 Live Extended Thinking führt ein Live-Gespräch über einen WebSocket unter wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking, nicht über die HTTP-Endpunkte. Verbinden Sie sich mit der Modell-ID gemini-3-8-live-extended-thinking und senden Sie Ihren EmpirioLabs-API-Schlüssel beim Handshake als Authorization: Bearer-Header. Audio läuft in beide Richtungen als base64-kodiertes 16-Bit-PCM. Ein Browser kann bei einem WebSocket keine Header setzen. Öffnen Sie diese Verbindung daher von Ihrem Server aus und leiten Sie das Audio über Ihren eigenen Socket an den Browser weiter. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Vollständige Gemini 3.8 Live Extended Thinking API-Referenz

Gemini 3.8 Live Extended Thinking API-Parameter

Request-Parameter, die die Gemini 3.8 Live Extended Thinking API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
voiceenumPuckZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Sprechstimme für die Sitzung. Setze sie mit session.update, bevor das Gespräch beginnt; danach kann sie sich nicht mehr ändern.
instructionsstring--Systemanleitung, wie sich das Modell verhält und spricht. Setze es mit session.update, bevor das Gespräch beginnt.
reasoning_effortenummediumlow, medium, highWie viel das Modell im Hintergrund argumentiert, während es spricht. Höherer Aufwand erfordert mehr Output-Tokens. Stelle es ein, bevor das Gespräch beginnt.
temperaturenumber-0 bis 2Sampling-Temperatur von 0 bis 2. Niedrigere Werte machen die Antworten konsistenter. Stelle es ein, bevor das Gespräch beginnt.
input_audio_formatenumpcm16pcm16, pcm24Codierung des Audios, das du dem Eingangspuffer anhängst: pcm16 ist base64 16-Bit-PCM bei 16 kHz, und pcm24 ist dasselbe mit 24 kHz.
output_audio_formatenumpcm24pcm24Codierung des Audios, das das Modell zurückstreamt: 16-Bit-PCM bei 24 kHz.
turn_detectionstring{"type":"server_vad"}-Serverseitige Sprachaktivitätserkennung. Entscheidet, wann du aufgehört hast zu sprechen, und das Modell sollte antworten. Sie ist standardmäßig aktiviert; stelle...

Gut zu wissen

Verbinden Vollduplex-Stimme über einen WebSocket auf wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking, authentifiziert mit dem üblichen Authorization Bearer-Header. Konfigurieren Sie die Sitzung mit session.update vor dem Senden des ersten Audios: Sprache, Anweisungen, Zugerkennung und Tools. Diese Einstellungen werden nach Beginn des Gesprächs behoben. Audio und Video senden - Mikrofonaudio als input_audio_buffer.append Ereignisse anhängen: 16-Bit-PCM bei 16 kHz oder bei 24 kHz mit input_audio_format auf pcm24 eingestellt. - Live-Videoframes als input_image_buffer.append Ereignisse, als Base64 JPEG- oder PNG-Bilder anhängen. - Spracherkennung ist standardmäßig aktiviert, also streamen Sie etwa eine Sekunde nach Ende der Sprache weiter. Stellen Sie turn_detection auf null, um jeden Zug selbst mit input_audio_buffer.commit zu beenden. Stimmen und Sprache – Verwenden Sie eine der 30 Stimmen in der voice Liste, zum Beispiel Puck, Kore oder Charon. Alle anderen Werte werden abgelehnt. - Das Modell antwortet in der von Ihnen gesprochenen Sprache. Antwortet - Sprachströme werden als response.audio.delta Ereignisse abgegeben, 16-Bit-PCM bei 24 kHz, mit den Wörtern als session.update 0__ Ereignisse. Ihre eigene Sprache wird ebenfalls transkribiert. - Sprechen, während das Modell antwortet, unterbricht sie. Reasoning session.update 1__ legt fest, wie viel das Modell im Hintergrund während des Sprechens argumentiert: niedrig, mittel (der Standard) oder hoch. Stellen Sie dies ein, bevor das Gespräch beginnt. - Das Modell erkennt oft zuerst eine Frage an und beantwortet in einer zweiten Runde. Jede Runde wird einzeln abgerechnet. Tools – Funktionsaufruf mit JSON-Schema-Parametern. Geben Sie jedes Ergebnis als session.update 2__ Element mit seinem session.update 3__ zurück. Billing Audio- und Texttoken werden in beide Richtungen separat bepreist, Videoframes als Eingabetoken und Reasoning-Token als Ausgabetoken. Jeder abgeschlossene Zug wird eigenständig aus der vom Modell gemeldeten Nutzung abgerechnet, einschließlich einer Antwort, die Sie unterbrechen.

Gemini 3.8 Live Extended Thinking API: häufige Fragen

Wie viel kostet die Gemini 3.8 Live Extended Thinking API?

Auf EmpirioLabs wird Gemini 3.8 Live Extended Thinking nach Verbrauch abgerechnet: Eingang: Audio $7.80 pro 1M Audio-Eingangstoken; Eingabe $2.60 pro 1M Prompt-Token; Output $11.70 pro 1 Million generierter Token; Ausgabe: Audio $31.20 pro 1M generierten Audio-Tokens. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von Gemini 3.8 Live Extended Thinking?

Gemini 3.8 Live Extended Thinking unterstützt ein Kontextfenster von 128K Token mit bis zu 65.536 Ausgabe-Token pro Antwort.

Welchen Endpoint verwendet Gemini 3.8 Live Extended Thinking?

Gemini 3.8 Live Extended Thinking wird über WEBSOCKET /v1/realtime auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich Gemini 3.8 Live Extended Thinking im Browser testen, bevor ich integriere?

Öffnen Sie das EmpirioLabs Playground und klicken Sie auf Start session, um es im Browser zu testen. Gemini 3.8 Live Extended Thinking läuft über einen WebSocket statt über Anfrage und Antwort, beginnen Sie für die Integration deshalb mit dem Schnellstart für Echtzeit-Sprache. Verbinden Sie sich von Ihrem Server aus mit Ihrem EmpirioLabs-API-Schlüssel und der Modell-ID gemini-3-8-live-extended-thinking und streamen Sie dann Audio in beide Richtungen.

Wie bekomme ich einen Gemini 3.8 Live Extended Thinking API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.