Zuhause Blog

Wie man Gemini 3.8 Live und Live erweitertes Denken verwendet

Gemini 3.8 Live und Live Erweitertes Denken über API

Sep 24, 2026

EmpirioLabs AI

Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking sind auf EmpirioLabs verfügbar. Beide sind Echtzeit-Sprachmodelle: Man öffnet einen WebSocket, streamt den Mikrofonton, und die gesprochene Antwort wird über dieselbe Verbindung zurückgestreamt.

Gemini 3.8 Live ist die latenzarme Option für Sprachagenten und Live-Dialoge. Es akzeptiert Live-Videoframes neben dem Audio, ruft während des Gesprächs deine Funktionen auf und antwortet in der Sprache, die der Anrufer spricht.

Gemini 3.8 Live-Erweitertes Denken Argumente im Hintergrund, während es spricht, für Fragen, die mehr als eine schnelle Antwort brauchen. Du legst fest, wie viel es mit Argumentation macht reasoning effort.

Probieren Sie eines der Playground: Gemini 3.8 Live oder Live-Erweitertes Denken. Wähle eine Stimme, klicke auf Sitzung starten und sprechen.

Anschluss

Jedes Echtzeitmodell auf der Plattform verwendet einen Endpunkt, der mit dem modell Abfrageparameter. Authentifizieren Sie den Handshake mit Ihrem EmpirioLabs API-Schlüssel:

wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live Autorisierung: Inhaber YOUR_EMPIRIOLABS_API_KEY

Das Protokoll folgt dem weit verbreiteten Echtzeit-Ereignisformat. Konfigurieren Sie die Sitzung mit session.update Bevor Sie das erste Audio senden, fügen Sie Mikrofonaudio mit input_audio_buffer.append, und lies die Antwort von response.audio.delta, mit dem Transkript auf response.audio_transcript.delta.

{"type": "session.update", "session": { "voice": "Kore", "instructions": "Du bist ein prägnanter Reiseassistent." }}

Der Ton ist in beide Richtungen 16-Bit-PCM: 16 kHz vom Mikrofon oder 24 kHz mit input_audio_format Setzen Sie auf pcm24, und 24 kHz für die Antwort. Die Sprachaktivitätserkennung ist von Anfang an aktiviert, sodass das Modell antwortet, wenn der Anrufer aufhört zu sprechen, und das Sprechen über eine Antwort unterbricht.

Videoframes

Beide Modelle können sehen, was der Anrufer ihnen zeigt. Senden Sie Bilder von einer Kamera oder einem Bildschirm als base64 JPEG- oder PNG-Bilder in ihrem eigenen Puffer und fragen Sie im selben Zug danach nach:

{"type": "input_image_buffer.append", "image": "<base64 JPEG oder PNG>"}

Funktionsaufruf

Deklarieren Sie Funktionen in session.update mit JSON-Schema-Parametern. Wenn das Modell einen aufruft, erhalten Sie response.function_call_arguments.done mit dem call_id, den Funktionsnamen und seine Argumente. Geben Sie das Ergebnis als ein function_call_output Item und das Modell spricht weiter mit ihm.

Argumentation über erweitertes Denken

{"type": "session.update", "session": {"reasoning_effort": "high"}}

reasoning effort Nimmt an Niedrig, Medium (der Standard) oder hoch. Das Modell erkennt oft zuerst eine Frage an und beantwortet dann in einer zweiten Antwort, also höre nach der ersten weiter zu antwort.fertig.

Preisgestaltung

Beide Modelle rechnen jede abgeschlossene Runde nach der Nutzung ab, die das Modell angibt, mit separaten Sätzen für Audio- und Texttoken in beide Richtungen. Videoframes rechnen als Eingabetokens ab, und Reasoning als Output-Tokens. Extended Thinking berichtet bei jeder Runde mehr Eingabetoken, sodass dieselbe Konversation mehr kostet als Live. Aktuelle Raten sind auf dem Gemini 3.8 Live und Live-Erweitertes Denken Modellseiten und auf den preisseite.

Dinge, die es wert sind, vor der ersten Sitzung zu wissen

  • Legen Sie die Sitzung fest, bevor Sie sprechen. Stimme, Anweisungen, Zugerkennung, Werkzeuge, Temperatur und Schlussarbeit werden behoben, sobald das Gespräch beginnt. Spätere Änderung ergibt einen Fehler; eröffne stattdessen eine neue Sitzung.
  • Verwenden Sie eine der 30 aufgeführten Stimmen. Puck ist der Standard. Jeder andere Wert wird mit einem Fehler abgelehnt.
  • Es gibt keine Spracheinstellung. Das Modell antwortet in der Sprache, die der Anrufer spricht.
  • Streame kurz, nachdem der Anrufer aufgehört hat. Die Sprachaktivitätserkennung benötigt eine kurze Stille, um zu entscheiden, dass der Zug vorbei ist, sodass ein Client, der den Ton beim letzten Wort abschaltet, auf eine Antwort wartet.
  • Eine neue Fassung ist ein neues Gespräch. Bewahre dein eigenes Transkript auf, wenn ein wiederhergestellter Klient den früheren Kontext braucht.

Ereignistabellen, die Sprachliste und die Audioformate sind in den Echtzeit-Sprach-API Docs. Für text-to-speech aus derselben Familie siehe Wie man Gemini 3.8 Flash TTS und Flash-Lite TTS verwendet. Beide Live-Modelle sind jetzt erhältlich.

Offenlegung: Dieser Artikel wurde mit KI-Unterstützung geschrieben und von EmpirioLabs AI überprüft.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.