Gemini 3.8 Live Extended Thinking API

Une conversation vocale qui continue de parler tout en raisonnant en arrière-plan, avec 30 voix, une entrée vidéo en direct, des appels d’outils et un effort de raisonnement ajustable.

GoogleProduction audio128K contextePublié 15 sept. 2026Endpoint propriétaireNouveau

À propos de Gemini 3.8 Live Extended Thinking

Une conversation vocale qui continue de parler tout en raisonnant en arrière-plan, avec 30 voix, une entrée vidéo en direct, des appels d’outils et un effort de raisonnement ajustable.

La session est configurée avec les événements session.update via le socket plutôt que les paramètres de requête. Les jetons texte et audio facturent à des débits séparés.

Aussi connu sous le nom Gemini Live Extended Thinking, Google Gemini 3.8 Live Extended Thinking

realtimespeech to speechaudio inaudio outvideofunction callingreasoningmultilingual

Caractéristiques de Gemini 3.8 Live Extended Thinking

ID du modèle
gemini-3-8-live-extended-thinking
Auteur
Google
Catégorie
Production audio
Publié
15 sept. 2026
Fenêtre de contexte
128K tokens
Sortie max
65 536 tokens
Entrée
AudioTexteVidéo
Sortie
AudioTexte
Endpoints
WEBSOCKET/v1/realtime
Identifiants de modèle alternatifs
gemini-3.8-live-extended-thinkinggoogle/gemini-3.8-live-extended-thinking

Tarifs de l'API Gemini 3.8 Live Extended Thinking

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Entrée: audio
par 1M de jetons d’entrée audio
$7.80
Entrée
par 1M de jetons d’invite
$2.60
Produit
par 1M de jetons générés
$11.70
Sortie: audio
par 1M de jetons audio générés
$31.20
Comparer sur la page complète des tarifs

Comment appeler l'API Gemini 3.8 Live Extended Thinking

Gemini 3.8 Live Extended Thinking tient une conversation en direct via un WebSocket sur wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking, et non via les endpoints HTTP. Connectez-vous avec l'id de modèle gemini-3-8-live-extended-thinking et envoyez votre clé API EmpirioLabs dans un en-tête Authorization: Bearer lors du handshake. L'audio circule dans les deux sens en PCM 16 bits encodé en base64. Un navigateur ne peut pas définir d'en-têtes sur un WebSocket : ouvrez donc cette connexion depuis votre serveur et relayez l'audio vers le navigateur via votre propre socket. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Référence complète de l'API Gemini 3.8 Live Extended Thinking

Paramètres de l'API Gemini 3.8 Live Extended Thinking

Paramètres de requête pris en charge par l'API Gemini 3.8 Live Extended Thinking sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
voiceenumPuckZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Voix parlée pour la session. Configurez-le avec session.update avant que la conversation ne commence; cela ne peut pas changer après.
instructionsstring--Conseils système sur le comportement et la communication du modèle. Configurez-le avec session.update avant que la conversation ne commence.
reasoning_effortenummediumlow, medium, highCombien le modèle raisonne en arrière-plan pendant qu’il parle. Un effort plus élevé utilise plus de jetons de sortie. Définissez-le avant que la conversation ne...
temperaturenumber-0 à 2Température d’échantillonnage de 0 à 2. Des valeurs plus basses rendent les réponses plus cohérentes. Définissez-la avant que la conversation ne commence.
input_audio_formatenumpcm16pcm16, pcm24Encodage de l’audio que vous ajoutez au tampon d’entrée: pcm16 est un PCM base64 16 bits à 16 kHz, et pcm24 est le même à 24 kHz.
output_audio_formatenumpcm24pcm24Encodage de l’audio que le modèle diffuse en retour: PCM 16 bits à 24 kHz.
turn_detectionstring{"type":"server_vad"}-Détection d’activité vocale côté serveur. Détermine quand vous avez arrêté de parler et le modèle doit répondre. C’est activé par défaut; réglez-le sur nul pour...

Bon à savoir

Connexion Voix full-duplex via un WebSocket à wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking, authentifié avec l’en-tête Authorization Bearer classique. Configurez la session avec session.update avant d’envoyer le premier audio: voix, instructions, détection de virage et outils. Ces réglages sont corrigés une fois la conversation commencée. Envoi audio et vidéo - Ajoutez l’audio du microphone en tant qu’événements input_audio_buffer.append: PCM 16 bits à 16 kHz, ou à 24 kHz avec input_audio_format réglé sur pcm24. - Ajoutez des images vidéo en direct comme événements input_image_buffer.append, sous forme d’images base64 JPEG ou PNG. - La détection de l’activité vocale est activée par défaut, donc continuez à diffuser environ une seconde après la fin de la voix. Réglez turn_detection sur nul pour terminer chaque tour vous-même avec input_audio_buffer.commit. Voix et langue - Utilisez l’une des 30 voix de la liste voice, par exemple Puck, Kore ou Charon. Toute autre valeur est refusée. - Le modèle répond dans la langue que vous parlez. Répons - Flux de voix en tant qu’événements response.audio.delta, PCM 16 bits à 24 kHz, avec les mots comme événements session.update 0__. Votre propre voix est également transcrite. - Parler pendant que le modèle répond l’interrompt. Raisonnement session.update 1__ définit combien le modèle raisonne en arrière-plan pendant qu’il parle: faible, moyen (par défaut) ou élevé. Définissez avant le début de la conversation. - Le modèle accuse souvent réception d’une question en premier et répond dans un second tour. Chaque tour est facturé de manière autonome. Outils - Appel de fonction avec les paramètres du schéma JSON. Retournez chaque résultat comme un session.update 2__ élément avec son session.update 3__. Facturation Les jetons audio et texte sont tarifés séparément dans les deux sens, les images vidéo sont facturées comme jetons d’entrée, et les jetons de raisonnement comme jetons de sortie. Chaque tour complété est facturé seul à partir de l’utilisation rapportée par le modèle, y compris une réponse que vous interrompez.

API Gemini 3.8 Live Extended Thinking : questions fréquentes

Combien coûte l'API Gemini 3.8 Live Extended Thinking ?

Sur EmpirioLabs, Gemini 3.8 Live Extended Thinking est facturé à l'usage : Entrée: audio $7.80 par 1M de jetons d’entrée audio; Entrée $2.60 par 1M de jetons d’invite; Produit $11.70 par 1M de jetons générés; Sortie: audio $31.20 par 1M de jetons audio générés. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quelle est la fenêtre de contexte de Gemini 3.8 Live Extended Thinking ?

Gemini 3.8 Live Extended Thinking prend en charge une fenêtre de contexte de 128K tokens avec jusqu'à 65 536 tokens de sortie par réponse.

Quel endpoint Gemini 3.8 Live Extended Thinking utilise-t-il ?

Gemini 3.8 Live Extended Thinking est servi via WEBSOCKET /v1/realtime sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer Gemini 3.8 Live Extended Thinking dans le navigateur avant d'intégrer ?

Ouvrez le playground EmpirioLabs et appuyez sur Start session pour l'essayer dans votre navigateur. Gemini 3.8 Live Extended Thinking fonctionne sur un WebSocket plutôt qu'en requête et réponse, donc pour l'intégrer commencez par le guide de démarrage voix en temps réel. Connectez-vous depuis votre serveur avec votre clé API EmpirioLabs et l'id de modèle gemini-3-8-live-extended-thinking, puis diffusez l'audio dans les deux sens.

Comment obtenir une clé API Gemini 3.8 Live Extended Thinking ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.