Accueil Blog

Comment utiliser Gemini 3.8 Live et Pensée Étendue en Direct

Gemini 3.8 Live et Pensée Étendue via API

Sep 24, 2026

EmpirioLabs AI

Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont disponibles sur EmpirioLabs. Les deux sont des modèles de voix en temps réel: vous ouvrez un WebSocket, diffusez l’audio du microphone, et la réponse vocale est renvoyée sur la même connexion.

Gemini 3.8 Live est l’option à faible latence pour les agents vocaux et les dialogues en direct. Il accepte les images vidéo en direct en même temps que l’audio, appelle vos fonctions pendant la conversation, et répond dans la langue parlée par l’appelant.

Gémeaux 3.8 Pensée Étendue en Direct Des raisons en arrière-plan pendant qu’il parle, pour des questions qui nécessitent plus qu’une réponse rapide. Vous définissez dans quelle mesure il raisonne avec raisonnement effort.

Essayez l’un ou l’autre dans le Playground: Gemini 3.8 Live ou Pensée prolongée en direct. Choisissez une voix, cliquez sur Lancer la session et discutez.

Connexion

Chaque modèle temps réel sur la plateforme utilise un point de terminaison, sélectionné avec le modèle Requête. Authentifiez la poignée de main avec votre clé API EmpirioLabs:

wss://api.empiriolabs.ai/v1/realtime ?model=gemini-3-8-live Autorisation: Porteur YOUR_EMPIRIOLABS_API_KEY

Le protocole suit le format d’événement temps réel largement utilisé. Configurez la session avec session.update Avant d’envoyer le premier audio, ajoutez l’audio du microphone avec input_audio_buffer.append, et lut la réponse de response.audio.delta, avec sa transcription sur response.audio_transcript.delta.

{"type »: « session.update », « session »: { « voice »: « Kore «, « instructions »: « Vous êtes un assistant de voyage concis. » }}

L’audio est PCM 16 bits dans les deux directions: 16 kHz depuis votre microphone, ou 24 kHz avec input_audio_format Fixer à PCM24, et 24 kHz pour la réponse. La détection d’activité vocale est activée dès le début, donc le modèle répond lorsque l’appelant cesse de parler, et parler par-dessus une réponse l’interrompt.

Images vidéo

Les deux modèles peuvent voir ce que leur montre l’appelant. Envoyez des images depuis une caméra ou un écran sous forme d’images base64 JPEG ou PNG dans leur propre tampon, et demandez à leur sujet en même temps:

{"type »: « input_image_buffer.append », « image »: « <base64 JPEG ou PNG>"}

Appel de fonction

Déclarer des fonctions dans session.update avec les paramètres du schéma JSON. Lorsque le modèle en appelle un, vous recevez response.function_call_arguments.done avec le call_id, le nom de la fonction et ses arguments. Retournons le résultat sous la forme d’un function_call_output Item et le modèle continue de parler avec.

Raisonnement sur la pensée prolongée

{"type »: « session.update », « session »: {"reasoning_effort »: « high"}}

raisonnement effort accepte Low, Médium (le défaut) ou haut. Le modèle accuse souvent réception d’abord d’une question puis répond dans une seconde réponse, donc continuez à écouter après la première response.done.

Prix

Les deux modèles facturent chaque tour achevé à partir de l’utilisation rapportée par le modèle, avec des débits séparés pour les jetons audio et les jetons texte dans les deux directions. Les images vidéo facturent comme jetons d’entrée, et les rationnements facturent comme jetons de sortie. Pensée étendue rapporte plus de jetons d’entrée à chaque tour, donc la même conversation coûte plus cher dessus que sur Live. Les taux actuels sont sur le Gemini 3.8 Live et Pensée prolongée en direct Pages de modèles et sur le page de prix.

Des choses qui valent la peine d’être connues avant ta première séance

  • Fixez la séance avant de parler. La voix, les instructions, la détection de tour, les outils, la température et l’effort de raisonnement sont corrigés une fois la conversation commencée. Les modifier plus tard renvoie une erreur; ouvrez une nouvelle session à la place.
  • Utilisez l’une des 30 voix listées. Puck est la valeur par défaut. Toute autre valeur est refusée en cas d’erreur.
  • Il n’y a pas de réglage linguistique. Le modèle répond dans la langue que l’appelant parle.
  • Continuez à streamer brièvement après que l’appelant ait arrêté. La détection d’activité vocale nécessite un court silence pour décider que le tour est terminé, donc un client qui coupe l’audio sur le dernier mot attend une réponse.
  • Une nouvelle prise est une nouvelle conversation. Gardez votre propre relevé de notes si un client qui reconnecte a besoin du contexte précédent.

Les tables d’événements, la liste vocale et les formats audio se trouvent dans le API vocale en temps réel Docs. Pour text-to-speech de la même famille, voir Comment utiliser Gemini 3.8 Flash TTS et Flash-Lite TTS. Les deux modèles Live sont disponibles dès maintenant.

Divulgation: Cet article a été rédigé avec l'aide d'AI et examiné par EmpirioLabs AI.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.