Inicio Blog

Cómo usar Gemini 3.8 Live y Live Extended Thinking

Gemini 3.8 Live y Live Extended Thinking vía API

Sep 24, 2026

EmpirioLabs AI

Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking están disponibles en EmpirioLabs. Ambos son modelos de voz en tiempo real: abres un WebSocket, transmites el audio del micrófono y la respuesta hablada se transmite de nuevo en la misma conexión.

Gemini 3.8 Live es la opción de baja latencia para agentes de voz y diálogos en directo. Acepta fotogramas de vídeo en directo junto con el audio, llama a tus funciones durante la conversación y responde en el idioma que habla el llamante.

Géminis 3.8 Pensamiento Extendido en Vivo Razones en segundo plano mientras habla, para preguntas que necesitan más que una respuesta rápida. Estableces cuánto razona con reasoning effort.

Prueba cualquiera de las dos en el Playground: Gemini 3.8 Live o Pensamiento Extendido en Vivo. Elige una voz, haz clic en Iniciar sesión y habla.

Conexión

Cada modelo en tiempo real en la plataforma utiliza un punto final, seleccionado con el modelo Consulta el parámetro. Autentica el handshake con tu clave API de EmpirioLabs:

wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live Autorización: Portador YOUR_EMPIRIOLABS_API_KEY

El protocolo sigue el formato de eventos en tiempo real ampliamente utilizado. Configurar la sesión con session.update Antes de enviar el primer audio, añade audio de micrófono con input_audio_buffer.append, y lee la respuesta de response.audio.delta, con su transcripción en response.audio_transcript.delta.

{"tipo": "sesión.actualización", "sesión": { "voz": "Kore", "instrucciones": "Eres un asistente de viaje conciso." }}

El audio es PCM de 16 bits en ambas direcciones: 16 kHz desde tu micrófono, o 24 kHz con input_audio_format Establecido a PCM24, y 24 kHz para la respuesta. La detección de actividad de voz está activada desde el principio, así que el modelo responde cuando el llamante deja de hablar, y hablar por encima de una respuesta lo interrumpe.

Fotogramas de vídeo

Ambos modelos pueden ver lo que les muestra el llamante. Envía fotogramas desde una cámara o una pantalla como imágenes base64 JPEG o PNG en su propio búfer, y pregunta por ellas al mismo tiempo:

{"tipo": "input_image_buffer.append", "imagen": "<base64 JPEG o PNG>"}

Llamada de función

Declarar funciones en session.update con parámetros de esquema JSON. Cuando el modelo llama a uno, recibes response.function_call_arguments.done con el call_id, el nombre de la función y sus argumentos. Devuelva el resultado como un function_call_output Objeto y el modelo sigue hablando con él.

Razonamiento sobre el pensamiento extendido

{"tipo": "sesión.actualización", "sesión": {"reasoning_effort": "alto"}}

reasoning effort acepta Grave, Medio (el valor por defecto) o Alto. El modelo suele reconocer primero una pregunta y luego responder en una segunda respuesta, así que sigue escuchando después de la primera response.done.

Precios

Ambos modelos facturan cada turno completo desde el uso que el modelo informa, con tasas separadas para tokens de audio y tokens de texto en ambas direcciones. Los fotogramas de vídeo facturan como tokens de entrada, y los de razonamiento como tokens de salida. Pensamiento Extendido informa de más tokens de entrada en cada turno, por lo que la misma conversación cuesta más que en Live. Las tarifas actuales están en el Gemini 3.8 Live y Pensamiento Extendido en Vivo Páginas de modelos y en el página de precios.

Cosas que merece la pena saber antes de la primera sesión

  • Establece la sesión antes de hablar. La voz, las instrucciones, la detección de turnos, las herramientas, la temperatura y el esfuerzo de razonamiento se corrigen una vez que comienza la conversación. Cambiarlos más tarde devuelve un error; abre una nueva sesión en su lugar.
  • Usa una de las 30 voces listadas. Puck es el valor por defecto. Cualquier otro valor se rechaza con un error.
  • No hay configuración de idioma. El modelo responde en el idioma que habla el llamante.
  • Sigue haciendo streaming brevemente después de que la persona que llame deje de llamar. La detección de actividad de voz necesita un breve silencio para decidir que ha terminado el turno, así que un cliente que corta el audio en la última palabra espera una respuesta.
  • Un nuevo socket es una conversación nueva. Guarda tu propio expediente si un cliente que vuelve a conectar necesita el contexto anterior.

Las tablas de eventos, la lista de voces y los formatos de audio están en el API de voz en tiempo real Documentos. Para text-to-speech de la misma familia, véase Cómo usar Gemini 3.8 Flash TTS y Flash-Lite TTS. Ambos modelos Live ya están disponibles.

Divulgación: Este artículo fue escrito con asistencia AI y revisado por EmpirioLabs AI.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.