Gemini 3.8 Live API

Conversación de voz de baja latencia por un solo socket, con 30 voces, entrada de vídeo en directo, llamadas de herramientas y respuestas que puedes interrumpir mientras hablas.

GoogleGeneración de audio128K contextoLanzado 15 sept 2026Endpoint propietarioNuevo

Acerca de Gemini 3.8 Live

Conversación de voz de baja latencia por un solo socket, con 30 voces, entrada de vídeo en directo, llamadas de herramientas y respuestas que puedes interrumpir mientras hablas.

La sesión se configura con los eventos session.update a través del socket en lugar de parámetros de solicitud. Los tokens de texto y audio facturan a tarifas separadas.

También conocido como Gemini Live, Google Gemini 3.8 Live

realtimespeech to speechaudio inaudio outvideofunction callingmultilingual

Especificaciones de Gemini 3.8 Live

ID del modelo
gemini-3-8-live
Autor
Google
Categoría
Generación de audio
Lanzado
15 sept 2026
Ventana de contexto
128K tokens
Salida máxima
65.536 tokens
Entrada
AudioTextoVideo
Salida
AudioTexto
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
gemini-3.8-livegoogle/gemini-3.8-live

Precios de la API de Gemini 3.8 Live

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Entrada: audio
por 1M de tokens de entrada de audio
$7.80
Entrada
por 1M de tokens de prompt
$2.60
Producto
por 1M de tokens generados
$11.70
Salida: audio
por cada 1M de tokens de audio generados
$31.20
Comparar en la página completa de precios

Cómo llamar a la API de Gemini 3.8 Live

Gemini 3.8 Live mantiene una conversación en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live, no a través de los endpoints HTTP. Conéctate con el id de modelo gemini-3-8-live y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. El audio viaja en ambos sentidos como PCM de 16 bits en base64. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Referencia completa de la API de Gemini 3.8 Live

Parámetros de la API de Gemini 3.8 Live

Parámetros de solicitud compatibles con la API de Gemini 3.8 Live en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
voiceenumPuckZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Voz hablada para la sesión. Configúralo con session.update antes de que empiece la conversación; no puede cambiar después.
instructionsstring--Guía del sistema sobre cómo se comporta y habla el modelo. Configúralo con session.update antes de que empiece la conversación.
temperaturenumber-0 a 2Temperatura de muestreo de 0 a 2. Valores más bajos hacen que las respuestas sean más consistentes. Configúralo antes de que empiece la conversación.
input_audio_formatenumpcm16pcm16, pcm24Codificación del audio que añades al búfer de entrada: pcm16 es PCM base64 de 16 bits a 16 kHz, y pcm24 es igual a 24 kHz.
output_audio_formatenumpcm24pcm24Codificación del audio que el modelo transmite de vuelta: PCM de 16 bits a 24 kHz.
turn_detectionstring{"type":"server_vad"}-Detección de actividad de voz en el servidor. Decide cuándo has dejado de hablar y el modelo debe responder. Está activado por defecto; ponlo en nulo para terminar...

Información útil

Conectando Voz dúplex completo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live, autenticada con el encabezado Authorization Bearer normal. Configura la sesión con session.update antes de enviar el primer audio: voz, instrucciones, detección de giros y herramientas. Estos ajustes se corrigen una vez que comienza la conversación. Envío de audio y vídeo - Añadir audio al micrófono como eventos input_audio_buffer.append: PCM de 16 bits a 16 kHz, o a 24 kHz con input_audio_format configurado a pcm24. - Añadir fotogramas de vídeo en directo como eventos input_image_buffer.append, como imágenes base64 JPEG o PNG. - La detección de actividad de voz está activada por defecto, así que sigue transmitiendo durante aproximadamente un segundo después de que termine el habla. Configura turn_detection a nulo para terminar cada turno tú mismo con input_audio_buffer.commit. Voces y lenguaje - Utiliza una de las 30 voces de la lista de voice, por ejemplo Puck, Kore o Charon. Cualquier otro valor es rechazado. - El modelo responde en el idioma que hablas. Responde - Flujos de voz como eventos response.audio.delta, PCM de 16 bits a 24 kHz, con las palabras como eventos session.update 0__. Tu propio habla también se transcribe. - Hablar mientras el modelo responde lo interrumpe. Herramientas - Llamada de función con parámetros del esquema JSON. Devuelve cada resultado como un elemento session.update 1__ con su session.update 2__. Facturación Los tokens de audio y texto se valoran por separado en ambas direcciones, los fotogramas de vídeo se facturan como tokens de entrada, y los tokens de razonamiento como tokens de salida. Cada turno completado se factura por sí solo según el uso que reporta el modelo, incluyendo una respuesta que interrumpes.

API de Gemini 3.8 Live: preguntas frecuentes

¿Cuánto cuesta la API de Gemini 3.8 Live?

En EmpirioLabs, Gemini 3.8 Live se factura por uso: Entrada: audio $7.80 por 1M de tokens de entrada de audio; Entrada $2.60 por 1M de tokens de prompt; Producto $11.70 por 1M de tokens generados; Salida: audio $31.20 por cada 1M de tokens de audio generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Cuál es la ventana de contexto de Gemini 3.8 Live?

Gemini 3.8 Live admite una ventana de contexto de 128K tokens con hasta 65.536 tokens de salida por respuesta.

¿Qué endpoint usa Gemini 3.8 Live?

Gemini 3.8 Live se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar Gemini 3.8 Live en el navegador antes de integrar?

Abre el playground de EmpirioLabs y pulsa Start session para probarlo en tu navegador. Gemini 3.8 Live funciona sobre un WebSocket en lugar de una petición y una respuesta, así que para integrarlo empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo gemini-3-8-live, y luego transmite audio en ambos sentidos.

¿Cómo consigo una clave de API de Gemini 3.8 Live?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.