
Traducción hablada simultánea a través de un WebSocket. Establece el idioma destino y luego habla; el modelo responde en ese idioma con texto y audio.
Traducción hablada simultánea a través de un WebSocket. Establece el idioma destino y luego habla; el modelo responde en ese idioma con texto y audio.
La sesión se configura con eventos session.update a través del socket en lugar de parámetros de solicitud. Se requiere el idioma destino. Los tokens de texto y audio facturan a velocidades separadas.
También conocido como Alibaba Cloud Qwen3.8 LiveTranslate Flash Realtime
qwen3-8-livetranslate-flash-realtime/v1/realtimeqwen3.8-livetranslate-flash-realtimealibaba/qwen3-8-livetranslate-flash-realtimeTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Qwen3.8 LiveTranslate Flash Realtime es traducción hablada en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime, no a través de los endpoints HTTP. Conéctate con el id de modelo qwen3-8-livetranslate-flash-realtime y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. Define el idioma de destino con un session.update antes de enviar audio. El audio viaja en ambos sentidos como PCM de 16 bits en base64. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
await ws.send(json.dumps({
"type": "session.update",
"session": {
"voice": "Tina",
"translation": {"language": "en"},
"modalities": ["text", "audio"],
},
}))
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] in ("response.audio_transcript.text", "response.text.text"):
print(event.get("text") or "")
elif event["type"] == "response.done":
break
asyncio.run(main())Parámetros de solicitud compatibles con la API de Qwen3.8 LiveTranslate Flash Realtime en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| voice | enum | Tina | Tina, Serena, Ethan, Cindy | Voz hablada para el audio traducido. Configúralo con session.update antes de que el modelo produzca cualquier audio. |
| target_language | enum | en | zh, en, ar, de, fr, es, pt, id, it, ko, ru, th, vi, ja, tr, h... | Idioma al que se traduce el modelo. Obligatorio. Configúralo con session.update antes de enviar el audio. |
| source_language | enum | auto | auto, zh, en, ar, de, fr, es, pt, id, it, ko, ru, th, vi, ja,... | El idioma que estás hablando. Deja automático para que el modelo lo detecte. |
| modalities | string | ["text","audio"] | - | Qué tipos de salida devuelve el modelo durante un turno. Corta audio para una traducción solo de texto. |
| input_audio_format | enum | pcm | pcm | Codificación del audio que añades al búfer de entrada: PCM base64 de 16 bits. |
| output_audio_format | enum | pcm | pcm | Codificación del audio que el modelo transmite de vuelta: PCM base64 de 16 bits. |
Traducción hablada a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime, autenticada con el encabezado ordinario de Portador de Autorización. Establece el idioma destino con session.update antes de enviar el audio. Usa una voz que este modelo acepte, o deja la Tina predeterminada. Los tokens de audio y texto se valoran por separado, y cada turno completado se factura por separado según el uso que reporte el modelo.
En EmpirioLabs, Qwen3.8 LiveTranslate Flash Realtime se factura por uso: Entrada: audio $15.00 por 1M de tokens de entrada de audio; Entrada $1.10 por 1M de tokens de prompt; Producto $40.00 por 1M de tokens generados; Salida: audio $60.00 por cada 1M de tokens de audio generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Qwen3.8 LiveTranslate Flash Realtime admite una ventana de contexto de 53K tokens con hasta 4096 tokens de salida por respuesta.
Qwen3.8 LiveTranslate Flash Realtime se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.
Abre el playground de EmpirioLabs y pulsa Start session para probarlo en tu navegador. Qwen3.8 LiveTranslate Flash Realtime funciona sobre un WebSocket en lugar de una petición y una respuesta, así que para integrarlo empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo qwen3-8-livetranslate-flash-realtime, y luego transmite audio en ambos sentidos.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.