Inicio Blog

Cómo usar Qwen3.8 Omni Flash y LiveTranslate

Qwen3.8 Omni Flash y LiveTranslate vía API

Sep 18, 2026

EmpirioLabs AI

Qwen3.8 Omni Flash es el modelo de Flash omni-input de Alibaba: lee texto, imágenes, audio y vídeo, y responde en texto. Se incluye con un contexto de token de 1M, pensando que está activado por defecto, llamada a funciones, salida estructurada estricta en esquema JSON y una herramienta integrada, búsqueda web.

Qwen3.8 Omni Flash está disponible en EmpirioLabs hoy a través de una API compatible con OpenAI, con streaming y hasta 128K tokens de salida. Pruébalo en el parque infantil o llamarlo de cualquier cliente compatible con OpenAI. La especificaciones completas y las tasas actuales viven en Página del modelo Qwen3.8 Omni Flash y el API docs.

El envío en el mismo lanzamiento es Qwen3.8 LiveTranslate Flash en tiempo real: traducción hablada a través de un WebSocket. Establece el idioma destino, habla, y el modelo responde en ese idioma con texto y audio. Ábrelo en el parque infantil o conectarse a wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime. Detalles en directo en la API de voz en tiempo real Página.

Precios

La facturación Omni Flash se basa en el uso, con una tarifa fija de entrada y una tarifa fija de salida en cada tamaño de prompt. Los tokens de audio y vídeo usan la misma tasa de entrada que el texto; la banda sonora de un vídeo se cuenta como tokens de audio junto con sus tokens de vídeo. La búsqueda web añade una pequeña tarifa por llamada que solo se aplica cuando una llamada realmente se ejecuta. Los tokens de pensamiento facturan como tokens de salida.

LiveTranslate factura cada uno de los modelos completados en el uso que reporta el modelo, con tarifas separadas para tokens de audio y tokens de texto. Las tarifas actuales para ambos modelos siempre están en su Páginas de modelos y el página de precios, que se mantienen en sincronía con lo que se cobra.

Quickstart

Indique cualquier SDK OpenAI en la URL base EmpirioLabs y pase qwen3-8-omni-flash como modelo:

desde openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-omni-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "Qué se dice y qué hay en pantalla?"}, {"type": "input_audio", "input_audio": { "format": "mp3", "data": "https://example.com/clip.mp3", }}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)

El mismo id de modelo funciona /v1/responses, el de forma antrópica /v1/messages, y el compatible con Google /v1beta/models/qwen3-8-omni-flash:generateContent Ruta. El id alternativo qwen3.8-omni-flash se resuelve con el mismo modelo.

LiveTranslate sobre un WebSocket

LiveTranslate no es HTTP. Conéctate al socket en tiempo real con la misma clave API que usas en todos los sitios y luego envía un session.update que establece el idioma objetivo antes que cualquier audio:

{"tipo": "sesión.actualización", "sesión": { "voz": "Tina", "traducción": {"idioma": "en"}, "modalidades": ["texto", "audio"] }}

Luego añade audio de micrófono como input_audio_buffer.append eventos. El modelo traduce mientras hablas y transmite audio de vuelta. Las voces en este modelo son Tina, Serena, Ethan y Cindy. El id alternativo qwen3.8-livetranslate-flash-realtime resuelve al mismo modelo. Se rechaza una llamada de chat-completions en este slug; el único punto final anunciado es el socket.

Pensamiento

En Omni Flash, el pensamiento profundo está activado por defecto y se retransmite como reasoning content junto con la respuesta. Contrólalo con habilitar pensar y thinking_budget (hasta 262.144 fichas), o enviar reasoning effort y la plataforma lo asigna a un presupuesto adaptado al modelo. Los tokens de pensamiento se facturan como tokens de salida, así que desactiva el pensamiento o establece un presupuesto pequeño para turnos cortos y sensibles a la latencia.

Herramientas integradas

Búsqueda web sobre Omni Flash rides detrás tool_web_search y está desactivado por defecto. Este modelo no expone el extractor web, el intérprete de código ni las herramientas de búsqueda de imágenes. Cuando se ejecuta la búsqueda, la respuesta usage.tool_usage Map informa exactamente cuántas llamadas se realizaron, para que puedas auditar la facturación por herramienta. Una sola solicitud puede invocar la búsqueda más de una vez, y cada llamada invocada se factura. LiveTranslate no tiene búsqueda web.

Salida estructurada

Para una forma de respuesta exacta en Omni Flash, pasa response_format con {"tipo": "json_schema",...} y "estricto": cierto: el modelo devuelve exactamente las claves del esquema sin añadidos. Modo JSON simple con {"tipo": "json_object"} también está soportado.

Cosas que merece la pena saber antes de tu primera llamada

  • Omni Flash lee audio y vídeo, y responde en texto. No solicites salida de audio. No hay control por voz en ese modelo.
  • Envía audio Omni Flash como URL o URI de datos base64. Anidado input_audio.data debe ser una URL o un Datos: URI, no base64 en bruto. Un playground usos de carga MP3 Formato: "MPEG"; que se aliasa con mp3.
  • tool_choice: "obligatorio" No funciona mientras está pensando. La solicitud es rechazada con un error evidente. Mantener tool_choice: "auto" con el pensamiento activado o establecido enable_thinking: falso Cuando necesitas forzar una llamada de función.
  • LiveTranslate necesita un idioma objetivo en la primera sesión.update. Sin él, el zócalo se cierra antes de que se produzca cualquier audio. Deja el idioma de origen sin configurar para detectar automáticamente.

Ambos modelos están disponibles ahora en la playground y a través de la EmpirioLabs API.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.