Qwen3.8 Omni Flash é o modelo de Flash omni-input do Alibaba: ele lê texto, imagens, áudio e vídeo, e responde em texto. Ele vem com um contexto de token 1M, pensando que está ativado por padrão, chamada de função, saída estruturada estrita em esquema JSON e uma ferramenta embutida, busca na web.
O Qwen3.8 Omni Flash está disponível hoje em EmpirioLabs por meio de uma API compatível com OpenAI, com streaming e até 128K tokens de saída. Experimente no playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo Qwen3.8 Omni Flash e o Documentos de API.
O envio no mesmo lançamento é Qwen3.8 LiveTranslate Flash em Tempo Real: tradução falada via WebSocket. Defina o idioma de destino, fale e o modelo responde nesse idioma com texto e áudio. Abra no playground ou conectar a wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime. Detalhes ao vivo no API de Voz em Tempo Real página.
Preços
A faturação do Omni Flash é baseada no uso, com uma taxa fixa de entrada e uma taxa fixa de saída em cada tamanho de prompt. Tokens de áudio e vídeo usam a mesma taxa de entrada que texto; a trilha sonora de um vídeo é contada como tokens de áudio junto com seus tokens de vídeo. A busca na web adiciona uma pequena taxa por chamada que se aplica apenas quando uma chamada realmente é executada. Tokens de pensamento faturam como tokens de saída.
As faturas do LiveTranslate completam cada uma a partir do uso que o modelo reporta, com taxas separadas para tokens de áudio e tokens de texto. As taxas atuais para ambos os modelos sempre estão disponíveis em seus Páginas de modelos e o página de preços, que permanecem em sincronia com o que você é cobrado.
Início rápido
Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe qwen3-8-omni-flash como modelo:
from openai import OpenAI client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-omni-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "O que está sendo dito e o que está na tela?"}, {"type": "input_audio", "input_audio": { "format": "mp3", "data": "https://example.com/clip.mp3", }}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)
O mesmo modelo id funciona /v1/responses, a Antrópica /v1/messages, e o compatível com o Google /v1beta/models/qwen3-8-omni-flash:gerar conteúdo rota. O id alternativo qwen3.8-omni-flash resolve para o mesmo modelo.
LiveTranslate sobre um WebSocket
O LiveTranslate não é HTTP. Conecte-se ao socket em tempo real com a mesma chave de API que você usa em todos os outros lugares, então envie um session.update que define o idioma alvo antes de qualquer áudio:
{"tipo": "session.update", "session": { "voz": "Tina", "tradução": {"language": "en"}, "modalidades": ["texto", "áudio"] }}
Depois, adicione o áudio do microfone como input_audio_buffer.append eventos. O modelo traduz enquanto você fala e transmite o áudio de volta. As vozes nesse modelo são Tina, Serena, Ethan e Cindy. O id alternativo qwen3.8-livetranslate-flash-realtime resolve para o mesmo modelo. Uma chamada de chat-completions nesse slug é rejeitada; o único endpoint anunciado é o socket.
Pensamento
No Omni Flash, o pensamento profundo está ativado por padrão e retorna como raciocinar conteúdo junto com a resposta. Controle-o com activar pensar e thinking_budget (até 262.144 tokens), ou enviar raciocinação esforço e a plataforma mapeia para um orçamento adequado ao modelo. Tokens de pensamento faturam como tokens de saída, então desative o pensamento ou defina um orçamento pequeno para turnos curtos e sensíveis à latência.
Ferramentas integradas
Busca na web sobre Omni Flash rides atrás tool_web_search e está desligado por padrão. Esse modelo não expõe o web extractor, interpretador de código ou ferramentas de busca de imagens. Quando a busca é executada, a resposta usage.tool_usage O Map informa exatamente quantas chamadas foram feitas, para que você possa auditar a faturação por ferramenta. Uma única solicitação pode invocar busca mais de uma vez, e cada chamada invocada é cobrada. O LiveTranslate não possui busca na web.
Saída estruturada
Para uma forma de resposta exata no Omni Flash, passe response_format com {"tipo": "json_schema",...} e "rígido": verdade: o modelo retorna exatamente as chaves do esquema sem extras. Modo JSON simples com {"tipo": "json_object"} também é suportado.
Coisas que valem a pena saber antes da primeira ligação
- O Omni Flash lê áudio e vídeo, e responde por texto. Não peça saída de áudio. Não há controle por voz nesse modelo.
- Envie áudio Omni Flash como URL ou URI de dados base64. Aninhado
input_audio.datadeve ser uma URL ou umDados:URI, não base64 bruto. Um playground uso de upload de MP3Formato: "MPEG"; que se reúne commp3. tool_choice: "obrigatório"não funciona enquanto o pensamento está ativo. O pedido é rejeitado com um erro claro. Fiquetool_choice: "auto"com o pensamento ativado, ou definidoenable_thinking: falsoQuando você precisa forçar uma chamada de função.- O LiveTranslate precisa de um idioma alvo na primeira sessão.update. Sem ele, o soquete fecha antes que qualquer áudio seja produzido. Deixe a língua de origem desconfigurada para auto-detectar.
Ambos os modelos estão disponíveis agora no playground e através do EmpirioLabs API.



