Casa Blog

Como usar o Qwen3.8 Omni Flash Realtime e o Qwen Audio 3.1

Qwen3.8 Omni Flash Realtime e Qwen Audio 3.1 Realtime Plus via API

Sep 21, 2026

EmpirioLabs AI

Dois novos modelos de voz Alibaba estão ao vivo no EmpirioLabs, e ambos são conversas, não solicitações. Você abre um WebSocket, transmite o áudio do microfone e o áudio volta enquanto o alto-falante ainda está falando.

Qwen3.8 Omni Flash em Tempo Real é aquele que também pode ver. Além do áudio que você já está enviando, você pode empurrar quadros de vídeo ao vivo, e ele responderá perguntas sobre o que está na tela no mesmo turno. Ele carrega 56 vozes e chama suas funções no meio da conversa.

Qwen Audio 3.1 Realtime Plus é o que pode pesquisar coisas. Ele tem busca nativa na web que você pode ativar por sessão, 27 vozes próprias e um contexto de 256K.

Tente qualquer um dos playground: Omni Flash Tempo Real ou Audio 3.1 Realtime Plus. Clique em iniciar sessão e converse.

Conexão

Existe um endpoint em tempo real para cada modelo na plataforma, e você escolhe o modelo com um parâmetro de consulta. Autentique o handshake com a mesma chave API que você usa em todos os outros lugares:

wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime Autorização: Portador YOUR_EMPIRIOLABS_API_KEY

O protocolo segue a forma amplamente usada de evento em tempo real, então um cliente escrito segundo essa convenção funciona sem alterações. Configure a sessão sobre o socket com session.update, adicione áudio do microfone como input_audio_buffer.append, e ler o áudio de volta de response.audio.delta com a transcrição correspondente em response.audio_transcript.delta.

{"type": "session.update", "session": { "voice": "Tina", "modalities": ["text", "audio"] }}

O áudio viaja nos dois sentidos como PCM de 16 bits. Esses dois modelos recebem 16 kHz para cima e retornam 24 kHz ao retornar. O session.created O evento que você recebe no Connect relata os formatos daquela sessão, então leia lá em vez de assumir.

Quadros de vídeo no Omni Flash Realtime

Os quadros vão em seu próprio buffer, ao lado do buffer de áudio:

{"tipo": "input_image_buffer.append", "imagem": "<base64 JPEG ou PNG>"}

Envie como se fosse quadros de uma câmera, depois pergunte o que você está mostrando na mesma conversa falada. Ela mantém até 50 turnos e 240 segundos de histórico de vídeo, e até 100 turnos e 600 segundos de áudio. A história antiga sai de contexto à medida que esses limites são ultrapassados.

Busca na web no Áudio 3.1

A busca está desativada, a menos que você peça e peça durante a sessão:

{"type": "session.update", "session": {"enable_search": true}}

Com ele ativado, o modelo pode responder perguntas sobre coisas que aconteceram após o treinamento. Os resultados são adicionados à conversa, então um turno que busca reporta uma contagem de tokens de entrada visivelmente maior do que um que não faz.

Preços

Ambos os modelos faturam cada um o turno completo a partir do uso reportado, com taxas separadas para tokens de áudio e tokens de texto em ambas as direções. Essa divisão importa: uma resposta falada é principalmente tokens de áudio, e pedir uma resposta apenas de texto é eliminada áudio de Modalidades Realmente custa menos. As taxas atuais vivem no Omni Flash Tempo Real e Audio 3.1 Realtime Plus Páginas de modelos e no página de preços, que permanecem sincronizados com o que você é cobrado. Nenhum dos modelos possui um nível de entrada em cache, então cada token de entrada fatura na taxa normal.

Coisas que valem a pena saber antes da primeira sessão

  • Não devolva a voz que a sessão reporta. Ambos os modelos anunciam uma voz no conectar que seu próprio gerador então recusa, o que mata o primeiro turno. Se deixar a voz desconfigurada, a plataforma define um padrão funcional para aquele modelo, ou escolha uma da lista de vozes você mesmo. As duas listas não compartilham nomes, então uma voz que funciona em uma não funcionará na outra.
  • A detecção de atividade de voz precisa de um momento de silêncio para ser acionada. Esses modelos decidem que você parou de falar ao ouvir você parar. Se seu cliente corta a transmissão de áudio no instante em que o falante termina a última palavra, nada é comprometido e nenhuma resposta chega, o que parece exatamente uma sessão quebrada. Continue transmitindo por cerca de um segundo após o fim da fala.
  • Quadros de vídeo não são conteúdo de mensagem. Eles passam por input_image_buffer.append. Colocar uma imagem dentro de um conversação.item.criar Content Array é rejeitado, e em alguns modelos ele sai do turno sem nenhuma mensagem do usuário.
  • No Audio 3.1, busca na web e chamada de funções são mutuamente exclusivas. Ative um por sessão, não ambos.
  • Um novo encaixe é uma conversa nova. Não há memória do lado do servidor entre conexões, então um cliente que reconecta deve reproduzir qualquer contexto que quiser que o modelo ainda tenha.

Tabelas completas de eventos, listas de voz e formatos de áudio estão no API de Voz em Tempo Real Documentação. Ambos os modelos já estão disponíveis.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.