Casa Blog

Como Usar o ASR, Stream ASR e Mensagem ASR do Qwen Audio 3.1

Qwen Audio 3.1 ASR, Stream ASR e Mensagem ASR via API

Sep 24, 2026

EmpirioLabs AI

O Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream e Qwen Audio 3.1 ASR Message estão disponíveis na EmpirioLabs. ASR transcreve áudio gravado através de PÓS-/v1/audio/transcriptions. Stream ASR e mensagem ASR transcrevam áudio ao vivo sobre WSS://api.empiriolabs.ai/v1/Realtime. Os três funcionam tanto na API quanto na Playground.

Os três modelos

  • qwen-audio-3-1-asr transcreve trechos curtos e gravações longas, e retorna a transcrição com segmentos de frases e carimbos de data e data. A língua é detectada automaticamente, incluindo dialetos chineses.
  • qwen-audio-3-1-asr-stream é construída para legendas ao vivo. Ela envia a frase até certo ponto enquanto o falante está falando, depois a frase estabelecida a cada pausa.
  • qwen-audio-3-1-asr-message é construído para mensagens de voz e entrada de voz. Ele retorna cada enunciado como uma transcrição completa assim que o falante pausa, sem resultados parciais.

Transcrevendo uma gravação

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -F modelo=qwen-audio-3-1-asr \ -F file=@meeting.mp3

Um corpo JSON com audio_url ou audio_base64 funciona no lugar do upload do arquivo. A resposta é um trabalho:

{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "status": "processamento", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }

Enquete o emprego até Status é completo:

curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY"

A transcrição está em result.text, com segmentos de sentença em result.segments e carimbos de tempo das palavras em resultado.palavras. Clipes curtos terminam em segundos; gravações longas demoram mais.

Transcrição ao vivo por WebSocket

Abra o endpoint em tempo real com o modelo na string de consulta e sua chave API no handshake:

wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream Autorização: Portador YOUR_EMPIRIOLABS_API_KEY

Stream de áudio PCM mono 16 bits 16 bits como base64 in input_audio_buffer.append eventos. Não há commit para enviar: o modelo detecta onde cada frase termina a partir da pausa que a segue.

{"tipo": "input_audio_buffer.append", "áudio": "<base64 PCM>"}

As transcrições chegam como eventos:

  • Resultados parciais. conversation.item.input_audio_transcription.delta Carrega a sentença até o fim de Texto enquanto o palestrante ainda está falando. Apenas Stream ASR.
  • Resultados decididos. conversation.item.input_audio_transcription.completed carrega a frase ou enunciado final em Transcrição. Ambos os modelos.

Notas operacionais

  1. Cada solicitação de transcrição retorna um trabalho, mesmo que seja um clipe curto. A primeira resposta carrega um job id, não a transcrição. Leia result.text de VAI /v1/jobs/<job_id> uma vez Status é completo.
  2. Exibição Texto de cada evento parcial em vez de se juntar delta valores. No ASR Stream, Texto é sempre a frase inteira até agora, então substituir a linha exibida por ela em todo evento mantém as legendas ao vivo corretas.
  3. A Mensagem ASR permanece silenciosa até que o alto-falante faça uma pausa. Não envia resultados parciais, então nenhum evento aparece enquanto alguém está falando. Use o ASR Stream para legendas ao vivo.
  4. Transmita um momento de silêncio após as últimas palavras. Uma frase se fixa quando o modelo ouve o alto-falante parar. Continue enviando áudio brevemente após as palavras finais e espere pelo completo evento antes de fechar o soquete, ou a última frase é perdida.

Preços

Todos os três modelos são pagos conforme você usa, sem necessidade de assinatura. Cada um é precificado por token, com uma taxa para a entrada de áudio e outra para a saída da transcrição, e não há camada de entrada em cache. O ASR fatura cada solicitação; ASR Stream e ASR Message faturam cada frase ou enunciado completo. Os modelos ao vivo têm taxas mais altas que o ASR, então use o ASR para gravações que não precisam de resultados enquanto o falante está falando. As taxas atuais estão nas páginas dos modelos para Qwen Audio 3.1 ASR, ASR Stream e Mensagem ASR, e no página de preços.

Comece a construir

Tente Qwen Audio 3.1 ASR no Playground enviando uma gravação, ou ASR Stream e Mensagem ASR clicando em Iniciar sessão e falando. A referência da API para cada modelo está em ASR, ASR Stream e Mensagem ASR, e as tabelas completas de eventos estão no API de Voz em Tempo Real guia.

Para conversas de voz da mesma família, veja Como usar o Qwen3.8 Omni Flash Realtime e o Qwen Audio 3.1.

Divulgação: Este artigo foi escrito com assistência de IA e revisado por EmpirioLabs IA.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.