O Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream e Qwen Audio 3.1 ASR Message estão disponíveis na EmpirioLabs. ASR transcreve áudio gravado através de PÓS-/v1/audio/transcriptions. Stream ASR e mensagem ASR transcrevam áudio ao vivo sobre WSS://api.empiriolabs.ai/v1/Realtime. Os três funcionam tanto na API quanto na Playground.
Os três modelos
qwen-audio-3-1-asrtranscreve trechos curtos e gravações longas, e retorna a transcrição com segmentos de frases e carimbos de data e data. A língua é detectada automaticamente, incluindo dialetos chineses.qwen-audio-3-1-asr-streamé construída para legendas ao vivo. Ela envia a frase até certo ponto enquanto o falante está falando, depois a frase estabelecida a cada pausa.qwen-audio-3-1-asr-messageé construído para mensagens de voz e entrada de voz. Ele retorna cada enunciado como uma transcrição completa assim que o falante pausa, sem resultados parciais.
Transcrevendo uma gravação
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -F modelo=qwen-audio-3-1-asr \ -F file=@meeting.mp3
Um corpo JSON com audio_url ou audio_base64 funciona no lugar do upload do arquivo. A resposta é um trabalho:
{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "status": "processamento", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }
Enquete o emprego até Status é completo:
curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY"
A transcrição está em result.text, com segmentos de sentença em result.segments e carimbos de tempo das palavras em resultado.palavras. Clipes curtos terminam em segundos; gravações longas demoram mais.
Transcrição ao vivo por WebSocket
Abra o endpoint em tempo real com o modelo na string de consulta e sua chave API no handshake:
wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream Autorização: Portador YOUR_EMPIRIOLABS_API_KEY
Stream de áudio PCM mono 16 bits 16 bits como base64 in input_audio_buffer.append eventos. Não há commit para enviar: o modelo detecta onde cada frase termina a partir da pausa que a segue.
{"tipo": "input_audio_buffer.append", "áudio": "<base64 PCM>"}
As transcrições chegam como eventos:
- Resultados parciais.
conversation.item.input_audio_transcription.deltaCarrega a sentença até o fim deTextoenquanto o palestrante ainda está falando. Apenas Stream ASR. - Resultados decididos.
conversation.item.input_audio_transcription.completedcarrega a frase ou enunciado final emTranscrição. Ambos os modelos.
Notas operacionais
- Cada solicitação de transcrição retorna um trabalho, mesmo que seja um clipe curto. A primeira resposta carrega um
job id, não a transcrição. Leiaresult.textdeVAI /v1/jobs/<job_id>uma vezStatusécompleto. - Exibição
Textode cada evento parcial em vez de se juntardeltavalores. No ASR Stream,Textoé sempre a frase inteira até agora, então substituir a linha exibida por ela em todo evento mantém as legendas ao vivo corretas. - A Mensagem ASR permanece silenciosa até que o alto-falante faça uma pausa. Não envia resultados parciais, então nenhum evento aparece enquanto alguém está falando. Use o ASR Stream para legendas ao vivo.
- Transmita um momento de silêncio após as últimas palavras. Uma frase se fixa quando o modelo ouve o alto-falante parar. Continue enviando áudio brevemente após as palavras finais e espere pelo
completoevento antes de fechar o soquete, ou a última frase é perdida.
Preços
Todos os três modelos são pagos conforme você usa, sem necessidade de assinatura. Cada um é precificado por token, com uma taxa para a entrada de áudio e outra para a saída da transcrição, e não há camada de entrada em cache. O ASR fatura cada solicitação; ASR Stream e ASR Message faturam cada frase ou enunciado completo. Os modelos ao vivo têm taxas mais altas que o ASR, então use o ASR para gravações que não precisam de resultados enquanto o falante está falando. As taxas atuais estão nas páginas dos modelos para Qwen Audio 3.1 ASR, ASR Stream e Mensagem ASR, e no página de preços.
Comece a construir
Tente Qwen Audio 3.1 ASR no Playground enviando uma gravação, ou ASR Stream e Mensagem ASR clicando em Iniciar sessão e falando. A referência da API para cada modelo está em ASR, ASR Stream e Mensagem ASR, e as tabelas completas de eventos estão no API de Voz em Tempo Real guia.
Para conversas de voz da mesma família, veja Como usar o Qwen3.8 Omni Flash Realtime e o Qwen Audio 3.1.
Divulgação: Este artigo foi escrito com assistência de IA e revisado por EmpirioLabs IA.



