Qwen Audio 3.1 ASR Message API

Transcrição ajustada para mensagens de voz e entrada de voz por um soquete, retornando cada enunciado como uma transcrição completa quando o falante pausa.

Alibaba CloudTranscriçãoLançado 21 de set. de 2026SingaporeEndpoint proprietárioNovo

Sobre Qwen Audio 3.1 ASR Message

Transcrição ajustada para mensagens de voz e entrada de voz por um soquete, retornando cada enunciado como uma transcrição completa quando o falante pausa.

Transmita áudio pcm16 a 16 kHz pelo soquete. Cada enunciado é retornado inteiro quando o alto-falante pausa.

Também conhecido como Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message

transcriptionspeech to textrealtimemultilingual

Especificações de Qwen Audio 3.1 ASR Message

ID do modelo
qwen-audio-3-1-asr-message
Autor
Alibaba Cloud
Categoria
Transcrição
Lançado
21 de set. de 2026
Entrada
Áudio
Saída
Texto
Região
Singapore
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
qwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-message

Preços da API Qwen Audio 3.1 ASR Message

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Entrada
por 1M de tokens de entrada de áudio
$1.86
Saída
por 1M de tokens gerados
$1.40
Comparar na página completa de preços

Como chamar a API Qwen Audio 3.1 ASR Message

Qwen Audio 3.1 ASR Message transcreve um fluxo de áudio ao vivo por um WebSocket em wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, e não pelos endpoints HTTP. Conecte-se com o id de modelo qwen-audio-3-1-asr-message e envie sua chave de API da EmpirioLabs como cabeçalho Authorization: Bearer no handshake. Acrescente áudio PCM de 16 bits em base64 e leia os eventos de transcrição enquanto a pessoa ainda fala. Um navegador não consegue definir cabeçalhos em um WebSocket, então abra esta conexão a partir do seu servidor e repasse o áudio ao navegador pelo seu próprio socket. Obtenha uma chave de API no painel EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Referência completa da API Qwen Audio 3.1 ASR Message

Parâmetros da API Qwen Audio 3.1 ASR Message

Parâmetros de requisição suportados pela API Qwen Audio 3.1 ASR Message na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
input_audio_formatenumpcm16pcm16Codificação do áudio que você adiciona ao buffer de entrada: PCM base64 de 16 bits, mono, a 16 kHz.

Bom saber

Conectando Transcrição de mensagens de voz via WebSocket em wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, autenticada com o cabeçalho comum Authorization Bearer. Enviando áudio Stream de áudio mono pcm16 a 16 kHz com input_audio_buffer.append. A detecção de atividade de voz decide onde cada enunciado termina, então não há commit a enviar. O que retorna Cada enunciado chega inteiro, como um único evento conversation.item.input_audio_transcription.completed quando o alto-falante pausa. Esse modelo não envia resultados parciais enquanto o alto-falante está falando; para legendas ao vivo, use qwen-audio-3-1-asr-stream. Faturamento Os tokens de entrada e saída são precificados por 1M, e cada enunciado completo é faturado separadamente a partir do uso que o modelo reporta.

API Qwen Audio 3.1 ASR Message: perguntas frequentes

Quanto custa a API Qwen Audio 3.1 ASR Message?

Na EmpirioLabs, Qwen Audio 3.1 ASR Message é cobrado por uso: Entrada $1.86 por 1M de tokens de entrada de áudio; Saída $1.40 por 1M de tokens gerados. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint Qwen Audio 3.1 ASR Message usa?

Qwen Audio 3.1 ASR Message é servido por WEBSOCKET /v1/realtime em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar Qwen Audio 3.1 ASR Message no navegador antes de integrar?

Abra o playground da EmpirioLabs e clique em Start session para testar no navegador. Qwen Audio 3.1 ASR Message funciona sobre um WebSocket em vez de requisição e resposta, então para integrar comece pelo guia rápido de voz em tempo real. Conecte-se do seu servidor com sua chave de API da EmpirioLabs e o id de modelo qwen-audio-3-1-asr-message e transmita áudio nos dois sentidos.

Como consigo uma chave de API Qwen Audio 3.1 ASR Message?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.