
Transcrição ao vivo por um socket, transmitindo palavras parciais enquanto o falante fala e uma frase fixa a cada pausa, com preço por token.
Transcrição ao vivo por um socket, transmitindo palavras parciais enquanto o falante fala e uma frase fixa a cada pausa, com preço por token.
Transmita áudio pcm16 em 16 kHz pelo soquete. Resultados parciais chegam enquanto o alto-falante está falando.
Também conhecido como Qwen Audio ASR Stream, Alibaba Cloud Qwen Audio 3.1 ASR Stream
qwen-audio-3-1-asr-stream/v1/realtimeqwen-audio-3.1-asr-streamalibaba/qwen-audio-3-1-asr-streamTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Qwen Audio 3.1 ASR Stream transcreve um fluxo de áudio ao vivo por um WebSocket em wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, e não pelos endpoints HTTP. Conecte-se com o id de modelo qwen-audio-3-1-asr-stream e envie sua chave de API da EmpirioLabs como cabeçalho Authorization: Bearer no handshake. Acrescente áudio PCM de 16 bits em base64 e leia os eventos de transcrição enquanto a pessoa ainda fala. Um navegador não consegue definir cabeçalhos em um WebSocket, então abra esta conexão a partir do seu servidor e repasse o áudio ao navegador pelo seu próprio socket. Obtenha uma chave de API no painel EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())Parâmetros de requisição suportados pela API Qwen Audio 3.1 ASR Stream na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Codificação do áudio que você adiciona ao buffer de entrada: PCM base64 de 16 bits, mono, a 16 kHz. |
Conectando Transcrição ao vivo via WebSocket no wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, autenticada com o cabeçalho comum Authorization Bearer. Enviando áudio Stream áudio mono pcm16 de 16 kHz com input_audio_buffer.append. A detecção de atividade de voz decide onde cada frase termina, então não há commit a enviar. O que retorna conversation.item.input_audio_transcription.delta eventos leva a frase até aqui enquanto o falante ainda está falando, e conversation.item.input_audio_transcription.completed carrega a frase resolvida a cada pausa. Faturamento Os tokens de entrada e saída são precificados por 1M, e cada frase completa é cobrada separadamente a partir do uso reportado pelo modelo.
Na EmpirioLabs, Qwen Audio 3.1 ASR Stream é cobrado por uso: Entrada $1.86 por 1M de tokens de entrada de áudio; Saída $1.40 por 1M de tokens gerados. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Qwen Audio 3.1 ASR Stream é servido por WEBSOCKET /v1/realtime em api.empiriolabs.ai com autenticação padrão por token Bearer.
Abra o playground da EmpirioLabs e clique em Start session para testar no navegador. Qwen Audio 3.1 ASR Stream funciona sobre um WebSocket em vez de requisição e resposta, então para integrar comece pelo guia rápido de voz em tempo real. Conecte-se do seu servidor com sua chave de API da EmpirioLabs e o id de modelo qwen-audio-3-1-asr-stream e transmita áudio nos dois sentidos.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.