
Transcripción sintonizada para mensajes de voz y entrada de voz por un socket, devolviendo cada enunciado como una transcripción completa cuando el hablante hace una pausa.
Transcripción sintonizada para mensajes de voz y entrada de voz por un socket, devolviendo cada enunciado como una transcripción completa cuando el hablante hace una pausa.
Transmite audio pcm16 a 16 kHz por el enchufe. Cada enunciado se devuelve completo cuando el altavoz hace una pausa.
También conocido como Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message
qwen-audio-3-1-asr-message/v1/realtimeqwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-messageTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Qwen Audio 3.1 ASR Message transcribe un flujo de audio en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, no a través de los endpoints HTTP. Conéctate con el id de modelo qwen-audio-3-1-asr-message y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. Añade audio PCM de 16 bits en base64 y lee los eventos de transcripción mientras la persona sigue hablando. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())Parámetros de solicitud compatibles con la API de Qwen Audio 3.1 ASR Message en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Codificación del audio que añades al búfer de entrada: PCM base64 de 16 bits, mono, a 16 kHz. |
Conectando Transcripción de mensajes de voz a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, autenticada con el encabezado ordinario de Portador de Autorización. Enviando audio Transmisión de audio mono pcm16 a 16 kHz con input_audio_buffer.append. La detección de actividad de voz decide dónde termina cada enunciado, por lo que no hay compromiso que enviar. Lo que regresa Cada enunciado llega completo, como un solo evento conversation.item.input_audio_transcription.completed una vez que el altavoz se pausa. Este modelo no envía resultados parciales mientras el altavoz está hablando; para subtítulos en directo, use qwen-audio-3-1-asr-stream. Facturación Los tokens de entrada y salida se valoran por 1M, y cada enunciado completado se factura por sí solo según el uso que reporte el modelo.
En EmpirioLabs, Qwen Audio 3.1 ASR Message se factura por uso: Entrada $1.86 por 1M de tokens de entrada de audio; Producto $1.40 por 1M de tokens generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Qwen Audio 3.1 ASR Message se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.
Abre el playground de EmpirioLabs y pulsa Start session para probarlo en tu navegador. Qwen Audio 3.1 ASR Message funciona sobre un WebSocket en lugar de una petición y una respuesta, así que para integrarlo empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo qwen-audio-3-1-asr-message, y luego transmite audio en ambos sentidos.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.