Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream y Qwen Audio 3.1 ASR Message están disponibles en EmpirioLabs. ASR transcribe el audio grabado a través de DESPUÉS /v1/audio/transcriptions. Transmisión ASR y mensajes ASR transcriben audio en directo sobre wss://api.empiriolabs.ai/v1/realtime. Los tres funcionan en la API y en la Playground.
Los tres modelos
qwen-audio-3-1-asrtranscribe clips cortos y grabaciones largas, y devuelve la transcripción con fragmentos de frases y marcas de tiempo de palabras. El idioma se detecta automáticamente, incluidos los dialectos chinos.qwen-audio-3-1-asr-streamestá diseñado para subtítulos en directo. Envía la frase tan lejos mientras el hablante habla, y luego la frase establecida en cada pausa.qwen-audio-3-1-asr-messageestá diseñado para mensajes de voz y entrada de voz. Devuelve cada enunciado como una transcripción completa una vez que el hablante hace una pausa, sin resultados parciales.
Transcripción de una grabación
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3
Un cuerpo JSON con audio_url o audio_base64 funciona en lugar de la subida del archivo. La respuesta es un trabajo:
{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "estado": "procesamiento", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }
Encuesta el trabajo hasta que Estado es terminado:
curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY"
La transcripción está en result.text, con segmentos de oración en result.segments y marcas de tiempo de palabras en resulta.palabras. Los clips cortos terminan en segundos; las grabaciones largas tardan más.
Transcripción en directo a través de un WebSocket
Abre el endpoint en tiempo real con el modelo en la cadena de consulta y tu clave API en el handshake:
wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream Autorización: Portador YOUR_EMPIRIOLABS_API_KEY
Transmisión de audio PCM mono de 16 bits de 16 bits como base64 in input_audio_buffer.append eventos. No hay compromiso para enviar: el modelo detecta dónde termina cada frase a partir de la pausa que la sigue.
{"tipo": "input_audio_buffer.append", "audio": "<base64 PCM>"}
Las transcripciones llegan como eventos:
- Resultados parciales.
conversation.item.input_audio_transcription.deltalleva la sentencia hasta aquí enTextomientras el altavoz sigue hablando. Solo transmisión ASR. - Resultados resueltos.
conversation.item.input_audio_transcription.completedlleva la oración o enunciado final enTranscripción. Ambos modelos.
Notas operativas
- Cada solicitud de transcripción devuelve un trabajo, incluso un clip corto. La primera respuesta lleva un
job id, no la transcripción. Leeresult.textde¡QUE /v1/jobs/<job_id>una vezEstadoesterminado. - Pantalla
Textode cada evento parcial en lugar de unirseDeltavalores. En ASR Stream,TextoSiempre es la frase completa hasta ahora, así que reemplazar la línea mostrada por ella en cada evento mantiene los subtítulos en vivo correctos. - El mensaje ASR permanece en silencio hasta que el altavoz se detiene. No da resultados parciales, así que no llegan eventos mientras alguien está hablando. Usa ASR Stream para subtítulos en directo.
- Emite un momento de silencio tras las últimas palabras. Una frase se asienta cuando el modelo oye al altavoz detenerse. Sigue enviando audio brevemente después de las últimas palabras y espera a que el
terminadoantes de cerrar el encuento, o se pierde la última frase.
Precios
Los tres modelos son de pago por uso, sin necesidad de suscripción. Cada uno tiene un precio por token, con una tarifa para la entrada de audio y otra para la salida de transcripción, y no hay un nivel de entrada en caché. ASR factura cada solicitud; ASR Stream y ASR Message facturan cada frase o enunciado completado. Los modelos en directo tienen tasas más altas que ASR, por lo que se usa ASR para grabaciones que no necesitan resultados mientras el hablante está hablando. Las tarifas actuales están en las páginas de modelos para Qwen Audio 3.1 ASR, Flujo ASR y Mensaje ASR, y en el página de precios.
Empieza a construir
Prueba Qwen Audio 3.1 ASR en el Playground subiendo una grabación, o Flujo ASR y Mensaje ASR haciendo clic en Iniciar sesión y hablando. La referencia de la API para cada modelo está en ASR, Flujo ASR y Mensaje ASR, y las tablas completas de eventos están en la API de voz en tiempo real guía.
Para conversaciones de voz de la misma familia, véase Cómo usar Qwen3.8 Omni Flash Realtime y Qwen Audio 3.1.
Divulgación: Este artículo fue escrito con asistencia AI y revisado por EmpirioLabs AI.



