Inicio Blog

Cómo usar Qwen Audio 3.1 ASR, flujo ASR y mensajes ASR

Qwen Audio 3.1 ASR, flujo ASR y mensaje ASR vía API

Sep 24, 2026

EmpirioLabs AI

Qwen Audio 3.1 ASR, Qwen Audio 3.1 ASR Stream y Qwen Audio 3.1 ASR Message están disponibles en EmpirioLabs. ASR transcribe el audio grabado a través de DESPUÉS /v1/audio/transcriptions. Transmisión ASR y mensajes ASR transcriben audio en directo sobre wss://api.empiriolabs.ai/v1/realtime. Los tres funcionan en la API y en la Playground.

Los tres modelos

  • qwen-audio-3-1-asr transcribe clips cortos y grabaciones largas, y devuelve la transcripción con fragmentos de frases y marcas de tiempo de palabras. El idioma se detecta automáticamente, incluidos los dialectos chinos.
  • qwen-audio-3-1-asr-stream está diseñado para subtítulos en directo. Envía la frase tan lejos mientras el hablante habla, y luego la frase establecida en cada pausa.
  • qwen-audio-3-1-asr-message está diseñado para mensajes de voz y entrada de voz. Devuelve cada enunciado como una transcripción completa una vez que el hablante hace una pausa, sin resultados parciales.

Transcripción de una grabación

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3

Un cuerpo JSON con audio_url o audio_base64 funciona en lugar de la subida del archivo. La respuesta es un trabajo:

{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "estado": "procesamiento", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }

Encuesta el trabajo hasta que Estado es terminado:

curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY"

La transcripción está en result.text, con segmentos de oración en result.segments y marcas de tiempo de palabras en resulta.palabras. Los clips cortos terminan en segundos; las grabaciones largas tardan más.

Transcripción en directo a través de un WebSocket

Abre el endpoint en tiempo real con el modelo en la cadena de consulta y tu clave API en el handshake:

wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream Autorización: Portador YOUR_EMPIRIOLABS_API_KEY

Transmisión de audio PCM mono de 16 bits de 16 bits como base64 in input_audio_buffer.append eventos. No hay compromiso para enviar: el modelo detecta dónde termina cada frase a partir de la pausa que la sigue.

{"tipo": "input_audio_buffer.append", "audio": "<base64 PCM>"}

Las transcripciones llegan como eventos:

  • Resultados parciales. conversation.item.input_audio_transcription.delta lleva la sentencia hasta aquí en Texto mientras el altavoz sigue hablando. Solo transmisión ASR.
  • Resultados resueltos. conversation.item.input_audio_transcription.completed lleva la oración o enunciado final en Transcripción. Ambos modelos.

Notas operativas

  1. Cada solicitud de transcripción devuelve un trabajo, incluso un clip corto. La primera respuesta lleva un job id, no la transcripción. Lee result.text de ¡QUE /v1/jobs/<job_id> una vez Estado es terminado.
  2. Pantalla Texto de cada evento parcial en lugar de unirse Delta valores. En ASR Stream, Texto Siempre es la frase completa hasta ahora, así que reemplazar la línea mostrada por ella en cada evento mantiene los subtítulos en vivo correctos.
  3. El mensaje ASR permanece en silencio hasta que el altavoz se detiene. No da resultados parciales, así que no llegan eventos mientras alguien está hablando. Usa ASR Stream para subtítulos en directo.
  4. Emite un momento de silencio tras las últimas palabras. Una frase se asienta cuando el modelo oye al altavoz detenerse. Sigue enviando audio brevemente después de las últimas palabras y espera a que el terminado antes de cerrar el encuento, o se pierde la última frase.

Precios

Los tres modelos son de pago por uso, sin necesidad de suscripción. Cada uno tiene un precio por token, con una tarifa para la entrada de audio y otra para la salida de transcripción, y no hay un nivel de entrada en caché. ASR factura cada solicitud; ASR Stream y ASR Message facturan cada frase o enunciado completado. Los modelos en directo tienen tasas más altas que ASR, por lo que se usa ASR para grabaciones que no necesitan resultados mientras el hablante está hablando. Las tarifas actuales están en las páginas de modelos para Qwen Audio 3.1 ASR, Flujo ASR y Mensaje ASR, y en el página de precios.

Empieza a construir

Prueba Qwen Audio 3.1 ASR en el Playground subiendo una grabación, o Flujo ASR y Mensaje ASR haciendo clic en Iniciar sesión y hablando. La referencia de la API para cada modelo está en ASR, Flujo ASR y Mensaje ASR, y las tablas completas de eventos están en la API de voz en tiempo real guía.

Para conversaciones de voz de la misma familia, véase Cómo usar Qwen3.8 Omni Flash Realtime y Qwen Audio 3.1.

Divulgación: Este artículo fue escrito con asistencia AI y revisado por EmpirioLabs AI.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.