Qwen Audio 3.1 ASR Message API

Transcripción sintonizada para mensajes de voz y entrada de voz por un socket, devolviendo cada enunciado como una transcripción completa cuando el hablante hace una pausa.

Alibaba CloudTranscripciónLanzado 21 sept 2026SingaporeEndpoint propietarioNuevo

Acerca de Qwen Audio 3.1 ASR Message

Transcripción sintonizada para mensajes de voz y entrada de voz por un socket, devolviendo cada enunciado como una transcripción completa cuando el hablante hace una pausa.

Transmite audio pcm16 a 16 kHz por el enchufe. Cada enunciado se devuelve completo cuando el altavoz hace una pausa.

También conocido como Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message

transcriptionspeech to textrealtimemultilingual

Especificaciones de Qwen Audio 3.1 ASR Message

ID del modelo
qwen-audio-3-1-asr-message
Autor
Alibaba Cloud
Categoría
Transcripción
Lanzado
21 sept 2026
Entrada
Audio
Salida
Texto
Región
Singapore
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
qwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-message

Precios de la API de Qwen Audio 3.1 ASR Message

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Entrada
por 1M de tokens de entrada de audio
$1.86
Producto
por 1M de tokens generados
$1.40
Comparar en la página completa de precios

Cómo llamar a la API de Qwen Audio 3.1 ASR Message

Qwen Audio 3.1 ASR Message transcribe un flujo de audio en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, no a través de los endpoints HTTP. Conéctate con el id de modelo qwen-audio-3-1-asr-message y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. Añade audio PCM de 16 bits en base64 y lee los eventos de transcripción mientras la persona sigue hablando. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Referencia completa de la API de Qwen Audio 3.1 ASR Message

Parámetros de la API de Qwen Audio 3.1 ASR Message

Parámetros de solicitud compatibles con la API de Qwen Audio 3.1 ASR Message en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
input_audio_formatenumpcm16pcm16Codificación del audio que añades al búfer de entrada: PCM base64 de 16 bits, mono, a 16 kHz.

Información útil

Conectando Transcripción de mensajes de voz a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message, autenticada con el encabezado ordinario de Portador de Autorización. Enviando audio Transmisión de audio mono pcm16 a 16 kHz con input_audio_buffer.append. La detección de actividad de voz decide dónde termina cada enunciado, por lo que no hay compromiso que enviar. Lo que regresa Cada enunciado llega completo, como un solo evento conversation.item.input_audio_transcription.completed una vez que el altavoz se pausa. Este modelo no envía resultados parciales mientras el altavoz está hablando; para subtítulos en directo, use qwen-audio-3-1-asr-stream. Facturación Los tokens de entrada y salida se valoran por 1M, y cada enunciado completado se factura por sí solo según el uso que reporte el modelo.

API de Qwen Audio 3.1 ASR Message: preguntas frecuentes

¿Cuánto cuesta la API de Qwen Audio 3.1 ASR Message?

En EmpirioLabs, Qwen Audio 3.1 ASR Message se factura por uso: Entrada $1.86 por 1M de tokens de entrada de audio; Producto $1.40 por 1M de tokens generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa Qwen Audio 3.1 ASR Message?

Qwen Audio 3.1 ASR Message se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar Qwen Audio 3.1 ASR Message en el navegador antes de integrar?

Abre el playground de EmpirioLabs y pulsa Start session para probarlo en tu navegador. Qwen Audio 3.1 ASR Message funciona sobre un WebSocket en lugar de una petición y una respuesta, así que para integrarlo empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo qwen-audio-3-1-asr-message, y luego transmite audio en ambos sentidos.

¿Cómo consigo una clave de API de Qwen Audio 3.1 ASR Message?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.