Qwen Audio 3.1 ASR Stream API

Transcripción en directo por un socket, transmitiendo palabras parciales mientras el hablante habla y una frase establecida en cada pausa, con precio por token.

Alibaba CloudTranscripciónSingaporeEndpoint propietarioNuevo

Acerca de Qwen Audio 3.1 ASR Stream

Transcripción en directo por un socket, transmitiendo palabras parciales mientras el hablante habla y una frase establecida en cada pausa, con precio por token.

Transmite audio pcm16 a 16 kHz por el enchufe. Los resultados parciales llegan mientras el altavoz está hablando.

También conocido como Qwen Audio ASR Stream, Alibaba Cloud Qwen Audio 3.1 ASR Stream

transcriptionspeech to textrealtimestreaming asrmultilingual

Especificaciones de Qwen Audio 3.1 ASR Stream

ID del modelo
qwen-audio-3-1-asr-stream
Autor
Alibaba Cloud
Categoría
Transcripción
Lanzado
-
Entrada
Audio
Salida
Texto
Región
Singapore
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
qwen-audio-3.1-asr-streamalibaba/qwen-audio-3-1-asr-stream

Precios de la API de Qwen Audio 3.1 ASR Stream

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Entrada
por 1M de tokens de entrada de audio
$1.86
Producto
por 1M de tokens generados
$1.40
Comparar en la página completa de precios

Cómo llamar a la API de Qwen Audio 3.1 ASR Stream

Qwen Audio 3.1 ASR Stream transcribe un flujo de audio en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, no a través de los endpoints HTTP. Conéctate con el id de modelo qwen-audio-3-1-asr-stream y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. Añade audio PCM de 16 bits en base64 y lee los eventos de transcripción mientras la persona sigue hablando. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Referencia completa de la API de Qwen Audio 3.1 ASR Stream

Parámetros de la API de Qwen Audio 3.1 ASR Stream

Parámetros de solicitud compatibles con la API de Qwen Audio 3.1 ASR Stream en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
input_audio_formatenumpcm16pcm16Codificación del audio que añades al búfer de entrada: PCM base64 de 16 bits, mono, a 16 kHz.

Información útil

Conectando Transcripción en directo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream, autenticada con el encabezado ordinario de Portador de Autorización. Enviando audio Transmisión de audio mono pcm16 a 16 kHz con input_audio_buffer.append. La detección de actividad de voz decide dónde termina cada frase, por lo que no hay compromiso que enviar. Lo que regresa conversation.item.input_audio_transcription.delta eventos transporta la frase hasta ahora mientras el hablante sigue hablando, y conversation.item.input_audio_transcription.completed lleva la frase establecida en cada pausa. Facturación Los tokens de entrada y salida se valoran por 1M, y cada oración completada se factura por sí sola a partir del uso que reporta el modelo.

API de Qwen Audio 3.1 ASR Stream: preguntas frecuentes

¿Cuánto cuesta la API de Qwen Audio 3.1 ASR Stream?

En EmpirioLabs, Qwen Audio 3.1 ASR Stream se factura por uso: Entrada $1.86 por 1M de tokens de entrada de audio; Producto $1.40 por 1M de tokens generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa Qwen Audio 3.1 ASR Stream?

Qwen Audio 3.1 ASR Stream se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar Qwen Audio 3.1 ASR Stream en el navegador antes de integrar?

Abre el playground de EmpirioLabs y pulsa Start session para probarlo en tu navegador. Qwen Audio 3.1 ASR Stream funciona sobre un WebSocket en lugar de una petición y una respuesta, así que para integrarlo empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo qwen-audio-3-1-asr-stream, y luego transmite audio en ambos sentidos.

¿Cómo consigo una clave de API de Qwen Audio 3.1 ASR Stream?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.