Qwen Audio 3.1 Realtime Plus API

Conversación de voz dúplex sobre un solo socket, con 27 voces, búsqueda web nativa, llamadas a herramientas y tasas separadas de tokens de texto y audio.

Alibaba CloudGeneración de audio256K contextoLanzado 20 sept 2026SingaporeEndpoint propietarioNuevo

Acerca de Qwen Audio 3.1 Realtime Plus

Conversación de voz dúplex sobre un solo socket, con 27 voces, búsqueda web nativa, llamadas a herramientas y tasas separadas de tokens de texto y audio.

La sesión está configurada con los eventos session.update a través del socket en lugar de parámetros de solicitud. La búsqueda web está desactivada por defecto y no puede combinarse con la llamada a funciones. Los tokens de texto y audio facturan a tarifas separadas.

También conocido como Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus

realtimespeech to speechaudio inaudio outfunction callingweb searchmultilingual

Especificaciones de Qwen Audio 3.1 Realtime Plus

ID del modelo
qwen-audio-3-1-realtime-plus
Autor
Alibaba Cloud
Categoría
Generación de audio
Lanzado
20 sept 2026
Ventana de contexto
256K tokens
Salida máxima
16.384 tokens
Entrada
AudioTexto
Salida
AudioTexto
Región
Singapore
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
qwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plus

Precios de la API de Qwen Audio 3.1 Realtime Plus

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Entrada: audio
por 1M de tokens de entrada de audio
$12.80
Entrada
por 1M de tokens de prompt
$1.60
Producto
por 1M de tokens generados
$12.80
Salida: audio
por cada 1M de tokens de audio generados
$48.00
Búsqueda web
por llamada cuando se invoca
$0.00
Comparar en la página completa de precios

Cómo llamar a la API de Qwen Audio 3.1 Realtime Plus

Qwen Audio 3.1 Realtime Plus mantiene una conversación en vivo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, no a través de los endpoints HTTP. Conéctate con el id de modelo qwen-audio-3-1-realtime-plus y envía tu clave de API de EmpirioLabs como cabecera Authorization: Bearer en el handshake. El audio viaja en ambos sentidos como PCM de 16 bits en base64. Un navegador no puede establecer cabeceras en un WebSocket, así que abre esta conexión desde tu servidor y retransmite el audio al navegador por tu propio socket. Consigue una clave de API en el panel de EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Referencia completa de la API de Qwen Audio 3.1 Realtime Plus

Parámetros de la API de Qwen Audio 3.1 Realtime Plus

Parámetros de solicitud compatibles con la API de Qwen Audio 3.1 Realtime Plus en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
voiceenumlonganqian_v3.1longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf...Voz hablada durante la sesión. Configúralo con session.update antes de que el modelo produzca audio. Estas voces son específicas de este modelo.
instructionsstring--Guía del sistema sobre cómo debe comportarse y hablar el modelo durante la conversación.
enable_searchbooleanfalse-Busca información en tiempo real en la web. No puede usarse en la misma sesión que la llamada a una función. Los resultados de búsqueda se añaden a la conversación y...
modalitiesstring["text","audio"]-Qué tipos de salida devolve el modelo durante un turno. Corta el audio para una respuesta solo de texto.
input_audio_formatenumpcm16pcm16Codificación del audio que añades al búfer de entrada: PCM base64 de 16 bits a 16 kHz.
output_audio_formatenumpcm24pcm24Codificación del audio que el modelo transmite de vuelta: PCM de 16 bits a 24 kHz.
turn_detectionstring{"type":"server_vad"}-Detección de actividad de voz en el servidor. Decide cuándo has dejado de hablar y el modelo debe responder. Está activado por defecto en este modelo.

Información útil

Conectando Voz dúplex completo a través de un WebSocket en wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, autenticada con el encabezado ordinario de Portador de Autorización. Configura la sesión con session.update sobre el socket: voz, instrucciones, modalidades y detección de giros. Enviando audio - Añadir audio al micrófono como eventos input_audio_buffer.append. - La detección de actividad de voz decide cuándo has dejado de hablar, así que sigue transmitiendo durante aproximadamente un segundo después de que termine el habla. Voces Las voces de este modelo son un conjunto propio. Elige una de la lista de voces en lugar de llevar una voz frente a otro modelo, o déjala desactivada y se te proporciona la predeterminada. Búsqueda web La búsqueda web está desactivada por defecto. Actívala con enable_search. No puede activarse en la misma sesión que la llamada a función, y los resultados de búsqueda se añaden a la conversación y cuentan como tokens de entrada. Facturación Los tokens de audio y texto se valoran por separado en ambas direcciones, y cada giro completado se factura por sí solo según el uso que el modelo reporta.

API de Qwen Audio 3.1 Realtime Plus: preguntas frecuentes

¿Cuánto cuesta la API de Qwen Audio 3.1 Realtime Plus?

En EmpirioLabs, Qwen Audio 3.1 Realtime Plus se factura por uso: Entrada: audio $12.80 por 1M de tokens de entrada de audio; Entrada $1.60 por 1M de tokens de prompt; Producto $12.80 por 1M de tokens generados; Salida: audio $48.00 por cada 1M de tokens de audio generados; Búsqueda web $0.00 por llamada cuando se invoca. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Cuál es la ventana de contexto de Qwen Audio 3.1 Realtime Plus?

Qwen Audio 3.1 Realtime Plus admite una ventana de contexto de 256K tokens con hasta 16.384 tokens de salida por respuesta.

¿Qué endpoint usa Qwen Audio 3.1 Realtime Plus?

Qwen Audio 3.1 Realtime Plus se sirve a través de WEBSOCKET /v1/realtime en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar Qwen Audio 3.1 Realtime Plus en el navegador antes de integrar?

Abre el playground de EmpirioLabs y pulsa Start session para probarlo en tu navegador. Qwen Audio 3.1 Realtime Plus funciona sobre un WebSocket en lugar de una petición y una respuesta, así que para integrarlo empieza por la guía rápida de voz en tiempo real. Conéctate desde tu servidor con tu clave de API de EmpirioLabs y el id de modelo qwen-audio-3-1-realtime-plus, y luego transmite audio en ambos sentidos.

¿Cómo consigo una clave de API de Qwen Audio 3.1 Realtime Plus?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.