Qwen Audio 3.1 Realtime Plus API

Conversa de fala duplex em um único socket, com 27 vozes, busca nativa na web, chamadas de ferramentas e taxas separadas de token de texto e áudio.

Alibaba CloudGeração de Áudio256K contextoLançado 20 de set. de 2026SingaporeEndpoint proprietárioNovo

Sobre Qwen Audio 3.1 Realtime Plus

Conversa de fala duplex em um único socket, com 27 vozes, busca nativa na web, chamadas de ferramentas e taxas separadas de token de texto e áudio.

A sessão é configurada com eventos session.update pelo socket, em vez de parâmetros de requisição. A busca web está desativada por padrão e não pode ser combinada com chamadas de funções. Tokens de texto e áudio cobram em taxas separadas.

Também conhecido como Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus

realtimespeech to speechaudio inaudio outfunction callingweb searchmultilingual

Especificações de Qwen Audio 3.1 Realtime Plus

ID do modelo
qwen-audio-3-1-realtime-plus
Autor
Alibaba Cloud
Categoria
Geração de Áudio
Lançado
20 de set. de 2026
Janela de contexto
256K tokens
Saída máxima
16.384 tokens
Entrada
ÁudioTexto
Saída
ÁudioTexto
Região
Singapore
Endpoints
WEBSOCKET/v1/realtime
IDs de modelo alternativos
qwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plus

Preços da API Qwen Audio 3.1 Realtime Plus

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Entrada: áudio
por 1M de tokens de entrada de áudio
$12.80
Entrada
por 1M de tokens de prompt
$1.60
Saída
por 1M de tokens gerados
$12.80
Saída: áudio
por 1M de tokens de áudio gerados
$48.00
Pesquisa Web
por chamada quando invocada
$0.00
Comparar na página completa de preços

Como chamar a API Qwen Audio 3.1 Realtime Plus

Qwen Audio 3.1 Realtime Plus mantém uma conversa ao vivo por um WebSocket em wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, e não pelos endpoints HTTP. Conecte-se com o id de modelo qwen-audio-3-1-realtime-plus e envie sua chave de API da EmpirioLabs como cabeçalho Authorization: Bearer no handshake. O áudio trafega nos dois sentidos como PCM de 16 bits em base64. Um navegador não consegue definir cabeçalhos em um WebSocket, então abra esta conexão a partir do seu servidor e repasse o áudio ao navegador pelo seu próprio socket. Obtenha uma chave de API no painel EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Referência completa da API Qwen Audio 3.1 Realtime Plus

Parâmetros da API Qwen Audio 3.1 Realtime Plus

Parâmetros de requisição suportados pela API Qwen Audio 3.1 Realtime Plus na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
voiceenumlonganqian_v3.1longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf...Voz falada para a sessão. Defina com session.update antes que o modelo produza qualquer áudio. Essas vozes são específicas para esse modelo.
instructionsstring--Orientação do sistema sobre como o modelo deve se comportar e falar durante a conversa.
enable_searchbooleanfalse-Pesquise na web informações em tempo real. Não pode ser usado na mesma sessão que a chamada de funções. Os resultados da busca são adicionados à conversa e contam...
modalitiesstring["text","audio"]-Quais tipos de saída o modelo retorna por um turno. Corte o áudio para uma resposta apenas de texto.
input_audio_formatenumpcm16pcm16Codificação do áudio que você adiciona ao buffer de entrada: PCM base64 de 16 bits a 16 kHz.
output_audio_formatenumpcm24pcm24Codificação do áudio que o modelo transmite de volta: PCM de 16 bits a 24 kHz.
turn_detectionstring{"type":"server_vad"}-Detecção de atividade de voz no lado do servidor. Decide quando você parou de falar e o modelo deve responder. Está ativado por padrão nesse modelo.

Bom saber

Conectando Voz full-duplex por WebSocket no wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, autenticada com o cabeçalho comum Authorization Bearer. Configure a sessão com session.update pelo socket: voz, instruções, modalidades e detecção de turno. Enviando áudio - Adicione áudio do microfone como input_audio_buffer.append eventos. - A detecção de atividade de voz decide quando você parou de falar, então continue transmitindo por cerca de um segundo após o fim da fala. Vozes As vozes deste modelo são um conjunto próprio. Escolha uma da lista de vozes em vez de carregar uma voz de outro modelo, ou deixe-a desconfigurada e o padrão será fornecido para você. Busca na Web A busca na web está desativada por padrão. Ative-a com enable_search. Não pode ser ativada na mesma sessão que a chamada de função, e os resultados da busca são adicionados à conversa e contados como tokens de entrada. Faturamento Tokens de áudio e texto são precificados separadamente em ambas as direções, e cada turno concluído é faturado separadamente a partir do uso reportado pelo modelo.

API Qwen Audio 3.1 Realtime Plus: perguntas frequentes

Quanto custa a API Qwen Audio 3.1 Realtime Plus?

Na EmpirioLabs, Qwen Audio 3.1 Realtime Plus é cobrado por uso: Entrada: áudio $12.80 por 1M de tokens de entrada de áudio; Entrada $1.60 por 1M de tokens de prompt; Saída $12.80 por 1M de tokens gerados; Saída: áudio $48.00 por 1M de tokens de áudio gerados; Pesquisa Web $0.00 por chamada quando invocada. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual é a janela de contexto de Qwen Audio 3.1 Realtime Plus?

Qwen Audio 3.1 Realtime Plus suporta uma janela de contexto de 256K tokens com até 16.384 tokens de saída por resposta.

Qual endpoint Qwen Audio 3.1 Realtime Plus usa?

Qwen Audio 3.1 Realtime Plus é servido por WEBSOCKET /v1/realtime em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar Qwen Audio 3.1 Realtime Plus no navegador antes de integrar?

Abra o playground da EmpirioLabs e clique em Start session para testar no navegador. Qwen Audio 3.1 Realtime Plus funciona sobre um WebSocket em vez de requisição e resposta, então para integrar comece pelo guia rápido de voz em tempo real. Conecte-se do seu servidor com sua chave de API da EmpirioLabs e o id de modelo qwen-audio-3-1-realtime-plus e transmita áudio nos dois sentidos.

Como consigo uma chave de API Qwen Audio 3.1 Realtime Plus?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.