
Conversa de fala duplex em um único socket, com 27 vozes, busca nativa na web, chamadas de ferramentas e taxas separadas de token de texto e áudio.
Conversa de fala duplex em um único socket, com 27 vozes, busca nativa na web, chamadas de ferramentas e taxas separadas de token de texto e áudio.
A sessão é configurada com eventos session.update pelo socket, em vez de parâmetros de requisição. A busca web está desativada por padrão e não pode ser combinada com chamadas de funções. Tokens de texto e áudio cobram em taxas separadas.
Também conhecido como Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus
qwen-audio-3-1-realtime-plus/v1/realtimeqwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plusTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Qwen Audio 3.1 Realtime Plus mantém uma conversa ao vivo por um WebSocket em wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, e não pelos endpoints HTTP. Conecte-se com o id de modelo qwen-audio-3-1-realtime-plus e envie sua chave de API da EmpirioLabs como cabeçalho Authorization: Bearer no handshake. O áudio trafega nos dois sentidos como PCM de 16 bits em base64. Um navegador não consegue definir cabeçalhos em um WebSocket, então abra esta conexão a partir do seu servidor e repasse o áudio ao navegador pelo seu próprio socket. Obtenha uma chave de API no painel EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())Parâmetros de requisição suportados pela API Qwen Audio 3.1 Realtime Plus na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| voice | enum | longanqian_v3.1 | longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf... | Voz falada para a sessão. Defina com session.update antes que o modelo produza qualquer áudio. Essas vozes são específicas para esse modelo. |
| instructions | string | - | - | Orientação do sistema sobre como o modelo deve se comportar e falar durante a conversa. |
| enable_search | boolean | false | - | Pesquise na web informações em tempo real. Não pode ser usado na mesma sessão que a chamada de funções. Os resultados da busca são adicionados à conversa e contam... |
| modalities | string | ["text","audio"] | - | Quais tipos de saída o modelo retorna por um turno. Corte o áudio para uma resposta apenas de texto. |
| input_audio_format | enum | pcm16 | pcm16 | Codificação do áudio que você adiciona ao buffer de entrada: PCM base64 de 16 bits a 16 kHz. |
| output_audio_format | enum | pcm24 | pcm24 | Codificação do áudio que o modelo transmite de volta: PCM de 16 bits a 24 kHz. |
| turn_detection | string | {"type":"server_vad"} | - | Detecção de atividade de voz no lado do servidor. Decide quando você parou de falar e o modelo deve responder. Está ativado por padrão nesse modelo. |
Conectando Voz full-duplex por WebSocket no wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus, autenticada com o cabeçalho comum Authorization Bearer. Configure a sessão com session.update pelo socket: voz, instruções, modalidades e detecção de turno. Enviando áudio - Adicione áudio do microfone como input_audio_buffer.append eventos. - A detecção de atividade de voz decide quando você parou de falar, então continue transmitindo por cerca de um segundo após o fim da fala. Vozes As vozes deste modelo são um conjunto próprio. Escolha uma da lista de vozes em vez de carregar uma voz de outro modelo, ou deixe-a desconfigurada e o padrão será fornecido para você. Busca na Web A busca na web está desativada por padrão. Ative-a com enable_search. Não pode ser ativada na mesma sessão que a chamada de função, e os resultados da busca são adicionados à conversa e contados como tokens de entrada. Faturamento Tokens de áudio e texto são precificados separadamente em ambas as direções, e cada turno concluído é faturado separadamente a partir do uso reportado pelo modelo.
Na EmpirioLabs, Qwen Audio 3.1 Realtime Plus é cobrado por uso: Entrada: áudio $12.80 por 1M de tokens de entrada de áudio; Entrada $1.60 por 1M de tokens de prompt; Saída $12.80 por 1M de tokens gerados; Saída: áudio $48.00 por 1M de tokens de áudio gerados; Pesquisa Web $0.00 por chamada quando invocada. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Qwen Audio 3.1 Realtime Plus suporta uma janela de contexto de 256K tokens com até 16.384 tokens de saída por resposta.
Qwen Audio 3.1 Realtime Plus é servido por WEBSOCKET /v1/realtime em api.empiriolabs.ai com autenticação padrão por token Bearer.
Abra o playground da EmpirioLabs e clique em Start session para testar no navegador. Qwen Audio 3.1 Realtime Plus funciona sobre um WebSocket em vez de requisição e resposta, então para integrar comece pelo guia rápido de voz em tempo real. Conecte-se do seu servidor com sua chave de API da EmpirioLabs e o id de modelo qwen-audio-3-1-realtime-plus e transmita áudio nos dois sentidos.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.