
通过一个插槽实现双工语音对话,支持27个语音,支持本地网页搜索、工具调用,以及独立的文本和音频令牌率。
通过一个插槽实现双工语音对话,支持27个语音,支持本地网页搜索、工具调用,以及独立的文本和音频令牌率。
会话通过套接字进行 session.update 事件配置,而非请求参数。网页搜索默认关闭,无法与函数调用结合使用。文本和音频令牌按不同费率计费。
也称为 Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus
qwen-audio-3-1-realtime-plus/v1/realtimeqwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plus来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Qwen Audio 3.1 Realtime Plus 通过 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus 的 WebSocket 进行实时对话,而不是通过 HTTP 端点。使用模型 id qwen-audio-3-1-realtime-plus 连接,并在握手时将 EmpirioLabs API 密钥作为 Authorization: Bearer 请求头发送。音频以 base64 编码的 16 位 PCM 双向传输。 浏览器无法为 WebSocket 设置请求头,请从你的服务器发起该连接,再通过你自己的 socket 把音频转发给浏览器。 在EmpirioLabs 控制台获取 API 密钥。
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())EmpirioLabs 上 Qwen Audio 3.1 Realtime Plus API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| voice | enum | longanqian_v3.1 | longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf... | 会话的语音。在模型产生任何音频之前,先用 session.update 设置。这些语音是该模型特有的。 |
| instructions | string | - | - | 系统指导模型在对话中应如何行为和表达。 |
| enable_search | boolean | false | - | 在网上搜索实时信息。不能与函数调用在同一会话中使用。搜索结果会被添加到对话中,并作为输入令牌计入。 |
| modalities | string | ["text","audio"] | - | 模型返回哪种输出类型,轮回一回合。去掉音频,只用文字回复。 |
| input_audio_format | enum | pcm16 | pcm16 | 你附加到输入缓冲区的音频编码:base64 16位PCM,频率为16 kHz。 |
| output_audio_format | enum | pcm24 | pcm24 | 该型号回流的音频编码:16位PCM,频率为24 kHz。 |
| turn_detection | string | {"type":"server_vad"} | - | 服务器端语音活动检测。它会判断你什么时候停止说话,模型应该会回复。这个型号默认开启了。 |
连接 通过WebSocket进行全双工语音,wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus,并用普通授权承载者头进行认证。通过套接字配置session.update会话:语音、指令、模态和转向检测。发送音频- 在事件input_audio_buffer.append时添加麦克风音频。- 语音活动检测决定你是否停止说话,因此语音结束后继续流媒体约一秒。语音 该型号的语音是独立的一组。从语音列表中选择一个,而不是携带其他型号的语音,或者保持未设置,默认语音会为你提供。网页搜索 网络搜索默认关闭。用enable_search开启。不能在与函数调用同一会话中启用,搜索结果会被添加到对话中并计入输入令牌。计费 音频和文本代币在双向中分别定价,每个完成的回合根据模型报告的使用情况单独计费。
在 EmpirioLabs,Qwen Audio 3.1 Realtime Plus 按量计费:输入:音频 $12.80 每 1M 音频输入令牌; 输入 $1.60 每100万个提示词标记; 产出 $12.80 每100万个生成代币; 输出:音频 $48.00 每1M生成的音频标记; 网络搜索 $0.00 每次调用时。本页的实时价格表始终与 API 的实际计费一致。
Qwen Audio 3.1 Realtime Plus 支持 256K token 的上下文窗口,每次响应最多 16,384 个输出 token。
Qwen Audio 3.1 Realtime Plus 通过 api.empiriolabs.ai 上的 WEBSOCKET /v1/realtime 提供,使用标准的 Bearer 令牌认证。
打开EmpirioLabs Playground并点击 Start session,即可在浏览器中试用。Qwen Audio 3.1 Realtime Plus 运行在 WebSocket 上,而不是一次请求一次响应,因此接入时请从实时语音快速入门开始。用 EmpirioLabs API 密钥和模型 id qwen-audio-3-1-realtime-plus 从你的服务器连接,然后双向流式传输音频。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。