Qwen Audio 3.1 Realtime Plus API

通过一个插槽实现双工语音对话,支持27个语音,支持本地网页搜索、工具调用,以及独立的文本和音频令牌率。

Alibaba Cloud音频生成256K 上下文发布日期 2026年9月20日Singapore专有端点新

关于 Qwen Audio 3.1 Realtime Plus

通过一个插槽实现双工语音对话,支持27个语音,支持本地网页搜索、工具调用,以及独立的文本和音频令牌率。

会话通过套接字进行 session.update 事件配置,而非请求参数。网页搜索默认关闭,无法与函数调用结合使用。文本和音频令牌按不同费率计费。

也称为 Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus

realtimespeech to speechaudio inaudio outfunction callingweb searchmultilingual

Qwen Audio 3.1 Realtime Plus 规格

模型 ID
qwen-audio-3-1-realtime-plus
开发方
Alibaba Cloud
类别
音频生成
发布日期
2026年9月20日
上下文窗口
256K 个 token
最大输出
16,384 个 token
输入
音频文本
输出
音频文本
区域
Singapore
端点
WEBSOCKET/v1/realtime
备用模型 ID
qwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plus

Qwen Audio 3.1 Realtime Plus API 价格

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
输入:音频
每 1M 音频输入令牌
$12.80
输入
每100万个提示词标记
$1.60
产出
每100万个生成代币
$12.80
输出:音频
每1M生成的音频标记
$48.00
网络搜索
每次调用时
$0.00
在完整价格页比较

如何调用 Qwen Audio 3.1 Realtime Plus API

Qwen Audio 3.1 Realtime Plus 通过 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus 的 WebSocket 进行实时对话,而不是通过 HTTP 端点。使用模型 id qwen-audio-3-1-realtime-plus 连接,并在握手时将 EmpirioLabs API 密钥作为 Authorization: Bearer 请求头发送。音频以 base64 编码的 16 位 PCM 双向传输。 浏览器无法为 WebSocket 设置请求头,请从你的服务器发起该连接,再通过你自己的 socket 把音频转发给浏览器。 在EmpirioLabs 控制台获取 API 密钥。

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
Qwen Audio 3.1 Realtime Plus API 完整参考

Qwen Audio 3.1 Realtime Plus API 参数

EmpirioLabs 上 Qwen Audio 3.1 Realtime Plus API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
voiceenumlonganqian_v3.1longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf...会话的语音。在模型产生任何音频之前,先用 session.update 设置。这些语音是该模型特有的。
instructionsstring--系统指导模型在对话中应如何行为和表达。
enable_searchbooleanfalse-在网上搜索实时信息。不能与函数调用在同一会话中使用。搜索结果会被添加到对话中,并作为输入令牌计入。
modalitiesstring["text","audio"]-模型返回哪种输出类型,轮回一回合。去掉音频,只用文字回复。
input_audio_formatenumpcm16pcm16你附加到输入缓冲区的音频编码:base64 16位PCM,频率为16 kHz。
output_audio_formatenumpcm24pcm24该型号回流的音频编码:16位PCM,频率为24 kHz。
turn_detectionstring{"type":"server_vad"}-服务器端语音活动检测。它会判断你什么时候停止说话,模型应该会回复。这个型号默认开启了。

须知

连接 通过WebSocket进行全双工语音,wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus,并用普通授权承载者头进行认证。通过套接字配置session.update会话:语音、指令、模态和转向检测。发送音频- 在事件input_audio_buffer.append时添加麦克风音频。- 语音活动检测决定你是否停止说话,因此语音结束后继续流媒体约一秒。语音 该型号的语音是独立的一组。从语音列表中选择一个,而不是携带其他型号的语音,或者保持未设置,默认语音会为你提供。网页搜索 网络搜索默认关闭。用enable_search开启。不能在与函数调用同一会话中启用,搜索结果会被添加到对话中并计入输入令牌。计费 音频和文本代币在双向中分别定价,每个完成的回合根据模型报告的使用情况单独计费。

Qwen Audio 3.1 Realtime Plus API:常见问题

Qwen Audio 3.1 Realtime Plus API 收费多少?

在 EmpirioLabs,Qwen Audio 3.1 Realtime Plus 按量计费:输入:音频 $12.80 每 1M 音频输入令牌; 输入 $1.60 每100万个提示词标记; 产出 $12.80 每100万个生成代币; 输出:音频 $48.00 每1M生成的音频标记; 网络搜索 $0.00 每次调用时。本页的实时价格表始终与 API 的实际计费一致。

Qwen Audio 3.1 Realtime Plus 的上下文窗口有多大?

Qwen Audio 3.1 Realtime Plus 支持 256K token 的上下文窗口,每次响应最多 16,384 个输出 token。

Qwen Audio 3.1 Realtime Plus 使用哪个端点?

Qwen Audio 3.1 Realtime Plus 通过 api.empiriolabs.ai 上的 WEBSOCKET /v1/realtime 提供,使用标准的 Bearer 令牌认证。

集成之前可以在浏览器里试用 Qwen Audio 3.1 Realtime Plus 吗?

打开EmpirioLabs Playground并点击 Start session,即可在浏览器中试用。Qwen Audio 3.1 Realtime Plus 运行在 WebSocket 上,而不是一次请求一次响应,因此接入时请从实时语音快速入门开始。用 EmpirioLabs API 密钥和模型 id qwen-audio-3-1-realtime-plus 从你的服务器连接,然后双向流式传输音频。

如何获取 Qwen Audio 3.1 Realtime Plus API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。