Qwen Audio 3.1 ASR Message API

转录针对语音信息和语音输入进行调谐,当说话者暂停时,每句话都作为一个完整的转录返回。

Alibaba Cloud转录发布日期 2026年9月21日Singapore专有端点新

关于 Qwen Audio 3.1 ASR Message

转录针对语音信息和语音输入进行调谐,当说话者暂停时,每句话都作为一个完整的转录返回。

通过插座流式传输16 kHz的pcm16音频。当扬声器暂停时,每个话语都会完整返回。

也称为 Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message

transcriptionspeech to textrealtimemultilingual

Qwen Audio 3.1 ASR Message 规格

模型 ID
qwen-audio-3-1-asr-message
开发方
Alibaba Cloud
类别
转录
发布日期
2026年9月21日
输入
音频
输出
文本
区域
Singapore
端点
WEBSOCKET/v1/realtime
备用模型 ID
qwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-message

Qwen Audio 3.1 ASR Message API 价格

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
输入
每 1M 音频输入令牌
$1.86
产出
每100万个生成代币
$1.40
在完整价格页比较

如何调用 Qwen Audio 3.1 ASR Message API

Qwen Audio 3.1 ASR Message 通过 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message 的 WebSocket 转写实时音频流,而不是通过 HTTP 端点。使用模型 id qwen-audio-3-1-asr-message 连接,并在握手时将 EmpirioLabs API 密钥作为 Authorization: Bearer 请求头发送。追加 base64 编码的 16 位 PCM 音频,说话过程中即可读取转写事件。 浏览器无法为 WebSocket 设置请求头,请从你的服务器发起该连接,再通过你自己的 socket 把音频转发给浏览器。 在EmpirioLabs 控制台获取 API 密钥。

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Qwen Audio 3.1 ASR Message API 完整参考

Qwen Audio 3.1 ASR Message API 参数

EmpirioLabs 上 Qwen Audio 3.1 ASR Message API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
input_audio_formatenumpcm16pcm16你附加到输入缓冲区的音频编码:base64 16位PCM,单声道,16 kHz。

须知

连接 语音消息转录,通过wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message的WebSocket进行,并用普通授权承载者头进行认证。发送音频 流16 kHz单声道pcm16音频,带input_audio_buffer.append。语音活动检测决定每个话语的结束位置,因此无需提交。回应内容 每个话语作为一个conversation.item.input_audio_transcription.completed事件完整到达,一旦说话者暂停。该模型在说话时不会发送部分结果;对于实时字幕,请使用qwen-audio-3-1-asr-stream。计费 输入和输出令牌按1M计费,每个完成的话语根据模型报告的使用情况单独计费。

Qwen Audio 3.1 ASR Message API:常见问题

Qwen Audio 3.1 ASR Message API 收费多少?

在 EmpirioLabs,Qwen Audio 3.1 ASR Message 按量计费:输入 $1.86 每 1M 音频输入令牌; 产出 $1.40 每100万个生成代币。本页的实时价格表始终与 API 的实际计费一致。

Qwen Audio 3.1 ASR Message 使用哪个端点?

Qwen Audio 3.1 ASR Message 通过 api.empiriolabs.ai 上的 WEBSOCKET /v1/realtime 提供,使用标准的 Bearer 令牌认证。

集成之前可以在浏览器里试用 Qwen Audio 3.1 ASR Message 吗?

打开EmpirioLabs Playground并点击 Start session,即可在浏览器中试用。Qwen Audio 3.1 ASR Message 运行在 WebSocket 上,而不是一次请求一次响应,因此接入时请从实时语音快速入门开始。用 EmpirioLabs API 密钥和模型 id qwen-audio-3-1-asr-message 从你的服务器连接,然后双向流式传输音频。

如何获取 Qwen Audio 3.1 ASR Message API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。