
转录针对语音信息和语音输入进行调谐,当说话者暂停时,每句话都作为一个完整的转录返回。
转录针对语音信息和语音输入进行调谐,当说话者暂停时,每句话都作为一个完整的转录返回。
通过插座流式传输16 kHz的pcm16音频。当扬声器暂停时,每个话语都会完整返回。
也称为 Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message
qwen-audio-3-1-asr-message/v1/realtimeqwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-message来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Qwen Audio 3.1 ASR Message 通过 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message 的 WebSocket 转写实时音频流,而不是通过 HTTP 端点。使用模型 id qwen-audio-3-1-asr-message 连接,并在握手时将 EmpirioLabs API 密钥作为 Authorization: Bearer 请求头发送。追加 base64 编码的 16 位 PCM 音频,说话过程中即可读取转写事件。 浏览器无法为 WebSocket 设置请求头,请从你的服务器发起该连接,再通过你自己的 socket 把音频转发给浏览器。 在EmpirioLabs 控制台获取 API 密钥。
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())EmpirioLabs 上 Qwen Audio 3.1 ASR Message API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | 你附加到输入缓冲区的音频编码:base64 16位PCM,单声道,16 kHz。 |
连接 语音消息转录,通过wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message的WebSocket进行,并用普通授权承载者头进行认证。发送音频 流16 kHz单声道pcm16音频,带input_audio_buffer.append。语音活动检测决定每个话语的结束位置,因此无需提交。回应内容 每个话语作为一个conversation.item.input_audio_transcription.completed事件完整到达,一旦说话者暂停。该模型在说话时不会发送部分结果;对于实时字幕,请使用qwen-audio-3-1-asr-stream。计费 输入和输出令牌按1M计费,每个完成的话语根据模型报告的使用情况单独计费。
在 EmpirioLabs,Qwen Audio 3.1 ASR Message 按量计费:输入 $1.86 每 1M 音频输入令牌; 产出 $1.40 每100万个生成代币。本页的实时价格表始终与 API 的实际计费一致。
Qwen Audio 3.1 ASR Message 通过 api.empiriolabs.ai 上的 WEBSOCKET /v1/realtime 提供,使用标准的 Bearer 令牌认证。
打开EmpirioLabs Playground并点击 Start session,即可在浏览器中试用。Qwen Audio 3.1 ASR Message 运行在 WebSocket 上,而不是一次请求一次响应,因此接入时请从实时语音快速入门开始。用 EmpirioLabs API 密钥和模型 id qwen-audio-3-1-asr-message 从你的服务器连接,然后双向流式传输音频。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。