Qwen Audio 3.1 ASR、Qwen Audio 3.1 ASR 流和 Qwen Audio 3.1 ASR 消息可在 EmpirioLabs 上收听。 ASR通过以下方式转录录制的音频 /v1/audio/transcriptions后.ASR流和ASR消息实时音频转录 WSS://api.empiriolabs.ai/v1/realtime.这三种都运行在 API 和 Playground 中。
三款车型
qwen-audio-3-1-asr转录短片段和长录音,并返回带有句段和单词时间戳的文字记录。语言自动检测,包括中文方言。qwen-audio-3-1-asr-stream是为实时字幕设计的。它在说话时把句子传到最远的地方,然后在每个停顿时传出既定句子。qwen-audio-3-1-asr-message为语音消息和语音输入而设计。当说话者暂停时,它会将每句话作为一个完整的转录返回,且没有部分结果。
转录录音
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H “授权:承载人 $EMPIRIOLABS_API_KEY” \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3
一个 JSON 主体,满足 audio_url 或 audio_base64 可以代替文件上传。回复是一份工作:
{ “job_id”: “3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10”, “status”: “processing 中”, “poll_url”: “/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10” }
轮询工作直到 现状 是 已完成编号:
curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -h “授权:承载人 $EMPIRIOLABS_API_KEY”
文字记录已发布 结果.文本,句子段为 结果。片段 以及单词时间戳 结果.words(结果词).短片段几秒钟内结束;长录音则耗时更长。
通过WebSocket进行实时转录
打开实时端点,模型包含查询字符串,API密钥在握手中:
wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream 授权:承载者YOUR_EMPIRIOLABS_API_KEY
以base64英寸格式流媒体传输16 kHz、16位单声道PCM音频 input_audio_buffer.append 事件。没有提交要发送:模型通过随后的暂停检测每个句子的结尾位置。
{“type”: “input_audio_buffer.append”, “audio”: “<base64 PCM>”}
会议记录以以下事件形式送达:
- 部分结果。
conversation.item.input_audio_transcription.delta到目前为止,句子已延伸至文本在说话者还在说话时。仅限ASR流。 - 结果已定。
conversation.item.input_audio_transcription.completed将已完成的句子或话语带入逐字稿.两个型号都是。
作战笔记
- 每个转录请求都会返回一个工作,甚至是短片段。 第一个响应带有
任务(d),不是逐字稿。读结果.文本来自快/v1/jobs/<job_id>曾经现状是已完成。 。 。. - 展示
文本从每个部分事件中取出,而不是加入三角洲价值观。 在ASR直播中,文本到目前为止,这句话总是整句话,所以每次事件都用它替换显示的行可以保持实时字幕的正确性。 - ASR消息在扬声器暂停前保持静音。 它不会发送部分结果,因此在有人说话时不会有事件出现。使用ASR流进行实时字幕。
- 在最后一句话后,进行一段默哀。 当模型听到说话者停止时,句子才会平静下来。在最后一个词后继续短暂发送音频,并等待
已完成在关闭插槽之前发生事件,否则最后一句话丢失。
定价
这三种型号均为按需付费,无需订阅。每种型号按令牌计费,音频输入和转录输出各有一次,且没有缓存输入层。ASR 按每个请求计费;ASR 流和 ASR 消息对每个完成的句子或话语计费。现场模型的费率高于 ASR,因此对于不需要在说话者说话时显示结果的录音,使用 ASR。当前速率可在模型页面上查阅 Qwen音频3.1 ASR, (中文), ASR流 以及 ASR消息,以及 定价页面。 。 。.
开始建造
试试看 Qwen音频3.1 ASR 通过上传录音,或Playground ASR流 以及 ASR消息 通过点击开始会话并说话。每个模型的 API 引用为 ASR, (中文), ASR流 以及 ASR消息,完整的事件表均为 实时语音API 向导。
同一家族的语音对话,请参见 如何使用Qwen3.8 Omni Flash Realtime和Qwen Audio 3.1。 。 。.
披露:这篇文章是在AI的协助下撰写的,并由EmpirioLabs AI审查.



