简短回答: StepAudio 3 ASR Max 是StepFun最大的语音识别模型,通过标准转录端点EmpirioLabs提供。发布音频文件至 /v1/audio/transcriptions后 与 型号:“stepaudio-3-asr-max” 然后你会拿回转录。它能自动检测口语,所以没有语言可选。
你的第一个请求
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H “授权:承载者 $EMPIRIOLABS_API_KEY” \ -F “model=stepaudio-3-asr-max” \ -F “file=@meeting.mp3”
你也可以用 file_url 指向一个公开可访问的文件,或者 base64 音频 audio_base64。 。 。.
它的用途
这是StepFun识别家族中的准确度层。它建立在大型语言模型上,因此通过上下文而非单纯的声音来解决普通转写错误的部分:
- 人名和地名、药名、专业术语和同音异义词
- 涵盖法律、金融、医疗、汽车和软件等领域的专业词汇
- 带口音的说话、低声说话、非常快的说话和混合语言句子
- 背景音乐下的歌唱与演讲
如果你是在大声转录普通干净的语音, StepAudio 2.5 ASR 是同一系列中更便宜的选择,并且共享该端点。
输入格式
发送 WAV, (中文), mp3, (中文), 奥格, (中文), M4A,或者 PCM.原始PCM需求 编解码器, (中文), 费率, (中文), 比特, 和 频道 同时;容器格式本身也包含这些信息。
号码格式
反向文本归一化默认开启,所以口述的数字、日期和货币会以人手打字的方式显示出来。关闭它时 enable_itn:错误 而是直接听到字面上的文字。
enable_itn | 文字记录 |
|---|---|
确实如此 (默认) | 去年所有地区的收入增长了12%。 |
错误 | 去年所有地区的收入增长了12%。 |
三件事让人措手不及
- 没有语言设置。 ASR Max 识别语言本身并用它转录。无论你通过什么,日语音频都会返回日语,所以不要在这个模型上构建语言选择器。中文、英语、日语、韩语、法语和西班牙语都被识别,除中文和英语外的所有内容都是预览版。
- 这里没有热词和单词时间戳。 这两种版本都存在于StepAudio 2.5 ASR中。如果你需要自定义词汇表或按词计时,就用那个模型吧。
- 接受长文件,并按实际长度计费。 充电时间遵循你发送音频的测量时长,至少一秒钟,因此删减录音前后无声是值得的。
定价
按音频小时计费,按使用量付费,没有订阅费,也没有最低承诺。直播费率在 模型页面 页:1 定价页面。 。 。.
试试不写代码
把文件放进去 StepAudio 3 ASR Max 在playground 然后直接阅读文字记录。完整参数参考: docs.empiriolabs.ai/models/stepaudio-3-asr-max。 。 。.



