首页 博客

如何使用 StepAudio 3 ASR Max API

StepAudio 3 ASR Max 通过 API 覆盖

Sep 15, 2026

EmpirioLabs AI

简短回答: StepAudio 3 ASR Max 是StepFun最大的语音识别模型,通过标准转录端点EmpirioLabs提供。发布音频文件至 /v1/audio/transcriptions后型号:“stepaudio-3-asr-max” 然后你会拿回转录。它能自动检测口语,所以没有语言可选。

你的第一个请求

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H “授权:承载者 $EMPIRIOLABS_API_KEY” \ -F “model=stepaudio-3-asr-max” \ -F “file=@meeting.mp3”

你也可以用 file_url 指向一个公开可访问的文件,或者 base64 音频 audio_base64。 。 。.

它的用途

这是StepFun识别家族中的准确度层。它建立在大型语言模型上,因此通过上下文而非单纯的声音来解决普通转写错误的部分:

  • 人名和地名、药名、专业术语和同音异义词
  • 涵盖法律、金融、医疗、汽车和软件等领域的专业词汇
  • 带口音的说话、低声说话、非常快的说话和混合语言句子
  • 背景音乐下的歌唱与演讲

如果你是在大声转录普通干净的语音, StepAudio 2.5 ASR 是同一系列中更便宜的选择,并且共享该端点。

输入格式

发送 WAV, (中文), mp3, (中文), 奥格, (中文), M4A,或者 PCM.原始PCM需求 编解码器, (中文), 费率, (中文), 比特, 和 频道 同时;容器格式本身也包含这些信息。

号码格式

反向文本归一化默认开启,所以口述的数字、日期和货币会以人手打字的方式显示出来。关闭它时 enable_itn:错误 而是直接听到字面上的文字。

enable_itn文字记录
确实如此 (默认)去年所有地区的收入增长了12%。
错误去年所有地区的收入增长了12%。

三件事让人措手不及

  1. 没有语言设置。 ASR Max 识别语言本身并用它转录。无论你通过什么,日语音频都会返回日语,所以不要在这个模型上构建语言选择器。中文、英语、日语、韩语、法语和西班牙语都被识别,除中文和英语外的所有内容都是预览版。
  2. 这里没有热词和单词时间戳。 这两种版本都存在于StepAudio 2.5 ASR中。如果你需要自定义词汇表或按词计时,就用那个模型吧。
  3. 接受长文件,并按实际长度计费。 充电时间遵循你发送音频的测量时长,至少一秒钟,因此删减录音前后无声是值得的。

定价

按音频小时计费,按使用量付费,没有订阅费,也没有最低承诺。直播费率在 模型页面 页:1 定价页面。 。 。.

试试不写代码

把文件放进去 StepAudio 3 ASR Max 在playground 然后直接阅读文字记录。完整参数参考: docs.empiriolabs.ai/models/stepaudio-3-asr-max。 。 。.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。