首页 博客

如何使用 StepAudio 3 TTS API

StepAudio 3 通过 API 覆盖的 TTS

Sep 15, 2026

EmpirioLabs AI

简短回答: StepAudio 3 TTS 是 StepFun 的旗舰text-to-speech模型,通过标准的 OpenAI 风格语音终端在EmpirioLabs上提供。发送最多 1,000 个字符到 /v1/audio/speech后型号:“stepaudio-3-tts”,从十二个系统声部中选择一个,并用普通英语描述你想要的表达方式 教学。 。 。.

你的第一个请求

curl https://api.empiriolabs.ai/v1/audio/speech \ -h “授权:持有者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “型号”:“stepaudio-3-tts”, “输入”:“您的通话正在接通。感谢您的等待。”, “voice”:“活泼女孩” }'

响应带有签名的 URL 指向生成的音频。默认格式为 mp3,24,000 Hz。

选择声音

该型号自带十二个系统音色。七个音色沿用自 StepAudio 2.5,另外五个为新声: 阿尔菲, (中文), 伊桑, (中文), 马太, (中文), 青顺生, 和 天润女生。 。 。.

配音性格
活泼女孩聪明、充满活力的女性助手,产品攻略
充满活力的青春温暖的年轻男性有声书,视频配音
soft-spoken-gentleman冷静温和的男性长篇叙述
magnetic-voiced-male深沉、沉重的男性预告片,戏剧性读物
优雅温柔女性真诚、令人安心的女性支持热线与教育
活泼微风-雌性轻松且富有说服力市场营销,短视频
子新南生自信的男性有声书,培训

完整名单见 模型参考.在同一字段中接受自定义克隆的语音ID。

指导分娩

你不是预设情绪标签,而是写下你想要的内容,模型执行。 教学 它为整篇文章定下基调,最多可容纳500个字符。

{ “model”:“stepaudio-3-tts”,“input”:“我们在日志里发现了东西。”,“voice”:“magnetic-voiced-male”,“instruction”:“缓慢而有节奏,像拖车的声音。让停顿落地。” }

对于单个单词或短语,请在括号内标明方向 输入 反而。

语言

设定 语言en, (中文), ZH, (中文), 是的, (中文), Ko, (中文), FR,或者 es.日语、韩语、法语和西班牙语都在预览阶段。如果不加,模型就会显示英文。

输出格式

选择 mp3, (中文), WAV, (中文), FLAC, (中文), 作品,或者 PCMresponse_format,且集合 sample_rate 可达到8000、16000、22050或24000。

三件事让人措手不及

  1. 括号是方向,不是文字。 里面的任何东西 ()输入 被当作表达提示读出来,从未被说出来。如果你需要用括号旁白朗读,请重写,不要加括号。
  2. 该型号不支持48,000 Hz。 它出现在一些通用text-to-speech文档中,但StepAudio 3 TTS拒绝了。为了获得最高音质,建议保持在24,000 Hz。
  3. 教学 以及 voice_label 这些都不能互换。 StepAudio 3 转语音 教学 以及拒绝者 voice_label.TTS 2步则相反。在它们之间移植请求意味着交换那个字段。

定价与限制

计费按输入字符计费,按使用量付费,没有订阅费,也没有最低限额。一个汉字算一个字符,两个英文字母算一个字。实时收费率在 模型页面 页:1 定价页面.请求最多1000字符,所以把较长的脚本拆分成句子大小的通话,自己加入音频。

试试不写代码

打开 StepAudio 3 TTS 在playground 试音和操作说明,然后将设置复制到你的请求中。完整参数参考: docs.empiriolabs.ai/models/stepaudio-3-tts。 。 。.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。