简短回答: StepAudio 3 TTS 是 StepFun 的旗舰text-to-speech模型,通过标准的 OpenAI 风格语音终端在EmpirioLabs上提供。发送最多 1,000 个字符到 /v1/audio/speech后 与 型号:“stepaudio-3-tts”,从十二个系统声部中选择一个,并用普通英语描述你想要的表达方式 教学。 。 。.
你的第一个请求
curl https://api.empiriolabs.ai/v1/audio/speech \ -h “授权:持有者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “型号”:“stepaudio-3-tts”, “输入”:“您的通话正在接通。感谢您的等待。”, “voice”:“活泼女孩” }'
响应带有签名的 URL 指向生成的音频。默认格式为 mp3,24,000 Hz。
选择声音
该型号自带十二个系统音色。七个音色沿用自 StepAudio 2.5,另外五个为新声: 阿尔菲, (中文), 伊桑, (中文), 马太, (中文), 青顺生, 和 天润女生。 。 。.
| 配音 | 性格 | 好 |
|---|---|---|
活泼女孩 | 聪明、充满活力的女性 | 助手,产品攻略 |
充满活力的青春 | 温暖的年轻男性 | 有声书,视频配音 |
soft-spoken-gentleman | 冷静温和的男性 | 长篇叙述 |
magnetic-voiced-male | 深沉、沉重的男性 | 预告片,戏剧性读物 |
优雅温柔女性 | 真诚、令人安心的女性 | 支持热线与教育 |
活泼微风-雌性 | 轻松且富有说服力 | 市场营销,短视频 |
子新南生 | 自信的男性 | 有声书,培训 |
完整名单见 模型参考.在同一字段中接受自定义克隆的语音ID。
指导分娩
你不是预设情绪标签,而是写下你想要的内容,模型执行。 教学 它为整篇文章定下基调,最多可容纳500个字符。
{ “model”:“stepaudio-3-tts”,“input”:“我们在日志里发现了东西。”,“voice”:“magnetic-voiced-male”,“instruction”:“缓慢而有节奏,像拖车的声音。让停顿落地。” }
对于单个单词或短语,请在括号内标明方向 输入 反而。
语言
设定 语言 到 en, (中文), ZH, (中文), 是的, (中文), Ko, (中文), FR,或者 es.日语、韩语、法语和西班牙语都在预览阶段。如果不加,模型就会显示英文。
输出格式
选择 mp3, (中文), WAV, (中文), FLAC, (中文), 作品,或者 PCM 与 response_format,且集合 sample_rate 可达到8000、16000、22050或24000。
三件事让人措手不及
- 括号是方向,不是文字。 里面的任何东西
()在输入被当作表达提示读出来,从未被说出来。如果你需要用括号旁白朗读,请重写,不要加括号。 - 该型号不支持48,000 Hz。 它出现在一些通用text-to-speech文档中,但StepAudio 3 TTS拒绝了。为了获得最高音质,建议保持在24,000 Hz。
教学以及voice_label这些都不能互换。 StepAudio 3 转语音教学以及拒绝者voice_label.TTS 2步则相反。在它们之间移植请求意味着交换那个字段。
定价与限制
计费按输入字符计费,按使用量付费,没有订阅费,也没有最低限额。一个汉字算一个字符,两个英文字母算一个字。实时收费率在 模型页面 页:1 定价页面.请求最多1000字符,所以把较长的脚本拆分成句子大小的通话,自己加入音频。
试试不写代码
打开 StepAudio 3 TTS 在playground 试音和操作说明,然后将设置复制到你的请求中。完整参数参考: docs.empiriolabs.ai/models/stepaudio-3-tts。 。 。.



