StepAudio 3 TTS API

涵盖六种语言的人类级语音合成,包含12个系统语音、自然语言传递方向和流媒体播放。

StepFun音频生成发布日期 2026年9月9日International专有端点

关于 StepAudio 3 TTS

涵盖六种语言的人类级语音合成,包含12个系统语音、自然语言传递方向和流媒体播放。

字符计数遵循StepFun定价:一个汉字算一个字符,两个英文字母算一个字符,两个标点符号算一个字符。

也称为 StepFun StepAudio 3 TTS

text to speechcontextual ttsvoice controlmultilingual

StepAudio 3 TTS 规格

模型 ID
stepaudio-3-tts
开发方
StepFun
类别
音频生成
发布日期
2026年9月9日
输入
文本
输出
音频
区域
International
端点
POST/v1/audio/speechPOST/v1/audio/speech:stream
备用模型 ID
stepfun/stepaudio-3-tts

StepAudio 3 TTS API 价格

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
合成
每10,000字符
$0.36
在完整价格页比较

如何调用 StepAudio 3 TTS API

StepAudio 3 TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID stepaudio-3-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
StepAudio 3 TTS API 完整参考

StepAudio 3 TTS API 参数

EmpirioLabs 上 StepAudio 3 TTS API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
inputstring-最大 1000文本用于合成。最多1000字符。括号内内容被视为传递方向,不言语。
voiceenumlively-girllively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v...官方 StepFun 语音。通过 API 也接受自定义克隆的语音 ID。
instructionstring-最大 500全文的全局情感或风格指导,用自然语言表达。最多500字符。
speednumber10.5 到 2说话速度。
volumenumber10.1 到 2输出音量。
languageenumenen, zh, ja, ko, fr, es目标语言。日语、韩语、法语和西班牙语目前为预览阶段。
response_formatenummp3mp3, wav, flac, opus, pcm输出音频格式。
sample_rateenum240008000, 16000, 22050, 24000输出采样率以Hz为单位。
markdown_filterbooleanfalse-在输入口述前,先去除Markdown语法。
pronunciation_mapstring--可选的发音覆盖,作为带有“written/spoken”规则声调数组的对象。

须知

最大输入为1000个字符。括号内的内容被视为传递方向,不为口语。使用指令进行全局情感或风格指导,最多500个字符。提供12种系统语音,并接受自定义克隆语音ID。识别语言包括中文、英语、日语、韩语、法语和西班牙语,预览中除了中文和英语外还有其他语言。输出格式包括mp3、wav、flac、opus和PCM,频率为8000、16000、22050或24000 Hz。Wav以完整文件形式返回,而非流式传输。该型号不支持voice_label。

StepAudio 3 TTS API:常见问题

StepAudio 3 TTS API 收费多少?

在 EmpirioLabs,StepAudio 3 TTS 按量计费:合成 $0.36 每10,000字符。本页的实时价格表始终与 API 的实际计费一致。

StepAudio 3 TTS 使用哪个端点?

StepAudio 3 TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。

集成之前可以在浏览器里试用 StepAudio 3 TTS 吗?

可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 StepAudio 3 TTS,你可以在写代码之前先测试提示词。

如何获取 StepAudio 3 TTS API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。