StepFun text-to-speech型号,配备官方配音、自定义克隆配音和语音标签控制。
字符计数遵循StepFun定价:一个汉字算一个字符,两个英文字母算一个字符,两个标点符号算一个字符。
也称为 StepFun Step TTS 2, Step-TTS-2
step-tts-2/v1/audio/speechstepfun/step-tts-2来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Step TTS 2 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID step-tts-2 一起发送。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "step-tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上 Step TTS 2 API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input | string | - | 最大 1000 | 文本要综合。最多1000字符。 |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | 输出音频格式。 |
| speed | number | 1 | 0.5 到 2 | 说话速度。 |
| volume | number | 1 | 0.1 到 2 | 输出音量。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | 输出采样率以Hz为单位。 |
| voice_label | object | - | - | 情绪和说话风格标签step-tts-2。 |
| pronunciation_map | object | - | - | 可选发音映射。 |
| markdown_filter | boolean | false | - | 在合成前过滤标记语法。 |
最大输入是1000个字符。支持官方语音ID、自定义克隆声音、voice_label情绪标签和voice_label风格标签。指令参数仅用于stepaudio-2.5-tts。
在 EmpirioLabs,Step TTS 2 按量计费:综述 $0.40 每10,000字符。本页的实时价格表始终与 API 的实际计费一致。
Step TTS 2 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Step TTS 2,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。