StepAudio 3 Gen API

将对话、音效、环境音和背景音乐合成在一个书面场景的片段中。

StepFun音频生成发布日期 2026年9月9日International专有端点新

关于 StepAudio 3 Gen

将对话、音效、环境音和背景音乐合成在一个书面场景的片段中。

字符计数遵循StepFun定价:一个汉字算一个字符,两个英文字母算一个字符,两个标点符号算一个字符。

也称为 StepFun StepAudio 3 Gen

audio generationtext to speechsound effectsvoice control

StepAudio 3 Gen 规格

模型 ID
stepaudio-3-gen
开发方
StepFun
类别
音频生成
发布日期
2026年9月9日
输入
文本
输出
音频
区域
International
端点
POST/v1/audio/generations
备用模型 ID
stepaudio-3-gen-previewstepfun/stepaudio-3-gen

StepAudio 3 Gen API 价格

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
生成
每10,000字符
$0.36
在完整价格页比较

如何调用 StepAudio 3 Gen API

StepAudio 3 Gen 通过 POST /v1/audio/generations 运行。请求会立即返回 job_id;轮询 GET /v1/jobs/{job_id} 直到任务完成,再从结果中读取输出 URL。 在EmpirioLabs 控制台获取 API 密钥。

cURL:提交任务
curl https://api.empiriolabs.ai/v1/audio/generations \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-gen",
    "prompt": "Describe what you want StepAudio 3 Gen to generate."
  }'
cURL:轮询结果
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/generations",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-gen",
        "prompt": "Describe what you want StepAudio 3 Gen to generate.",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
StepAudio 3 Gen API 完整参考

StepAudio 3 Gen API 参数

EmpirioLabs 上 StepAudio 3 Gen API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
promptstring--要生成的场景。用方括号包裹音效或音乐提示,括号内标注表达方向。
instructionstring-最大 500全局指导,涵盖背景音乐和情感基调。最多500字符。
rolesstring--可选的扬声器,作为带有姓名和语音描述的对象。所有姓名和描述加起来最多500字符。
scriptsstring--可选的有序行,作为带有说话者和文本的对象。总字符上限为1000个字符。多说话场景请使用此代替提示。
response_formatenummp3mp3, wav, flac, opus, pcm输出音频格式。
sample_rateenum240008000, 16000, 22050, 24000, 48000输出采样率以Hz为单位。
speednumber10.5 到 2说话速度。
volumenumber10.1 到 2输出音量。
text_normalizationenumstandardstandard, enhanced数字、日期和符号的朗读方式。

须知

描述一个场景,模型将其作为一个完成的片段进行:语音台词、音效、环境音和背景音乐共同进行。发送提示,或使用角色和脚本实现多扬声器控制。用方括号包裹音效或音乐提示,括号内标明传达方向。角色和指令各限制为500个字符,脚本上限为1000个。输出格式包括mp3、wav、flac、opus和PCM。该型号不支持参考语音和语音克隆。该模型处于预览阶段,其功能可能会有所变化。

StepAudio 3 Gen API:常见问题

StepAudio 3 Gen API 收费多少?

在 EmpirioLabs,StepAudio 3 Gen 按量计费:生成 $0.36 每10,000字符。本页的实时价格表始终与 API 的实际计费一致。

StepAudio 3 Gen 使用哪个端点?

StepAudio 3 Gen 通过 api.empiriolabs.ai 上的 POST /v1/audio/generations 提供,使用标准的 Bearer 令牌认证。

集成之前可以在浏览器里试用 StepAudio 3 Gen 吗?

可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 StepAudio 3 Gen,你可以在写代码之前先测试提示词。

如何获取 StepAudio 3 Gen API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。