書かれたシーンからセリフ、効果音、環境音、背景音楽を一つのクリップにまとめて生成します。
文字数のカウントはStepFunの料金体系に従い、中国語1文字が1文字、英語の文字2文字が1文字、句読点2文字が1文字としてカウントされます。
別名 StepFun StepAudio 3 Gen
stepaudio-3-gen/v1/audio/generationsstepaudio-3-gen-previewstepfun/stepaudio-3-genEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
StepAudio 3 Gen は POST /v1/audio/generations で動作します。リクエストはすぐに job_id を返すので、ジョブが完了するまで GET /v1/jobs/{job_id} をポーリングし、結果から出力 URL を読み取ってください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs 上の StepAudio 3 Gen API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| prompt | string | - | - | 生成するシーン。効果音や音楽の合図を角括弧で囲み、配達方向を括弧で囲みます。 |
| instruction | string | - | 最大 500 | 設定、背景音楽、感情的なトーンに関するグローバルなガイダンス。最大500文字。 |
| roles | string | - | - | オプションのスピーカーは、名前と音声の説明がついたオブジェクトとして使えます。すべての名前と説明を合わせると最大500文字まで制限されています。 |
| scripts | string | - | - | オプションで順序付けられた行を、スピーカーとテキストを持つオブジェクトとして設定。合計で1,000文字まで制限されています。複数話者のシーンではプロンプトの代わりにこれを使ってください。 |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | 出力音声フォーマット。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 48000 | 出力サンプリングレートはHzで表示されます。 |
| speed | number | 1 | 0.5 から 2 | 話す速度。 |
| volume | number | 1 | 0.1 から 2 | 出力量。 |
| text_normalization | enum | standard | standard, enhanced | 数字、日付、記号がどのように声に出して読み上げられるか。 |
シーンを説明すると、モデルはそれを一つの完成したクリップとして演じます:スピークライン、効果音、環境音、バックグラウンドミュージックが一緒に組み合わさっています。プロンプトを送信するか、マルチスピーカー制御用のロールやスクリプトを使用します。効果音や音楽のキューを角括弧で囲み、伝え方を括弧で囲みます。役割と指示はそれぞれ500文字、スクリプトは1,000文字に制限されています。出力フォーマットはmp3、wav、flac、opus、pcmです。このモデルでは参照音声や音声クローンは利用できません。このモデルはプレビュー段階であり、機能は変更される場合があります。
EmpirioLabs では StepAudio 3 Gen は従量課金です: 生成 $0.36 10,000文字あたり。このページのライブ料金表は常に API の請求額と一致します。
StepAudio 3 Gen は api.empiriolabs.ai 上の POST /v1/audio/generations で提供され、標準的な Bearer トークン認証を使用します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで StepAudio 3 Gen をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。