StepAudio 3 Gen API

書かれたシーンからセリフ、効果音、環境音、背景音楽を一つのクリップにまとめて生成します。

StepFunオーディオ生成リリース 2026年9月9日International独自エンドポイント新着

StepAudio 3 Gen について

書かれたシーンからセリフ、効果音、環境音、背景音楽を一つのクリップにまとめて生成します。

文字数のカウントはStepFunの料金体系に従い、中国語1文字が1文字、英語の文字2文字が1文字、句読点2文字が1文字としてカウントされます。

別名 StepFun StepAudio 3 Gen

audio generationtext to speechsound effectsvoice control

StepAudio 3 Gen の仕様

モデルID
stepaudio-3-gen
開発元
StepFun
カテゴリ
オーディオ生成
リリース
2026年9月9日
入力
テキスト
出力
音声
リージョン
International
エンドポイント
POST/v1/audio/generations
代替モデルID
stepaudio-3-gen-previewstepfun/stepaudio-3-gen

StepAudio 3 Gen API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
生成
10,000文字あたり
$0.36
料金ページ全体で比較

StepAudio 3 Gen API の呼び出し方

StepAudio 3 Gen は POST /v1/audio/generations で動作します。リクエストはすぐに job_id を返すので、ジョブが完了するまで GET /v1/jobs/{job_id} をポーリングし、結果から出力 URL を読み取ってください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL: ジョブを送信
curl https://api.empiriolabs.ai/v1/audio/generations \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-gen",
    "prompt": "Describe what you want StepAudio 3 Gen to generate."
  }'
cURL: 結果をポーリング
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/generations",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-gen",
        "prompt": "Describe what you want StepAudio 3 Gen to generate.",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
StepAudio 3 Gen API の完全リファレンス

StepAudio 3 Gen API のパラメーター

EmpirioLabs 上の StepAudio 3 Gen API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
promptstring--生成するシーン。効果音や音楽の合図を角括弧で囲み、配達方向を括弧で囲みます。
instructionstring-最大 500設定、背景音楽、感情的なトーンに関するグローバルなガイダンス。最大500文字。
rolesstring--オプションのスピーカーは、名前と音声の説明がついたオブジェクトとして使えます。すべての名前と説明を合わせると最大500文字まで制限されています。
scriptsstring--オプションで順序付けられた行を、スピーカーとテキストを持つオブジェクトとして設定。合計で1,000文字まで制限されています。複数話者のシーンではプロンプトの代わりにこれを使ってください。
response_formatenummp3mp3, wav, flac, opus, pcm出力音声フォーマット。
sample_rateenum240008000, 16000, 22050, 24000, 48000出力サンプリングレートはHzで表示されます。
speednumber10.5 から 2話す速度。
volumenumber10.1 から 2出力量。
text_normalizationenumstandardstandard, enhanced数字、日付、記号がどのように声に出して読み上げられるか。

知っておくと便利

シーンを説明すると、モデルはそれを一つの完成したクリップとして演じます:スピークライン、効果音、環境音、バックグラウンドミュージックが一緒に組み合わさっています。プロンプトを送信するか、マルチスピーカー制御用のロールやスクリプトを使用します。効果音や音楽のキューを角括弧で囲み、伝え方を括弧で囲みます。役割と指示はそれぞれ500文字、スクリプトは1,000文字に制限されています。出力フォーマットはmp3、wav、flac、opus、pcmです。このモデルでは参照音声や音声クローンは利用できません。このモデルはプレビュー段階であり、機能は変更される場合があります。

StepAudio 3 Gen API: よくある質問

StepAudio 3 Gen API の料金はいくらですか?

EmpirioLabs では StepAudio 3 Gen は従量課金です: 生成 $0.36 10,000文字あたり。このページのライブ料金表は常に API の請求額と一致します。

StepAudio 3 Gen はどのエンドポイントを使いますか?

StepAudio 3 Gen は api.empiriolabs.ai 上の POST /v1/audio/generations で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで StepAudio 3 Gen を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで StepAudio 3 Gen をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

StepAudio 3 Gen の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。