
6言語にわたる人間レベルの音声合成、12のシステムボイス、自然言語の伝達方向、ストリーミング再生が可能です。
6言語にわたる人間レベルの音声合成、12のシステムボイス、自然言語の伝達方向、ストリーミング再生が可能です。
文字数のカウントはStepFunの料金体系に従い、中国語1文字が1文字、英語の文字2文字が1文字、句読点2文字が1文字としてカウントされます。
別名 StepFun StepAudio 3 TTS
stepaudio-3-tts/v1/audio/speechPOST/v1/audio/speech:streamstepfun/stepaudio-3-ttsEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
StepAudio 3 TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID stepaudio-3-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上の StepAudio 3 TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| input | string | - | 最大 1000 | テキストを合成します。最大1,000文字。括弧内の内容は配信指示として扱われ、話し言葉ではありません。 |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | 公式StepFunの声です。カスタムクローン音声IDもAPIを通じて受け入れられます。 |
| instruction | string | - | 最大 500 | 全文のグローバルな感情またはスタイルのガイダンスを自然言語で提供します。最大500文字まで。 |
| speed | number | 1 | 0.5 から 2 | 話す速度。 |
| volume | number | 1 | 0.1 から 2 | 出力量。 |
| language | enum | en | en, zh, ja, ko, fr, es | 対象言語。日本語、韓国語、フランス語、スペイン語はプレビュー中です。 |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | 出力音声フォーマット。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | 出力サンプリングレートはHzで表示されます。 |
| markdown_filter | boolean | false | - | 入力からMarkdownの構文を音声から削除してください。 |
| pronunciation_map | string | - | - | 発音は「written/spoken」ルールの音調配列を持つオブジェクトとしてオプションでオーバーライドされます。 |
最大入力文字数は1,000文字です。括弧内の内容は配信指示として扱われ、音声は出されません。グローバルな感情やスタイルのガイダンスには最大500文字の指示をご利用ください。12種類のシステム音声が利用可能で、カスタムのクローン音声IDも受け入れられます。認識可能な言語は中国語、英語、日本語、韓国語、フランス語、スペイン語で、プレビューでは中国語と英語以外の言語も含まれています。出力フォーマットはmp3、wav、flac、opus、pcmで8000、16000、22050、または24000Hzです。Wavはストリーミングではなく完全なファイルとして返されます。このモデルはvoice_labelをサポートしていません。
EmpirioLabs では StepAudio 3 TTS は従量課金です: 合成 $0.36 10,000文字あたり。このページのライブ料金表は常に API の請求額と一致します。
StepAudio 3 TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで StepAudio 3 TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。