
23以上の言語で表現力豊かなマルチスピーカーボイスで、ポッドキャスト、オーディオブック、カスタマーサポートの高品質TSプレビュー。
23以上の言語で表現力豊かなマルチスピーカーボイスで、ポッドキャスト、オーディオブック、カスタマーサポートの高品質TSプレビュー。
別名 Gemini Pro TTS, Gemini TTS, Google Gemini 2.5 Pro TTS, Gemini-2.5-Pro-TTS
gemini-2-5-pro-tts/v1/audio/speechgemini-2.5-pro-ttsgoogle/gemini-2.5-pro-ttsEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
Gemini 2.5 Pro TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID gemini-2-5-pro-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2-5-pro-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-2-5-pro-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上の Gemini 2.5 Pro TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| input | string | - | - | 音声に変換するためのテキスト。マルチスピーカーモードでは、ラインの前にSpeaker1: / Speaker2: で表記します。 |
| mode | enum | single | single, multi | シングル=ワンボイス、マルチ=ツーボイスダイアログ(ボイス+ボイス2+スピーカー名を使用)。 |
| language | string | en-US | - | 発音の手がかり用のBCP-47言語タグ(en-US、es-ESなど)。 |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 主な声名(例:Kore、Puck、Aoede)。デフォルトは空欄のままにしてください。 |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | マルチスピーカーモード用の2つ目の音声名。 |
| speaker1_name | string | Speaker1 | - | スピーカー1の入力プレフィックスに使用された表示名(デフォルト:Speaker1)。 |
| speaker2_name | string | Speaker2 | - | スピーカー2の入力プレフィックスに使用される表示名(デフォルト:Speaker2)。 |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | 音声ファイル形式(mp3、wav、opus、flacなど)。 |
| speed | number | 1 | 0.25 から 2 | 再生速度。1.0 = ナチュラル;<1は遅く、>1は速く。 |
| volume_gain | number | 0 | -96 から 16 | 出力ゲインはdB単位です。0 = 変わらない。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 出力サンプリングレートはHz(8000、16000、24000、44100、48000)です。 |
| style_prompt | string | - | - | 自然言語スタイルの指示(例:「温かく、会話的」や「ニュースキャスター、真面目」など)。 |
Modes - シングルスピーカー - マルチスピーカー(最大2ボイス) - テキストは、 SpeakerName: text 形式Limits - テキスト+スタイルプロンプト: 4,000バイト各 - オーディオ課金: 生成されたオーディオの秒あたりの〜32トークン(~10-15 chars/s) 声と言語 - 30以上のボイスオプション emotional/tonal 文字 - 24 +言語のローカルをサポート出力フォーマット - MP3、WAV、OGG
EmpirioLabs では Gemini 2.5 Pro TTS は従量課金です: パスワード $3.00 1M プロンプトトークンあたり; ソリューション $60.00 1M生成トークンあたり。このページのライブ料金表は常に API の請求額と一致します。
Gemini 2.5 Pro TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで Gemini 2.5 Pro TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。