Gemini 3.1 Flash TTS API

新しいオーディオタグを備えた高度に制御可能なTSは、正確なスタイル、トーン、ペース、そしてナレーション、アシスタント、ボイスアプリを横断して配信します。

Googleオーディオ生成リリース 2026年4月13日独自エンドポイント

Gemini 3.1 Flash TTS について

新しいオーディオタグを備えた高度に制御可能なTSは、正確なスタイル、トーン、ペース、そしてナレーション、アシスタント、ボイスアプリを横断して配信します。

別名 Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts

text to speechmulti speakermultilingual

Gemini 3.1 Flash TTS の仕様

モデルID
gemini-3-1-flash-tts
プロバイダー
Google
カテゴリ
オーディオ生成
リリース
2026年4月13日
入力
テキスト
出力
音声
エンドポイント
POST/v1/audio/speech
代替モデルID
gemini-3.1-flash-ttsgoogle/gemini-3.1-flash-tts

Gemini 3.1 Flash TTS API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
パスワード
1M プロンプトトークンあたり
$2.60
ソリューション
1M生成トークンあたり
$52.00
料金ページ全体で比較

Gemini 3.1 Flash TTS API の呼び出し方

Gemini 3.1 Flash TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID gemini-3-1-flash-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-1-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.1 Flash TTS API の完全リファレンス

Gemini 3.1 Flash TTS API のパラメーター

EmpirioLabs 上の Gemini 3.1 Flash TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
inputstring--音声に変換するためのテキスト。マルチスピーカーモードでは、ラインの前にSpeaker1: / Speaker2: で表記します。
modeenumsinglesingle, multiシングル=ワンボイス、マルチ=ツーボイスダイアログ(ボイス+ボイス2+スピーカー名を使用)。
languagestringen-US-発音の手がかり用のBCP-47言語タグ(en-US、es-ESなど)。
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...主な声名(例:Kore、Puck、Aoede)。デフォルトは空欄のままにしてください。
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...マルチスピーカーモード用の2つ目の音声名。
speaker1_namestringSpeaker1-スピーカー1の入力プレフィックスに使用された表示名(デフォルト:Speaker1)。
speaker2_namestringSpeaker2-スピーカー2の入力プレフィックスに使用される表示名(デフォルト:Speaker2)。
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW音声ファイル形式(mp3、wav、opus、flacなど)。
speednumber10.25 から 2再生速度。1.0 = ナチュラル;<1は遅く、>1は速く。
volume_gainnumber0-96 から 16出力ゲインはdB単位です。0 = 変わらない。
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000出力サンプリングレートはHz(8000、16000、24000、44100、48000)です。
style_promptstring--自然言語スタイルの指示(例:「温かく、会話的」や「ニュースキャスター、真面目」など)。

知っておくと便利

ほとんどの制御可能なGemini TTS日付に。 *Limits** - テキスト + スタイル プロンプト: 各 4,000 バイト (8,000 結合) - 最大出力: ~10 分 - 音声課金: ~25 トークン毎秒 (~15 chars/s) - 言語は自動検出され、言語設定は、制約なしです。

Gemini 3.1 Flash TTS API: よくある質問

Gemini 3.1 Flash TTS API の料金はいくらですか?

EmpirioLabs では Gemini 3.1 Flash TTS は従量課金です: パスワード $2.60 1M プロンプトトークンあたり; ソリューション $52.00 1M生成トークンあたり。このページのライブ料金表は常に API の請求額と一致します。

Gemini 3.1 Flash TTS はどのエンドポイントを使いますか?

Gemini 3.1 Flash TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで Gemini 3.1 Flash TTS を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで Gemini 3.1 Flash TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

Gemini 3.1 Flash TTS の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。