Gemini 3.1 Flash TTS API

ナレーション、アシスタント、ボイスアプリをまたいで、新しいオーディオタグで正確なスタイル、トーン、テンポ、伝え方を実現し、高度にコントロールしやすいTTS。

Googleオーディオ生成リリース 2026年4月13日独自エンドポイント

Gemini 3.1 Flash TTS について

ナレーション、アシスタント、ボイスアプリをまたいで、新しいオーディオタグで正確なスタイル、トーン、テンポ、伝え方を実現し、高度にコントロールしやすいTTS。

別名 Gemini Flash TTS, Google Gemini 3.1 Flash TTS

text to speechmulti speakermultilingual

Gemini 3.1 Flash TTS の仕様

モデルID
gemini-3-1-flash-tts
開発元
Google
カテゴリ
オーディオ生成
リリース
2026年4月13日
入力
テキスト
出力
音声
エンドポイント
POST/v1/audio/speech
代替モデルID
gemini-3.1-flash-ttsgoogle/gemini-3.1-flash-tts

Gemini 3.1 Flash TTS API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
入力
1Mプロンプトトークンあたり
$2.60
ソリューション
生成された1Mトークンあたり
$52.00
料金ページ全体で比較

Gemini 3.1 Flash TTS API の呼び出し方

Gemini 3.1 Flash TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID gemini-3-1-flash-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-1-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.1 Flash TTS API の完全リファレンス

Gemini 3.1 Flash TTS API のパラメーター

EmpirioLabs 上の Gemini 3.1 Flash TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
inputstring--音声に変換するためのテキスト。マルチスピーカーモードでは、ラインの前にSpeaker1: / Speaker2: で表記します。
modeenumsinglesingle, multiシングル=ワンボイス、マルチ=ツーボイスダイアログ(ボイス+ボイス2+スピーカー名を使用)。
languagestringen-US-発音の手がかり用のBCP-47言語タグ(en-US、es-ESなど)。
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...主な声名(例:Kore、Puck、Aoede)。デフォルトは空欄のままにしてください。
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...マルチスピーカーモード用の2つ目の音声名。
speaker1_namestringSpeaker1-スピーカー1の入力プレフィックスに使用された表示名(デフォルト:Speaker1)。
speaker2_namestringSpeaker2-スピーカー2の入力プレフィックスに使用される表示名(デフォルト:Speaker2)。
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW音声ファイル形式(mp3、wav、opus、flacなど)。
speednumber10.25 から 2再生速度。1.0 = ナチュラル;<1は遅く、>1は速く。
volume_gainnumber0-96 から 16出力ゲインはdB単位です。0 = 変わらない。
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000出力サンプリングレートはHz(8000、16000、24000、44100、48000)です。
style_promptstring--自然言語スタイルの指示(例:「温かく、会話的」や「ニュースキャスター、真面目」など)。

知っておくと便利

これまでで最も操作しやすいジェミニTTS。制限- テキスト+スタイルプロンプト:各4,000バイト(合計8,000バイト)- 最大出力:~10分 - 音声請求:~1秒あたり25トークン(~15chars/s)- 言語は自動検出;言語設定は制約ではなくヒントです インラインオーディオタグ(コントロール配信) - 感情:[whispers]、 [shouts]、[laughs]、[sighs]、[cheerful]、[sad]、[angry]など - ペース:[slow]、[fast]、 [whispers] 0__、 [whispers] 1__ - 間: [whispers] 2__、 [whispers] 3__、 [whispers] 4__ - 強調: [whispers] 5__、 [whispers] 6__、 [whispers] 7__、 [whispers] 8__、 [whispers] 9__、 [shouts] 0__

Gemini 3.1 Flash TTS API: よくある質問

Gemini 3.1 Flash TTS API の料金はいくらですか?

EmpirioLabs では Gemini 3.1 Flash TTS は従量課金です: 入力 $2.60 1Mプロンプトトークンあたり; ソリューション $52.00 生成された1Mトークンあたり。このページのライブ料金表は常に API の請求額と一致します。

Gemini 3.1 Flash TTS はどのエンドポイントを使いますか?

Gemini 3.1 Flash TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで Gemini 3.1 Flash TTS を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで Gemini 3.1 Flash TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

Gemini 3.1 Flash TTS の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。