Gemini 3.8 Flash TTS API

表現豊かな音声、インラインボーカルタグ付き、スタイルディレクション、2話者対話が130言語、2,000以上の音声ライブラリをカバーしています。

Googleオーディオ生成リリース 2026年9月22日独自エンドポイント新着

Gemini 3.8 Flash TTS について

表現豊かな音声、インラインボーカルタグ付き、スタイルディレクション、2話者対話が130言語、2,000以上の音声ライブラリをカバーしています。

別名 Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash TTS の仕様

モデルID
gemini-3-8-flash-tts
開発元
Google
カテゴリ
オーディオ生成
リリース
2026年9月22日
入力
テキスト
出力
音声
エンドポイント
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
代替モデルID
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

Gemini 3.8 Flash TTS API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
入力
1Mプロンプトトークンあたり
$2.60
ソリューション
生成された1Mトークンあたり
$46.80
料金ページ全体で比較

Gemini 3.8 Flash TTS API の呼び出し方

Gemini 3.8 Flash TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID gemini-3-8-flash-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.8 Flash TTS API の完全リファレンス

Gemini 3.8 Flash TTS API のパラメーター

EmpirioLabs 上の Gemini 3.8 Flash TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
inputstring-最大 5000音声に変換するためのテキスト。マルチスピーカーモードの場合、行の前にSpeaker1: / Speaker2:最大5,000文字まで。伝え方をstyle_promptに設定し、音が出るべき場所にこれらのボーカルタグを配置します:<argh>、<breath>、<重い息>、<exhales>、<cackle><cheer><chuck...
modeenumsinglesingle, multiシングル=ワンボイス、マルチ=ツーボイスダイアログ(ボイス+ボイス2+スピーカー名を使用)。
languagestring--オプションのBCP-47言語タグ(en-US、es-ESなど)。テキストの言語は自動的に検出されます。リストに記載された30の声は、対応するすべての言語を話します。ライブラリの声は独自の言語で使用しなければなりません。
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...プライマリボイス名(例:Kore、Puck、Aoede)。デフォルトは空欄のままにしてください。これら30の声は、サポートされているすべての言語を話します。GET...
voice_audio_urlstring--voice=カスタムのみ:クローン用の声(WAV、MP3、M4A、OGG、WEBM、FLAC)から10秒から30秒のクリーンで自然な音声録音のHTTPS URLです。静かな部屋で、同意録音と同じマイクで録音してください。
voice_consent_audio_urlstring--voice=custom only: 同じ話者がこの文を声に出して読むためのhttps URLを送ります:「私はこの声の所有者であり、Googleがこの声を使って合成音声モデルを作成することに同意します。」同じ文は30言語のいずれかで受け入れられます。このパラメータのメタデータconsent_statementsそれぞれがリストされ...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...マルチスピーカーモード用の2つ目の音声名。
speaker1_namestringSpeaker1-スピーカー1の入力プレフィックスに使用された表示名(デフォルト:Speaker1)。
speaker2_namestringSpeaker2-スピーカー2の入力プレフィックスに使用される表示名(デフォルト:Speaker2)。
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW音声ファイル形式:WAV、MP3、OGG(Opus)、または電話用にALAW / MULAWです。
speednumber10.25 から 2再生速度。1.0 = ナチュラル;<1は遅く、>1は速く。
volume_gainnumber0-96 から 16出力ゲインはdB単位です。0 = 変わらない。
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000出力サンプレート(Hz)(8000、16000、22050、24000、44100、または48000)です。
style_promptstring--自然言語スタイルの指示(例:「温かく、会話的」や「ニュースキャスター、真面目」など)。

知っておくと便利

制限 - テキスト:リクエストあたり最大5,000文字 - 音声請求:生成された音声に対して1秒あたり32の出力トークン - 130言語。テキストの言語は自動的に検出されます。ボイス - voiceリストの30ボイスはすべての対応言語を話します。- GET /v1/voices?model=gemini-3-8-flash-tts 30か所にわたる2,000以上のボイスライブラリを、言語、アクセント、性別、音程、各言語の説明とともにリストアップします。language、gender、pitch、またはqでフィルタリングしてください。返すIDはvoiceまたはvoice2として機能します。languageを設定する場合は、そのボイスの言語を使いましょう。カスタムボイス - voiceを GET /v1/voices?model=gemini-3-8-flash-tts 0__に設定し、https URLで同じ成人スピーカーの録音を2回渡します: GET /v1/voices?model=gemini-3-8-flash-tts 1__、10〜30秒の自然な音声、そして GET /v1/voices?model=gemini-3-8-flash-tts 2__話者が「私はこの声の所有者であり、Googleがこの声を使って合成音声モデルを作成することに同意します」と読みます。この文は30言語で受け入れられています。そのパラメータの各表現を一覧に GET /v1/voices?model=gemini-3-8-flash-tts 3__します。- 静かな部屋で同じマイクで両方を録音します。WAV、MP3、M4A、OGG、WEBM、FLACがそれぞれ最大15MBまで対応可能です。- レスポンスには GET /v1/voices?model=gemini-3-8-flash-tts 4__ と GET /v1/voices?model=gemini-3-8-flash-tts 5__ が含まれます。 GET /v1/voices?model=gemini-3-8-flash-tts 6__を GET /v1/voices?model=gemini-3-8-flash-tts 7__または GET /v1/voices?model=gemini-3-8-flash-tts 8__として渡し、7日間新しい録音なしで声を再利用します。IDを持つ誰でもその声を期限切れまで使用できるので、非公開にしてください。配信方向 - 文章ではなく GET /v1/voices?model=gemini-3-8-flash-tts 9__、文章全体に方向を付ける。例えば「温かく、急ぎすぎず、安心させる」など。- 音声が出るはずの場所にボーカルタグを付ける。テキストが別の言語であっても、これらの英語タグは「 language 0 language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__」のみ使用。

Gemini 3.8 Flash TTS API: よくある質問

Gemini 3.8 Flash TTS API の料金はいくらですか?

EmpirioLabs では Gemini 3.8 Flash TTS は従量課金です: 入力 $2.60 1Mプロンプトトークンあたり; ソリューション $46.80 生成された1Mトークンあたり。このページのライブ料金表は常に API の請求額と一致します。

Gemini 3.8 Flash TTS はどのエンドポイントを使いますか?

Gemini 3.8 Flash TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで Gemini 3.8 Flash TTS を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで Gemini 3.8 Flash TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

Gemini 3.8 Flash TTS の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。