ジェミニ3.8フラッシュTTSおよびジェミニ3.8フラッシュライトTTSはEmpirioLabsで利用可能です。 どちらもテキストを音声に変換します ポスト/v1/audio/speech、音声をストリーミング ポスト/v1/audio/speech:stream2,000以上の音声ライブラリを利用しています。どちらもAPIとPlaygroundの両方で動作します。
2つのモデル
gemini-3-8-flash-ttsクリエイティブな指導のために作られており、ナレーション、オーディオブック、キャラクター、そして2人の話者によるシーンが含まれます。130言語をカバーしています。gemini-3-8-flash-lite-tts音声エージェント、吹き替え、大量音声などの大量作業向けに設計されており、生成音声はより低価格で対応可能です。101言語をカバーしています。
両モデルは同じ要求体を扱うため、切り替えは モデルお問い合わせ.
あなたの最初のお願い
curl https://api.empiriolabs.ai/v1/audio/speech \ -H 「認証:ベアラー $EMPIRIOLABS_API_KEY」\ -H 「コンテンツタイプ:application/json」 \ -d '{ 「モデル」:「gemini-3-8-flash-tts」, 「入力」:「お帰りなさい。<短い間>今週変わったことを示します。」, 「声」:「コレ」、 「style_prompt」:「温かくゆっくり」 }'
応答には生成された音声への署名付きURLが付与されます。デフォルトのフォーマットは24,000 HzのWAVです。セット output_format から MP3, OGG, アルアロー、または ムラウ、および sample_rate 8,000、16,000、22,050、24,000、44,100、または48,000 Hzのいずれかに対応できます。
演出
- スタイルの方向性。
style_prompt例えば「落ち着いて安心させる」や「興奮したスポーツ解説者」など、文章全体のトーンを設定します。 - ボーカルタグ。 タグ:
<laugh>,<sigh>,<breath>、および<短い間>音が出るべき場所に行ってください。完全なリストは入力モデル参照のパラメータ。テキストが別の言語であっても英語タグを使用してください。 - 強調。 強調のために単語を大文字にしてください。
二人の会話
セット モード から マルチ、各スピーカーに対して声を選びます。 声 および ボイス2、すべての行を話者の名前とコロンで始めます。名前は一致しなければなりません speaker1_name および speaker2_name、 はデフォルトで スピーカー1 および スピーカー2お問い合わせ.
{ 「model」:「gemini-3-8-flash-lite-tts」 「mode」 「multi」 「speaker1_name」 「Maya」 「speaker2_name」 「Theo」 「voice」 「Aoede」 「voice2」 「パック」 「input」 「Maya: 荷物は届きましたか?」\nTheo: 届きました。<laugh>すべての箱、時間通りに。」 }
声を選ぶ
30の声が 声 Kore、Puck、Charon、Aoedeなどのリストは、サポートされているすべての言語を話します。完全なライブラリには、30か所のロケーションで2,000以上の声が収録されており、それぞれに言語、アクセント、性別、音程、説明があります。リストは以下の通りです 出て/v1/voices および でフィルタリングします。 言語, 性別, 音高または の検索語 q:
curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -h "Authorization: Bearer $EMPIRIOLABS_API_KEY"
リスティングが返す音声IDはどんな音声でも使えます 声 および ボイス2お問い合わせ.
ストリーミング
ポスト/v1/audio/speech:stream 同じボディを取り、サーバー送信イベントを返します: audio.chunk 音声が生成される際にはbase64の16ビットPCMが24,000 Hzで発生し、その後1回 audio.done(音声終了) リクエストされた形式の完全なファイルへのリンクが付くイベント。
作戦メモ
- Gemini 3.1 Flash TTS用に書かれたスクリプトはタグの書き直しが必要です。 3.8モデルは、次のような角括弧タグを使用しています。
<whispers>および<laugh>3.1で使われている角括弧タグの代わりに。スクリプトを移動する際にタグを更新してください。 - 図書館の声は独自の言語を保つ。 セットするとき
言語図書館の声とともに、その声の場所であるに違いありません。fr-fr-advisor-1お問い合わせアメリカ合衆国却下されます。30の多言語音声はあらゆる言語を受け入れます。 - ダイアログラベルは話者の名前と一致しなければなりません。 で
マルチモードの場合、最初のラベル付き行の前のテキストは拒否され、ラベルが両方とも一致しない行は除外されますspeaker1_nameノーspeaker2_nameは前のターンの一部として読み上げられます。 速度完全なファイルに適用されます。 ストリーミングエンドポイントは速度1.0以外に。ファイルをリクエストしてくださいポスト/v1/audio/speech異なる速度が必要なときに。
料金について
どちらのモデルも課金制で、サブスクリプションはありません。リクエストは入力テキストトークンと生成音声に対して請求され、音声は1秒あたり32トークンで請求されます。Flash-Liteは生成音声の料金が低いです。現在の料金はモデルページに記載されています ジェミニ3.8フラッシュTTS および ジェミニ 3.8 フラッシュライトTTS そして プライシングページお問い合わせ.
建設を始めろ
試してみて ジェミニ3.8フラッシュTTS または ジェミニ 3.8 フラッシュライトTTS PlaygroundのAPI参照を読みます。 フラッシュ および フラッシュライトお問い合わせ.
同じファミリーのリアルタイム音声会話については、こちらをご覧ください Gemini 3.8のLiveおよびLive Extended Thinkingの使い方お問い合わせ.
ディスクロージャー:この記事は、EmpirioLabs AIによるAIの支援とレビューで書かれました.



