Gemini 3.1 Flash TTS API

高度可控的TTS带有新的音频标记,用于精确的风格,音调,速度,以及跨叙述,助手,语音应用程序的发送.

Google音频生成发布日期 2026年4月13日专有端点

关于 Gemini 3.1 Flash TTS

高度可控的TTS带有新的音频标记,用于精确的风格,音调,速度,以及跨叙述,助手,语音应用程序的发送.

也称为 Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts

text to speechmulti speakermultilingual

Gemini 3.1 Flash TTS 规格

模型 ID
gemini-3-1-flash-tts
提供方
Google
类别
音频生成
发布日期
2026年4月13日
输入
文本
输出
音频
端点
POST/v1/audio/speech
备用模型 ID
gemini-3.1-flash-ttsgoogle/gemini-3.1-flash-tts

Gemini 3.1 Flash TTS API 价格

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
投入
每1M 提示符
$2.60
产出
每1M个生成的令牌
$52.00
在完整价格页比较

如何调用 Gemini 3.1 Flash TTS API

Gemini 3.1 Flash TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID gemini-3-1-flash-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-1-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.1 Flash TTS API 完整参考

Gemini 3.1 Flash TTS API 参数

EmpirioLabs 上 Gemini 3.1 Flash TTS API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
inputstring--文本转换为语音。对于多扬声器模式,前缀线路应加 Speaker1: / Speaker2: 。
modeenumsinglesingle, multi单声部=一声部,多重部=双部对话(使用人声+声音2+说话者名称)。
languagestringen-US-BCP-47 语言标签(en-US、es-ES 等),用于发音线索。
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...主要声音名(例如Kore、Puck、Aoede)。默认时留空。
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...多扬声器模式的第二个语音名称。
speaker1_namestringSpeaker1-显示名称用于扬声器1的输入前缀(默认:Speaker1)。
speaker2_namestringSpeaker2-扬声器2输入前缀中使用的显示名称(默认:Speaker2)。
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW音频文件格式(mp3、wav、opus、flac等)。
speednumber10.25 到 2播放速度。1.0 = 自然;<1慢,>1快。
volume_gainnumber0-96 到 16输出增益以dB为单位。0 = 不变。
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000输出采样率以Hz为单位(8000、16000、24000、44100、48000)。
style_promptstring--自然语言风格的引导(例如“温暖、对话式”或“新闻播报员,严肃”)。

须知

迄今为止最易控制的双子座TTS。限制- 文本+样式提示:每个4,000字节(总共8,000字节)- 最大输出:~10分钟 - 音频计费:~每秒25个令牌(~15字符/秒)- 语言自动检测;语言设置是提示,不是约束 内联音频标签(控制表达)- 情绪:'[低语]','[喊叫]','[笑]','[叹气]','[欢快]','[悲伤]','[生气]'等。- 节奏:'[慢]','[快]','[极快]','[正常节奏]'- 停顿:'[短暂停]','[长停顿]','[呼吸]'- 重音:'[轻声]','[大声]','[高音]','[低音]','[上升音]','[下降音]'

Gemini 3.1 Flash TTS API:常见问题

Gemini 3.1 Flash TTS API 收费多少?

在 EmpirioLabs,Gemini 3.1 Flash TTS 按量计费:投入 $2.60 每1M 提示符; 产出 $52.00 每1M个生成的令牌。本页的实时价格表始终与 API 的实际计费一致。

Gemini 3.1 Flash TTS 使用哪个端点?

Gemini 3.1 Flash TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。

集成之前可以在浏览器里试用 Gemini 3.1 Flash TTS 吗?

可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Gemini 3.1 Flash TTS,你可以在写代码之前先测试提示词。

如何获取 Gemini 3.1 Flash TTS API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。