
高度可控的TTS带有新的音频标记,用于精确的风格,音调,速度,以及跨叙述,助手,语音应用程序的发送.
高度可控的TTS带有新的音频标记,用于精确的风格,音调,速度,以及跨叙述,助手,语音应用程序的发送.
也称为 Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts
gemini-3-1-flash-tts/v1/audio/speechgemini-3.1-flash-ttsgoogle/gemini-3.1-flash-tts来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Gemini 3.1 Flash TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID gemini-3-1-flash-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-1-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上 Gemini 3.1 Flash TTS API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input | string | - | - | 文本转换为语音。对于多扬声器模式,前缀线路应加 Speaker1: / Speaker2: 。 |
| mode | enum | single | single, multi | 单声部=一声部,多重部=双部对话(使用人声+声音2+说话者名称)。 |
| language | string | en-US | - | BCP-47 语言标签(en-US、es-ES 等),用于发音线索。 |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 主要声音名(例如Kore、Puck、Aoede)。默认时留空。 |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 多扬声器模式的第二个语音名称。 |
| speaker1_name | string | Speaker1 | - | 显示名称用于扬声器1的输入前缀(默认:Speaker1)。 |
| speaker2_name | string | Speaker2 | - | 扬声器2输入前缀中使用的显示名称(默认:Speaker2)。 |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | 音频文件格式(mp3、wav、opus、flac等)。 |
| speed | number | 1 | 0.25 到 2 | 播放速度。1.0 = 自然;<1慢,>1快。 |
| volume_gain | number | 0 | -96 到 16 | 输出增益以dB为单位。0 = 不变。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 输出采样率以Hz为单位(8000、16000、24000、44100、48000)。 |
| style_prompt | string | - | - | 自然语言风格的引导(例如“温暖、对话式”或“新闻播报员,严肃”)。 |
迄今为止最易控制的双子座TTS。限制- 文本+样式提示:每个4,000字节(总共8,000字节)- 最大输出:~10分钟 - 音频计费:~每秒25个令牌(~15字符/秒)- 语言自动检测;语言设置是提示,不是约束 内联音频标签(控制表达)- 情绪:'[低语]','[喊叫]','[笑]','[叹气]','[欢快]','[悲伤]','[生气]'等。- 节奏:'[慢]','[快]','[极快]','[正常节奏]'- 停顿:'[短暂停]','[长停顿]','[呼吸]'- 重音:'[轻声]','[大声]','[高音]','[低音]','[上升音]','[下降音]'
在 EmpirioLabs,Gemini 3.1 Flash TTS 按量计费:投入 $2.60 每1M 提示符; 产出 $52.00 每1M个生成的令牌。本页的实时价格表始终与 API 的实际计费一致。
Gemini 3.1 Flash TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Gemini 3.1 Flash TTS,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。