高质量TTS预览播客,音频书,以及客户支持,具有23+语言的表达式多语言语音.
也称为 Gemini Pro TTS, Gemini TTS, Google Gemini 2.5 Pro TTS, Gemini-2.5-Pro-TTS
gemini-2-5-pro-tts/v1/audio/speechgemini-2.5-pro-ttsgoogle/gemini-2.5-pro-tts来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Gemini 2.5 Pro TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID gemini-2-5-pro-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2-5-pro-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-2-5-pro-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上 Gemini 2.5 Pro TTS API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input | string | - | - | 文本转换为语音。对于多扬声器模式,前缀线路应加 Speaker1: / Speaker2: 。 |
| mode | enum | single | single, multi | 单声部=一声部,多重部=双部对话(使用人声+声音2+说话者名称)。 |
| language | string | en-US | - | BCP-47 语言标签(en-US、es-ES 等),用于发音线索。 |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 主要声音名(例如Kore、Puck、Aoede)。默认时留空。 |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 多扬声器模式的第二个语音名称。 |
| speaker1_name | string | Speaker1 | - | 显示名称用于扬声器1的输入前缀(默认:Speaker1)。 |
| speaker2_name | string | Speaker2 | - | 扬声器2输入前缀中使用的显示名称(默认:Speaker2)。 |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | 音频文件格式(mp3、wav、opus、flac等)。 |
| speed | number | 1 | 0.25 到 2 | 播放速度。1.0 = 自然;<1慢,>1快。 |
| volume_gain | number | 0 | -96 到 16 | 输出增益以dB为单位。0 = 不变。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 输出采样率以Hz为单位(8000、16000、24000、44100、48000)。 |
| style_prompt | string | - | - | 自然语言风格的引导(例如“温暖、对话式”或“新闻播报员,严肃”)。 |
模式 - 单语 - 多语种(最大 2 个声音) - 文本必须使用 SpeakerName: text 格式 - 文本 + 样式 提示: 4000 字节/ 单语 - 音频计费: ~ 32 个令牌/ 秒生成音频(~ 10-15 chars/s) 语音和语言 - 30+ 语音选项横跨 emotional/tonal 字符 - 24+ 语言语言支持输出格式** - MP3, WAV, OGG
在 EmpirioLabs,Gemini 2.5 Pro TTS 按量计费:投入 $3.00 每1M 提示符; 产出 $60.00 每1M个生成的令牌。本页的实时价格表始终与 API 的实际计费一致。
Gemini 2.5 Pro TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Gemini 2.5 Pro TTS,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。