
具表现力的语音,带有内嵌语音标签、风格指导和双语对话,涵盖130种语言和超过2000个声音库。
具表现力的语音,带有内嵌语音标签、风格指导和双语对话,涵盖130种语言和超过2000个声音库。
也称为 Gemini Flash TTS, Google Gemini 3.8 Flash TTS
gemini-3-8-flash-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesgemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Gemini 3.8 Flash TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID gemini-3-8-flash-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-8-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上 Gemini 3.8 Flash TTS API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input | string | - | 最大 5000 | 文本转换为语音。多扬声器模式下,前缀为Speaker1: / Speaker2:最多5000字符。style_prompt中设定表达方向,并将这些声音标签放置在声音应有的位置:<argh>, <breath>, <重喘>,... |
| mode | enum | single | single, multi | 单声部=一声部,多重部=双部对话(使用人声+声音2+说话者名称)。 |
| language | string | - | - | 可选的BCP-47语言标签(en-US、es-ES等)。文本的语言会自动检测。列出的30个语音应使用所有支持的语言;图书馆的语音必须与其自身语言一起使用。 |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 主要语音名称(例如 Kore、Puck、Aoede)。默认保留空格。这 30 个语音会说所有支持的语言。GET /v1/voices 列出了超过 2,000 个语音的完整库,任何其返回的语音 ID 也被接受。自定义克隆 voice_audio_url 和 voice_consent_audio_url... |
| voice_audio_url | string | - | - | voice=仅自定义:一个HTTPS地址,指向10到30秒的清晰自然语音录音(WAV、MP3、M4A、OGG、WEBM或FLAC)。在安静的房间里录制,使用与同意录音相同的麦克风。 |
| voice_consent_audio_url | string | - | - | voice=仅自定义:https URL 指向同一说话者朗读此语:“我是此语音的所有者,我同意谷歌使用此语音创建合成语音模型。”30种语言中任意一种都接受相同的语句;consent_statements该参数的元数据列出了每一种。 |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 多扬声器模式的第二个语音名称。 |
| speaker1_name | string | Speaker1 | - | 显示名称用于扬声器1的输入前缀(默认:Speaker1)。 |
| speaker2_name | string | Speaker2 | - | 扬声器2输入前缀中使用的显示名称(默认:Speaker2)。 |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | 音频文件格式:WAV、MP3、OGG(Opus)或电话用的ALAW / MULAW。 |
| speed | number | 1 | 0.25 到 2 | 播放速度。1.0 = 自然;<1慢,>1快。 |
| volume_gain | number | 0 | -96 到 16 | 输出增益以dB为单位。0 = 不变。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 输出采样率以Hz为单位(8000、16000、22050、24000、44100或48000)。 |
| style_prompt | string | - | - | 自然语言风格的引导(例如“温暖、对话式”或“新闻播报员,严肃”)。 |
限制 - 文本:每个请求最多5,000个字符- 音频计费:每秒生成音频输出32个令牌 - 130种语言。文本语言自动检测。语音 - voice列表中的30个语音使用所有支持的语言。- GET /v1/voices?model=gemini-3-8-flash-tts列出超过2,000个声音库,分布在30个地点,包含语言、口音、性别、音高及描述。用language、gender、pitch或q进行过滤。它返回的任何ID可作为voice或voice2使用;设置language时,使用语音的语言。自定义语音 - 将voice设置为 GET /v1/voices?model=gemini-3-8-flash-tts 0__,并通过 https URL 传递同一成年说话者的两段录音: GET /v1/voices?model=gemini-3-8-flash-tts 1__、10 到 30 秒的自然语音,以及 GET /v1/voices?model=gemini-3-8-flash-tts 2__,说话者写道“我是此语音的所有者,我同意 Google 使用此语音创建合成语音模型”。该语句被接受为 30 种语言; GET /v1/voices?model=gemini-3-8-flash-tts 3__ 该参数列出每种措辞。- 在安静的房间内用同一麦克风录制两者。接受 WAV、MP3、M4A、OGG、WEBM 和 FLAC,每个最高 15 MB。- 响应包含 GET /v1/voices?model=gemini-3-8-flash-tts 4__ 和 GET /v1/voices?model=gemini-3-8-flash-tts 5__。将 GET /v1/voices?model=gemini-3-8-flash-tts 6__ 传递为 GET /v1/voices?model=gemini-3-8-flash-tts 7__ 或 GET /v1/voices?model=gemini-3-8-flash-tts 8__,以便重复使用 7 天内无新录音。任何持有身份证的人都可以使用该声音直到其过期,因此请保持私密。传达方向 - 将整段文字的方向标注在 GET /v1/voices?model=gemini-3-8-flash-tts 9__中,而非文本中,例如“温暖、不急、令人安心”。- 在应有声音的位置放置人声标签。即使文本是另一种语言,也使用这些英文标签:仅限“ language 0__” language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__“。
在 EmpirioLabs,Gemini 3.8 Flash TTS 按量计费:输入 $2.60 每100万个提示词标记; 产出 $46.80 每100万个生成代币。本页的实时价格表始终与 API 的实际计费一致。
Gemini 3.8 Flash TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Gemini 3.8 Flash TTS,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。