Gemini 3.8 Flash TTS API

具表现力的语音,带有内嵌语音标签、风格指导和双语对话,涵盖130种语言和超过2000个声音库。

Google音频生成发布日期 2026年9月22日专有端点新

关于 Gemini 3.8 Flash TTS

具表现力的语音,带有内嵌语音标签、风格指导和双语对话,涵盖130种语言和超过2000个声音库。

也称为 Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash TTS 规格

模型 ID
gemini-3-8-flash-tts
开发方
Google
类别
音频生成
发布日期
2026年9月22日
输入
文本
输出
音频
端点
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
备用模型 ID
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

Gemini 3.8 Flash TTS API 价格

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
输入
每100万个提示词标记
$2.60
产出
每100万个生成代币
$46.80
在完整价格页比较

如何调用 Gemini 3.8 Flash TTS API

Gemini 3.8 Flash TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID gemini-3-8-flash-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.8 Flash TTS API 完整参考

Gemini 3.8 Flash TTS API 参数

EmpirioLabs 上 Gemini 3.8 Flash TTS API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
inputstring-最大 5000文本转换为语音。多扬声器模式下,前缀为Speaker1: / Speaker2:最多5000字符。style_prompt中设定表达方向,并将这些声音标签放置在声音应有的位置:<argh>, <breath>, <重喘>,...
modeenumsinglesingle, multi单声部=一声部,多重部=双部对话(使用人声+声音2+说话者名称)。
languagestring--可选的BCP-47语言标签(en-US、es-ES等)。文本的语言会自动检测。列出的30个语音应使用所有支持的语言;图书馆的语音必须与其自身语言一起使用。
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...主要语音名称(例如 Kore、Puck、Aoede)。默认保留空格。这 30 个语音会说所有支持的语言。GET /v1/voices 列出了超过 2,000 个语音的完整库,任何其返回的语音 ID 也被接受。自定义克隆 voice_audio_url 和 voice_consent_audio_url...
voice_audio_urlstring--voice=仅自定义:一个HTTPS地址,指向10到30秒的清晰自然语音录音(WAV、MP3、M4A、OGG、WEBM或FLAC)。在安静的房间里录制,使用与同意录音相同的麦克风。
voice_consent_audio_urlstring--voice=仅自定义:https URL 指向同一说话者朗读此语:“我是此语音的所有者,我同意谷歌使用此语音创建合成语音模型。”30种语言中任意一种都接受相同的语句;consent_statements该参数的元数据列出了每一种。
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...多扬声器模式的第二个语音名称。
speaker1_namestringSpeaker1-显示名称用于扬声器1的输入前缀(默认:Speaker1)。
speaker2_namestringSpeaker2-扬声器2输入前缀中使用的显示名称(默认:Speaker2)。
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW音频文件格式:WAV、MP3、OGG(Opus)或电话用的ALAW / MULAW。
speednumber10.25 到 2播放速度。1.0 = 自然;<1慢,>1快。
volume_gainnumber0-96 到 16输出增益以dB为单位。0 = 不变。
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000输出采样率以Hz为单位(8000、16000、22050、24000、44100或48000)。
style_promptstring--自然语言风格的引导(例如“温暖、对话式”或“新闻播报员,严肃”)。

须知

限制 - 文本:每个请求最多5,000个字符- 音频计费:每秒生成音频输出32个令牌 - 130种语言。文本语言自动检测。语音 - voice列表中的30个语音使用所有支持的语言。- GET /v1/voices?model=gemini-3-8-flash-tts列出超过2,000个声音库,分布在30个地点,包含语言、口音、性别、音高及描述。用language、gender、pitch或q进行过滤。它返回的任何ID可作为voice或voice2使用;设置language时,使用语音的语言。自定义语音 - 将voice设置为 GET /v1/voices?model=gemini-3-8-flash-tts 0__,并通过 https URL 传递同一成年说话者的两段录音: GET /v1/voices?model=gemini-3-8-flash-tts 1__、10 到 30 秒的自然语音,以及 GET /v1/voices?model=gemini-3-8-flash-tts 2__,说话者写道“我是此语音的所有者,我同意 Google 使用此语音创建合成语音模型”。该语句被接受为 30 种语言; GET /v1/voices?model=gemini-3-8-flash-tts 3__ 该参数列出每种措辞。- 在安静的房间内用同一麦克风录制两者。接受 WAV、MP3、M4A、OGG、WEBM 和 FLAC,每个最高 15 MB。- 响应包含 GET /v1/voices?model=gemini-3-8-flash-tts 4__ 和 GET /v1/voices?model=gemini-3-8-flash-tts 5__。将 GET /v1/voices?model=gemini-3-8-flash-tts 6__ 传递为 GET /v1/voices?model=gemini-3-8-flash-tts 7__ 或 GET /v1/voices?model=gemini-3-8-flash-tts 8__,以便重复使用 7 天内无新录音。任何持有身份证的人都可以使用该声音直到其过期,因此请保持私密。传达方向 - 将整段文字的方向标注在 GET /v1/voices?model=gemini-3-8-flash-tts 9__中,而非文本中,例如“温暖、不急、令人安心”。- 在应有声音的位置放置人声标签。即使文本是另一种语言,也使用这些英文标签:仅限“ language 0__” language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__“。

Gemini 3.8 Flash TTS API:常见问题

Gemini 3.8 Flash TTS API 收费多少?

在 EmpirioLabs,Gemini 3.8 Flash TTS 按量计费:输入 $2.60 每100万个提示词标记; 产出 $46.80 每100万个生成代币。本页的实时价格表始终与 API 的实际计费一致。

Gemini 3.8 Flash TTS 使用哪个端点?

Gemini 3.8 Flash TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。

集成之前可以在浏览器里试用 Gemini 3.8 Flash TTS 吗?

可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Gemini 3.8 Flash TTS,你可以在写代码之前先测试提示词。

如何获取 Gemini 3.8 Flash TTS API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。