Gemini 3.8 Flash-Lite TTS API

为语音代理和配音提供经济高效的语音服务,支持流媒体、语音标签和双人对话,涵盖101种语言和2000+个语音。

Google音频生成发布日期 2026年9月22日专有端点新

关于 Gemini 3.8 Flash-Lite TTS

为语音代理和配音提供经济高效的语音服务,支持流媒体、语音标签和双人对话,涵盖101种语言和2000+个语音。

也称为 Gemini Flash-Lite TTS, Google Gemini 3.8 Flash-Lite TTS, Gemini-3.8-Flash-Lite-TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash-Lite TTS 规格

模型 ID
gemini-3-8-flash-lite-tts
开发方
Google
类别
音频生成
发布日期
2026年9月22日
输入
文本
输出
音频
端点
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
备用模型 ID
gemini-3.8-flash-lite-ttsgoogle/gemini-3.8-flash-lite-tts

Gemini 3.8 Flash-Lite TTS API 价格

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
输入
每100万个提示词标记
$2.60
产出
每100万个生成代币
$31.20
在完整价格页比较

如何调用 Gemini 3.8 Flash-Lite TTS API

Gemini 3.8 Flash-Lite TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID gemini-3-8-flash-lite-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-lite-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-lite-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.8 Flash-Lite TTS API 完整参考

Gemini 3.8 Flash-Lite TTS API 参数

EmpirioLabs 上 Gemini 3.8 Flash-Lite TTS API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
inputstring-最大 5000文本转换为语音。多扬声器模式下,前缀为Speaker1: / Speaker2:最多5000字符。style_prompt中设定表达方向,并将这些声音标签放置在声音应有的位置:<argh>, <breath>, <重喘>,...
modeenumsinglesingle, multi单声部=一声部,多重部=双部对话(使用人声+声音2+说话者名称)。
languagestring--可选的BCP-47语言标签(en-US、es-ES等)。文本的语言会自动检测。列出的30个语音应使用所有支持的语言;图书馆的语音必须与其自身语言一起使用。
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...主要语音名称(例如 Kore、Puck、Aoede)。默认保留空格。这 30 个语音会说所有支持的语言。GET /v1/voices 列出了超过 2,000 个语音的完整库,任何其返回的语音 ID 也被接受。自定义克隆 voice_audio_url 和 voice_consent_audio_url...
voice_audio_urlstring--voice=仅自定义:一个HTTPS地址,指向10到30秒的清晰自然语音录音(WAV、MP3、M4A、OGG、WEBM或FLAC)。在安静的房间里录制,使用与同意录音相同的麦克风。
voice_consent_audio_urlstring--voice=仅自定义:https URL 指向同一说话者朗读此语:“我是此语音的所有者,我同意谷歌使用此语音创建合成语音模型。”30种语言中任意一种都接受相同的语句;consent_statements该参数的元数据列出了每一种。
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...多扬声器模式的第二个语音名称。
speaker1_namestringSpeaker1-显示名称用于扬声器1的输入前缀(默认:Speaker1)。
speaker2_namestringSpeaker2-扬声器2输入前缀中使用的显示名称(默认:Speaker2)。
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW音频文件格式:WAV、MP3、OGG(Opus)或电话用的ALAW / MULAW。
speednumber10.25 到 2播放速度。1.0 = 自然;<1慢,>1快。
volume_gainnumber0-96 到 16输出增益以dB为单位。0 = 不变。
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000输出采样率以Hz为单位(8000、16000、22050、24000、44100或48000)。
style_promptstring--自然语言风格的引导(例如“温暖、对话式”或“新闻播报员,严肃”)。

须知

限制 - 文本:每个请求最多5,000个字符- 音频计费:每秒生成音频32个令牌输出 - 101种语言。文本语言自动检测。语音 - voice列表中的30个语音支持所有支持语言。- GET /v1/voices?model=gemini-3-8-flash-lite-tts列出超过2,000个声音的完整库,涵盖30个地点,包含语言、口音、性别、音高及每个语言的描述。用language、gender、pitch或q过滤。它返回的任何ID可作为voice或voice2;当你同时设置language时,使用语音的语言。自定义语音 - 将voice设置为 GET /v1/voices?model=gemini-3-8-flash-lite-tts 0__,并通过 https URL 传递同一成年说话者的两段录音: GET /v1/voices?model=gemini-3-8-flash-lite-tts 1__、10 到 30 秒的自然语音,以及 GET /v1/voices?model=gemini-3-8-flash-lite-tts 2__,说话者写道“我是此语音的所有者,我同意 Google 使用此语音创建合成语音模型”。该语句被接受为 30 种语言; GET /v1/voices?model=gemini-3-8-flash-lite-tts 3__ 该参数列出每种措辞。- 在安静的房间内用同一麦克风录制两者。接受 WAV、MP3、M4A、OGG、WEBM 和 FLAC,每个最高 15 MB。- 响应包含 GET /v1/voices?model=gemini-3-8-flash-lite-tts 4__ 和 GET /v1/voices?model=gemini-3-8-flash-lite-tts 5__。将 GET /v1/voices?model=gemini-3-8-flash-lite-tts 6__ 传递为 GET /v1/voices?model=gemini-3-8-flash-lite-tts 7__ 或 GET /v1/voices?model=gemini-3-8-flash-lite-tts 8__,以便重复使用 7 天内无新录音。任何持有身份证的人都可以使用该声音直到其过期,因此请保持私密。传达方向 - 将整段文字的方向标注在 GET /v1/voices?model=gemini-3-8-flash-lite-tts 9__中,而非文本中,例如“温暖、不急、令人安心”。- 在应有声音的位置放置人声标签。即使文本是另一种语言,也使用这些英文标签:仅限“ language 0__” language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__“。

Gemini 3.8 Flash-Lite TTS API:常见问题

Gemini 3.8 Flash-Lite TTS API 收费多少?

在 EmpirioLabs,Gemini 3.8 Flash-Lite TTS 按量计费:输入 $2.60 每100万个提示词标记; 产出 $31.20 每100万个生成代币。本页的实时价格表始终与 API 的实际计费一致。

Gemini 3.8 Flash-Lite TTS 使用哪个端点?

Gemini 3.8 Flash-Lite TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。

集成之前可以在浏览器里试用 Gemini 3.8 Flash-Lite TTS 吗?

可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Gemini 3.8 Flash-Lite TTS,你可以在写代码之前先测试提示词。

如何获取 Gemini 3.8 Flash-Lite TTS API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。