首页 博客

如何使用Gemini 3.8闪光TTS和Flash-Lite TTS

通过API支持Gemini 3.8闪存TTS和Flash-Lite TTS

Sep 23, 2026

EmpirioLabs AI

EmpirioLabs 上有 Gemini 3.8 闪电 TTS 和 Gemini 3.8 Flash-Lite TTS。 两者都通过将文本转为语音 /v1/audio/speech后,音频流 /v1/audio/speech:stream后并且都使用了超过2000个音色的同一个库。两者都能在API和Playground中工作。

这两种型号

  • gemini-3-8-flash-tts 专为创意指导设计:旁白、有声书、角色和双人场景。涵盖130种语言。
  • gemini-3-8-flash-lite-tts 专为大量工作设计,如语音代理、配音和批量音频,生成音频的费率较低。它覆盖101种语言。

两个型号都接受相同的请求体,因此在它们之间切换是 模型。 。 。.

你的第一个请求

curl https://api.empiriolabs.ai/v1/audio/speech \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -H “内容类型:application/json” \ -d '{ “型号”:“gemini-3-8-flash-tts”, “输入”:“欢迎回来。<短暂停顿> 这是本周发生的变化。”, “声音”:“Kore”, “style_prompt”:“温暖且从容” }'

响应带有签名的音频URL。默认格式为WAV,频率为24,000 Hz。设置 output_format 到 MP3, (中文), OGG, (中文), 阿拉法,或者 穆拉, 和 sample_rate 频率可从8,000、16,000、22,050、24,000、44,100或48,000 Hz中任一。

演出导演

  • 风格方向。 style_prompt 为整段话定下基调,例如“冷静且令人安心”或“兴奋的体育评论员”。
  • 声音标签。 标签 <laugh>, (中文), <sigh>, (中文), <breath>, 和 <短暂的停顿> 在声音应该发生的位置排线。完整列表在 输入 参数在模型引用中。即使文本是另一种语言,也要使用英文标签。
  • 强调。 用大写字母来强调。

双人对话

设定 模式 到 多重,为每个说话者选择一个声音,满足 声音 以及 配音2每行开头都用说话者的名字和冒号开头。名字必须一致 speaker1_name 以及 speaker2_name,默认为 发言人1 以及 说话者2。 。 。.

{ “型号”:“gemini-3-8-flash-lite-tts”,“模式”:“多”,“speaker1_name”:“玛雅”,“speaker2_name”:“西奥”,“voice”:“Aoede”,“voice2”:“Puck”,“输入”:“Maya:货物到了吗?\nTheo:到了。<laugh>每个箱子,准时。” }

选择声音

三十个声音 声音 列表,如Kore、Puck、Charon和Aoede,使用所有支持的语言。完整的图书馆包含超过2000个声音,分布在30个地点,每个地点都有语言、口音、性别、音高和描述。列出时 快/v1/voices 并通过 进行过滤 语言, (中文), 性别, (中文), 音高,或一个搜索词 q编号:

curl “https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -h ”授权:承载人 $EMPIRIOLABS_API_KEY”

任何列表返回的语音ID都能用 声音 以及 配音2。 。 。.

流媒体

/v1/audio/speech:stream后 取同一个实体并返回服务器发送事件: 音频.chunk 在音频生成时携带base64 16位PCM(24,000 Hz)的事件,然后是 音频.完成 事件中附有请求格式的完整文件链接。

作战笔记

  1. 为Gemini 3.1 Flash TTS编写的脚本需要重写其标签。 3.8型号使用角括号标签,如 <whispers> 以及 <laugh> 而不是3.1用方括号标签。移动脚本时更新标签。
  2. 图书馆的声音保留着自己的语言。 当你设定时 语言 结合图书馆声音,必须是该声音所在地: fr-fr-advisor-1 与 美国 被拒绝。30个多语言声音接受任何语言。
  3. 对话标签必须与说话者姓名相匹配。 在 多重 模式,第一行标记前的文本被拒绝,且标签不匹配的行 speaker1_name 也不是 speaker2_name 作为上一回合的一部分。
  4. 速度 适用于完整文件。 流端拒绝 速度 除1.0版本外。请求文件 /v1/audio/speech后 当你需要不同的速度时。

定价

这两种型号都是按需付费,无需订阅。请求按输入文本标记和生成音频计费,每秒语音32个音频标记,Flash-Lite的生成音频费率较低。当前速率可在模型页面上查询 双子座3.8闪电TTS 以及 Gemini 3.8 Flash-Lite TTS 以及 定价页面。 。 。.

开始建造

试试看 双子座3.8闪电TTS 或 Gemini 3.8 Flash-Lite TTS Playground并阅读 API 参考 闪电侠 以及 Flash-Lite。 。 。.

同一家族的实时语音对话,请参见 如何使用Gemini 3.8 Live和Live Extended Thinking(扩展思维)。 。 。.

披露:这篇文章是在AI的协助下撰写的,并由EmpirioLabs AI审查.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。