首页 博客

如何使用TTS 2 Flash API

如何使用TTS 2 Flash API

Sep 4, 2026

EmpirioLabs AI

TTS 2 Flash 已在EmpirioLabs上提供。 Inworld 已将实时 TTS-2 系列正式发布,Flash 是其中延迟优先的成员。它拥有跨 200+ 种语言和地区的单一语音身份,合成时可流式传输音频,并可返回每词或字符的时间戳。同系列中以质量为先的实时 TTS-2 也已在线。

TTS 2 Flash 支持什么

Flash接收文本并返回音频。它用一个语音身份覆盖200+种语言和地区,所以当你切换语言时,同一个语音ID会保持其字符,包括在一代中途切换。输出以MP3、WAV、OGG、FLAC、PCM、A-LAW或μ-law的形式返回,采样率从8 kHz到48 kHz。

语音下拉菜单显示20个精心挑选的预设。那是便利列表,不是目录:通过任何其他语音ID,包括地区和克隆声音,都通过 voice_id,并调用语音端点以枚举可用内容。

如何称TTS 2为Flash

使用兼容 OpenAI 的语音端点并设置 模型tts-2-flash编号:

curl https://api.empiriolabs.ai/v1/audio/speech \ -h '授权:承载者 $EMPIRIOLABS_API_KEY' \ -h '内容类型:application/json' \ -d '{ “model”: “tts-2-flash”, “input”: “你好,感谢您的来电。今天我能为您做些什么?”, “voice”: “Ashley”, “language”: “en-US”, “output_format”: “MP3” }'

响应会带有已签名的生成音频URL,以及一个包含计费字符数的使用块。计费是按输入字符计费的,所以成本是追踪你发送的文本,而不是返回音频的长度。

流媒体

对于语音代理和任何在音频仍在制作中播放音频的设备,请发送到同一端点的流媒体版本。它返回服务器发送事件: 音频.chunk 活动中以合成方式呈现Base64音频,可选 音频.时间戳 当你要求单词或角色时间,以及最后一个时机时,事件发生 音频.完成 带有重放URL和使用块的事件。设置 timestamp_type真是太棒了角色 当你开车时,字幕或高亮界面。

在TTS 2和TTS 2闪存之间选择

两款型号共享相同的请求形状、相同的语音和语言覆盖,因此切换只需一个词即可更改 模型.选择时关键的区别是配送控制。

实时TTS-2接受纯英语语音指令:用括号打开文本,模型以该指令执行该行,而非大声朗读指令。它既能理解简短指令,也能理解自由形式的简报。

{ “model”:“tts-2”, “input”:“[热情地说话,像在迎接老朋友] 早上好,很高兴再次见到你。”, “声音”:“Ashley” }

TTS 2 闪存不应用这个方向。发送同样的括号文本给闪存时会被忽略,所以当性能重要时选择 TTS 2,延迟和音量重要时选择闪存。在闪存中,用 速度 以及 温度 而是控制。

第一次通话前值得了解的笔记

  • 语音指导仅限TTS 2。 Flash 会无声地忽略括号指令而不是拒绝,因此为 TTS 2 编写的提示会在 Flash 上运行,然后返回时会无方向。
  • 方向文本是计费的。 括号内的指令即使从未被口说,仍计入请求的字符总数,因此请简短说明。
  • 每个请求的限制是2000个字符。 在客户端的句子边界处分块较长的文本,并串接音频,而不是发送一个长段。
  • 文本归一化默认开启。 数字、日期和缩写会被扩展为口语形式,这也意味着计费字符数可能超过你发送的字符串长度。如果你已经自己规范了文本,请关闭它。

开始吧

试试 TTS 2 闪存 游戏场,阅读 API 参考,或查看当前费率 模型页面。 。 。.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。