TTS 2 Flash 已在EmpirioLabs上提供。 Inworld 已将实时 TTS-2 系列正式发布,Flash 是其中延迟优先的成员。它拥有跨 200+ 种语言和地区的单一语音身份,合成时可流式传输音频,并可返回每词或字符的时间戳。同系列中以质量为先的实时 TTS-2 也已在线。
TTS 2 Flash 支持什么
Flash接收文本并返回音频。它用一个语音身份覆盖200+种语言和地区,所以当你切换语言时,同一个语音ID会保持其字符,包括在一代中途切换。输出以MP3、WAV、OGG、FLAC、PCM、A-LAW或μ-law的形式返回,采样率从8 kHz到48 kHz。
语音下拉菜单显示20个精心挑选的预设。那是便利列表,不是目录:通过任何其他语音ID,包括地区和克隆声音,都通过 voice_id,并调用语音端点以枚举可用内容。
如何称TTS 2为Flash
使用兼容 OpenAI 的语音端点并设置 模型 到 tts-2-flash编号:
curl https://api.empiriolabs.ai/v1/audio/speech \ -h '授权:承载者 $EMPIRIOLABS_API_KEY' \ -h '内容类型:application/json' \ -d '{ “model”: “tts-2-flash”, “input”: “你好,感谢您的来电。今天我能为您做些什么?”, “voice”: “Ashley”, “language”: “en-US”, “output_format”: “MP3” }'
响应会带有已签名的生成音频URL,以及一个包含计费字符数的使用块。计费是按输入字符计费的,所以成本是追踪你发送的文本,而不是返回音频的长度。
流媒体
对于语音代理和任何在音频仍在制作中播放音频的设备,请发送到同一端点的流媒体版本。它返回服务器发送事件: 音频.chunk 活动中以合成方式呈现Base64音频,可选 音频.时间戳 当你要求单词或角色时间,以及最后一个时机时,事件发生 音频.完成 带有重放URL和使用块的事件。设置 timestamp_type 到 真是太棒了 或 角色 当你开车时,字幕或高亮界面。
在TTS 2和TTS 2闪存之间选择
两款型号共享相同的请求形状、相同的语音和语言覆盖,因此切换只需一个词即可更改 模型.选择时关键的区别是配送控制。
实时TTS-2接受纯英语语音指令:用括号打开文本,模型以该指令执行该行,而非大声朗读指令。它既能理解简短指令,也能理解自由形式的简报。
{ “model”:“tts-2”, “input”:“[热情地说话,像在迎接老朋友] 早上好,很高兴再次见到你。”, “声音”:“Ashley” }
TTS 2 闪存不应用这个方向。发送同样的括号文本给闪存时会被忽略,所以当性能重要时选择 TTS 2,延迟和音量重要时选择闪存。在闪存中,用 速度 以及 温度 而是控制。
第一次通话前值得了解的笔记
- 语音指导仅限TTS 2。 Flash 会无声地忽略括号指令而不是拒绝,因此为 TTS 2 编写的提示会在 Flash 上运行,然后返回时会无方向。
- 方向文本是计费的。 括号内的指令即使从未被口说,仍计入请求的字符总数,因此请简短说明。
- 每个请求的限制是2000个字符。 在客户端的句子边界处分块较长的文本,并串接音频,而不是发送一个长段。
- 文本归一化默认开启。 数字、日期和缩写会被扩展为口语形式,这也意味着计费字符数可能超过你发送的字符串长度。如果你已经自己规范了文本,请关闭它。



