
实时语音模型,采用纯英语语音指导,跨100+语言实现统一语音身份,且流媒体time-to-first-audio低于200毫秒。
实时语音模型,采用纯英语语音指导,跨100+语言实现统一语音身份,且流媒体time-to-first-audio低于200毫秒。
也称为 Inworld TTS 2, TTS-2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
TTS 2 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID tts-2 一起发送。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上 TTS 2 API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input | string | - | 最大 2000 | 文本要综合。每个请求最多2000字符;在客户端的句子边界处,分块更长的副本。 |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | 语音预设。20位精心挑选的声音,涵盖英语、西班牙语、葡萄牙语、印地语及各种口音。想要完整的语音目录(包括克隆声音),请使用voice_id。 |
| voice_id | string | - | - | 自由形式的语音ID。设置时覆盖语音。利用这些来处理超出20个预设列表的声音,包括克隆和地区声音。传递来自GET的任何语音/v1/voices.示例:Ashley,Mark。 |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47语言代码。该模型在100+语言中保持一个语音身份;即使下拉菜单里没有支持的代码,也请把它传递到这里。 |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | 音频container/codec。WAV = LINEAR16 RIFF(无处不在)。MP3 / OGG = 压缩。PCM = 无标题原始,适合分块实时播放。FLAC = 无损。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | 输出采样率以Hz为单位。24000是Inworld的默认采样率,也是其语音模型训练的标准;广播质量提升到48000。 |
| speed | number | 1 | 0.5 到 1.5 | 说话率乘数。0.5 = 半速,1.5 = 快50%。 |
| temperature | number | 1 | 0.1 到 2 | 声音的表现力/变化性。Lower = 更稳定/“平坦”;更高=表现力更强,但渲染间差异更大。 |
| bit_rate | number | 128000 | 32000 到 320000 | MP3 / OGG_OPUS 的比特率以 BPPS 表示。其他编码则被忽略。 |
| apply_text_normalization | enum | ON | ON, OFF | 开启后,Inworld 会将数字/缩写/日期扩展为口头形式(“5美元”→“5美元”)。 |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | 如果不是 NONE,响应会包含每个词或每个字符的时间戳,timestamp_info。对标题/高亮界面很有用。 |
限制 - 最大输入:每个请求2000字符(句子边界处文本块更长) - WebSocket:20个并发连接,5个contexts/connection - 每个窗口消息:1000个字符 延迟 - p90 TTFB:低于200毫秒(Inworld基准测试) 语音 - 跨100+语言持有一个语音身份 - 下拉菜单中策划的预设;通过voice_id传递任何其他语音ID, 通俗英语语音指令以引导语气和表达方式
在 EmpirioLabs,TTS 2 按量计费。本页的实时价格表始终与 API 的实际计费一致。
TTS 2 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 TTS 2,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。