广播质量语音合成,具有丰富的表达式音标,271+语音跨越15种语言,实时SSE流传每字时间戳.
也称为 TTS Max, Inworld TTS 1.5 Max, TTS-1.5-Max, tts-1-5-max
tts-1-5-max/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-1.5-maxtts-1.5-max来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
TTS 1.5 Max 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID tts-1-5-max 一起发送。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-5-max",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-1-5-max", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上 TTS 1.5 Max API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input | string | - | 最大 2000 | 文本要综合。每个请求最多2000字符;在客户端的句子边界处,分块更长的副本。 |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | 语音预设。20位精心挑选的声音,涵盖英语+西班牙语+葡萄牙语+印地语+多种口音。对于完整的271声部目录(包括克隆声),请使用voice_id。 |
| voice_id | string | - | - | 自由形式的语音ID。设置时覆盖语音。用这个词来处理精选20个预设列表之外的声音。Inworld TTS 1.5 支持271+个名字配音,涵盖15种语言(地区口音、性别变体)。举例:Maitê、Olivia,或GET /v1/voices.中的任何声音名字 |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47语言代码。Inworld TTS 1.5 涵盖了 15 种语言。 |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | 音频container/codec。WAV = LINEAR16 RIFF(无处不在)。MP3 / OGG = 压缩。PCM = 无标题原始,适合分块实时播放。FLAC = 无损。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | 输出采样率以Hz为单位。24000是Inworld的默认采样率,也是其语音模型训练的标准;广播质量提升到48000。 |
| speed | number | 1 | 0.5 到 1.5 | 说话率乘数。0.5 = 半速,1.5 = 快50%。 |
| temperature | number | 1 | 0.1 到 2 | 声音的表现力/变化性。Lower = 更稳定/“平坦”;更高=表现力更强,但渲染间差异更大。 |
| bit_rate | number | 128000 | 32000 到 320000 | MP3 / OGG_OPUS 的比特率以 BPPS 表示。其他编码则被忽略。 |
| apply_text_normalization | enum | ON | ON, OFF | 开启后,Inworld 会将数字/缩写/日期扩展为口头形式(“5美元”→“5美元”)。 |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | 如果不是 NONE,响应会包含每个词或每个字符的时间戳,timestamp_info。对标题/高亮界面很有用。 |
Limits - 最大输入:每个请求2,000个字符(句号边界处的较长文本) - WebSocket:20个并行连接,5 contexts/connection Per-WS消息:1000个字符Latency - p90 TTFB:低于250 ms(世界基准)Voices - 271+ 命名预置,跨越15种语言 - 20个手选预置在下架中曝光;通过 voice_id 通过其他语音ID
在 EmpirioLabs,TTS 1.5 Max 按量计费。本页的实时价格表始终与 API 的实际计费一致。
TTS 1.5 Max 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 TTS 1.5 Max,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。