分层语音合成,拥有1000多个语音、16种语言、20种汉语方言、自然语言表达方向和内联情感标签。
语音选择对应等级:基础语音ID在两个等级都有效,并自动匹配到所选model_tier,而六个系统语音则锁定在一个等级。音高还会改变渲染音频的节奏,所以如果想保持原始时长,可以将音调与速度匹配。
也称为 Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Qwen Audio 3.0 TTS 通过 POST /v1/audio/speech 生成语音并返回可播放的音频。把要朗读的文本作为 input,连同模型 ID qwen-audio-3-0-tts 一起发送。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上 Qwen Audio 3.0 TTS API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| input | string | - | 最大 20000 | 文本可合成。每个请求最多可包含20,000个字符。支持直接在文本中放置内联表达标签,例如[兴奋]、[笑]、[低语]、[叹气]、[喘气]和[讽刺]。 |
| model_tier | enum | plus | plus, flash | 此外:最高音质和表现力,最适合内容创作、有声书、配音和品牌语音工作。Flash:调校为实时交互,首包延迟更低,最适合语音助手和真人客服。每个套餐按自己的费率收费。 |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | 语音预设。基础声音在两个音色上都有效,所以更改音色model_tier可以保留你的选择。六个旗舰声色是等级锁定的:Plus上的龙安灵心和龙安路丰,以及Flash上的longanhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、龙钟。完整的1026个音色目录请使用voice_id。 |
| voice_id | string | - | - | 自由格式语音ID,设置时覆盖语音。接受来自GET/v1/voices的任意基础语音,既可作为裸ID(推荐,适用于两级)或完全合格ID。完全合格ID会自动匹配到所选model_tier。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 输出采样率为Hz。24000适合语音播放,48000则在更大文件大小下提供广播质量的输出。 |
| speed | number | 1 | 0.5 到 2 | 说话速度倍数。0.5是半速,2.0是双倍速。 |
| pitch | number | 1 | 0.5 到 2 | 音高倍率。低于1.0的数值会降低声音,超过的数值会提升音高。音高还会影响渲染音频的节奏,所以当你想保持原始时长时,可以把音高和速度配合使用。 |
| volume | integer | 50 | 0 到 100 | 输出响度,50是参考电平。 |
| instruction | string | - | 最大 128 | 自然语言表达指令,最多128个字符。控制情感、语气、角色、节奏和说话风格,例如“以兴奋、欢快的语气快速说话”或“像深夜电台主持人一样慢慢朗读”。 |
| language_hints | array | - | zh, en | 语言编码会偏向混合语言文本的发音,例如[“zh”, “en”]。保持未设置,让模型检测语言。 |
| seed | integer | 0 | 0 到 65535 | 采样种子。重复使用输入和设置相同的种子,以实现可重复渲染。 |
| bit_rate | integer | 32000 | 16000 到 64000 | 编码码率以BPS为单位。仅适用于opus格式,mp3、wav和pcm则被忽略。 |
| pronunciation | object | - | - | 发音覆盖书写形式键位,例如{“重要”:“zhong4 yao4}。用它来修正名字、缩写和同形字。 |
| replace | object | - | - | 合成前应用的文字替换,例如 {“EmpirioLabs”: “Empirio Labs”}。对品牌名和缩写非常有用。 |
层级 - Plus:最高音质和表现力,适用于内容创作、有声书、配音和品牌配音工作 - Flash:调校为实时交互,首包延迟更低,适用于语音助手和实时代理 - 用model_tier参数切换,或发送qwen-audio-3.0-tts-plus或qwen-audio-3.0-tts-flash作为型号IDVoices - 超过1000个基础语音, 所有语音在两个层级都可用,因此更改版本时保留您选择的语音。- 六大旗舰系统语音具有特定等级:Plus版为longanlingxin和longanlufeng,Flash版为longanhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loongjohn。- 使用GET /v1/voices浏览完整目录,并可通过 qwen-audio-3.0-tts-plus 0__转入任何语音。输入限制, 每次请求最多20,000字符, qwen-audio-3.0-tts-plus 1__最多接受128字符, 不支持SSML输入。使用 qwen-audio-3.0-tts-plus 2__表示交付方向,并在文本内使用内联标签,如 qwen-audio-3.0-tts-plus 3__或 qwen-audio-3.0-tts-plus 4__ 计费 - 按输入文本字符按所选层级的费率计费
在 EmpirioLabs,Qwen Audio 3.0 TTS 按量计费:加合成 $0.20 每10,000字符; 闪合成 $0.15 每10,000字符。本页的实时价格表始终与 API 的实际计费一致。
Qwen Audio 3.0 TTS 通过 api.empiriolabs.ai 上的 POST /v1/audio/speech 提供,使用标准的 Bearer 令牌认证。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Qwen Audio 3.0 TTS,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。