首页 博客

如何使用Qwen Audio 3.0 TTS API

Qwen Audio 3.0 通过 API 转语音转EmpirioLabs

Jul 23, 2026

EmpirioLabs AI

Qwen Audio 3.0 TTS 可在 EmpirioLabs 上使用。 这是阿里巴巴的语音合成模型,我们以单一型号形式发布,带有分级切换:Plus用于最高音质和表现力,Flash用于实时交互,首包延迟更低。两层共享相同的参数和语音库,所以你只需选一个语音,只需一个字段切换分级。

Qwen Audio 3.0 TTS 的优势

它涵盖16种语言,包括阿拉伯语、中文、英语、法语、德语、印尼语、意大利语、日语、韩语、马来语、葡萄牙语、俄语、西班牙语、他加禄语、泰语和越南语,以及20个华语方言地区。传送方式有两种:一种是通俗英语 教学 它为整个渲染设定情感、基调、角色、节奏和风格,并配有内联标签,如 [兴奋], (中文), [低语], (中文), [笑],或者 [叹气] 直接插入正文,在句中转换表情。

语音库是切换分级轻松的原因。基础语音超过1000个,且每个声音都存在于两个等级,且同一个ID,所以在Plus和Flash之间切换不会改变说话者。此外,每个等级都有自己的旗舰系统语音。

提出请求

它是标准的OpenAI形语音端点,因此大多数客户端只需更改一个基础URL:

curl https://api.empiriolabs.ai/v1/audio/speech \ -h “授权:持有者 $EMPIRIOLABS_API_KEY” \ -H “内容类型:application/json” \ -d '{ “model”:“qwen-audio-3-0-tts”,“model_tier”:“闪烁”,“输入”:“[兴奋]结果出来了,而且超过了我们的预测![笑声]”,“声音”:“loongjameszhao”,“instruction”:“快速用欢快、充满热情的语气说话”,“response_format”:“mp3”,“sample_rate”:24000 }'

你会获得一个签名音频URL。输出支持MP3、WAV、无头PCM和Opus,采样率从8 kHz到48 kHz不等。速度、音高、音量和种子都暴露在外,还有名字和缩略词的发音覆盖、品牌名的直面文本替换,以及Markdown过滤器,防止格式化字符被朗读。

如需浏览完整的语音目录,请致电 快/v1/voices.它支持按语言、性别、等级进行筛选,并支持跨语音名称、特征和使用场景的自由文本搜索。

建造前有三件事值得了解

基础语音是分层可移植的,系统语音则不是。 任何基础语音ID都能在Plus和Flash上使用,所以你可以在保持声音恒定的情况下,按分级A/B。六大旗舰系统语音每台都锁定一个分级,如果你把一个发错了,API会告诉你哪个分级,而不是模糊地失败。

该模型不支持 SSML。 用途 教学 用于全局交付方向,以及用于本地表达变更的内联标签。这种组合涵盖了人们对 SSML 的大部分需求,且更容易编写。

音高也会改变节奏。 降低音高会拉伸剪辑,提高则压缩剪辑,所以如果你想在原始时长下不同的音高,可以调整 速度 来弥补。

定价与入门

计费是按输入文本字符计费,按你选择的层级计费,且是pay-as-you-go。Flash是两者中更便宜的。当前两层的费率都在 Qwen Audio 3.0 TTS 型号页面 以及 定价页面。 。 。.

你可以试试不用写任何代码 游戏场,其中分层开关、语音选择器和每个参数都是实时控制。完整参数引用在 API 文档。 。 。.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。