首页 博客

如何使用 Quen 音频 3.0 TTS API

Qwen 音频 3.0 TTS 通过 API 运行于 EmpirioLabs

Jul 23, 2026

EmpirioLabs AI

Qwen Audio 3.0 TTS可在 EmpirioLabs 上获得. 它是阿里巴巴的语音合成模型,我们把它作为单型模型,带有一级开关: 加音质和表达性最高,闪电与下一级包空闲进行实时交互. 两层共享相同的参数和同一个语音库,所以你选择一个声音一次,用一个字段来改变两层.

Quen 音频 3.0 TTS 擅长什么

它涵盖16种语言,包括阿拉伯语,汉语,英语,法语,德语,印尼语,意大利语,日语,朝鲜语,马来语,葡萄牙语,俄语,西班牙语,塔加洛格语,泰语,越南语,此外还有20个汉语方言区. 交付有两种方式: 简单英语 指令 设定整个渲染过程的情感、语气、性格、速度和风格,以及内在标记,例如 [兴奋], (中文), [低声], (中文), [笑声],或者 [叹息] 直接掉到文字中,以改变表达的中刑。

语音库是层次开关无痛的原因. 有超过1000个基声,每一个基声都存在于同一个id下的两层,因此Plus和Flash之间的移动不会改变谁说话. 除此之外,每层都有一套自己的旗舰系统声音.

提出请求

这是标准的 OpenAI 形状的语音端点,所以大多数客户端需要一个基础 URL 更改:

卷 https://api.empiriolabs.ai/v1/audio/speech =-H "授权:熊熊 $EMPRIOLABS API KEY" "联系: application/json "=================================================================================================================================================================== 结果是,他们击败了我们的预测! [笑],"声音":"loongjameszhao","教程":"用兴奋,热情的语气快速说话","response format":"mp3","sample rate":24000}'

你得到一个签名的音频 URL。 输出支持MP3,WAV,无头PCM,以及Opus,样本速率从8千赫到48千赫. 速度、投球、音量和种子都暴露在外,还有地名和缩略语的发音覆盖,品牌名称的文字替换,以及一个Markdown过滤器,因此格式化字符不高声读取。

要浏览完整的语音目录,呼叫 获取 /v1/voices它支持按语言、性别、层次进行过滤,并跨语音名称、特征和使用案例进行自由文字搜索。

三件事值得你先知道,然后才能建起来

基础声音是可移动的,系统声音不是。 任意基声id在 Plus 和 Flash 上都有效,所以您可以 A/B 具有声音恒定的电位. 6个旗舰系统的声音被锁定到各一个级别,如果你发送一个到错误的级别,API会告诉你是哪个级别服务,而不是模糊的失败.

此模型不支持 SSML 。 用途 指令 用于全局执行方向和本地表达式变化的内置标记。 这一组合涵盖了人们所接触的SSML的大部分工作,而且作者也更容易.

皮奇也会改变速度 低音投球可以拉伸弹夹,提高弹夹可以压缩弹夹,所以如果想要在原时段另投一个,请调整 速度 以补偿。

定价和开始

计费是每个输入文本的字符, 以您选择的级别为准, 它是 pay-as-you-go 。 闪电是两者中最便宜的. 目前两个级别的比率为: Quen 音频 3.0 TTS 模型页面 继续 定价页面。 。 。.

你可以不写代码就试试 游戏场,其中阶梯切换器,采声器,以及每个参数都是活控. 完整的参数引用在 API 文档。 。 。.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。