Qwen Audio 3.0 TTS可在 EmpirioLabs 上获得. 它是阿里巴巴的语音合成模型,我们把它作为单型模型,带有一级开关: 加音质和表达性最高,闪电与下一级包空闲进行实时交互. 两层共享相同的参数和同一个语音库,所以你选择一个声音一次,用一个字段来改变两层.
Quen 音频 3.0 TTS 擅长什么
它涵盖16种语言,包括阿拉伯语,汉语,英语,法语,德语,印尼语,意大利语,日语,朝鲜语,马来语,葡萄牙语,俄语,西班牙语,塔加洛格语,泰语,越南语,此外还有20个汉语方言区. 交付有两种方式: 简单英语 指令 设定整个渲染过程的情感、语气、性格、速度和风格,以及内在标记,例如 [兴奋], (中文), [低声], (中文), [笑声],或者 [叹息] 直接掉到文字中,以改变表达的中刑。
语音库是层次开关无痛的原因. 有超过1000个基声,每一个基声都存在于同一个id下的两层,因此Plus和Flash之间的移动不会改变谁说话. 除此之外,每层都有一套自己的旗舰系统声音.
提出请求
这是标准的 OpenAI 形状的语音端点,所以大多数客户端需要一个基础 URL 更改:
卷 https://api.empiriolabs.ai/v1/audio/speech =-H "授权:熊熊 $EMPRIOLABS API KEY" "联系: application/json "=================================================================================================================================================================== 结果是,他们击败了我们的预测! [笑],"声音":"loongjameszhao","教程":"用兴奋,热情的语气快速说话","response format":"mp3","sample rate":24000}'
你得到一个签名的音频 URL。 输出支持MP3,WAV,无头PCM,以及Opus,样本速率从8千赫到48千赫. 速度、投球、音量和种子都暴露在外,还有地名和缩略语的发音覆盖,品牌名称的文字替换,以及一个Markdown过滤器,因此格式化字符不高声读取。
要浏览完整的语音目录,呼叫 获取 /v1/voices它支持按语言、性别、层次进行过滤,并跨语音名称、特征和使用案例进行自由文字搜索。
三件事值得你先知道,然后才能建起来
基础声音是可移动的,系统声音不是。 任意基声id在 Plus 和 Flash 上都有效,所以您可以 A/B 具有声音恒定的电位. 6个旗舰系统的声音被锁定到各一个级别,如果你发送一个到错误的级别,API会告诉你是哪个级别服务,而不是模糊的失败.
此模型不支持 SSML 。 用途 指令 用于全局执行方向和本地表达式变化的内置标记。 这一组合涵盖了人们所接触的SSML的大部分工作,而且作者也更容易.
皮奇也会改变速度 低音投球可以拉伸弹夹,提高弹夹可以压缩弹夹,所以如果想要在原时段另投一个,请调整 速度 以补偿。
定价和开始
计费是每个输入文本的字符, 以您选择的级别为准, 它是 pay-as-you-go 。 闪电是两者中最便宜的. 目前两个级别的比率为: Quen 音频 3.0 TTS 模型页面 继续 定价页面。 。 。.
你可以不写代码就试试 游戏场,其中阶梯切换器,采声器,以及每个参数都是活控. 完整的参数引用在 API 文档。 。 。.



