Qwen Audio 3.0 TTSはEmpirioLabsで利用可能です。 これはアリババの音声合成モデルであり、単一のモデルとしてティアスイッチ付きで出荷しています:最高の音質と表現力のためにPlus、リアルタイムインタラクションを用いて初パケット遅延を抑えるFlashです。両方のティアは同じパラメータとボイスライブラリを共有しているので、ボイスを一度選んで1つのフィールドでティアを変えます。
Qwen Audio 3.0 TTSの得意分野
アラビア語、中国語、英語、フランス語、ドイツ語、インドネシア語、イタリア語、日本語、韓国語、マレー語、ポルトガル語、ロシア語、スペイン語、タガログ語、タイ語、ベトナム語を含む16言語と、20の中国語方言地域をカバーしています。配信は二つの方向に向けられます。すなわち、平易な英語です 指導 これは全体のレンダリングの感情、トーン、キャラクター、ペース、スタイルを設定し、インラインタグ(例えば [興奮して], [ささやき], [笑い]、または [ため息] 文の途中で表情を変えるために、そのままテキストに挿入された。
ボイスライブラリのおかげでティア切り替えがスムーズです。基本ボイスは1,000種類以上あり、すべて同じIDで両方のティアに存在しているため、PlusとFlashを切り替えても話している人たちが変わることはありません。さらに、各ティアには独自のフラッグシップシステムボイスが少数あります。
リクエストを出す
これは標準的なOpenAI型音声エンドポイントなので、ほとんどのクライアントは1つの基本URL変更で済みます。
curl https://api.empiriolabs.ai/v1/audio/speech \ -H 「認証:ベアラー $EMPIRIOLABS_API_KEY」 \ -H 「Content-Type: application/json」 \ -d '{ "model": "qwen-audio-3-0-tts", "model_tier": "flash", "input": "[興奮]結果が出て、予測を上回った


