Qwen Audio 3.0 TTS API

1,000以上の音声、16言語、20の中国方言、自然言語の伝え方、インライン感情タグを備えた階層的な音声合成。

Alibaba Cloudオーディオ生成リリース 2026年7月20日Singapore独自エンドポイント新着

Qwen Audio 3.0 TTS について

1,000以上の音声、16言語、20の中国方言、自然言語の伝え方、インライン感情タグを備えた階層的な音声合成。

音声選択はティアに対応しており、基本のボイスIDは両方のティアで動作し、選択したmodel_tierに自動的にマッチングされます。一方、6つのシステムボイスは1つのティアに固定されます。ピッチはレンダリングされた音声のペースも変わるので、元の長さを保ちたいときは速度と組み合わせてください。

別名 Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

Qwen Audio 3.0 TTS の仕様

モデルID
qwen-audio-3-0-tts
開発元
Alibaba Cloud
カテゴリ
オーディオ生成
リリース
2026年7月20日
入力
テキスト
出力
音声
リージョン
Singapore
エンドポイント
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
代替モデルID
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

Qwen Audio 3.0 TTS API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
プラス合成
10,000文字あたり
$0.20
フラッシュ合成
10,000文字あたり
$0.15
料金ページ全体で比較

Qwen Audio 3.0 TTS API の呼び出し方

Qwen Audio 3.0 TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID qwen-audio-3-0-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Qwen Audio 3.0 TTS API の完全リファレンス

Qwen Audio 3.0 TTS API のパラメーター

EmpirioLabs 上の Qwen Audio 3.0 TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
inputstring-最大 20000テキストを合成する。リクエストあたり最大20,000文字まで対応可能です。テキストに直接挿入するインライン表現タグ(例:[興奮]、[笑い]、[ささやき]、[ため息]、[息を呑む]、[皮肉]など)。
model_tierenumplusplus, flashさらに:最高音質と表現力、コンテンツ制作、オーディオブック、吹き替え、ブランドボイスに最適です。Flash:リアルタイムのインタラクションに最適化され、初回パケット遅延が低く、音声アシスタントやライブエージェントに最適です。各階層はそれぞれ独自の料金で請求されます。
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...音声プリセット。基本ボイスは両方のティアで使えるので、model_tierを変えても選択肢が維持されます。6つの旗艦ボイスはティアロックされています:Plusではlonganlingxinとlonganlufeng、Flashではlonganhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loon...
voice_idstring--フリーフォームのボイスIDで、設定時にボイスを上書きします。GET /v1/voicesのどのベース音声でも、素身ID(推奨、両方のティアで対応)または完全認定音声として受け付けます。完全に適格なIDは自動的に選択したmodel_tierにマッチングされます。
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000出力サンプルレート(Hz)は音声再生に適し、48000はより大きなファイルサイズで放送品質の出力を提供します。
speednumber10.5 から 2話す速度の倍率。0.5は半速、2.0は倍速です。
pitchnumber10.5 から 2ピッチ倍率。1.0未満の値は声を下げ、1.0を超えると声を上げます。ピッチはレンダリングされた音声のペースも変化させるので、元の長さを維持したい場合は速度と組み合わせてください。
volumeinteger500 から 100出力ラウドネス、ここで基準レベルは50です。
instructionstring-最大 128自然言語による指示で、最大128文字まで対応。感情、トーン、キャラクター、ペース、話し方をコントロールします。例えば「興奮した明るい口調で素早く話す」や「深夜のラジオホストのようにゆっくり読む」などです。
language_hintsarray-zh, en言語コードは混合言語テキストの発音に偏りをつけます。例えば["zh", "en"]。モデルが言語を検出できるようにセットを解除しておきます。
seedinteger00 から 65535種のサンプリング。同じ入力と設定を持つシードを再利用すれば、再現可能なレンダリングが可能です。
bit_rateinteger3200016000 から 64000エンコーダーのビットレートはBPSで。opusフォーマットにのみ適用され、mp3、wav、pcmでは無視されます。
pronunciationobject--発音は書き言葉のキーに重なって上書きされます。例えば{"重要": "zhong4 yao4"}。名前、頭字語、同音異義語の修正に使う。
replaceobject--合成前に適用される文字通りのテキスト置換、例えば{"EmpirioLabs": "Empirio Labs"}。ブランド名や略称に便利です。
ドキュメントにあと2個のパラメーター

知っておくと便利

Tiers - Plus:コンテンツ制作、オーディオブック、吹き替え、ブランドボイスワークに最高の音質と表現力 - Flash:リアルタイムインタラクションにチューニングされ、初回パケット遅延を低く、音声アシスタントやライブエージェント向けに - model_tierパラメータで切り替えるか、モデルIDとしてqwen-audio-3.0-tts-plusまたはqwen-audio-3.0-tts-flashを送信 Voices - 1,000以上の基本音声 すべての声は両方のティアで利用可能なので、ティアを変更しても選択した声は保持されます。シックスフラッグシップシステムのボイスはティアごとに異なります。Plusではlonganlingxinとlonganlufeng、Flashではlonganhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loongjohn。GET /v1/voicesで全カタログを閲覧し、任意の声を qwen-audio-3.0-tts-plus 0__に通すことができます。入力制限 - リクエストあたり最大20,000文字。 qwen-audio-3.0-tts-plus 1__最大128文字対応SSML入力はサポートされていません。 qwen-audio-3.0-tts-plus 2__は配信方向に使い、テキスト内の内側には qwen-audio-3.0-tts-plus 3__や qwen-audio-3.0-tts-plus 4__などのインラインタグを付けます Billing - 入力テキストの文字単位で選択された階層の料金で請求されます

Qwen Audio 3.0 TTS API: よくある質問

Qwen Audio 3.0 TTS API の料金はいくらですか?

EmpirioLabs では Qwen Audio 3.0 TTS は従量課金です: プラス合成 $0.20 10,000文字あたり; フラッシュ合成 $0.15 10,000文字あたり。このページのライブ料金表は常に API の請求額と一致します。

Qwen Audio 3.0 TTS はどのエンドポイントを使いますか?

Qwen Audio 3.0 TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで Qwen Audio 3.0 TTS を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで Qwen Audio 3.0 TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

Qwen Audio 3.0 TTS の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。