
1,000以上の音声、16言語、20の中国方言、自然言語の伝え方、インライン感情タグを備えた階層的な音声合成。
1,000以上の音声、16言語、20の中国方言、自然言語の伝え方、インライン感情タグを備えた階層的な音声合成。
音声選択はティアに対応しており、基本のボイスIDは両方のティアで動作し、選択したmodel_tierに自動的にマッチングされます。一方、6つのシステムボイスは1つのティアに固定されます。ピッチはレンダリングされた音声のペースも変わるので、元の長さを保ちたいときは速度と組み合わせてください。
別名 Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flashEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
Qwen Audio 3.0 TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID qwen-audio-3-0-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上の Qwen Audio 3.0 TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| input | string | - | 最大 20000 | テキストを合成する。リクエストあたり最大20,000文字まで対応可能です。テキストに直接挿入するインライン表現タグ(例:[興奮]、[笑い]、[ささやき]、[ため息]、[息を呑む]、[皮肉]など)。 |
| model_tier | enum | plus | plus, flash | さらに:最高音質と表現力、コンテンツ制作、オーディオブック、吹き替え、ブランドボイスに最適です。Flash:リアルタイムのインタラクションに最適化され、初回パケット遅延が低く、音声アシスタントやライブエージェントに最適です。各階層はそれぞれ独自の料金で請求されます。 |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | 音声プリセット。基本ボイスは両方のティアで使えるので、model_tierを変えても選択肢が維持されます。6つの旗艦ボイスはティアロックされています:Plusではlonganlingxinとlonganlufeng、Flashではlonganhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loon... |
| voice_id | string | - | - | フリーフォームのボイスIDで、設定時にボイスを上書きします。GET /v1/voicesのどのベース音声でも、素身ID(推奨、両方のティアで対応)または完全認定音声として受け付けます。完全に適格なIDは自動的に選択したmodel_tierにマッチングされます。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 出力サンプルレート(Hz)は音声再生に適し、48000はより大きなファイルサイズで放送品質の出力を提供します。 |
| speed | number | 1 | 0.5 から 2 | 話す速度の倍率。0.5は半速、2.0は倍速です。 |
| pitch | number | 1 | 0.5 から 2 | ピッチ倍率。1.0未満の値は声を下げ、1.0を超えると声を上げます。ピッチはレンダリングされた音声のペースも変化させるので、元の長さを維持したい場合は速度と組み合わせてください。 |
| volume | integer | 50 | 0 から 100 | 出力ラウドネス、ここで基準レベルは50です。 |
| instruction | string | - | 最大 128 | 自然言語による指示で、最大128文字まで対応。感情、トーン、キャラクター、ペース、話し方をコントロールします。例えば「興奮した明るい口調で素早く話す」や「深夜のラジオホストのようにゆっくり読む」などです。 |
| language_hints | array | - | zh, en | 言語コードは混合言語テキストの発音に偏りをつけます。例えば["zh", "en"]。モデルが言語を検出できるようにセットを解除しておきます。 |
| seed | integer | 0 | 0 から 65535 | 種のサンプリング。同じ入力と設定を持つシードを再利用すれば、再現可能なレンダリングが可能です。 |
| bit_rate | integer | 32000 | 16000 から 64000 | エンコーダーのビットレートはBPSで。opusフォーマットにのみ適用され、mp3、wav、pcmでは無視されます。 |
| pronunciation | object | - | - | 発音は書き言葉のキーに重なって上書きされます。例えば{"重要": "zhong4 yao4"}。名前、頭字語、同音異義語の修正に使う。 |
| replace | object | - | - | 合成前に適用される文字通りのテキスト置換、例えば{"EmpirioLabs": "Empirio Labs"}。ブランド名や略称に便利です。 |
Tiers - Plus:コンテンツ制作、オーディオブック、吹き替え、ブランドボイスワークに最高の音質と表現力 - Flash:リアルタイムインタラクションにチューニングされ、初回パケット遅延を低く、音声アシスタントやライブエージェント向けに - model_tierパラメータで切り替えるか、モデルIDとしてqwen-audio-3.0-tts-plusまたはqwen-audio-3.0-tts-flashを送信 Voices - 1,000以上の基本音声 すべての声は両方のティアで利用可能なので、ティアを変更しても選択した声は保持されます。シックスフラッグシップシステムのボイスはティアごとに異なります。Plusではlonganlingxinとlonganlufeng、Flashではlonganhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loongjohn。GET /v1/voicesで全カタログを閲覧し、任意の声を qwen-audio-3.0-tts-plus 0__に通すことができます。入力制限 - リクエストあたり最大20,000文字。 qwen-audio-3.0-tts-plus 1__最大128文字対応SSML入力はサポートされていません。 qwen-audio-3.0-tts-plus 2__は配信方向に使い、テキスト内の内側には qwen-audio-3.0-tts-plus 3__や qwen-audio-3.0-tts-plus 4__などのインラインタグを付けます Billing - 入力テキストの文字単位で選択された階層の料金で請求されます
EmpirioLabs では Qwen Audio 3.0 TTS は従量課金です: プラス合成 $0.20 10,000文字あたり; フラッシュ合成 $0.15 10,000文字あたり。このページのライブ料金表は常に API の請求額と一致します。
Qwen Audio 3.0 TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで Qwen Audio 3.0 TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。