
豊富な表現力豊かなプロッディ、15言語の271以上の音声、単語ごとのタイムスタンプによるリアルタイムのSSEストリーミング
豊富な表現力豊かなプロッディ、15言語の271以上の音声、単語ごとのタイムスタンプによるリアルタイムのSSEストリーミング
別名 TTS Max, Inworld TTS 1.5 Max, TTS-1.5-Max, tts-1-5-max
tts-1-5-max/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-1.5-maxtts-1.5-maxEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
TTS 1.5 Max は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID tts-1-5-max と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-5-max",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-1-5-max", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上の TTS 1.5 Max API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| input | string | - | 最大 2000 | テキストを合成する。リクエストあたり最大2,000文字;クライアントの文の境界でより長いコピーをまとめてください。 |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | 音声プリセット。英語+スペイン語+ポルトガル語+ヒンディー語+さまざまなアクセントを持つ20人の厳選声優。全271ボイスカタログ(クローンボイスを含む)については、代わりにvoice_idをご利用ください。 |
| voice_id | string | - | - | フリーフォームのボイスID。設定するとボイスを上書きします。これを使って、厳選された20プリセットリスト以外の声にも対応できます。Inworld TTS 1.5では、15言語(地域アクセント、性別バリエーション)で271+の名前付きボイスが配信されています。例:マイテ、オリビア、またはGET /v1/voices.の任意のボイスネーム |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47言語コード。Inworld TTS 1.5は15言語をカバーしています。 |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | 音声container/codec。WAV = RIFF内でLINEAR16(遍在)。MP3 / OGG = 圧縮。PCM = ヘッダーレス生、チャンクされたリアルタイム再生に有用です。FLAC = ロスレス。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | 出力サンプリングレートはHzで、Inworldのデフォルトで音声モデルがトレーニングする標準です。放送品質を48000に上げます。 |
| speed | number | 1 | 0.5 から 1.5 | 話す速度の倍率。0.5 = 半速、1.5 = 50%速い。 |
| temperature | number | 1 | 0.1 から 2 | 声の表現力や変化性。Lower = より一貫性が高い/「フラット」;高いほど = 表現力が豊かですが、レンダリング間で変化が大きいです。 |
| bit_rate | number | 128000 | 32000 から 320000 | MP3 / OGG_OPUSのビットレートはBPSで表しています。他のエンコーディングは無視されます。 |
| apply_text_normalization | enum | ON | ON, OFF | オンになると、Inworldは数字・略語・日付を音声形式(「USD 5」→「5 US Doll」に拡張します)。 |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | NONEでない場合は、応答には単語ごとまたは文字ごとのタイムスタンプがtimestamp_infoに含まれます。キャプションやハイライトのUIに便利です。 |
限度 - 最大入力: 1 リクエストあたり 2,000 文字 (文章境界線で長いテキストをチャンク) - WebSocket: 20 同時接続、5 contexts/connection Per-WS メッセージ: 1,000 文字Latency - p90 TTFB: 250 ms (Inworld ベンチマーク)Voices - 271 + 15 カ国語でプリセット - 20 件のハンド 選択プリセットがドロップダウンで公開されます。他のどのボイスも渡します。
EmpirioLabs では TTS 1.5 Max は従量課金です。このページのライブ料金表は常に API の請求額と一致します。
TTS 1.5 Max は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで TTS 1.5 Max をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。