TTS 1.5 Max API

豊富な表現力豊かなプロッディ、15言語の271以上の音声、単語ごとのタイムスタンプによるリアルタイムのSSEストリーミング

Inworldオーディオ生成リリース 2026年1月21日独自エンドポイント

TTS 1.5 Max について

豊富な表現力豊かなプロッディ、15言語の271以上の音声、単語ごとのタイムスタンプによるリアルタイムのSSEストリーミング

別名 TTS Max, Inworld TTS 1.5 Max, TTS-1.5-Max, tts-1-5-max

multi speakerreal timestreamingword timestampscharacter timestampsmultilingualexpressive prosodybroadcast quality

TTS 1.5 Max の仕様

モデルID
tts-1-5-max
プロバイダー
Inworld
カテゴリ
オーディオ生成
リリース
2026年1月21日
入力
テキスト
出力
音声
エンドポイント
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
代替モデルID
inworld-tts-1.5-maxtts-1.5-max

TTS 1.5 Max API の料金最大15%お得

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
シンセシス
1M文字
$35.00$29.75
料金ページ全体で比較

TTS 1.5 Max API の呼び出し方

TTS 1.5 Max は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID tts-1-5-max と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-5-max",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-1-5-max", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
TTS 1.5 Max API の完全リファレンス

TTS 1.5 Max API のパラメーター

EmpirioLabs 上の TTS 1.5 Max API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
inputstring-最大 2000テキストを合成する。リクエストあたり最大2,000文字;クライアントの文の境界でより長いコピーをまとめてください。
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...音声プリセット。英語+スペイン語+ポルトガル語+ヒンディー語+さまざまなアクセントを持つ20人の厳選声優。全271ボイスカタログ(クローンボイスを含む)については、代わりにvoice_idをご利用ください。
voice_idstring--フリーフォームのボイスID。設定するとボイスを上書きします。これを使って、厳選された20プリセットリスト以外の声にも対応できます。Inworld TTS 1.5では、15言語(地域アクセント、性別バリエーション)で271+の名前付きボイスが配信されています。例:マイテ、オリビア、またはGET /v1/voices.の任意のボイスネーム
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47言語コード。Inworld TTS 1.5は15言語をカバーしています。
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAW音声container/codec。WAV = RIFF内でLINEAR16(遍在)。MP3 / OGG = 圧縮。PCM = ヘッダーレス生、チャンクされたリアルタイム再生に有用です。FLAC = ロスレス。
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000出力サンプリングレートはHzで、Inworldのデフォルトで音声モデルがトレーニングする標準です。放送品質を48000に上げます。
speednumber10.5 から 1.5話す速度の倍率。0.5 = 半速、1.5 = 50%速い。
temperaturenumber10.1 から 2声の表現力や変化性。Lower = より一貫性が高い/「フラット」;高いほど = 表現力が豊かですが、レンダリング間で変化が大きいです。
bit_ratenumber12800032000 から 320000MP3 / OGG_OPUSのビットレートはBPSで表しています。他のエンコーディングは無視されます。
apply_text_normalizationenumONON, OFFオンになると、Inworldは数字・略語・日付を音声形式(「USD 5」→「5 US Doll」に拡張します)。
timestamp_typeenumNONENONE, WORD, CHARACTERNONEでない場合は、応答には単語ごとまたは文字ごとのタイムスタンプがtimestamp_infoに含まれます。キャプションやハイライトのUIに便利です。

知っておくと便利

限度 - 最大入力: 1 リクエストあたり 2,000 文字 (文章境界線で長いテキストをチャンク) - WebSocket: 20 同時接続、5 contexts/connection Per-WS メッセージ: 1,000 文字Latency - p90 TTFB: 250 ms (Inworld ベンチマーク)Voices - 271 + 15 カ国語でプリセット - 20 件のハンド 選択プリセットがドロップダウンで公開されます。他のどのボイスも渡します。

TTS 1.5 Max API: よくある質問

TTS 1.5 Max API の料金はいくらですか?

EmpirioLabs では TTS 1.5 Max は従量課金です。このページのライブ料金表は常に API の請求額と一致します。

TTS 1.5 Max はどのエンドポイントを使いますか?

TTS 1.5 Max は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで TTS 1.5 Max を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで TTS 1.5 Max をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

TTS 1.5 Max の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。