TTS 2 API

リアルタイム音声モデルで、平易な英語音声指示、100+言語にわたる一つの音声識別、200ms未満のストリーミングtime-to-first-audio。

Inworldオーディオ生成リリース 2026年5月5日独自エンドポイント新着

TTS 2 について

リアルタイム音声モデルで、平易な英語音声指示、100+言語にわたる一つの音声識別、200ms未満のストリーミングtime-to-first-audio。

別名 Inworld TTS 2, TTS-2

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosody

TTS 2 の仕様

モデルID
tts-2
プロバイダー
Inworld
カテゴリ
オーディオ生成
リリース
2026年5月5日
入力
テキスト
出力
音声
エンドポイント
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
代替モデルID
inworld-tts-2

TTS 2 API の料金最大12%お得

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
シンセシス
1M文字
$25.00$22.00
料金ページ全体で比較

TTS 2 API の呼び出し方

TTS 2 は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID tts-2 と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
TTS 2 API の完全リファレンス

TTS 2 API のパラメーター

EmpirioLabs 上の TTS 2 API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
inputstring-最大 2000テキストを合成する。リクエストあたり最大2,000文字;クライアントの文の境界でより長いコピーをまとめてください。
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...音声プリセット。英語、スペイン語、ポルトガル語、ヒンディー語、そして様々なアクセントをカバーする20人の厳選された声が出演しています。クローン音声を含む全音声カタログを入手するには、代わりにvoice_idをご利用ください。
voice_idstring--フリーフォームのボイスID。設定するとボイスを上書きします。このリストを使って、キュレーションされた20プリセットリストを超えたあらゆる声、クローンや地域ごとの声にも対応できます。GETから任意のボイスネームを渡してください/v1/voices.例:Ashley、Mark。
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47言語コード。このモデルは100+言語にまたがる単一の声のアイデンティティを保持します。ドロップダウンになくても、サポートされているコードはここに渡してください。
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAW音声container/codec。WAV = RIFF内でLINEAR16(遍在)。MP3 / OGG = 圧縮。PCM = ヘッダーレス生、チャンクされたリアルタイム再生に有用です。FLAC = ロスレス。
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000出力サンプリングレートはHzで、Inworldのデフォルトで音声モデルがトレーニングする標準です。放送品質を48000に上げます。
speednumber10.5 から 1.5話す速度の倍率。0.5 = 半速、1.5 = 50%速い。
temperaturenumber10.1 から 2声の表現力や変化性。Lower = より一貫性が高い/「フラット」;高いほど = 表現力が豊かですが、レンダリング間で変化が大きいです。
bit_ratenumber12800032000 から 320000MP3 / OGG_OPUSのビットレートはBPSで表しています。他のエンコーディングは無視されます。
apply_text_normalizationenumONON, OFFオンになると、Inworldは数字・略語・日付を音声形式(「USD 5」→「5 US Doll」に拡張します)。
timestamp_typeenumNONENONE, WORD, CHARACTERNONEでない場合は、応答には単語ごとまたは文字ごとのタイムスタンプがtimestamp_infoに含まれます。キャプションやハイライトのUIに便利です。

知っておくと便利

制限 - 最大入力:1リクエストあたり2,000文字(文の境界でチャンクが長くなる) - WebSocket:同時接続20、contexts/connection5 - WSあたりメッセージ:1,000文字 レイテンシ - p90 TTFB:200ms未満(Inworldベンチマーク) ボイス - 100+言語間で保持される1つの音声アイデンティティ - ドロップダウンでキュレーション済みプリセット;他の音声IDをvoice_idで渡す - 平易な英語の音声指示でトーンや伝え方を調整します

TTS 2 API: よくある質問

TTS 2 API の料金はいくらですか?

EmpirioLabs では TTS 2 は従量課金です。このページのライブ料金表は常に API の請求額と一致します。

TTS 2 はどのエンドポイントを使いますか?

TTS 2 は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで TTS 2 を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで TTS 2 をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

TTS 2 の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。