
リアルタイム音声モデルで、平易な英語音声指示、100+言語にわたる一つの音声識別、200ms未満のストリーミングtime-to-first-audio。
リアルタイム音声モデルで、平易な英語音声指示、100+言語にわたる一つの音声識別、200ms未満のストリーミングtime-to-first-audio。
別名 Inworld TTS 2, TTS-2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
TTS 2 は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID tts-2 と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs 上の TTS 2 API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| input | string | - | 最大 2000 | テキストを合成する。リクエストあたり最大2,000文字;クライアントの文の境界でより長いコピーをまとめてください。 |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | 音声プリセット。英語、スペイン語、ポルトガル語、ヒンディー語、そして様々なアクセントをカバーする20人の厳選された声が出演しています。クローン音声を含む全音声カタログを入手するには、代わりにvoice_idをご利用ください。 |
| voice_id | string | - | - | フリーフォームのボイスID。設定するとボイスを上書きします。このリストを使って、キュレーションされた20プリセットリストを超えたあらゆる声、クローンや地域ごとの声にも対応できます。GETから任意のボイスネームを渡してください/v1/voices.例:Ashley、Mark。 |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47言語コード。このモデルは100+言語にまたがる単一の声のアイデンティティを保持します。ドロップダウンになくても、サポートされているコードはここに渡してください。 |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | 音声container/codec。WAV = RIFF内でLINEAR16(遍在)。MP3 / OGG = 圧縮。PCM = ヘッダーレス生、チャンクされたリアルタイム再生に有用です。FLAC = ロスレス。 |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | 出力サンプリングレートはHzで、Inworldのデフォルトで音声モデルがトレーニングする標準です。放送品質を48000に上げます。 |
| speed | number | 1 | 0.5 から 1.5 | 話す速度の倍率。0.5 = 半速、1.5 = 50%速い。 |
| temperature | number | 1 | 0.1 から 2 | 声の表現力や変化性。Lower = より一貫性が高い/「フラット」;高いほど = 表現力が豊かですが、レンダリング間で変化が大きいです。 |
| bit_rate | number | 128000 | 32000 から 320000 | MP3 / OGG_OPUSのビットレートはBPSで表しています。他のエンコーディングは無視されます。 |
| apply_text_normalization | enum | ON | ON, OFF | オンになると、Inworldは数字・略語・日付を音声形式(「USD 5」→「5 US Doll」に拡張します)。 |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | NONEでない場合は、応答には単語ごとまたは文字ごとのタイムスタンプがtimestamp_infoに含まれます。キャプションやハイライトのUIに便利です。 |
制限 - 最大入力:1リクエストあたり2,000文字(文の境界でチャンクが長くなる) - WebSocket:同時接続20、contexts/connection5 - WSあたりメッセージ:1,000文字 レイテンシ - p90 TTFB:200ms未満(Inworldベンチマーク) ボイス - 100+言語間で保持される1つの音声アイデンティティ - ドロップダウンでキュレーション済みプリセット;他の音声IDをvoice_idで渡す - 平易な英語の音声指示でトーンや伝え方を調整します
EmpirioLabs では TTS 2 は従量課金です。このページのライブ料金表は常に API の請求額と一致します。
TTS 2 は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで TTS 2 をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。