GLM TTS API

LLM ベースの text-to-speech で、音声の 3-10 秒からゼロショットボイスクローニング、マルチリワード RL による制御可能な出力。

Z.aiオーディオ生成リリース 2025年12月11日ネイティブ推論

GLM TTS について

LLM ベースの text-to-speech で、音声の 3-10 秒からゼロショットボイスクローニング、マルチリワード RL による制御可能な出力。

別名 Z.ai GLM TTS, GLM-TTS

voice cloningemotion control

GLM TTS の仕様

モデルID
glm-tts
プロバイダー
Z.ai
カテゴリ
オーディオ生成
リリース
2025年12月11日
入力
テキスト音声
出力
音声
エンドポイント
POST/v1/audio/speech
代替モデルID
zhipu/glm-tts

GLM TTS API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
速い(INT8)
1k文字
$0.20
品質 (FP16)
1k文字
$0.21
料金ページ全体で比較

GLM TTS API の呼び出し方

GLM TTS は POST /v1/audio/speech で音声を生成し、再生可能なオーディオを返します。読み上げるテキストを input として、モデル ID glm-tts と一緒に送信してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
GLM TTS API の完全リファレンス

GLM TTS API のパラメーター

EmpirioLabs 上の GLM TTS API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
inputstring--テキストを合成する。マルチスピーカーの場合は、[S1] / [S2] タグや「Speaker N:」ラインを使用します。
voiceenumemmaemma, james, arthur, xiaomei, zhigang, customemma=英語女性、james=US男性、arthur=US男性別名前、xiaomei=中国女性、zhigang=中国人男性、custom=アップロード参照voice_audio_url。
voice_audio_urlstring--カスタム音声クローン用の音声URLを参照してください。参照録音には、話者がこの同意フレーズを自分の声で朗読するものが含まれていなければなりません:「合成音声を生成する目的でEmpirio...
output_formatenummp3mp3, wav出力メディアファイル形式(mp3、wav、mp4、png、jpgなど、エンドポイントによって異なります)。
speednumber10.5 から 2話す速度の倍率。
model_qualityenumqualityquality, fast品質=FP16(より良い)、速=INT8(より速い)
sample_rateenum2400024000, 16000出力サンプリングレートはHzで表示されます。
volumenumber10.1 から 2出力ゲイン倍率。
use_cachebooleantrue-同じ世代の繰り返しを加速させる。
optimize_inputbooleantrue-技術用語、頭字語、特殊文字の自動発音。
seednumber--再現性シード。

知っておくと便利

限度 - 最大入力:5,000文字 - 生成:5-10分マウスクローニング - 参照オーディオ:3-10秒 - 受け入れられたフォーマット:WAV、MP3、OGG、FLAC、AAC、M4A、WebM プリセットボイス - エマ(英語F) - ジェームズ(米国M) - 関節(英国M) - zhigang(中国語F) - zhigang(中国語M)

GLM TTS API: よくある質問

GLM TTS API の料金はいくらですか?

EmpirioLabs では GLM TTS は従量課金です: 速い(INT8) $0.20 1k文字; 品質 (FP16) $0.21 1k文字。このページのライブ料金表は常に API の請求額と一致します。

GLM TTS はどのエンドポイントを使いますか?

GLM TTS は api.empiriolabs.ai 上の POST /v1/audio/speech で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで GLM TTS を試せますか?

はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで GLM TTS をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。

GLM TTS の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。