
LLM-basiertes text-to-speech mit Zero-Shot-Sprachklonen aus 3-10 Audio- und emotionsexpressiver, steuerbarer Ausgabe über Multi-Reward RL.
LLM-basiertes text-to-speech mit Zero-Shot-Sprachklonen aus 3-10 Audio- und emotionsexpressiver, steuerbarer Ausgabe über Multi-Reward RL.
Auch bekannt als Z.ai GLM TTS, GLM-TTS
glm-tts/v1/audio/speechzhipu/glm-ttsLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
GLM TTS erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID glm-tts. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die GLM TTS API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | - | Text zur Synthese. Für die Nutzung mit mehreren Lautsprechern [S1] / [S2]-Tags oder 'Speaker N:'-Zeilen. |
| voice | enum | emma | emma, james, arthur, xiaomei, zhigang, custom | emma=Englisch weiblich, james=US männlich, arthur=US männlich alt, xiaomei=chinesisch weiblich, zhigang=chinesisch männlich, benutzerdefiniert=Referenz hochladen... |
| voice_audio_url | string | - | - | Referenz auf Audio-URL für benutzerdefiniertes Sprachklonen. Die Referenzaufnahme muss zeigen, dass der Sprecher genau diese Einwilligungsphrase laut in seiner... |
| output_format | enum | mp3 | mp3, wav | Ausgabe des Mediendateiformats (mp3, wav, mp4, png, jpg usw., je nach Endpunkt). |
| speed | number | 1 | 0.5 bis 2 | Sprechratemultiplikator. |
| model_quality | enum | quality | quality, fast | quality=FP16 (besser), schnell=INT8 (schneller) |
| sample_rate | enum | 24000 | 24000, 16000 | Ausgabe-Abtastrate in Hz. |
| volume | number | 1 | 0.1 bis 2 | Ausgangsverstärkungsmultiplikator. |
| use_cache | boolean | true | - | Beschleunigt wiederholte identische Generationen. |
| optimize_input | boolean | true | - | Autofix-Aussprache von Fachbegriffen, Abkürzungen und Sonderzeichen. |
| seed | number | - | - | Reproduzierbarkeitssamen. |
Limits - Maximale Eingabe: 5.000 Zeichen - Generation: 5-10 Minuten Voice cloning - Referenz-Audio: 3-10 Sekunden - Akzeptierte Formate: WAV, MP3, OGG, FLAC, AAC, M4A, WebM Preset-Stimmen - emma (englisch F) - james (US M) - arthur (UK M) - xiaomei (chinesisch F) - zhigang (chinesisch M)
Auf EmpirioLabs wird GLM TTS nach Verbrauch abgerechnet: Schnell (INT8) $0.20 pro 1k Zeichen; Qualität (FP16) $0.21 pro 1k Zeichen. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
GLM TTS wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt GLM TTS im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.