
text-to-speech basées sur LLM avec clonage vocal zéro shot de 3 à 10 secondes d’audio et une sortie contrôlable et expressive émotionnelle via RL multi-récompenses.
text-to-speech basées sur LLM avec clonage vocal zéro shot de 3 à 10 secondes d’audio et une sortie contrôlable et expressive émotionnelle via RL multi-récompenses.
Aussi connu sous le nom Z.ai GLM TTS, GLM-TTS
glm-tts/v1/audio/speechzhipu/glm-ttsTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
GLM TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle glm-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Paramètres de requête pris en charge par l'API GLM TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input | string | - | - | Texte à synthèse. Pour les haut-parleurs multiples, utilisez les tags [S1] / [S2] ou les lignes « Speaker N:. » |
| voice | enum | emma | emma, james, arthur, xiaomei, zhigang, custom | emma = Anglais féminin, james=US Masculin, arthur=US Masculin alt, xiaomei=Chinoise féminine, zhigang=Chinois Homme, custom=upload reference via voice_audio_url. |
| voice_audio_url | string | - | - | Référence à l’URL audio pour le clonage vocal personnalisé. L’enregistrement de référence doit contenir le locuteur lisant exactement cette phrase de consentement à... |
| output_format | enum | mp3 | mp3, wav | Format de fichier média de sortie (mp3, wav, mp4, png, jpg, etc., selon le point d’arrivée). |
| speed | number | 1 | 0.5 à 2 | Multiplicateur de débit de parole. |
| model_quality | enum | quality | quality, fast | qualité = FP16 (mieux), rapide = INT8 (plus rapide) |
| sample_rate | enum | 24000 | 24000, 16000 | Taux d’échantillonnage de sortie en Hz. |
| volume | number | 1 | 0.1 à 2 | Multiplicateur de gain de sortie. |
| use_cache | boolean | true | - | Cela accélère les générations identiques répétées. |
| optimize_input | boolean | true | - | Prononciation auto-fixée des termes techniques, acronymes et caractères spéciaux. |
| seed | number | - | - | Graine de reproductibilité. |
Limites - Entrée maximale: 5 000 caractères - Génération: 5-10 minutes Clonage vocal - Audio de référence: 3-10 secondes - Formats acceptés: WAV, MP3, OGG, FLAC, AAC, M4A, WebM Voix prédéfinies - emma (F anglais) - James (M américain) - Arthur (M britannique) - xiaomei (F chinois) - zhigang (M chinois)
Sur EmpirioLabs, GLM TTS est facturé à l'usage : Rapide (INT8) $0.20 pour 1k caractères; Qualité (FP16) $0.21 pour 1k caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
GLM TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute GLM TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.