
LLM-based text-to-speech com clonagem de voz zero de 3-10s de áudio e emoção-expressiva, saída controlável através de RL multi-recompensa.
LLM-based text-to-speech com clonagem de voz zero de 3-10s de áudio e emoção-expressiva, saída controlável através de RL multi-recompensa.
Também conhecido como Z.ai GLM TTS, GLM-TTS
glm-tts/v1/audio/speechzhipu/glm-ttsTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
GLM TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo glm-tts. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parâmetros de requisição suportados pela API GLM TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input | string | - | - | Texto para sintetizar. Para múltiplos alto-falantes, use tags [S1] / [S2] ou linhas 'Alto-falante N:'. |
| voice | enum | emma | emma, james, arthur, xiaomei, zhigang, custom | emma=Inglês feminino, james=US Male, arthur=US Male alt, xiaomei=Chinese Female, zhigang=Chinese Male, custom=upload reference via voice_audio_url. |
| voice_audio_url | string | - | - | Consulte a URL de áudio para clonagem de voz personalizada. A gravação de referência deve conter o falante lendo exatamente essa frase de consentimento em voz alta,... |
| output_format | enum | mp3 | mp3, wav | Formato de arquivo de mídia de saída (mp3, wav, mp4, png, jpg, etc., dependendo do endpoint). |
| speed | number | 1 | 0.5 a 2 | Multiplicador de taxa de fala. |
| model_quality | enum | quality | quality, fast | qualidade=FP16 (melhor), rápido=INT8 (mais rápido) |
| sample_rate | enum | 24000 | 24000, 16000 | Taxa de amostragem de saída em Hz. |
| volume | number | 1 | 0.1 a 2 | Multiplicador de ganho de saída. |
| use_cache | boolean | true | - | Acelera gerações idênticas repetidas. |
| optimize_input | boolean | true | - | Pronúncia auto-fixa de termos técnicos, siglas e caracteres especiais. |
| seed | number | - | - | Semente de reprodutibilidade. |
Limites - Entrada máxima: 5.000 caracteres - Geração: 5-10 minutos Clonagem de voz - Áudio de referência: 3-10 segundos - Formatos aceitos: WAV, MP3, OGG, FLAC, AAC, M4A, WebM Vozes predefinidas - emma (inglês F) - james (US M) - arthur (UK M) -xiaomei (Chinês F) - zhigang (Chinês M)
Na EmpirioLabs, GLM TTS é cobrado por uso: Rápido (INT8) $0.20 por 1k caracteres; Qualidade (FP16) $0.21 por 1k caracteres. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
GLM TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa GLM TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.