
LLM 기반 text-to-speech 오디오 및 감정 압축의 3-10s에서 제로 샷 음성 복제, 다중 반복 RL을 통해 제어 가능한 출력.
LLM 기반 text-to-speech 오디오 및 감정 압축의 3-10s에서 제로 샷 음성 복제, 다중 반복 RL을 통해 제어 가능한 출력.
다른 이름 Z.ai GLM TTS, GLM-TTS
glm-tts/v1/audio/speechzhipu/glm-ttsEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
GLM TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID glm-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs에서 GLM TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input | string | - | - | 합성할 텍스트. 다중 스피커를 사용할 경우 [S1] / [S2] 태그 또는 'Speaker N:' 라인을 사용하세요. |
| voice | enum | emma | emma, james, arthur, xiaomei, zhigang, custom | emma=영어 여성, james=미국 남성, arthur=미국 남성 대체 문자, xiaomei=중국 여성, zhigang=중국 남성, custom=voice_audio_url 통한 출처 업로드. |
| voice_audio_url | string | - | - | 커스텀 음성 복제를 위한 오디오 URL 참조. 참조 녹음에는 화자가 자신의 목소리로 이 정확한 동의 문구를 낭독하는 장면이 포함되어야 합니다: "합성 음성을 생성하기 위해 내 목소리를 복제하는 Empirio Labs 동의합니다. 제 음성 샘플이 개인화된 오디오 콘텐츠를 만드는 데 사용될 것이라고... |
| output_format | enum | mp3 | mp3, wav | 출력 미디어 파일 형식(엔드포인트에 따라 mp3, wav, mp4, png, jpg 등)을 선택할 수 있습니다. |
| speed | number | 1 | 0.5 ~ 2 | 말하는 속도 배수. |
| model_quality | enum | quality | quality, fast | 퀄리티=FP16(더 좋음), 빠름=INT8(더 빠름) |
| sample_rate | enum | 24000 | 24000, 16000 | 출력 샘플링 속도는 Hz 단위입니다. |
| volume | number | 1 | 0.1 ~ 2 | 출력 이득 배수기. |
| use_cache | boolean | true | - | 동일한 세대가 반복되는 속도를 높여줍니다. |
| optimize_input | boolean | true | - | 기술 용어, 약어, 특수 문자의 자동 고정 발음. |
| seed | number | - | - | 재현성 시드. |
Limits - 최대 입력: 5,000 문자 - 생성: 5-10 분 음성 복제 - 참조 오디오: 3-10 초 - 허용 형식: WAV, MP3, OGG, FLAC, AAC, M4A, WebM 사전 설정 목소리 - emma (English F) - james (US M) - arthur (UK M) - xiaomei (Chinese F) - zhigang (Chinese M)
EmpirioLabs에서 GLM TTS은(는) 종량제로 청구됩니다: 빠른 (INT8) $0.20 1k 문자; 품질 (FP16) $0.21 1k 문자. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
GLM TTS은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 GLM TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.