GLM TTS API

LLM 기반 text-to-speech 오디오 및 감정 압축의 3-10s에서 제로 샷 음성 복제, 다중 반복 RL을 통해 제어 가능한 출력.

Z.ai오디오 생성출시 2025년 12월 11일네이티브 추론

GLM TTS 소개

LLM 기반 text-to-speech 오디오 및 감정 압축의 3-10s에서 제로 샷 음성 복제, 다중 반복 RL을 통해 제어 가능한 출력.

다른 이름 Z.ai GLM TTS, GLM-TTS

voice cloningemotion control

GLM TTS 사양

모델 ID
glm-tts
제공자
Z.ai
카테고리
오디오 생성
출시
2025년 12월 11일
입력
텍스트오디오
출력
오디오
엔드포인트
POST/v1/audio/speech
대체 모델 ID
zhipu/glm-tts

GLM TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
빠른 (INT8)
1k 문자
$0.20
품질 (FP16)
1k 문자
$0.21
전체 가격 페이지에서 비교

GLM TTS API 호출 방법

GLM TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID glm-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
GLM TTS API 전체 레퍼런스

GLM TTS API 파라미터

EmpirioLabs에서 GLM TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring--합성할 텍스트. 다중 스피커를 사용할 경우 [S1] / [S2] 태그 또는 'Speaker N:' 라인을 사용하세요.
voiceenumemmaemma, james, arthur, xiaomei, zhigang, customemma=영어 여성, james=미국 남성, arthur=미국 남성 대체 문자, xiaomei=중국 여성, zhigang=중국 남성, custom=voice_audio_url 통한 출처 업로드.
voice_audio_urlstring--커스텀 음성 복제를 위한 오디오 URL 참조. 참조 녹음에는 화자가 자신의 목소리로 이 정확한 동의 문구를 낭독하는 장면이 포함되어야 합니다: "합성 음성을 생성하기 위해 내 목소리를 복제하는 Empirio Labs 동의합니다. 제 음성 샘플이 개인화된 오디오 콘텐츠를 만드는 데 사용될 것이라고...
output_formatenummp3mp3, wav출력 미디어 파일 형식(엔드포인트에 따라 mp3, wav, mp4, png, jpg 등)을 선택할 수 있습니다.
speednumber10.5 ~ 2말하는 속도 배수.
model_qualityenumqualityquality, fast퀄리티=FP16(더 좋음), 빠름=INT8(더 빠름)
sample_rateenum2400024000, 16000출력 샘플링 속도는 Hz 단위입니다.
volumenumber10.1 ~ 2출력 이득 배수기.
use_cachebooleantrue-동일한 세대가 반복되는 속도를 높여줍니다.
optimize_inputbooleantrue-기술 용어, 약어, 특수 문자의 자동 고정 발음.
seednumber--재현성 시드.

알아두면 좋은 점

Limits - 최대 입력: 5,000 문자 - 생성: 5-10 분 음성 복제 - 참조 오디오: 3-10 초 - 허용 형식: WAV, MP3, OGG, FLAC, AAC, M4A, WebM 사전 설정 목소리 - emma (English F) - james (US M) - arthur (UK M) - xiaomei (Chinese F) - zhigang (Chinese M)

GLM TTS API: 자주 묻는 질문

GLM TTS API 비용은 얼마인가요?

EmpirioLabs에서 GLM TTS은(는) 종량제로 청구됩니다: 빠른 (INT8) $0.20 1k 문자; 품질 (FP16) $0.21 1k 문자. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

GLM TTS은(는) 어떤 엔드포인트를 사용하나요?

GLM TTS은(는) api.empiriolabs.aiPOST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 GLM TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 GLM TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

GLM TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.