
실시간 음성 모델로 평범한 영어 음성 지시, 100+ 개 언어 간 단일 음성 식별, 200ms 미만의 스트리밍 time-to-first-audio.
실시간 음성 모델로 평범한 영어 음성 지시, 100+ 개 언어 간 단일 음성 식별, 200ms 미만의 스트리밍 time-to-first-audio.
다른 이름 Inworld TTS 2, TTS-2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
TTS 2은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID tts-2와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs에서 TTS 2 API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input | string | - | 최대 2000 | 합성할 텍스트. 요청당 최대 2,000자; 클라이언트의 문장 경계에서 더 긴 카피를 작성하세요. |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | 음성 프리셋. 영어, 스페인어, 포르투갈어, 힌디어, 다양한 억양을 아우르는 20명의 엄선된 목소리가 참여했습니다. 전체 음성 카탈로그(복제 음성 포함)를 원하시면 voice_id 대신 사용하세요. |
| voice_id | string | - | - | 자유 음성 ID. 설정되면 음성 제어를 무시합니다. 이 자료를 활용해 엄선된 20개 프리셋 리스트 외의 모든 목소리, 복제 목소리와 지역 목소리를 포함해 다루세요. GET에서 어떤 음성 이름이든 전달하세요 /v1/voices. 예시: Ashley, Mark. |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47 언어 코드. 이 모델은 100+ 언어 전반에 걸쳐 하나의 음성 정체성을 유지하며; 드롭다운에 없더라도 지원되는 코드를 여기 전달하세요. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | 오디오 container/codec. WAV = RIFF 내부에서 LINEAR16 (어디에나 있음). MP3 / OGG = 압축됨. PCM = 헤더 없는 RAW, 청크된 실시간 재생에 유용합니다. FLAC = 무손실. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | 출력 샘플레이트는 Hz 기준입니다. 24000은 Inworld의 기본 설정이자 음성 모델이 훈련하는 기준입니다; 방송 품질을 위해 48000으로 올립니다. |
| speed | number | 1 | 0.5 ~ 1.5 | 말하는 속도 배수. 0.5 = 절반 속도, 1.5 = 50% 더 빠릅니다. |
| temperature | number | 1 | 0.1 ~ 2 | 목소리 표현력/변이성. Lower = 더 일관성 있고 "평평한"; 더 높을수록 = 표현력이 풍부하지만 렌더링 간 차이가 더 큽니다. |
| bit_rate | number | 128000 | 32000 ~ 320000 | MP3 / OGG_OPUS의 비트레이트는 BPS로 설정해야 합니다. 다른 인코딩은 무시합니다. |
| apply_text_normalization | enum | ON | ON, OFF | Inworld가 켜지면 숫자 / 약어/날짜를 음성 형태로 확장합니다 ("USD 5" → "5달러"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | NONE이 아닌 경우, 응답에는 단어별 또는 문자당 타임스탬프가 포함된다timestamp_info. 캡션/하이라이트 UI에 유용합니다. |
한계 - 최대 입력: 요청당 2,000자 (문장 경계 부분의 더 긴 텍스트) - WebSocket: 20개의 동시 연결, 5contexts/connection - WS 메시지당 1,000자 지연 - p90 TTFB: 200ms 미만 (Inworld 벤치마크) 음성 - 100+ 언어 간 하나의 음성 식별자 - 드롭다운에서 큐레이션된 프리셋; 다른 음성 ID를 voice_id 전달 - 톤과 전달을 조율하는 일반 영어 음성 지시를 제공합니다
EmpirioLabs에서 TTS 2은(는) 종량제로 청구됩니다. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
TTS 2은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 TTS 2을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.