
단일 및 멀티 스피커 음성 및 제어 가능한 스타일, 악센트 및 표현식 톤을 가진 낮은 속도 text-to-speech.
단일 및 멀티 스피커 음성 및 제어 가능한 스타일, 악센트 및 표현식 톤을 가진 낮은 속도 text-to-speech.
다른 이름 Gemini Flash TTS, Google Gemini 2.5 Flash TTS, Gemini-2.5-Flash-TTS, gemini-2-5-flash-tts
gemini-2-5-flash-tts/v1/audio/speechgemini-2.5-flash-ttsgoogle/gemini-2.5-flash-ttsEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
Gemini 2.5 Flash TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID gemini-2-5-flash-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2-5-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-2-5-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs에서 Gemini 2.5 Flash TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input | string | - | - | 음성 변환을 위한 텍스트. 멀티스피커 모드의 경우, Speaker1: / Speaker2:로 줄 앞에 붙입니다. |
| mode | enum | single | single, multi | 싱글 = 한 음성 대사, 멀티 = 두 음성 대화 (음성 + voice2 + 화자 이름 사용). |
| language | string | en-US | - | 발음 단서를 위한 BCP-47 언어 태그(en-US, es-ES 등). |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 주요 음성 이름(예: Kore, Puck, Aoede). 기본값은 비워두세요. |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 멀티스피커 모드의 두 번째 음성 이름입니다. |
| speaker1_name | string | Speaker1 | - | 스피커 1의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker1). |
| speaker2_name | string | Speaker2 | - | 스피커 2의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | 오디오 파일 형식(mp3, wav, opus, flac 등). |
| speed | number | 1 | 0.25 ~ 2 | 재생 속도. 1.0 = 자연; <1 느리게, > 1 더 빨라. |
| volume_gain | number | 0 | -96 ~ 16 | 출력 게인은 dB 단위입니다. 0 = 변함 없음. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 출력 샘플레이트는 Hz 단위로 (8000, 16000, 24000, 44100, 48000) |
| style_prompt | string | - | - | 자연어(Naturallanguage Style) 방향(예: "따뜻하고, 대화체적인" 또는 "뉴스캐스터, 진지함"). |
Modes - 단일 스피커 - 멀티 스피커 (최대 2 음성) - 텍스트는 SpeakerName: text 형식으로 있어야합니다 - 텍스트 + 스타일 프롬프트: 4,000 바이트 각각 - 오디오 청구: 생성 된 오디오 (~ 10-15 chars/s)의 초당 32 토큰 음성 및 언어 emotional/tonal 문자의 30 + 음성 옵션 - 24 + 언어 로컬 지원 출력 형식 ** - MP3, WAV, OGG
EmpirioLabs에서 Gemini 2.5 Flash TTS은(는) 종량제로 청구됩니다: 이름 * $1.50 1M 신속한 토큰 당; 제품정보 $30.00 1M 생성 토큰. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
Gemini 2.5 Flash TTS은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Gemini 2.5 Flash TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.