
인라인 음성 태그, 스타일 방향, 두 화자 대화가 적용된 표현력 있는 말하기 기능으로, 130개 언어와 2,000개 이상의 음성 라이브러리를 지원합니다.
인라인 음성 태그, 스타일 방향, 두 화자 대화가 적용된 표현력 있는 말하기 기능으로, 130개 언어와 2,000개 이상의 음성 라이브러리를 지원합니다.
다른 이름 Gemini Flash TTS, Google Gemini 3.8 Flash TTS
gemini-3-8-flash-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesgemini-3.8-flash-ttsgoogle/gemini-3.8-flash-ttsEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
Gemini 3.8 Flash TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID gemini-3-8-flash-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-8-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs에서 Gemini 3.8 Flash TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input | string | - | 최대 5000 | 텍스트를 음성으로 변환할 수 있습니다. 다중 스피커 모드의 경우, 접두사에 Speaker1: / Speaker2:를 붙이세요. 최대 5,000자까지 가능합니다. 전달 방향을 style_prompt에 넣고, 소리가 나야 할 위치에 다음 보컬 태그를 배치하세요: <argh>, <breath>,... |
| mode | enum | single | single, multi | 싱글 = 한 음성 대사, 멀티 = 두 음성 대화 (음성 + voice2 + 화자 이름 사용). |
| language | string | - | - | 선택적으로 BCP-47 언어 태그(en-US, es-ES 등)가 있습니다. 텍스트의 언어는 자동으로 감지됩니다. 나열된 30개의 음성은 모든 지원되는 언어를 구사합니다; 라이브러리 음성은 반드시 자체 언어로 사용해야 합니다. |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 기본 음성 이름(예: Kore, Puck, Aoede). 기본값은 빈칸으로 남겨두세요. 이 30개의 음성 모두가 지원되는 모든 언어를 사용합니다. GET /v1/voices은 2,000개 이상의 음성 라이브러리를 모두 나열하며, 반환하는 음성 ID도 여기서 허용됩니다. 커스텀... |
| voice_audio_url | string | - | - | voice=custom only: 클론용 목소리(WAV, MP3, M4A, OGG, WEBM 또는 FLAC)에서 10초에서 30초 정도의 깨끗하고 자연스러운 음성 녹음에 대한 https URL. 동의 녹음과 같은 마이크로 조용한 방에서 녹음하세요. |
| voice_consent_audio_url | string | - | - | voice=custom only: 이 문장을 소리 내어 읽는 동일한 화자에게 https URL을 제공합니다: "나는 이 목소리의 소유자이며, 구글이 이 목소리를 사용해 합성 음성 모델을 만드는 것에 동의합니다." 30개 언어 중 어느 곳에서도 동일한 문장이 허용됩니다; 이 매개변수의 메타데이터... |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | 멀티스피커 모드의 두 번째 음성 이름입니다. |
| speaker1_name | string | Speaker1 | - | 스피커 1의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker1). |
| speaker2_name | string | Speaker2 | - | 스피커 2의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | 오디오 파일 형식: WAV, MP3, OGG(Opus), 전화용 ALAW / MULAW. |
| speed | number | 1 | 0.25 ~ 2 | 재생 속도. 1.0 = 자연; <1 느리게, > 1 더 빨라. |
| volume_gain | number | 0 | -96 ~ 16 | 출력 게인은 dB 단위입니다. 0 = 변함 없음. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 출력 샘플링 속도는 Hz 기준입니다 (8000, 16000, 22050, 24000, 44100, 또는 48000). |
| style_prompt | string | - | - | 자연어(Naturallanguage Style) 방향(예: "따뜻하고, 대화체적인" 또는 "뉴스캐스터, 진지함"). |
제한 - 텍스트: 요청당 최대 5,000자 - 오디오 청구: 생성된 오디오당 초당 32개의 출력 토큰 - 130개 언어. 텍스트의 언어는 자동으로 감지됩니다. 음성 - voice 목록에 있는 30개의 음성은 지원되는 모든 언어를 사용합니다. - GET /v1/voices?model=gemini-3-8-flash-tts 30개 지역에 걸쳐 2,000개 이상의 음성의 전체 라이브러리를 언어, 억양, 성별, 음높이 및 설명과 함께 나열합니다. language, gender, pitch, 또는 q로 필터링하세요. 반환되는 모든 ID는 voice 또는 voice2로 작동합니다; language 설정할 때는 해당 음성의 고유한 언어를 사용합니다. 커스텀 보이스 voice GET /v1/voices?model=gemini-3-8-flash-tts 0__ 설정하고 https URL로 동일한 성인 화자의 녹음 두 개를 전달합니다: GET /v1/voices?model=gemini-3-8-flash-tts 1__, 10초에서 30초간의 자연스러운 발화, 그리고 GET /v1/voices?model=gemini-3-8-flash-tts 2__ 화자가 "나는 이 음성의 소유자이며, 구글이 이 음성을 사용해 합성 음성 모델을 만드는 것에 동의합니다."라고 읽습니다. 이 문장은 30개 언어로 인정되며; 해당 매개변수에 GET /v1/voices?model=gemini-3-8-flash-tts 3__ 각 문구가 나열됩니다. - 조용한 방에서 같은 마이크로 두 음성을 녹음하세요. WAV, MP3, M4A, OGG, WEBM, FLAC 모두 최대 15MB까지 허용됩니다. - 응답에는 GET /v1/voices?model=gemini-3-8-flash-tts 4__과 GET /v1/voices?model=gemini-3-8-flash-tts 5__가 포함됩니다. GET /v1/voices?model=gemini-3-8-flash-tts 6__을 GET /v1/voices?model=gemini-3-8-flash-tts 7__ 또는 GET /v1/voices?model=gemini-3-8-flash-tts 8__ 상태로 전달하여 7일 동안 새 녹음 없이 목소리를 재사용할 수 있습니다. 신분증이 만료될 때까지 누구나 음성을 사용할 수 있으니 비공개로 유지하세요. 전달 방향 - 전체 지시를 텍스트가 아닌 GET /v1/voices?model=gemini-3-8-flash-tts 9__에 표시하세요. 예를 들어 "따뜻하고, 서두르지 않으며, 안심시키는" 같은 것. - 음성 태그를 소리가 나야 할 위치에 인라인에 배치하세요. 텍스트가 다른 언어일 때도 이 영어 태그를 사용하세요: '' language 0__'' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'만 사용하세요.
EmpirioLabs에서 Gemini 3.8 Flash TTS은(는) 종량제로 청구됩니다: 입력 $2.60 1M 프롬프트 토큰당; 제품정보 $46.80 생성된 토큰 1M 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
Gemini 3.8 Flash TTS은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Gemini 3.8 Flash TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.