Gemini 3.8 Flash-Lite TTS API

음성 에이전트와 더빙을 위한 비용 효율적인 음성 서비스, 스트리밍, 음성 태그, 101개 언어와 2,000+ 음성 2인 대화 기능을 지원합니다.

Google오디오 생성출시 2026년 9월 22일독점 엔드포인트신규

Gemini 3.8 Flash-Lite TTS 소개

음성 에이전트와 더빙을 위한 비용 효율적인 음성 서비스, 스트리밍, 음성 태그, 101개 언어와 2,000+ 음성 2인 대화 기능을 지원합니다.

다른 이름 Gemini Flash-Lite TTS, Google Gemini 3.8 Flash-Lite TTS, Gemini-3.8-Flash-Lite-TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash-Lite TTS 사양

모델 ID
gemini-3-8-flash-lite-tts
개발사
Google
카테고리
오디오 생성
출시
2026년 9월 22일
입력
텍스트
출력
오디오
엔드포인트
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
대체 모델 ID
gemini-3.8-flash-lite-ttsgoogle/gemini-3.8-flash-lite-tts

Gemini 3.8 Flash-Lite TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
입력
1M 프롬프트 토큰당
$2.60
제품정보
생성된 토큰 1M 단위
$31.20
전체 가격 페이지에서 비교

Gemini 3.8 Flash-Lite TTS API 호출 방법

Gemini 3.8 Flash-Lite TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID gemini-3-8-flash-lite-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-lite-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-lite-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.8 Flash-Lite TTS API 전체 레퍼런스

Gemini 3.8 Flash-Lite TTS API 파라미터

EmpirioLabs에서 Gemini 3.8 Flash-Lite TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring-최대 5000텍스트를 음성으로 변환할 수 있습니다. 다중 스피커 모드의 경우, 접두사에 Speaker1: / Speaker2:를 붙이세요. 최대 5,000자까지 가능합니다. 전달 방향을 style_prompt에 넣고, 소리가 나야 할 위치에 다음 보컬 태그를 배치하세요: <argh>, <breath>,...
modeenumsinglesingle, multi싱글 = 한 음성 대사, 멀티 = 두 음성 대화 (음성 + voice2 + 화자 이름 사용).
languagestring--선택적으로 BCP-47 언어 태그(en-US, es-ES 등)가 있습니다. 텍스트의 언어는 자동으로 감지됩니다. 나열된 30개의 음성은 모든 지원되는 언어를 구사합니다; 라이브러리 음성은 반드시 자체 언어로 사용해야 합니다.
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...기본 음성 이름(예: Kore, Puck, Aoede). 기본값은 빈칸으로 남겨두세요. 이 30개의 음성 모두가 지원되는 모든 언어를 사용합니다. GET /v1/voices은 2,000개 이상의 음성 라이브러리를 모두 나열하며, 반환하는 음성 ID도 여기서 허용됩니다. 커스텀...
voice_audio_urlstring--voice=custom only: 클론용 목소리(WAV, MP3, M4A, OGG, WEBM 또는 FLAC)에서 10초에서 30초 정도의 깨끗하고 자연스러운 음성 녹음에 대한 https URL. 동의 녹음과 같은 마이크로 조용한 방에서 녹음하세요.
voice_consent_audio_urlstring--voice=custom only: 이 문장을 소리 내어 읽는 동일한 화자에게 https URL을 제공합니다: "나는 이 목소리의 소유자이며, 구글이 이 목소리를 사용해 합성 음성 모델을 만드는 것에 동의합니다." 30개 언어 중 어느 곳에서도 동일한 문장이 허용됩니다; 이 매개변수의 메타데이터...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...멀티스피커 모드의 두 번째 음성 이름입니다.
speaker1_namestringSpeaker1-스피커 1의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker1).
speaker2_namestringSpeaker2-스피커 2의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW오디오 파일 형식: WAV, MP3, OGG(Opus), 전화용 ALAW / MULAW.
speednumber10.25 ~ 2재생 속도. 1.0 = 자연; <1 느리게, > 1 더 빨라.
volume_gainnumber0-96 ~ 16출력 게인은 dB 단위입니다. 0 = 변함 없음.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000출력 샘플링 속도는 Hz 기준입니다 (8000, 16000, 22050, 24000, 44100, 또는 48000).
style_promptstring--자연어(Naturallanguage Style) 방향(예: "따뜻하고, 대화체적인" 또는 "뉴스캐스터, 진지함").

알아두면 좋은 점

제한 - 텍스트: 요청당 최대 5,000자 - 오디오 요금: 생성된 오디오당 32개의 토큰 출력 - 101개 언어. 텍스트의 언어는 자동으로 감지됩니다. 음성 - voice 목록에 있는 30개의 음성은 지원되는 모든 언어를 말합니다. - GET /v1/voices?model=gemini-3-8-flash-lite-tts는 30개 지역에 걸쳐 2,000개 이상의 음성으로 구성된 전체 라이브러리를 언어, 억양, 성별, 음높이 및 각 음성의 설명과 함께 나열합니다. language, gender, pitch, 또는 q로 필터링하세요. 반환되는 모든 ID는 voice 또는 voice2로 작동합니다; language 설정할 때는 해당 음성의 고유한 언어를 사용하세요. 커스텀 보이스 voice GET /v1/voices?model=gemini-3-8-flash-lite-tts 0__ 설정하고 https URL로 동일한 성인 화자의 녹음 두 개를 전달합니다: GET /v1/voices?model=gemini-3-8-flash-lite-tts 1__, 10초에서 30초간의 자연스러운 발화, 그리고 GET /v1/voices?model=gemini-3-8-flash-lite-tts 2__ 화자가 "나는 이 음성의 소유자이며, 구글이 이 음성을 사용해 합성 음성 모델을 만드는 것에 동의합니다."라고 읽습니다. 이 문장은 30개 언어로 인정되며; 해당 매개변수에 GET /v1/voices?model=gemini-3-8-flash-lite-tts 3__ 각 문구가 나열됩니다. - 조용한 방에서 같은 마이크로 두 음성을 녹음하세요. WAV, MP3, M4A, OGG, WEBM, FLAC 모두 최대 15MB까지 허용됩니다. - 응답에는 GET /v1/voices?model=gemini-3-8-flash-lite-tts 4__과 GET /v1/voices?model=gemini-3-8-flash-lite-tts 5__가 포함됩니다. GET /v1/voices?model=gemini-3-8-flash-lite-tts 6__을 GET /v1/voices?model=gemini-3-8-flash-lite-tts 7__ 또는 GET /v1/voices?model=gemini-3-8-flash-lite-tts 8__ 상태로 전달하여 7일 동안 새 녹음 없이 목소리를 재사용할 수 있습니다. 신분증이 만료될 때까지 누구나 음성을 사용할 수 있으니 비공개로 유지하세요. 전달 방향 - 전체 지시를 텍스트가 아닌 GET /v1/voices?model=gemini-3-8-flash-lite-tts 9__에 표시하세요. 예를 들어 "따뜻하고, 서두르지 않으며, 안심시키는" 같은 것. - 음성 태그를 소리가 나야 할 위치에 인라인에 배치하세요. 텍스트가 다른 언어일 때도 이 영어 태그를 사용하세요: '' language 0__'' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'만 사용하세요.

Gemini 3.8 Flash-Lite TTS API: 자주 묻는 질문

Gemini 3.8 Flash-Lite TTS API 비용은 얼마인가요?

EmpirioLabs에서 Gemini 3.8 Flash-Lite TTS은(는) 종량제로 청구됩니다: 입력 $2.60 1M 프롬프트 토큰당; 제품정보 $31.20 생성된 토큰 1M 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

Gemini 3.8 Flash-Lite TTS은(는) 어떤 엔드포인트를 사용하나요?

Gemini 3.8 Flash-Lite TTS은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 Gemini 3.8 Flash-Lite TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Gemini 3.8 Flash-Lite TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

Gemini 3.8 Flash-Lite TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.