Gemini 3.8 Flash TTS API

인라인 음성 태그, 스타일 방향, 두 화자 대화가 적용된 표현력 있는 말하기 기능으로, 130개 언어와 2,000개 이상의 음성 라이브러리를 지원합니다.

Google오디오 생성출시 2026년 9월 22일독점 엔드포인트신규

Gemini 3.8 Flash TTS 소개

인라인 음성 태그, 스타일 방향, 두 화자 대화가 적용된 표현력 있는 말하기 기능으로, 130개 언어와 2,000개 이상의 음성 라이브러리를 지원합니다.

다른 이름 Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash TTS 사양

모델 ID
gemini-3-8-flash-tts
개발사
Google
카테고리
오디오 생성
출시
2026년 9월 22일
입력
텍스트
출력
오디오
엔드포인트
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
대체 모델 ID
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

Gemini 3.8 Flash TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
입력
1M 프롬프트 토큰당
$2.60
제품정보
생성된 토큰 1M 단위
$46.80
전체 가격 페이지에서 비교

Gemini 3.8 Flash TTS API 호출 방법

Gemini 3.8 Flash TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID gemini-3-8-flash-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.8 Flash TTS API 전체 레퍼런스

Gemini 3.8 Flash TTS API 파라미터

EmpirioLabs에서 Gemini 3.8 Flash TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring-최대 5000텍스트를 음성으로 변환할 수 있습니다. 다중 스피커 모드의 경우, 접두사에 Speaker1: / Speaker2:를 붙이세요. 최대 5,000자까지 가능합니다. 전달 방향을 style_prompt에 넣고, 소리가 나야 할 위치에 다음 보컬 태그를 배치하세요: <argh>, <breath>,...
modeenumsinglesingle, multi싱글 = 한 음성 대사, 멀티 = 두 음성 대화 (음성 + voice2 + 화자 이름 사용).
languagestring--선택적으로 BCP-47 언어 태그(en-US, es-ES 등)가 있습니다. 텍스트의 언어는 자동으로 감지됩니다. 나열된 30개의 음성은 모든 지원되는 언어를 구사합니다; 라이브러리 음성은 반드시 자체 언어로 사용해야 합니다.
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...기본 음성 이름(예: Kore, Puck, Aoede). 기본값은 빈칸으로 남겨두세요. 이 30개의 음성 모두가 지원되는 모든 언어를 사용합니다. GET /v1/voices은 2,000개 이상의 음성 라이브러리를 모두 나열하며, 반환하는 음성 ID도 여기서 허용됩니다. 커스텀...
voice_audio_urlstring--voice=custom only: 클론용 목소리(WAV, MP3, M4A, OGG, WEBM 또는 FLAC)에서 10초에서 30초 정도의 깨끗하고 자연스러운 음성 녹음에 대한 https URL. 동의 녹음과 같은 마이크로 조용한 방에서 녹음하세요.
voice_consent_audio_urlstring--voice=custom only: 이 문장을 소리 내어 읽는 동일한 화자에게 https URL을 제공합니다: "나는 이 목소리의 소유자이며, 구글이 이 목소리를 사용해 합성 음성 모델을 만드는 것에 동의합니다." 30개 언어 중 어느 곳에서도 동일한 문장이 허용됩니다; 이 매개변수의 메타데이터...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...멀티스피커 모드의 두 번째 음성 이름입니다.
speaker1_namestringSpeaker1-스피커 1의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker1).
speaker2_namestringSpeaker2-스피커 2의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW오디오 파일 형식: WAV, MP3, OGG(Opus), 전화용 ALAW / MULAW.
speednumber10.25 ~ 2재생 속도. 1.0 = 자연; <1 느리게, > 1 더 빨라.
volume_gainnumber0-96 ~ 16출력 게인은 dB 단위입니다. 0 = 변함 없음.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000출력 샘플링 속도는 Hz 기준입니다 (8000, 16000, 22050, 24000, 44100, 또는 48000).
style_promptstring--자연어(Naturallanguage Style) 방향(예: "따뜻하고, 대화체적인" 또는 "뉴스캐스터, 진지함").

알아두면 좋은 점

제한 - 텍스트: 요청당 최대 5,000자 - 오디오 청구: 생성된 오디오당 초당 32개의 출력 토큰 - 130개 언어. 텍스트의 언어는 자동으로 감지됩니다. 음성 - voice 목록에 있는 30개의 음성은 지원되는 모든 언어를 사용합니다. - GET /v1/voices?model=gemini-3-8-flash-tts 30개 지역에 걸쳐 2,000개 이상의 음성의 전체 라이브러리를 언어, 억양, 성별, 음높이 및 설명과 함께 나열합니다. language, gender, pitch, 또는 q로 필터링하세요. 반환되는 모든 ID는 voice 또는 voice2로 작동합니다; language 설정할 때는 해당 음성의 고유한 언어를 사용합니다. 커스텀 보이스 voice GET /v1/voices?model=gemini-3-8-flash-tts 0__ 설정하고 https URL로 동일한 성인 화자의 녹음 두 개를 전달합니다: GET /v1/voices?model=gemini-3-8-flash-tts 1__, 10초에서 30초간의 자연스러운 발화, 그리고 GET /v1/voices?model=gemini-3-8-flash-tts 2__ 화자가 "나는 이 음성의 소유자이며, 구글이 이 음성을 사용해 합성 음성 모델을 만드는 것에 동의합니다."라고 읽습니다. 이 문장은 30개 언어로 인정되며; 해당 매개변수에 GET /v1/voices?model=gemini-3-8-flash-tts 3__ 각 문구가 나열됩니다. - 조용한 방에서 같은 마이크로 두 음성을 녹음하세요. WAV, MP3, M4A, OGG, WEBM, FLAC 모두 최대 15MB까지 허용됩니다. - 응답에는 GET /v1/voices?model=gemini-3-8-flash-tts 4__과 GET /v1/voices?model=gemini-3-8-flash-tts 5__가 포함됩니다. GET /v1/voices?model=gemini-3-8-flash-tts 6__을 GET /v1/voices?model=gemini-3-8-flash-tts 7__ 또는 GET /v1/voices?model=gemini-3-8-flash-tts 8__ 상태로 전달하여 7일 동안 새 녹음 없이 목소리를 재사용할 수 있습니다. 신분증이 만료될 때까지 누구나 음성을 사용할 수 있으니 비공개로 유지하세요. 전달 방향 - 전체 지시를 텍스트가 아닌 GET /v1/voices?model=gemini-3-8-flash-tts 9__에 표시하세요. 예를 들어 "따뜻하고, 서두르지 않으며, 안심시키는" 같은 것. - 음성 태그를 소리가 나야 할 위치에 인라인에 배치하세요. 텍스트가 다른 언어일 때도 이 영어 태그를 사용하세요: '' language 0__'' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'만 사용하세요.

Gemini 3.8 Flash TTS API: 자주 묻는 질문

Gemini 3.8 Flash TTS API 비용은 얼마인가요?

EmpirioLabs에서 Gemini 3.8 Flash TTS은(는) 종량제로 청구됩니다: 입력 $2.60 1M 프롬프트 토큰당; 제품정보 $46.80 생성된 토큰 1M 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

Gemini 3.8 Flash TTS은(는) 어떤 엔드포인트를 사용하나요?

Gemini 3.8 Flash TTS은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 Gemini 3.8 Flash TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Gemini 3.8 Flash TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

Gemini 3.8 Flash TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.