Gemini 3.1 Flash TTS API

내레이션, 어시스턴트, 음성 앱 전반에 걸쳐 정밀한 스타일, 톤, 속도, 전달을 위한 새로운 오디오 태그를 통해 매우 제어가 가능한 TTS입니다.

Google오디오 생성출시 2026년 4월 13일독점 엔드포인트

Gemini 3.1 Flash TTS 소개

내레이션, 어시스턴트, 음성 앱 전반에 걸쳐 정밀한 스타일, 톤, 속도, 전달을 위한 새로운 오디오 태그를 통해 매우 제어가 가능한 TTS입니다.

다른 이름 Gemini Flash TTS, Google Gemini 3.1 Flash TTS

text to speechmulti speakermultilingual

Gemini 3.1 Flash TTS 사양

모델 ID
gemini-3-1-flash-tts
개발사
Google
카테고리
오디오 생성
출시
2026년 4월 13일
입력
텍스트
출력
오디오
엔드포인트
POST/v1/audio/speech
대체 모델 ID
gemini-3.1-flash-ttsgoogle/gemini-3.1-flash-tts

Gemini 3.1 Flash TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
입력
1M 프롬프트 토큰당
$2.60
제품정보
생성된 토큰 1M 단위
$52.00
전체 가격 페이지에서 비교

Gemini 3.1 Flash TTS API 호출 방법

Gemini 3.1 Flash TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID gemini-3-1-flash-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-1-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.1 Flash TTS API 전체 레퍼런스

Gemini 3.1 Flash TTS API 파라미터

EmpirioLabs에서 Gemini 3.1 Flash TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring--음성 변환을 위한 텍스트. 멀티스피커 모드의 경우, Speaker1: / Speaker2:로 줄 앞에 붙입니다.
modeenumsinglesingle, multi싱글 = 한 음성 대사, 멀티 = 두 음성 대화 (음성 + voice2 + 화자 이름 사용).
languagestringen-US-발음 단서를 위한 BCP-47 언어 태그(en-US, es-ES 등).
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...주요 음성 이름(예: Kore, Puck, Aoede). 기본값은 비워두세요.
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...멀티스피커 모드의 두 번째 음성 이름입니다.
speaker1_namestringSpeaker1-스피커 1의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker1).
speaker2_namestringSpeaker2-스피커 2의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW오디오 파일 형식(mp3, wav, opus, flac 등).
speednumber10.25 ~ 2재생 속도. 1.0 = 자연; <1 느리게, > 1 더 빨라.
volume_gainnumber0-96 ~ 16출력 게인은 dB 단위입니다. 0 = 변함 없음.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000출력 샘플레이트는 Hz 단위로 (8000, 16000, 24000, 44100, 48000)
style_promptstring--자연어(Naturallanguage Style) 방향(예: "따뜻하고, 대화체적인" 또는 "뉴스캐스터, 진지함").

알아두면 좋은 점

지금까지 가장 조작이 쉬운 제미니 TTS입니다. 한계 - 텍스트 + 스타일 프롬프트: 각 4,000바이트(합산 8,000바이트) - 최대 출력: ~10분 - 오디오 청구: ~초당 토큰 ~25개 (~15chars/s) - 언어 자동 감지; 언어 설정은 제약이 아니라 힌트입니다 인라인 오디오 태그 (제어 전달) - 감정: [whispers], [shouts], [laughs], [sighs], [cheerful], [sad], [angry] 등 - 속도: [slow], [fast], [whispers] 0__, [whispers] 1__ - 일시정지: [whispers] 2__, [whispers] 3__, [whispers] 4__ - 강조: [whispers] 5__, [whispers] 6__, [whispers] 7__, [whispers] 8__, [whispers] 9__, [shouts] 0__

Gemini 3.1 Flash TTS API: 자주 묻는 질문

Gemini 3.1 Flash TTS API 비용은 얼마인가요?

EmpirioLabs에서 Gemini 3.1 Flash TTS은(는) 종량제로 청구됩니다: 입력 $2.60 1M 프롬프트 토큰당; 제품정보 $52.00 생성된 토큰 1M 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

Gemini 3.1 Flash TTS은(는) 어떤 엔드포인트를 사용하나요?

Gemini 3.1 Flash TTS은(는) api.empiriolabs.aiPOST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 Gemini 3.1 Flash TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Gemini 3.1 Flash TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

Gemini 3.1 Flash TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.