Gemini 3.1 Flash TTS API

narration, 조수 및 음성 앱을 통해 정밀한 스타일, 음색, 속도 및 납품을 위한 새로운 오디오 태그를 가진 높게 지배할 수 있는 TTS.

Google오디오 생성출시 2026년 4월 13일독점 엔드포인트

Gemini 3.1 Flash TTS 소개

narration, 조수 및 음성 앱을 통해 정밀한 스타일, 음색, 속도 및 납품을 위한 새로운 오디오 태그를 가진 높게 지배할 수 있는 TTS.

다른 이름 Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts

text to speechmulti speakermultilingual

Gemini 3.1 Flash TTS 사양

모델 ID
gemini-3-1-flash-tts
제공자
Google
카테고리
오디오 생성
출시
2026년 4월 13일
입력
텍스트
출력
오디오
엔드포인트
POST/v1/audio/speech
대체 모델 ID
gemini-3.1-flash-ttsgoogle/gemini-3.1-flash-tts

Gemini 3.1 Flash TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
이름 *
1M 신속한 토큰 당
$2.60
제품정보
1M 생성 토큰
$52.00
전체 가격 페이지에서 비교

Gemini 3.1 Flash TTS API 호출 방법

Gemini 3.1 Flash TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID gemini-3-1-flash-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-1-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.1 Flash TTS API 전체 레퍼런스

Gemini 3.1 Flash TTS API 파라미터

EmpirioLabs에서 Gemini 3.1 Flash TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring--음성 변환을 위한 텍스트. 멀티스피커 모드의 경우, Speaker1: / Speaker2:로 줄 앞에 붙입니다.
modeenumsinglesingle, multi싱글 = 한 음성 대사, 멀티 = 두 음성 대화 (음성 + voice2 + 화자 이름 사용).
languagestringen-US-발음 단서를 위한 BCP-47 언어 태그(en-US, es-ES 등).
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...주요 음성 이름(예: Kore, Puck, Aoede). 기본값은 비워두세요.
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...멀티스피커 모드의 두 번째 음성 이름입니다.
speaker1_namestringSpeaker1-스피커 1의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker1).
speaker2_namestringSpeaker2-스피커 2의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW오디오 파일 형식(mp3, wav, opus, flac 등).
speednumber10.25 ~ 2재생 속도. 1.0 = 자연; <1 느리게, > 1 더 빨라.
volume_gainnumber0-96 ~ 16출력 게인은 dB 단위입니다. 0 = 변함 없음.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000출력 샘플레이트는 Hz 단위로 (8000, 16000, 24000, 44100, 48000)
style_promptstring--자연어(Naturallanguage Style) 방향(예: "따뜻하고, 대화체적인" 또는 "뉴스캐스터, 진지함").

알아두면 좋은 점

대부분의 제어 가능 Gemini TTS 날짜. 리밋 - 텍스트 + 스타일 프롬프트: 4,000 바이트 각 (8,000 결합) - 최대 출력: ~10 분 - 오디오 청구: ~ 초당 25 토큰 (~15 chars/s) - 언어는 자동 감지; 언어 설정은 힌트, constraint 인라인 오디오 태그 (제어 배달) - Emotion: [whispers], [shouts], [laughs] 2, [shouts] 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 3 2 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3

Gemini 3.1 Flash TTS API: 자주 묻는 질문

Gemini 3.1 Flash TTS API 비용은 얼마인가요?

EmpirioLabs에서 Gemini 3.1 Flash TTS은(는) 종량제로 청구됩니다: 이름 * $2.60 1M 신속한 토큰 당; 제품정보 $52.00 1M 생성 토큰. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

Gemini 3.1 Flash TTS은(는) 어떤 엔드포인트를 사용하나요?

Gemini 3.1 Flash TTS은(는) api.empiriolabs.aiPOST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 Gemini 3.1 Flash TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Gemini 3.1 Flash TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

Gemini 3.1 Flash TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.