Gemini 2.5 Pro TTS API

팟캐스트, 오디오북, 고객 지원을 위한 고품질 TTS 미리보기와 23+ 언어 전반에 걸친 표현력 있는 다중 화자 음성.

Google오디오 생성출시 2025년 5월 20일독점 엔드포인트

Gemini 2.5 Pro TTS 소개

팟캐스트, 오디오북, 고객 지원을 위한 고품질 TTS 미리보기와 23+ 언어 전반에 걸친 표현력 있는 다중 화자 음성.

다른 이름 Gemini Pro TTS, Gemini TTS, Google Gemini 2.5 Pro TTS

text to speechmulti speakermultilingual

Gemini 2.5 Pro TTS 사양

모델 ID
gemini-2-5-pro-tts
개발사
Google
카테고리
오디오 생성
출시
2025년 5월 20일
입력
텍스트
출력
오디오
엔드포인트
POST/v1/audio/speech
대체 모델 ID
gemini-2.5-pro-ttsgoogle/gemini-2.5-pro-tts

Gemini 2.5 Pro TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
입력
1M 프롬프트 토큰당
$3.00
제품정보
생성된 토큰 1M 단위
$60.00
전체 가격 페이지에서 비교

Gemini 2.5 Pro TTS API 호출 방법

Gemini 2.5 Pro TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID gemini-2-5-pro-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2-5-pro-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-2-5-pro-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 2.5 Pro TTS API 전체 레퍼런스

Gemini 2.5 Pro TTS API 파라미터

EmpirioLabs에서 Gemini 2.5 Pro TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring--음성 변환을 위한 텍스트. 멀티스피커 모드의 경우, Speaker1: / Speaker2:로 줄 앞에 붙입니다.
modeenumsinglesingle, multi싱글 = 한 음성 대사, 멀티 = 두 음성 대화 (음성 + voice2 + 화자 이름 사용).
languagestringen-US-발음 단서를 위한 BCP-47 언어 태그(en-US, es-ES 등).
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...주요 음성 이름(예: Kore, Puck, Aoede). 기본값은 비워두세요.
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...멀티스피커 모드의 두 번째 음성 이름입니다.
speaker1_namestringSpeaker1-스피커 1의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker1).
speaker2_namestringSpeaker2-스피커 2의 입력 접두사에 사용되는 디스플레이 이름(기본값: Speaker2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAW오디오 파일 형식(mp3, wav, opus, flac 등).
speednumber10.25 ~ 2재생 속도. 1.0 = 자연; <1 느리게, > 1 더 빨라.
volume_gainnumber0-96 ~ 16출력 게인은 dB 단위입니다. 0 = 변함 없음.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000출력 샘플레이트는 Hz 단위로 (8000, 16000, 24000, 44100, 48000)
style_promptstring--자연어(Naturallanguage Style) 방향(예: "따뜻하고, 대화체적인" 또는 "뉴스캐스터, 진지함").

알아두면 좋은 점

모드 - 단일 스피커 - 다중 스피커 (최대 2음성): 텍스트는 SpeakerName: text 형식이어야 함 제한 - 텍스트 + 스타일 프롬프트: 각 4,000바이트 - 오디오 요금: 초당 ~32개의 토큰 생성 오디오(~10-15 chars/s) 음성 및 언어 - emotional/tonal자 30+ 음성 옵션 - 24+ 언어 로컬 지원 출력 형식 - MP3, WAV, OGG

Gemini 2.5 Pro TTS API: 자주 묻는 질문

Gemini 2.5 Pro TTS API 비용은 얼마인가요?

EmpirioLabs에서 Gemini 2.5 Pro TTS은(는) 종량제로 청구됩니다: 입력 $3.00 1M 프롬프트 토큰당; 제품정보 $60.00 생성된 토큰 1M 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

Gemini 2.5 Pro TTS은(는) 어떤 엔드포인트를 사용하나요?

Gemini 2.5 Pro TTS은(는) api.empiriolabs.aiPOST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 Gemini 2.5 Pro TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Gemini 2.5 Pro TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

Gemini 2.5 Pro TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.