Gemini 2.5 Pro TTS API

Pré-visualização TTS de alta qualidade para podcasts, audiolivros e suporte ao cliente, com vozes expressivas multi-falantes em mais de 23 idiomas.

GoogleGeração de ÁudioLançado 20 de mai. de 2025Endpoint proprietário

Sobre Gemini 2.5 Pro TTS

Pré-visualização TTS de alta qualidade para podcasts, audiolivros e suporte ao cliente, com vozes expressivas multi-falantes em mais de 23 idiomas.

Também conhecido como Gemini Pro TTS, Gemini TTS, Google Gemini 2.5 Pro TTS, Gemini-2.5-Pro-TTS

text to speechmulti speakermultilingual

Especificações de Gemini 2.5 Pro TTS

ID do modelo
gemini-2-5-pro-tts
Provedor
Google
Categoria
Geração de Áudio
Lançado
20 de mai. de 2025
Entrada
Texto
Saída
Áudio
Endpoints
POST/v1/audio/speech
IDs de modelo alternativos
gemini-2.5-pro-ttsgoogle/gemini-2.5-pro-tts

Preços da API Gemini 2.5 Pro TTS

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Entrada
por fichas de alerta de 1M
$3.00
Saída
por tokens gerados 1M
$60.00
Comparar na página completa de preços

Como chamar a API Gemini 2.5 Pro TTS

Gemini 2.5 Pro TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo gemini-2-5-pro-tts. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2-5-pro-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-2-5-pro-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API Gemini 2.5 Pro TTS

Parâmetros da API Gemini 2.5 Pro TTS

Parâmetros de requisição suportados pela API Gemini 2.5 Pro TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring--Texto para converter em fala. Para o modo multi-alto-falante, prefixe as linhas com Alto-falante1: / Alto-falante2:.
modeenumsinglesingle, multiSingle = uma voz, multi = diálogo a duas vozes (usa voz + voz2 + nomes dos falantes).
languagestringen-US-Etiqueta de idioma BCP-47 (en-US, es-ES, etc.) para pistas de pronúncia.
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Nome principal da voz (ex.: Kore, Puck, Aoede). Deixe em branco para o padrão.
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Segundo nome de voz para modo multi-alto-falante.
speaker1_namestringSpeaker1-Nome de exibição usado no prefixo de entrada para o alto-falante 1 (padrão: Alto-falante 1).
speaker2_namestringSpeaker2-Nome de exibição usado no prefixo de entrada do alto-falante 2 (padrão: Alto-falante2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWFormato de arquivo de áudio (mp3, wav, opus, flac, etc.).
speednumber10.25 a 2Taxa de reprodução. 1.0 = natural; <1 mais devagar, >1 mais rápido.
volume_gainnumber0-96 a 16Ganho de saída em dB. 0 = inalterado.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000Taxa de amostragem de saída em Hz (8000, 16000, 24000, 44100, 48000).
style_promptstring--Direção de estilo em linguagem natural (por exemplo, "caloroso, conversacional" ou "apresentador de notícias, sério").

Bom saber

Modes - Alto-falante único - Multi-falante (máximo 2 vozes) - texto deve estar em SpeakerName: text formato Limites - Texto + prompt de estilo: 4.000 bytes cada - Faturação de áudio: ~32 tokens por segundo de áudio gerado (~10-15 chars/s) Vozes e idiomas - 30+ opções de voz em emotional/tonal caracteres - 24+ locais de linguagem suportados Formatos de saída - MP3, WAV, OGG

API Gemini 2.5 Pro TTS: perguntas frequentes

Quanto custa a API Gemini 2.5 Pro TTS?

Na EmpirioLabs, Gemini 2.5 Pro TTS é cobrado por uso: Entrada $3.00 por fichas de alerta de 1M; Saída $60.00 por tokens gerados 1M. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint Gemini 2.5 Pro TTS usa?

Gemini 2.5 Pro TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar Gemini 2.5 Pro TTS no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa Gemini 2.5 Pro TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API Gemini 2.5 Pro TTS?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.