
TTS altamente controlável com novas etiquetas de áudio para estilo preciso, tom, ritmo e entrega através de narração, assistentes e aplicativos de voz.
TTS altamente controlável com novas etiquetas de áudio para estilo preciso, tom, ritmo e entrega através de narração, assistentes e aplicativos de voz.
Também conhecido como Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts
gemini-3-1-flash-tts/v1/audio/speechgemini-3.1-flash-ttsgoogle/gemini-3.1-flash-ttsTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Gemini 3.1 Flash TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo gemini-3-1-flash-tts. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-1-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parâmetros de requisição suportados pela API Gemini 3.1 Flash TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input | string | - | - | Texto para converter em fala. Para o modo multi-alto-falante, prefixe as linhas com Alto-falante1: / Alto-falante2:. |
| mode | enum | single | single, multi | Single = uma voz, multi = diálogo a duas vozes (usa voz + voz2 + nomes dos falantes). |
| language | string | en-US | - | Etiqueta de idioma BCP-47 (en-US, es-ES, etc.) para pistas de pronúncia. |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Nome principal da voz (ex.: Kore, Puck, Aoede). Deixe em branco para o padrão. |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Segundo nome de voz para modo multi-alto-falante. |
| speaker1_name | string | Speaker1 | - | Nome de exibição usado no prefixo de entrada para o alto-falante 1 (padrão: Alto-falante 1). |
| speaker2_name | string | Speaker2 | - | Nome de exibição usado no prefixo de entrada do alto-falante 2 (padrão: Alto-falante2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | Formato de arquivo de áudio (mp3, wav, opus, flac, etc.). |
| speed | number | 1 | 0.25 a 2 | Taxa de reprodução. 1.0 = natural; <1 mais devagar, >1 mais rápido. |
| volume_gain | number | 0 | -96 a 16 | Ganho de saída em dB. 0 = inalterado. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | Taxa de amostragem de saída em Hz (8000, 16000, 24000, 44100, 48000). |
| style_prompt | string | - | - | Direção de estilo em linguagem natural (por exemplo, "caloroso, conversacional" ou "apresentador de notícias, sério"). |
Gemini TTS mais control?vel at? agora. Limites - Texto + prompt de estilo: 4.000 bytes cada (8.000 combinados) - Sa?da m?xima: ~10 minutos - Cobran?a de ?udio: ~25 tokens por segundo (~15 caracteres/s) - O idioma ? detectado automaticamente; a configura??o de idioma ? uma dica, n?o uma restri??o Tags de ?udio inline (controle de entrega) - Emo??o: [whispers], [shouts], [laughs], [sighs], [cheerful], [sad], [angry], etc. - Ritmo: [slow], [fast], [extremely fast], [normal pace] - Pausas: [short pause], [long pause], [breath] - ?nfase: [softly], [loudly], [high pitch], [low pitch], [rising tone], [falling tone]
Na EmpirioLabs, Gemini 3.1 Flash TTS é cobrado por uso: Entrada $2.60 por fichas de alerta de 1M; Saída $52.00 por tokens gerados 1M. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Gemini 3.1 Flash TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa Gemini 3.1 Flash TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.