
Fala econômica para agentes de voz e dublagem, com streaming, tags vocais e diálogo com dois falantes em 101 idiomas e 2.000+ vozes.
Fala econômica para agentes de voz e dublagem, com streaming, tags vocais e diálogo com dois falantes em 101 idiomas e 2.000+ vozes.
Também conhecido como Gemini Flash-Lite TTS, Google Gemini 3.8 Flash-Lite TTS, Gemini-3.8-Flash-Lite-TTS
gemini-3-8-flash-lite-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesgemini-3.8-flash-lite-ttsgoogle/gemini-3.8-flash-lite-ttsTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Gemini 3.8 Flash-Lite TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo gemini-3-8-flash-lite-tts. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-8-flash-lite-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-8-flash-lite-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parâmetros de requisição suportados pela API Gemini 3.8 Flash-Lite TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input | string | - | máx. 5000 | Texto para converter em fala. Para modo multi-alto-falante, prefixe linhas com Alto-falante1: / Orador2:. Até 5.000 caracteres. Coloque a direção da entrega em... |
| mode | enum | single | single, multi | Single = uma voz, multi = diálogo a duas vozes (usa voz + voz2 + nomes dos falantes). |
| language | string | - | - | Tag opcional de idioma BCP-47 (en-US, es-ES, etc.). A língua do texto é detectada automaticamente. As 30 vozes listadas falam todos os idiomas suportados; uma voz de... |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Nome principal da voz (ex.: Kore, Puck, Aoede). Deixe em branco para o padrão. Essas 30 vozes falam todos os idiomas suportados. O GET /v1/voices lista a biblioteca... |
| voice_audio_url | string | - | - | Voice=Customish: Uma URL https para uma gravação de 10 a 30 segundos de fala limpa e natural da voz para clone (WAV, MP3, M4A, OGG, WEBM ou FLAC). Grave em uma sala... |
| voice_consent_audio_url | string | - | - | Voice=Custom: Uma URL https para o mesmo alto-falante lendo esta declaração em voz alta: "Sou o proprietário desta voz e consinto que o Google use esta voz para... |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Segundo nome de voz para modo multi-alto-falante. |
| speaker1_name | string | Speaker1 | - | Nome de exibição usado no prefixo de entrada para o alto-falante 1 (padrão: Alto-falante 1). |
| speaker2_name | string | Speaker2 | - | Nome de exibição usado no prefixo de entrada do alto-falante 2 (padrão: Alto-falante2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | Formato de arquivo de áudio: WAV, MP3, OGG (Opus) ou ALAW / MULAW para telefonia. |
| speed | number | 1 | 0.25 a 2 | Taxa de reprodução. 1.0 = natural; <1 mais devagar, >1 mais rápido. |
| volume_gain | number | 0 | -96 a 16 | Ganho de saída em dB. 0 = inalterado. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | Taxa de amostragem de saída em Hz (8000, 16000, 22050, 24000, 44100 ou 48000). |
| style_prompt | string | - | - | Direção de estilo em linguagem natural (por exemplo, "caloroso, conversacional" ou "apresentador de notícias, sério"). |
Limites - Texto: até 5.000 caracteres por requisição - Faturamento de áudio: 32 tokens de saída por segundo de áudio gerado - 101 idiomas. O idioma do texto é detectado automaticamente. Vozes - As 30 vozes na lista de voice falam todos os idiomas suportados. - GET /v1/voices?model=gemini-3-8-flash-lite-tts lista a biblioteca completa de mais de 2.000 vozes em 30 locais, com o idioma, sotaque, gênero, tom e uma descrição de cada um. Filtre com language, gender, pitch ou q. Qualquer id que ele retorne funciona como voice ou voice2; quando você também definir language, use o idioma próprio da voz. Vozes personalizadas - Defina voice para GET /v1/voices?model=gemini-3-8-flash-lite-tts 0__ e passe duas gravações do mesmo falante adulto como URLs https: GET /v1/voices?model=gemini-3-8-flash-lite-tts 1__, de 10 a 30 segundos de fala natural, e GET /v1/voices?model=gemini-3-8-flash-lite-tts 2__, o alto-falante dizendo "Eu sou o dono desta voz e consinto que o Google use esta voz para criar um modelo de voz sintética." A declaração é aceita em 30 idiomas; GET /v1/voices?model=gemini-3-8-flash-lite-tts 3__ nesse parâmetro lista cada redação. - Grave ambos em uma sala silenciosa no mesmo microfone. WAV, MP3, M4A, OGG, WEBM e FLAC são aceitos, com até 15 MB cada. - A resposta inclui GET /v1/voices?model=gemini-3-8-flash-lite-tts 4__ e GET /v1/voices?model=gemini-3-8-flash-lite-tts 5__. Passe o GET /v1/voices?model=gemini-3-8-flash-lite-tts 6__ como GET /v1/voices?model=gemini-3-8-flash-lite-tts 7__ ou GET /v1/voices?model=gemini-3-8-flash-lite-tts 8__ reutilizar a voz por 7 dias sem novas gravações. Qualquer pessoa com o id pode usar a voz até que ela expire, então mantenha-a privada. Direção de entrega - Coloque a direção para toda a passagem no GET /v1/voices?model=gemini-3-8-flash-lite-tts 9__ em vez do texto, por exemplo, "quente, sem pressa e tranquilizador". - Coloque as tags vocais na linha onde o som deve acontecer. Use essas tags em inglês mesmo quando o texto estiver em outro idioma: apenas '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'.
Na EmpirioLabs, Gemini 3.8 Flash-Lite TTS é cobrado por uso: Entrada $2.60 por 1M de tokens de prompt; Saída $31.20 por 1M de tokens gerados. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Gemini 3.8 Flash-Lite TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa Gemini 3.8 Flash-Lite TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.