Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS estão disponíveis na EmpirioLabs. Ambos transformam texto em fala através PÓS-/v1/audio/speech, transmitir áudio através PÓS-/v1/audio/speech:stream, e se baseiam na mesma biblioteca de mais de 2.000 vozes. Ambos funcionam na API e no Playground.
Os dois modelos
gemini-3-8-flash-ttsé feito para direção criativa: narração, audiolivros, personagens e cenas com dois falantes. Abrange 130 idiomas.gemini-3-8-flash-lite-ttsé feito para trabalhos de alto volume, como agentes de voz, dublagem e áudio em massa, com uma taxa menor para áudio gerado. Abrange 101 idiomas.
Ambos os modelos recebem o mesmo corpo de solicitação, então alternar entre eles é uma mudança de modelo.
Seu primeiro pedido
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "gemini-3-8-flash-tts", "entrada": "Bem-vindo de volta. <pausa curta> Aqui está o que mudou esta semana.", "voz": "Kore", "style_prompt": "quente e sem pressa" }'
A resposta carrega uma URL assinada para o áudio gerado. O formato padrão é WAV a 24.000 Hz. Definir output_format para MP3, OGG, ALAW, ou MULAW, e sample_rate para qualquer um de 8.000, 16.000, 22.050, 24.000, 44.100 ou 48.000 Hz.
Dirigindo a apresentação
- Direção de estilo.
style_promptdefine o tom de toda a passagem, por exemplo, "calmo e tranquilizador" ou "comentarista esportivo animado". - Etiquetas vocais. Tags como
<laugh>,<sigh>,<breath>, e<breve pausa>Vá para dentro do local onde o som deve acontecer. A lista completa está noEntradano parâmetro na referência do modelo. Use as tags em inglês mesmo quando o texto estiver em outro idioma. - Ênfase. Coloque uma palavra maiúscula para enfatizar.
Diálogo entre dois oradores
Definir Modo para Multi, escolha uma voz para cada falante com Voz e voz2, e começa cada linha com o nome do falante e dois cors. Os nomes devem coincidir speaker1_name e speaker2_name, que por padrão é Speaker1 e Speaker2.
{ "modelo": "gemini-3-8-flash-lite-tts", "modo": "multi", "speaker1_name": "Maya", "speaker2_name": "Theo", "voz": "Aoede", "voz2": "Puck", "entrada": "Maya: A remessa chegou?\nTheo: Chegou.<laugh> Cada caixa, no prazo." }
Escolhendo uma voz
As 30 vozes no Voz lista, como Kore, Puck, Charon e Aoede, falam todos os idiomas suportados. A biblioteca completa possui mais de 2.000 vozes em 30 locais, cada um com idioma, sotaque, gênero, tom e descrição. Liste com VÁ /v1/voices e filtrar por Idioma, Gênero, Pitch, ou um termo de busca com q:
curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY"
Qualquer ID de voz que o anúncio devolve funciona em Voz e voz2.
Streaming
PÓS-/v1/audio/speech:stream toma o mesmo corpo e retorna Eventos Enviados pelo Servidor: audio.chunk eventos transportando PCM base64 de 16 bits a 24.000 Hz enquanto o áudio é gerado, depois um audio.done evento com link para o arquivo completo no formato solicitado.
Notas operacionais
- Scripts escritos para Gemini 3.1 Flash TTS precisam de suas tags reescritas. Os modelos 3.8 usam etiquetas de colchetes angulares como
<whispers>e<laugh>Em vez das tags de colchete que a 3.1 usa. Atualize as tags quando mover um script para o lado. - Uma voz de biblioteca mantém sua própria linguagem. Quando você define
Idiomajunto com uma voz de biblioteca, deve ser o local dessa voz:fr-fr-advisor-1comen-USé rejeitado. As 30 vozes multilíngues aceitam qualquer idioma. - Os rótulos dos diálogos devem corresponder aos nomes dos falantes. Em
Multimodo de texto, texto antes da primeira linha rotulada é rejeitado, e uma linha cujo rótulo não corresponde a nenhum dos doisspeaker1_namenemspeaker2_nameé lido como parte do turno anterior. VelocidadeAplica-se a arquivos completos. O endpoint de streaming rejeita umVelocidadeExceto a 1.0. Solicite o arquivo dePÓS-/v1/audio/speechQuando você precisa de uma velocidade diferente.
Preços
Ambos os modelos são pagos conforme o uso, sem assinatura. Um pedido é cobrado pelos tokens de texto de entrada e pelo áudio gerado, a 32 tokens de áudio por segundo de fala, e o Flash-Lite tem a tarifa mais baixa para áudio gerado. As tarifas atuais estão nas páginas dos modelos para Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS e no página de preços.
Comece a construir
Tente Gemini 3.8 Flash TTS ou Gemini 3.8 Flash-Lite TTS no Playground, e leia a referência da API para Flash e Flash-Lite.
Para conversas de voz em tempo real da mesma família, veja Como Usar Gêmeos 3.8 Live e Pensamento Estendido ao Vivo.
Divulgação: Este artigo foi escrito com assistência de IA e revisado por EmpirioLabs IA.



