Gemini 3.8 Flash TTS API

Fala expressiva com tags vocais em linha, direção de estilo e diálogo para dois falantes, em 130 idiomas e uma biblioteca com mais de 2.000 vozes.

GoogleGeração de ÁudioLançado 22 de set. de 2026Endpoint proprietárioNovo

Sobre Gemini 3.8 Flash TTS

Fala expressiva com tags vocais em linha, direção de estilo e diálogo para dois falantes, em 130 idiomas e uma biblioteca com mais de 2.000 vozes.

Também conhecido como Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Especificações de Gemini 3.8 Flash TTS

ID do modelo
gemini-3-8-flash-tts
Autor
Google
Categoria
Geração de Áudio
Lançado
22 de set. de 2026
Entrada
Texto
Saída
Áudio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

Preços da API Gemini 3.8 Flash TTS

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Entrada
por 1M de tokens de prompt
$2.60
Saída
por 1M de tokens gerados
$46.80
Comparar na página completa de preços

Como chamar a API Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo gemini-3-8-flash-tts. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API Gemini 3.8 Flash TTS

Parâmetros da API Gemini 3.8 Flash TTS

Parâmetros de requisição suportados pela API Gemini 3.8 Flash TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring-máx. 5000Texto para converter em fala. Para modo multi-alto-falante, prefixe linhas com Alto-falante1: / Orador2:. Até 5.000 caracteres. Coloque a direção da entrega em...
modeenumsinglesingle, multiSingle = uma voz, multi = diálogo a duas vozes (usa voz + voz2 + nomes dos falantes).
languagestring--Tag opcional de idioma BCP-47 (en-US, es-ES, etc.). A língua do texto é detectada automaticamente. As 30 vozes listadas falam todos os idiomas suportados; uma voz de...
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Nome principal da voz (ex.: Kore, Puck, Aoede). Deixe em branco para o padrão. Essas 30 vozes falam todos os idiomas suportados. O GET /v1/voices lista a biblioteca...
voice_audio_urlstring--Voice=Customish: Uma URL https para uma gravação de 10 a 30 segundos de fala limpa e natural da voz para clone (WAV, MP3, M4A, OGG, WEBM ou FLAC). Grave em uma sala...
voice_consent_audio_urlstring--Voice=Custom: Uma URL https para o mesmo alto-falante lendo esta declaração em voz alta: "Sou o proprietário desta voz e consinto que o Google use esta voz para...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Segundo nome de voz para modo multi-alto-falante.
speaker1_namestringSpeaker1-Nome de exibição usado no prefixo de entrada para o alto-falante 1 (padrão: Alto-falante 1).
speaker2_namestringSpeaker2-Nome de exibição usado no prefixo de entrada do alto-falante 2 (padrão: Alto-falante2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWFormato de arquivo de áudio: WAV, MP3, OGG (Opus) ou ALAW / MULAW para telefonia.
speednumber10.25 a 2Taxa de reprodução. 1.0 = natural; <1 mais devagar, >1 mais rápido.
volume_gainnumber0-96 a 16Ganho de saída em dB. 0 = inalterado.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000Taxa de amostragem de saída em Hz (8000, 16000, 22050, 24000, 44100 ou 48000).
style_promptstring--Direção de estilo em linguagem natural (por exemplo, "caloroso, conversacional" ou "apresentador de notícias, sério").

Bom saber

Limites - Texto: até 5.000 caracteres por requisição - Faturamento de áudio: 32 tokens de saída por segundo de áudio gerado - 130 idiomas. O idioma do texto é detectado automaticamente. Vozes - As 30 vozes da lista de voice falam todos os idiomas suportados. - GET /v1/voices?model=gemini-3-8-flash-tts lista a biblioteca completa de mais de 2.000 vozes em 30 locais, com o idioma, sotaque, gênero, tom e uma descrição de cada uma. Filtre com language, gender, pitch ou q. Qualquer id que ele retorne funciona como voice ou voice2; quando você também definir language, use o idioma próprio da voz. Vozes personalizadas - Defina voice para GET /v1/voices?model=gemini-3-8-flash-tts 0__ e passe duas gravações do mesmo falante adulto como URLs https: GET /v1/voices?model=gemini-3-8-flash-tts 1__, de 10 a 30 segundos de fala natural, e GET /v1/voices?model=gemini-3-8-flash-tts 2__, o alto-falante dizendo "Eu sou o dono desta voz e consinto que o Google use esta voz para criar um modelo de voz sintética." A declaração é aceita em 30 idiomas; GET /v1/voices?model=gemini-3-8-flash-tts 3__ nesse parâmetro lista cada redação. - Grave ambos em uma sala silenciosa no mesmo microfone. WAV, MP3, M4A, OGG, WEBM e FLAC são aceitos, com até 15 MB cada. - A resposta inclui GET /v1/voices?model=gemini-3-8-flash-tts 4__ e GET /v1/voices?model=gemini-3-8-flash-tts 5__. Passe o GET /v1/voices?model=gemini-3-8-flash-tts 6__ como GET /v1/voices?model=gemini-3-8-flash-tts 7__ ou GET /v1/voices?model=gemini-3-8-flash-tts 8__ reutilizar a voz por 7 dias sem novas gravações. Qualquer pessoa com o id pode usar a voz até que ela expire, então mantenha-a privada. Direção de entrega - Coloque a direção para toda a passagem no GET /v1/voices?model=gemini-3-8-flash-tts 9__ em vez do texto, por exemplo, "quente, sem pressa e tranquilizador". - Coloque as tags vocais na linha onde o som deve acontecer. Use essas tags em inglês mesmo quando o texto estiver em outro idioma: apenas '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'.

API Gemini 3.8 Flash TTS: perguntas frequentes

Quanto custa a API Gemini 3.8 Flash TTS?

Na EmpirioLabs, Gemini 3.8 Flash TTS é cobrado por uso: Entrada $2.60 por 1M de tokens de prompt; Saída $46.80 por 1M de tokens gerados. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint Gemini 3.8 Flash TTS usa?

Gemini 3.8 Flash TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar Gemini 3.8 Flash TTS no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa Gemini 3.8 Flash TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API Gemini 3.8 Flash TTS?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.