
Voz económica para agentes de voz y doblaje, con streaming, etiquetas vocales y diálogo entre dos hablantes en 101 idiomas y 2.000+ voces.
Voz económica para agentes de voz y doblaje, con streaming, etiquetas vocales y diálogo entre dos hablantes en 101 idiomas y 2.000+ voces.
También conocido como Gemini Flash-Lite TTS, Google Gemini 3.8 Flash-Lite TTS, Gemini-3.8-Flash-Lite-TTS
gemini-3-8-flash-lite-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesgemini-3.8-flash-lite-ttsgoogle/gemini-3.8-flash-lite-ttsTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Gemini 3.8 Flash-Lite TTS genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo gemini-3-8-flash-lite-tts. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-8-flash-lite-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-8-flash-lite-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de Gemini 3.8 Flash-Lite TTS en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 5000 | Texto para convertir a voz. Para el modo multialtavoz, prefija líneas con Speaker1: / Speaker2:. Hasta 5.000 caracteres. Pon la dirección de la entrega en... |
| mode | enum | single | single, multi | Una = una voz, Múltiples = Diálogo a dos voces (usa voz + voz2 + nombres de los altavoces). |
| language | string | - | - | Etiqueta opcional de idioma BCP-47 (en-US, es-ES, etc.). El idioma del texto se detecta automáticamente. Las 30 voces listadas hablan todos los idiomas soportados;... |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Nombre de voz principal (por ejemplo, Kore, Puck, Aoede). Deja en blanco para el valor predeterminado. Estas 30 voces hablan todos los idiomas soportados. GET... |
| voice_audio_url | string | - | - | Voice=Custom Only: una URL https de una grabación de 10 a 30 segundos de voz limpia y natural desde la voz para clonar (WAV, MP3, M4A, OGG, WEBM o FLAC). Grávala en... |
| voice_consent_audio_url | string | - | - | voice=custom only: una URL https al mismo altavoz leyendo esta declaración en voz alta: "Soy el propietario de esta voz y consiento que Google use esta voz para... |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Segundo nombre de voz para el modo multialtavoz. |
| speaker1_name | string | Speaker1 | - | Nombre de pantalla usado en el prefijo de entrada para altavoz 1 (por defecto: Speaker1). |
| speaker2_name | string | Speaker2 | - | Nombre de pantalla usado en el prefijo de entrada para altavoz 2 (por defecto: Altavoz 2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | Formato de archivo de audio: WAV, MP3, OGG (Opus) o ALAW / MULAW para telefonía. |
| speed | number | 1 | 0.25 a 2 | Velocidad de reproducción. 1.0 = natural; <1 más lento, >1 más rápido. |
| volume_gain | number | 0 | -96 a 16 | Ganancia de salida en dB. 0 = sin cambios. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | Frecuencia de muestreo de salida en Hz (8000, 16000, 22050, 24000, 44100 o 48000). |
| style_prompt | string | - | - | Dirección de estilo en lenguaje natural (por ejemplo, "cálido, conversacional" o "presentador de noticias, serio"). |
Límites - Texto: hasta 5.000 caracteres por solicitud - Facturación de audio: 32 tokens de salida por segundo de audio generado - 101 idiomas. El idioma del texto se detecta automáticamente. Voces - Las 30 voces de la lista de voice hablan todos los idiomas soportados. - GET /v1/voices?model=gemini-3-8-flash-lite-tts lista la biblioteca completa de más de 2.000 voces en 30 localidades, con el idioma, acento, género, tono y una descripción de cada una. Filtra con language, gender, pitch o q. Cualquier id que devuelva funciona como voice o voice2; cuando también configures language, usa el idioma propio de la voz. Voces personalizadas - Configura voice para GET /v1/voices?model=gemini-3-8-flash-lite-tts 0__ y pasa dos grabaciones del mismo hablante adulto como URLs https: GET /v1/voices?model=gemini-3-8-flash-lite-tts 1__, de 10 a 30 segundos de habla natural, y GET /v1/voices?model=gemini-3-8-flash-lite-tts 2__, el altavoz leyendo "Soy el propietario de esta voz y consiento que Google use esta voz para crear un modelo de voz sintética." La afirmación está aceptada en 30 idiomas; GET /v1/voices?model=gemini-3-8-flash-lite-tts 3__ en ese parámetro lista cada redacción. - Graba ambas en una habitación silenciosa con el mismo micrófono. Se aceptan WAV, MP3, M4A, OGG, WEBM y FLAC, hasta 15 MB cada una. - La respuesta incluye GET /v1/voices?model=gemini-3-8-flash-lite-tts 4__ y GET /v1/voices?model=gemini-3-8-flash-lite-tts 5__. Pasar el GET /v1/voices?model=gemini-3-8-flash-lite-tts 6__ como GET /v1/voices?model=gemini-3-8-flash-lite-tts 7__ o GET /v1/voices?model=gemini-3-8-flash-lite-tts 8__ reutilizar la voz durante 7 días sin nuevas grabaciones. Cualquiera con el id puede usar la voz hasta que expire, así que mantenlo privado. Dirección de entrega - Pon la dirección para todo el pasaje en GET /v1/voices?model=gemini-3-8-flash-lite-tts 9__ en lugar de en el texto, por ejemplo "cálido, sin prisas y tranquilizador". - Coloca etiquetas vocales en línea donde debe ocurrir el sonido. Usa estas etiquetas en inglés incluso cuando el texto esté en otro idioma: solo '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'.
En EmpirioLabs, Gemini 3.8 Flash-Lite TTS se factura por uso: Entrada $2.60 por 1M de tokens de prompt; Producto $31.20 por 1M de tokens generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Gemini 3.8 Flash-Lite TTS se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta Gemini 3.8 Flash-Lite TTS en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.