
Habla expresiva con etiquetas vocales en línea, dirección de estilo y diálogo entre dos hablantes, en 130 idiomas y una biblioteca de más de 2.000 voces.
Habla expresiva con etiquetas vocales en línea, dirección de estilo y diálogo entre dos hablantes, en 130 idiomas y una biblioteca de más de 2.000 voces.
También conocido como Gemini Flash TTS, Google Gemini 3.8 Flash TTS
gemini-3-8-flash-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesgemini-3.8-flash-ttsgoogle/gemini-3.8-flash-ttsTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Gemini 3.8 Flash TTS genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo gemini-3-8-flash-tts. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-8-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de Gemini 3.8 Flash TTS en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 5000 | Texto para convertir a voz. Para el modo multialtavoz, prefija líneas con Speaker1: / Speaker2:. Hasta 5.000 caracteres. Pon la dirección de la entrega en... |
| mode | enum | single | single, multi | Una = una voz, Múltiples = Diálogo a dos voces (usa voz + voz2 + nombres de los altavoces). |
| language | string | - | - | Etiqueta opcional de idioma BCP-47 (en-US, es-ES, etc.). El idioma del texto se detecta automáticamente. Las 30 voces listadas hablan todos los idiomas soportados;... |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Nombre de voz principal (por ejemplo, Kore, Puck, Aoede). Deja en blanco para el valor predeterminado. Estas 30 voces hablan todos los idiomas soportados. GET... |
| voice_audio_url | string | - | - | Voice=Custom Only: una URL https de una grabación de 10 a 30 segundos de voz limpia y natural desde la voz para clonar (WAV, MP3, M4A, OGG, WEBM o FLAC). Grávala en... |
| voice_consent_audio_url | string | - | - | voice=custom only: una URL https al mismo altavoz leyendo esta declaración en voz alta: "Soy el propietario de esta voz y consiento que Google use esta voz para... |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Segundo nombre de voz para el modo multialtavoz. |
| speaker1_name | string | Speaker1 | - | Nombre de pantalla usado en el prefijo de entrada para altavoz 1 (por defecto: Speaker1). |
| speaker2_name | string | Speaker2 | - | Nombre de pantalla usado en el prefijo de entrada para altavoz 2 (por defecto: Altavoz 2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | Formato de archivo de audio: WAV, MP3, OGG (Opus) o ALAW / MULAW para telefonía. |
| speed | number | 1 | 0.25 a 2 | Velocidad de reproducción. 1.0 = natural; <1 más lento, >1 más rápido. |
| volume_gain | number | 0 | -96 a 16 | Ganancia de salida en dB. 0 = sin cambios. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | Frecuencia de muestreo de salida en Hz (8000, 16000, 22050, 24000, 44100 o 48000). |
| style_prompt | string | - | - | Dirección de estilo en lenguaje natural (por ejemplo, "cálido, conversacional" o "presentador de noticias, serio"). |
Límites - Texto: hasta 5.000 caracteres por solicitud - Facturación de audio: 32 tokens de salida por segundo de audio generado - 130 idiomas. El idioma del texto se detecta automáticamente. Voces - Las 30 voces de la lista de voice hablan todos los idiomas compatibles. - GET /v1/voices?model=gemini-3-8-flash-tts lista la biblioteca completa de más de 2.000 voces en 30 ubicaciones, con el idioma, acento, género, tono y una descripción de cada una. Filtra con language, gender, pitch o q. Cualquier id que devuelva funciona como voice o voice2; cuando también configures language, usa el idioma propio de la voz. Voces personalizadas - Configura voice para GET /v1/voices?model=gemini-3-8-flash-tts 0__ y pasa dos grabaciones del mismo hablante adulto como URLs https: GET /v1/voices?model=gemini-3-8-flash-tts 1__, de 10 a 30 segundos de habla natural, y GET /v1/voices?model=gemini-3-8-flash-tts 2__, el altavoz leyendo "Soy el propietario de esta voz y consiento que Google use esta voz para crear un modelo de voz sintética." La afirmación está aceptada en 30 idiomas; GET /v1/voices?model=gemini-3-8-flash-tts 3__ en ese parámetro lista cada redacción. - Graba ambas en una habitación silenciosa con el mismo micrófono. Se aceptan WAV, MP3, M4A, OGG, WEBM y FLAC, hasta 15 MB cada una. - La respuesta incluye GET /v1/voices?model=gemini-3-8-flash-tts 4__ y GET /v1/voices?model=gemini-3-8-flash-tts 5__. Pasar el GET /v1/voices?model=gemini-3-8-flash-tts 6__ como GET /v1/voices?model=gemini-3-8-flash-tts 7__ o GET /v1/voices?model=gemini-3-8-flash-tts 8__ reutilizar la voz durante 7 días sin nuevas grabaciones. Cualquiera con el id puede usar la voz hasta que expire, así que mantenlo privado. Dirección de entrega - Pon la dirección para todo el pasaje en GET /v1/voices?model=gemini-3-8-flash-tts 9__ en lugar de en el texto, por ejemplo "cálido, sin prisas y tranquilizador". - Coloca etiquetas vocales en línea donde debe ocurrir el sonido. Usa estas etiquetas en inglés incluso cuando el texto esté en otro idioma: solo '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'.
En EmpirioLabs, Gemini 3.8 Flash TTS se factura por uso: Entrada $2.60 por 1M de tokens de prompt; Producto $46.80 por 1M de tokens generados. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Gemini 3.8 Flash TTS se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta Gemini 3.8 Flash TTS en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.