Inicio Blog

Cómo usar Gemini 3.8 Flash TTS y Flash-Lite TTS

Gemini 3.8 Flash TTS y Flash-Lite TTS vía API

Sep 23, 2026

EmpirioLabs AI

Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS están disponibles en EmpirioLabs. Ambos convierten texto en voz a través de DESPUÉS /v1/audio/speech, transmite audio a través de DESPUÉS /v1/audio/speech:stream, y se basan en la misma biblioteca de más de 2.000 voces. Ambos funcionan en la API y en la Playground.

Los dos modelos

  • gemini-3-8-flash-tts está diseñado para la dirección creativa: narración, audiolibros, personajes y escenas con dos hablantes. Cubre 130 idiomas.
  • gemini-3-8-flash-lite-tts está diseñado para trabajos de alto volumen como agentes de voz, doblaje y audio masivo, con una menor frecuencia para audio generado. Cubre 101 idiomas.

Ambos modelos usan el mismo cuerpo de solicitud, así que cambiar entre ellos es un cambio de modelo.

Tu primera petición

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "gemini-3-8-flash-tts", "entrada": "Bienvenido de nuevo. <pausa breve> Esto es lo que cambió esta semana.", "voz": "Kore", "style_prompt": "cálido y sin prisas" }'

La respuesta lleva una URL firmada al audio generado. El formato predeterminado es WAV a 24.000 Hz. Establecido output_format a MP3, OGG, ALAW, o MULAW, y sample_rate a cualquiera de 8.000, 16.000, 22.050, 24.000, 44.100 o 48.000 Hz.

Dirección de la actuación

  • Dirección de estilo. style_prompt marca el tono de todo el pasaje, por ejemplo "calmado y tranquilizador" o "comentarista deportivo entusiasmado".
  • Etiquetas vocales. Etiquetas como <laugh>, <sigh>, <breath>, y <breve pausa> Ve en línea donde debería ocurrir el sonido. La lista completa está en el Entrada en la referencia del modelo. Utiliza las etiquetas en inglés incluso cuando el texto esté en otro idioma.
  • Énfasis. Escribe una palabra con mayúscula para enfatizarlo.

Diálogo entre dos oradores

Set Modo a Multi, elige una voz para cada altavoz con Voz y Voz2, y empiezan cada línea con el nombre del hablante y dos puntos. Los nombres deben coincidir speaker1_name y speaker2_name, que por defecto es Speaker1 y Speaker2.

{ "modelo": "gemini-3-8-flash-lite-tts", "modo": "multi", "speaker1_name": "Maya", "speaker2_name": "Theo", "voz": "Aoede", "voz2": "Puck", "entrada": "Maya: ¿Ha llegado el envío?\nTheo: Sí.<laugh> Cada caja, a tiempo." }

Elegir una voz

Las 30 voces en el Voz lista, como Kore, Puck, Charon y Aoede, hablan todos los idiomas soportados. La biblioteca completa contiene más de 2.000 voces en 30 lugares, cada uno con un idioma, acento, género, tono y descripción. Listáralo con ¡QUE /v1/voices y filtrar por Idioma, Género, Pitch, o un término de búsqueda con q:

curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY"

Cualquier ID de voz que devuelva el anuncio funciona en Voz y Voz2.

Streaming

DESPUÉS /v1/audio/speech:stream toma el mismo cuerpo y devuelve Eventos Enviados por el Servidor: audio.chunk eventos que transmiten PCM base64 de 16 bits a 24.000 Hz mientras se genera el audio, luego uno audio.done evento con un enlace al archivo completo en el formato solicitado.

Notas operativas

  1. Los scripts escritos para Gemini 3.1 Flash TTS necesitan que sus etiquetas sean reescritas. Los modelos 3.8 utilizan etiquetas de corchetes angulares como <whispers> y <laugh> En lugar de las etiquetas de corchetes que usa la 3.1. Actualiza las etiquetas cuando mueves un script.
  2. La voz de una biblioteca mantiene su propio lenguaje. Cuando estableces Idioma Junto con una voz de biblioteca, debe ser la ubicación de esa voz: fr-fr-advisor-1 con en-ee.uu. es rechazado. Las 30 voces multilingües aceptan cualquier idioma.
  3. Las etiquetas de diálogo deben coincidir con los nombres de los altavoces. En Multi modo, el texto antes de la primera línea etiquetada es rechazado, y una línea cuya etiqueta no coincide con ninguno de los dos speaker1_name ni speaker2_name se lee como parte del turno anterior.
  4. Velocidad Se aplica a archivos completos. El extremo de streaming rechaza un Velocidad Excepto la 1.0. Solicita el archivo a DESPUÉS /v1/audio/speech Cuando necesitas una velocidad diferente.

Precios

Ambos modelos son de pago por uso, sin suscripción. Se factura una solicitud por sus tokens de texto de entrada y su audio generado, a 32 tokens de audio por segundo de voz, y Flash-Lite tiene la tarifa más baja para audio generado. Las tarifas actuales están en las páginas de modelos de Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS y en el página de precios.

Empieza a construir

Prueba Gemini 3.8 Flash TTS o Gemini 3.8 Flash-Lite TTS en el Playground, y leer la referencia de API para Flash y Flash-Lite.

Para conversaciones de voz en tiempo real de la misma familia, véase Cómo usar Gemini 3.8 Live y Live Extended Thinking.

Divulgación: Este artículo fue escrito con asistencia AI y revisado por EmpirioLabs AI.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.