Accueil Blog

Comment utiliser Gemini 3.8 Flash TTS et Flash-Lite TTS

Gemini 3.8 Flash TTS et Flash-Lite TTS via API

Sep 23, 2026

EmpirioLabs AI

Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS sont disponibles sur EmpirioLabs. Les deux transforment le texte en voix APRÈS /v1/audio/speech, flux audio à travers APRÈS /v1/audio/speech:stream, et s’appuient sur la même bibliothèque de plus de 2 000 voix. Les deux fonctionnent dans l’API et dans le Playground.

Les deux modèles

  • gemini-3-8-flash-tts est conçu pour la direction créative: narration, livres audio, personnages et scènes à deux intervenants. Il couvre 130 langues.
  • gemini-3-8-flash-lite-tts est conçu pour des travaux à haut volume tels que les agents vocaux, le doublage et l’audio en masse, avec un débit plus faible pour l’audio généré. Il couvre 101 langues.

Les deux modèles prennent le même corps de requête, donc passer de l’un à l’autre est un changement de modèle.

Votre première demande

curl https://api.empiriolabs.ai/v1/audio/speech \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « gemini-3-8-flash-tts », « entrée »: « Bon retour. <pause courte> Voici ce qui a changé cette semaine. », « voice »: « Kore », « style_prompt »: « chaud et sans hâte » }'

La réponse porte une URL signée vers l’audio généré. Le format par défaut est WAV à 24 000 Hz. Définir output_format à MP3, OGG, ALAW, ou MULAW, et sample_rate à n’importe quelle fréquence de 8 000, 16 000, 22 050, 24 000, 44 100 ou 48 000 Hz.

Mise en scène de la performance

  • Direction du style. style_prompt donne le ton à tout le passage, par exemple « calme et rassurant » ou « commentateur sportif enthousiaste ».
  • Tags vocaux. Tags tels que <laugh>, <sigh>, <breath>, et < courte pause> Va en ligne là où le son devrait se produire. La liste complète se trouve sur le Entrée dans la référence du modèle. Utiliser les balises anglaises même lorsque le texte est dans une autre langue.
  • Emphase. Mettez un mot en majuscules pour le souligner.

Dialogue à deux intervenants

Jeu Mode à Multi, choisis une voix pour chaque intervenant avec Voix et Voix2, et chaque ligne commence par le nom du locuteur et un deux-points. Les noms doivent correspondre speaker1_name et speaker2_name, qui par défaut est Speaker1 et Speaker2.

{ « modèle »: « gemini-3-8-flash-lite-tts », « mode »: « multi », « speaker1_name »: « Maya », « speaker2_name »: « Theo », « voice »: « Aoede », « voice2 »: « Puck », « input »: « Maya: La cargaison est-elle arrivée ?\nTheo: Oui.<laugh> Chaque boîte, à l’heure. » }

Choisir une voix

Les 30 voix dans le Voix liste, telles que Kore, Puck, Charon et Aoede, parlent toutes les langues prises en charge. La bibliothèque complète contient plus de 2 000 voix réparties dans 30 lieux, chacun avec une langue, un accent, un genre, une hauteur et une description. Listez-la avec ALLEZ-/v1/voices et filtrer par Langue, Genre, Hauteur, ou un terme de recherche avec q:

curl « https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY »

N’importe quelle voix que l’annonce renvoie fonctionne Voix et Voix2.

Streaming

APRÈS /v1/audio/speech:stream prend le même corps et renvoie les événements envoyés par le serveur: audio.chunk des événements transportant du PCM base64 16 bits à 24 000 Hz au fur et à mesure que l’audio est généré, puis un audio.done événement avec un lien vers le fichier complet dans le format demandé.

Notes opérationnelles

  1. Les scripts écrits pour Gemini 3.1 Flash TTS doivent être réécrits par leurs tags. Les modèles 3.8 utilisent des balises à crochets d’angle telles que <whispers> et <laugh> au lieu des tags à crochets utilisés par la 3.1. Mettez à jour les tags lorsque vous déplacez un script.
  2. La voix d’une bibliothèque garde son propre langage. Quand tu as réglé Langue Avec une voix de bibliothèque, il doit s’agir du lieu de cette voix: fr-fr-advisor-1 avec en-US est rejeté. Les 30 voix multilingues acceptent n’importe quelle langue.
  3. Les étiquettes de dialogue doivent correspondre aux noms des haut-parleurs. Dans Multi mode, le texte avant la première ligne étiquetée est rejeté, et une ligne dont l’etiquetage ne correspond à aucun des deux speaker1_name ni speaker2_name est lu comme faisant partie du tour précédent.
  4. Vitesse S’applique aux fichiers complets. Le terminau de streaming rejette un Vitesse autre que la version 1.0. Demandez le fichier à APRÈS /v1/audio/speech Quand vous avez besoin d’une vitesse différente.

Prix

Les deux modèles sont payants à l’usage, sans abonnement. Une demande est facturée pour ses jetons de texte d’entrée et son audio généré, à 32 jetons audio par seconde de voix, et Flash-Lite affiche le tarif le plus bas pour l’audio généré. Les tarifs actuels sont sur les pages des modèles pour Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS et sur le page de prix.

Commencez à construire

Essaie Gemini 3.8 Flash TTS ou Gemini 3.8 Flash-Lite TTS dans le Playground, et lire la référence API pour Flash et Flash-Lite.

Pour les conversations vocales en temps réel de la même famille, voir Comment utiliser Gemini 3.8 Live et Pensée Étendue en Direct.

Divulgation: Cet article a été rédigé avec l'aide d'AI et examiné par EmpirioLabs AI.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.