Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS sont disponibles sur EmpirioLabs. Les deux transforment le texte en voix APRÈS /v1/audio/speech, flux audio à travers APRÈS /v1/audio/speech:stream, et s’appuient sur la même bibliothèque de plus de 2 000 voix. Les deux fonctionnent dans l’API et dans le Playground.
Les deux modèles
gemini-3-8-flash-ttsest conçu pour la direction créative: narration, livres audio, personnages et scènes à deux intervenants. Il couvre 130 langues.gemini-3-8-flash-lite-ttsest conçu pour des travaux à haut volume tels que les agents vocaux, le doublage et l’audio en masse, avec un débit plus faible pour l’audio généré. Il couvre 101 langues.
Les deux modèles prennent le même corps de requête, donc passer de l’un à l’autre est un changement de modèle.
Votre première demande
curl https://api.empiriolabs.ai/v1/audio/speech \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « gemini-3-8-flash-tts », « entrée »: « Bon retour. <pause courte> Voici ce qui a changé cette semaine. », « voice »: « Kore », « style_prompt »: « chaud et sans hâte » }'
La réponse porte une URL signée vers l’audio généré. Le format par défaut est WAV à 24 000 Hz. Définir output_format à MP3, OGG, ALAW, ou MULAW, et sample_rate à n’importe quelle fréquence de 8 000, 16 000, 22 050, 24 000, 44 100 ou 48 000 Hz.
Mise en scène de la performance
- Direction du style.
style_promptdonne le ton à tout le passage, par exemple « calme et rassurant » ou « commentateur sportif enthousiaste ». - Tags vocaux. Tags tels que
<laugh>,<sigh>,<breath>, et< courte pause>Va en ligne là où le son devrait se produire. La liste complète se trouve sur leEntréedans la référence du modèle. Utiliser les balises anglaises même lorsque le texte est dans une autre langue. - Emphase. Mettez un mot en majuscules pour le souligner.
Dialogue à deux intervenants
Jeu Mode à Multi, choisis une voix pour chaque intervenant avec Voix et Voix2, et chaque ligne commence par le nom du locuteur et un deux-points. Les noms doivent correspondre speaker1_name et speaker2_name, qui par défaut est Speaker1 et Speaker2.
{ « modèle »: « gemini-3-8-flash-lite-tts », « mode »: « multi », « speaker1_name »: « Maya », « speaker2_name »: « Theo », « voice »: « Aoede », « voice2 »: « Puck », « input »: « Maya: La cargaison est-elle arrivée ?\nTheo: Oui.<laugh> Chaque boîte, à l’heure. » }
Choisir une voix
Les 30 voix dans le Voix liste, telles que Kore, Puck, Charon et Aoede, parlent toutes les langues prises en charge. La bibliothèque complète contient plus de 2 000 voix réparties dans 30 lieux, chacun avec une langue, un accent, un genre, une hauteur et une description. Listez-la avec ALLEZ-/v1/voices et filtrer par Langue, Genre, Hauteur, ou un terme de recherche avec q:
curl « https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY »
N’importe quelle voix que l’annonce renvoie fonctionne Voix et Voix2.
Streaming
APRÈS /v1/audio/speech:stream prend le même corps et renvoie les événements envoyés par le serveur: audio.chunk des événements transportant du PCM base64 16 bits à 24 000 Hz au fur et à mesure que l’audio est généré, puis un audio.done événement avec un lien vers le fichier complet dans le format demandé.
Notes opérationnelles
- Les scripts écrits pour Gemini 3.1 Flash TTS doivent être réécrits par leurs tags. Les modèles 3.8 utilisent des balises à crochets d’angle telles que
<whispers>et<laugh>au lieu des tags à crochets utilisés par la 3.1. Mettez à jour les tags lorsque vous déplacez un script. - La voix d’une bibliothèque garde son propre langage. Quand tu as réglé
LangueAvec une voix de bibliothèque, il doit s’agir du lieu de cette voix:fr-fr-advisor-1avecen-USest rejeté. Les 30 voix multilingues acceptent n’importe quelle langue. - Les étiquettes de dialogue doivent correspondre aux noms des haut-parleurs. Dans
Multimode, le texte avant la première ligne étiquetée est rejeté, et une ligne dont l’etiquetage ne correspond à aucun des deuxspeaker1_namenispeaker2_nameest lu comme faisant partie du tour précédent. VitesseS’applique aux fichiers complets. Le terminau de streaming rejette unVitesseautre que la version 1.0. Demandez le fichier àAPRÈS /v1/audio/speechQuand vous avez besoin d’une vitesse différente.
Prix
Les deux modèles sont payants à l’usage, sans abonnement. Une demande est facturée pour ses jetons de texte d’entrée et son audio généré, à 32 jetons audio par seconde de voix, et Flash-Lite affiche le tarif le plus bas pour l’audio généré. Les tarifs actuels sont sur les pages des modèles pour Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS et sur le page de prix.
Commencez à construire
Essaie Gemini 3.8 Flash TTS ou Gemini 3.8 Flash-Lite TTS dans le Playground, et lire la référence API pour Flash et Flash-Lite.
Pour les conversations vocales en temps réel de la même famille, voir Comment utiliser Gemini 3.8 Live et Pensée Étendue en Direct.
Divulgation: Cet article a été rédigé avec l'aide d'AI et examiné par EmpirioLabs AI.



