Gemini 3.8 Flash TTS API

Parole expressive avec balises vocales en ligne, direction de style et dialogues à deux locuteurs, dans 130 langues et une bibliothèque de plus de 2 000 voix.

GoogleProduction audioPublié 22 sept. 2026Endpoint propriétaireNouveau

À propos de Gemini 3.8 Flash TTS

Parole expressive avec balises vocales en ligne, direction de style et dialogues à deux locuteurs, dans 130 langues et une bibliothèque de plus de 2 000 voix.

Aussi connu sous le nom Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Caractéristiques de Gemini 3.8 Flash TTS

ID du modèle
gemini-3-8-flash-tts
Auteur
Google
Catégorie
Production audio
Publié
22 sept. 2026
Entrée
Texte
Sortie
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Identifiants de modèle alternatifs
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

Tarifs de l'API Gemini 3.8 Flash TTS

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Entrée
par 1M de jetons d’invite
$2.60
Produit
par 1M de jetons générés
$46.80
Comparer sur la page complète des tarifs

Comment appeler l'API Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle gemini-3-8-flash-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Référence complète de l'API Gemini 3.8 Flash TTS

Paramètres de l'API Gemini 3.8 Flash TTS

Paramètres de requête pris en charge par l'API Gemini 3.8 Flash TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
inputstring-max 5000Conversion du texte en voix vocale. Pour le mode multi-haut-parleurs, préfixez les lignes avec Speaker1: / Speaker2:. Jusqu’à 5 000 caractères. Mettez la direction...
modeenumsinglesingle, multiSimple = une voix, multi = dialogue à deux voix (utilise voix + voix2 + noms des locuteurs).
languagestring--Balise linguistique BCP-47 optionnelle (en-US, es-ES, etc.). La langue du texte est détectée automatiquement. Les 30 voix listées parlent toutes les langues prises...
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Nom de la voix principale (par exemple Kore, Puck, Aoede). Laisser vide pour le défaut. Ces 30 voix parlent toutes les langues prises en charge. GET /v1/voices liste...
voice_audio_urlstring--Voice=Custom Only: une URL https vers un enregistrement de 10 à 30 secondes de parole propre et naturelle de la voix vers clone (WAV, MP3, M4A, OGG, WEBM ou FLAC)....
voice_consent_audio_urlstring--Voice=Custom Only: une URL https du même haut-parleur lisant cette déclaration à voix haute: « Je suis le propriétaire de cette voix et je consens à ce que Google...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Second nom vocal pour le mode multi-haut-parleurs.
speaker1_namestringSpeaker1-Nom d’affichage utilisé dans le préfixe d’entrée pour le haut-parleur 1 (par défaut: haut-parleur 1).
speaker2_namestringSpeaker2-Nom d’affichage utilisé dans le préfixe d’entrée pour le haut-parleur 2 (par défaut: haut-parleur2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWFormat de fichier audio: WAV, MP3, OGG (Opus), ou ALAW / MULAW pour la téléphonie.
speednumber10.25 à 2Vitesse de lecture. 1.0 = naturel; <1 plus lent, >1 plus rapide.
volume_gainnumber0-96 à 16Gain de sortie en dB. 0 = inchangé.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000Fréquence d’échantillonnage en sortie en Hz (8000, 16000, 22050, 24000, 44100 ou 48000).
style_promptstring--Direction du style en langage naturel (par exemple « chaleureux, conversationnel » ou « présentateur de journaux, sérieux »).

Bon à savoir

Limites - Texte: jusqu’à 5 000 caractères par requête - Facturation audio: 32 jetons de sortie par seconde d’audio généré - 130 langues. La langue du texte est détectée automatiquement. Voix - Les 30 voix de la liste voice parlent toutes les langues prises en charge. - GET /v1/voices?model=gemini-3-8-flash-tts liste la bibliothèque complète de plus de 2 000 voix réparties dans 30 lieux, avec la langue, l’accent, le genre, la hauteur et une description de chacune. Filtrez-le avec language, gender, pitch ou q. Tout id qu’il renvoie fonctionne comme voice ou voice2; lorsque vous définissez aussi language, utilisez la langue propre à la voix. Voix personnalisées - Réglez voice pour GET /v1/voices?model=gemini-3-8-flash-tts 0__ et passez deux enregistrements du même locuteur adulte sous forme d’URL https: GET /v1/voices?model=gemini-3-8-flash-tts 1__, 10 à 30 secondes de parole naturelle, et GET /v1/voices?model=gemini-3-8-flash-tts 2__, le haut-parleur indiquant « Je suis le propriétaire de cette voix et je consens à ce que Google utilise cette voix pour créer un modèle de voix synthétique. » L’affirmation est acceptée en 30 langues; GET /v1/voices?model=gemini-3-8-flash-tts 3__ sur ce paramètre liste chaque formulation. - Enregistrer les deux dans une pièce silencieuse sur le même microphone. WAV, MP3, M4A, OGG, WEBM et FLAC sont acceptés, jusqu’à 15 Mo chacun. - La réponse inclut GET /v1/voices?model=gemini-3-8-flash-tts 4__ et GET /v1/voices?model=gemini-3-8-flash-tts 5__. Passez le GET /v1/voices?model=gemini-3-8-flash-tts 6__ comme GET /v1/voices?model=gemini-3-8-flash-tts 7__ ou GET /v1/voices?model=gemini-3-8-flash-tts 8__ de réutiliser la voix pendant 7 jours sans nouveaux enregistrements. Toute personne ayant l’id peut utiliser la voix jusqu’à son expiration, gardez-la donc privée. Instruction de livraison - Mettez la direction pour tout le passage dans GET /v1/voices?model=gemini-3-8-flash-tts 9__ plutôt que dans le texte, par exemple « chaud, sans hâte et rassurant ». - Placez les balises vocales en ligne là où le son doit apparaître. Utilisez ces balises anglaises même lorsque le texte est dans une autre langue: « language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__ » seulement.

API Gemini 3.8 Flash TTS : questions fréquentes

Combien coûte l'API Gemini 3.8 Flash TTS ?

Sur EmpirioLabs, Gemini 3.8 Flash TTS est facturé à l'usage : Entrée $2.60 par 1M de jetons d’invite; Produit $46.80 par 1M de jetons générés. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint Gemini 3.8 Flash TTS utilise-t-il ?

Gemini 3.8 Flash TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer Gemini 3.8 Flash TTS dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute Gemini 3.8 Flash TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API Gemini 3.8 Flash TTS ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.