Gemini 2.5 Flash TTS API

Faible latence text-to-speech avec voix à un ou plusieurs haut-parleurs, ainsi qu’un style, un accent et un ton expressif contrôlables pour les applications de production.

GoogleProduction audioPublié 20 mai 2025Endpoint propriétaire

À propos de Gemini 2.5 Flash TTS

Faible latence text-to-speech avec voix à un ou plusieurs haut-parleurs, ainsi qu’un style, un accent et un ton expressif contrôlables pour les applications de production.

Aussi connu sous le nom Gemini Flash TTS, Google Gemini 2.5 Flash TTS, Gemini-2.5-Flash-TTS, gemini-2-5-flash-tts

text to speechmulti speakermultilingual

Caractéristiques de Gemini 2.5 Flash TTS

ID du modèle
gemini-2-5-flash-tts
Fournisseur
Google
Catégorie
Production audio
Publié
20 mai 2025
Entrée
Texte
Sortie
Audio
Endpoints
POST/v1/audio/speech
Identifiants de modèle alternatifs
gemini-2.5-flash-ttsgoogle/gemini-2.5-flash-tts

Tarifs de l'API Gemini 2.5 Flash TTS

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Entrée
par jetons 1M
$1.50
Produit
par jeton généré 1M
$30.00
Comparer sur la page complète des tarifs

Comment appeler l'API Gemini 2.5 Flash TTS

Gemini 2.5 Flash TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle gemini-2-5-flash-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2-5-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-2-5-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Référence complète de l'API Gemini 2.5 Flash TTS

Paramètres de l'API Gemini 2.5 Flash TTS

Paramètres de requête pris en charge par l'API Gemini 2.5 Flash TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
inputstring--Texte à convertir en parole. Pour le mode multi-haut-parleurs, préfixez les lignes avec Speaker1: / Speaker2:.
modeenumsinglesingle, multiSimple = une voix, multi = dialogue à deux voix (utilise voix + voix2 + noms des locuteurs).
languagestringen-US-Étiquette linguistique BCP-47 (EN-US, es-ES, etc.) pour les indices de prononciation.
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Nom principal de la voix (par exemple Kore, Puck, Aoede). Laissez vide pour le défaut.
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Second nom vocal pour le mode multi-haut-parleurs.
speaker1_namestringSpeaker1-Nom d’affichage utilisé dans le préfixe d’entrée pour le haut-parleur 1 (par défaut: haut-parleur 1).
speaker2_namestringSpeaker2-Nom d’affichage utilisé dans le préfixe d’entrée pour le haut-parleur 2 (par défaut: haut-parleur2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWFormat de fichier audio (mp3, wav, opus, flac, etc.).
speednumber10.25 à 2Vitesse de lecture. 1.0 = naturel; <1 plus lent, >1 plus rapide.
volume_gainnumber0-96 à 16Gain de sortie en dB. 0 = inchangé.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000Fréquence d’échantillonnage de sortie en Hz (8000, 16000, 24000, 44100, 48000).
style_promptstring--Direction du style en langage naturel (par exemple « chaleureux, conversationnel » ou « présentateur de journaux, sérieux »).

Bon à savoir

Modes - Haut-parleur unique - Multi-haut-parleur (maximum 2 voix), le texte doit être au format SpeakerName: text Limites - Texte + invite de style: 4 000 octets chacun - Facturation audio: ~32 jetons par seconde d’audio généré (~10-15 chars/s) Voix et langues - 30+ options vocales réparties sur emotional/tonal caractères - 24+ lieux linguistiques pris en charge Formats de sortie - MP3, WAV, OGG

API Gemini 2.5 Flash TTS : questions fréquentes

Combien coûte l'API Gemini 2.5 Flash TTS ?

Sur EmpirioLabs, Gemini 2.5 Flash TTS est facturé à l'usage : Entrée $1.50 par jetons 1M; Produit $30.00 par jeton généré 1M. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint Gemini 2.5 Flash TTS utilise-t-il ?

Gemini 2.5 Flash TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer Gemini 2.5 Flash TTS dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute Gemini 2.5 Flash TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API Gemini 2.5 Flash TTS ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.