
TTS hautement contrôlable avec de nouvelles balises audio pour un style, un ton, un rythme et une livraison précis via narration, assistants et applications vocales.
TTS hautement contrôlable avec de nouvelles balises audio pour un style, un ton, un rythme et une livraison précis via narration, assistants et applications vocales.
Aussi connu sous le nom Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts
gemini-3-1-flash-tts/v1/audio/speechgemini-3.1-flash-ttsgoogle/gemini-3.1-flash-ttsTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
Gemini 3.1 Flash TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle gemini-3-1-flash-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-1-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Paramètres de requête pris en charge par l'API Gemini 3.1 Flash TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input | string | - | - | Texte à convertir en parole. Pour le mode multi-haut-parleurs, préfixez les lignes avec Speaker1: / Speaker2:. |
| mode | enum | single | single, multi | Simple = une voix, multi = dialogue à deux voix (utilise voix + voix2 + noms des locuteurs). |
| language | string | en-US | - | Étiquette linguistique BCP-47 (EN-US, es-ES, etc.) pour les indices de prononciation. |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Nom principal de la voix (par exemple Kore, Puck, Aoede). Laissez vide pour le défaut. |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Second nom vocal pour le mode multi-haut-parleurs. |
| speaker1_name | string | Speaker1 | - | Nom d’affichage utilisé dans le préfixe d’entrée pour le haut-parleur 1 (par défaut: haut-parleur 1). |
| speaker2_name | string | Speaker2 | - | Nom d’affichage utilisé dans le préfixe d’entrée pour le haut-parleur 2 (par défaut: haut-parleur2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | Format de fichier audio (mp3, wav, opus, flac, etc.). |
| speed | number | 1 | 0.25 à 2 | Vitesse de lecture. 1.0 = naturel; <1 plus lent, >1 plus rapide. |
| volume_gain | number | 0 | -96 à 16 | Gain de sortie en dB. 0 = inchangé. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | Fréquence d’échantillonnage de sortie en Hz (8000, 16000, 24000, 44100, 48000). |
| style_prompt | string | - | - | Direction du style en langage naturel (par exemple « chaleureux, conversationnel » ou « présentateur de journaux, sérieux »). |
Le TTS Gemini le plus contrôlable à ce jour. Limites - Texte + invite de style: 4 000 octets chacun (8 000 au total) - Sortie maximale: ~10 minutes - Facturation audio: ~25 jetons par seconde (~15 chars/s) - Le langage est détecté automatiquement; le réglage de langue est un indice, pas une contrainte Balises audio en ligne (transmission de contrôle) - Émotion: [whispers], [shouts], [laughs], [sighs], [cheerful], [sad], [angry], etc. - Rythme: [slow], [fast], [whispers] 0__, [whispers] 1__ - Pauses: [whispers] 2__, [whispers] 3__, [whispers] 4__ - Emphase: [whispers] 5__, [whispers] 6__, [whispers] 7__, [whispers] 8__, [whispers] 9__, [shouts] 0__
Sur EmpirioLabs, Gemini 3.1 Flash TTS est facturé à l'usage : Entrée $2.60 par jetons 1M; Produit $52.00 par jeton généré 1M. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
Gemini 3.1 Flash TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute Gemini 3.1 Flash TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.