
Hoch kontrollierbare TTS mit neuen Audio-Tags für präzisen Stil, Ton, Tempo und Lieferung über Narration, Assistenten und Voice-Apps.
Hoch kontrollierbare TTS mit neuen Audio-Tags für präzisen Stil, Ton, Tempo und Lieferung über Narration, Assistenten und Voice-Apps.
Auch bekannt als Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts
gemini-3-1-flash-tts/v1/audio/speechgemini-3.1-flash-ttsgoogle/gemini-3.1-flash-ttsLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Gemini 3.1 Flash TTS erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID gemini-3-1-flash-tts. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-1-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die Gemini 3.1 Flash TTS API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | - | Text zum Umwandeln in Sprache. Für den Multi-Lautsprecher-Modus präfixieren Sie Zeilen mit Lautsprecher1: / Lautsprecher2:. |
| mode | enum | single | single, multi | Single = eine Stimme, Multi = Zweistimmiger Dialog (verwendet Voice + Voice2 + Sprechernamen). |
| language | string | en-US | - | BCP-47 Sprachtag (en-US, es-ES, etc.) für Aussprachehinweise. |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Hauptstimmname (z. B. Kore, Puck, Aoede). Lassen Sie das Standardergebnis leer. |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | Zweiter Sprachname für den Multi-Lautsprecher-Modus. |
| speaker1_name | string | Speaker1 | - | Anzeigename, der im Eingangspräfix von Lautsprecher 1 verwendet wird (Standard: Lautsprecher1). |
| speaker2_name | string | Speaker2 | - | Anzeigename, der im Eingangspräfix für Lautsprecher 2 verwendet wird (Standard: Lautsprecher2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | Audio-Dateiformat (mp3, wav, opus, flac usw.). |
| speed | number | 1 | 0.25 bis 2 | Wiedergaberate. 1.0 = natürlich; <1 langsamer, >1 schneller. |
| volume_gain | number | 0 | -96 bis 16 | Ausgangsverstärkung in dB. 0 = unverändert. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | Ausgabe-Abtastrate in Hz (8000, 16000, 24000, 44100, 48000). |
| style_prompt | string | - | - | Natürlichsprachliche Regie (z. B. "warm, gesprächig" oder "Nachrichtensprecher, ernst"). |
Die meisten kontrollierbaren Gemini TTS bis heute. Limits - Text + Stilaufforderung: jeweils 4.000 Bytes (8.000 kombiniert) - Maximale Ausgabe: ~10 Minuten - Audioabrechnung: ~25 Tokens pro Sekunde (~15 chars/s) - Sprache wird automatisch erkannt; die Spracheinstellung ist ein Hinweis, keine Einschränkung Inline-Audio-Tags, [laughs], [sighs], [cheerful], [sad], [fast], [whispers] 0, [whispers] 1 Pauses: [whispers] 2, [whispers] 3, [whispers] 4, [whispers] 6, [whispers] 7, [whispers] 8,
Auf EmpirioLabs wird Gemini 3.1 Flash TTS nach Verbrauch abgerechnet: Input $2.60 pro 1M prompte Token; Output $52.00 pro 1M generierte Token. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Gemini 3.1 Flash TTS wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt Gemini 3.1 Flash TTS im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.