Gemini 3.8 Flash TTS API

Ausdrucksstarke Sprache mit Inline-Vokaltags, Stilrichtung und Dialog mit zwei Sprechern, in 130 Sprachen und einer Bibliothek von mehr als 2.000 Stimmen.

GoogleAudiogenerationVeröffentlicht 22. Sept. 2026Proprietärer EndpointNeu

Über Gemini 3.8 Flash TTS

Ausdrucksstarke Sprache mit Inline-Vokaltags, Stilrichtung und Dialog mit zwei Sprechern, in 130 Sprachen und einer Bibliothek von mehr als 2.000 Stimmen.

Auch bekannt als Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash TTS Spezifikationen

Modell-ID
gemini-3-8-flash-tts
Autor
Google
Kategorie
Audiogeneration
Veröffentlicht
22. Sept. 2026
Eingabe
Text
Ausgabe
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Alternative Modell-IDs
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

Gemini 3.8 Flash TTS API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M Prompt-Token
$2.60
Ausgabe
pro 1 Million generierter Token
$46.80
Auf der vollständigen Preisseite vergleichen

So rufst du die Gemini 3.8 Flash TTS API auf

Gemini 3.8 Flash TTS erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID gemini-3-8-flash-tts. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige Gemini 3.8 Flash TTS API-Referenz

Gemini 3.8 Flash TTS API-Parameter

Request-Parameter, die die Gemini 3.8 Flash TTS API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring-max. 5000Text zum Umwandeln in Sprache. Für den Multi-Lautsprecher-Modus Präfixzeilen mit Speaker1: / Speaker2:. Bis zu 5.000 Zeichen. Geben Sie die Übertragungsrichtung in...
modeenumsinglesingle, multiSingle = eine Stimme, Multi = Zweistimmiger Dialog (verwendet Voice + Voice2 + Sprechernamen).
languagestring--Optionaler BCP-47-Sprachtag (en-US, es-ES usw.). Die Sprache des Textes wird automatisch erkannt. Die 30 aufgeführten Stimmen sprechen jede unterstützte Sprache;...
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Primärer Stimmenname (z. B. Kore, Puck, Aoede). Lassen Sie den Standard leer. Diese 30 Stimmen sprechen jede unterstützte Sprache. GET /v1/voices listet die...
voice_audio_urlstring--voice=Nur benutzerdefiniert: Eine HTTPS-URL zu einer 10 bis 30 Sekunden langen Aufnahme sauberer, natürlicher Sprache der Stimme zum Klon (WAV, MP3, M4A, OGG, WEBM...
voice_consent_audio_urlstring--voice=custom only: Eine HTTPS-URL zum selben Sprecher, der diese Aussage laut vorliest: "Ich bin der Eigentümer dieser Stimme und stimme zu, dass Google diese Stimme...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Zweiter Sprachname für den Multi-Lautsprecher-Modus.
speaker1_namestringSpeaker1-Anzeigename, der im Eingangspräfix von Lautsprecher 1 verwendet wird (Standard: Lautsprecher1).
speaker2_namestringSpeaker2-Anzeigename, der im Eingangspräfix für Lautsprecher 2 verwendet wird (Standard: Lautsprecher2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWAudio-Dateiformat: WAV, MP3, OGG (Opus) oder ALAW / MULAW für Telefonie.
speednumber10.25 bis 2Wiedergaberate. 1.0 = natürlich; <1 langsamer, >1 schneller.
volume_gainnumber0-96 bis 16Ausgangsverstärkung in dB. 0 = unverändert.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000Ausgabe-Abtastrate in Hz (8000, 16000, 22050, 24000, 44100 oder 48000).
style_promptstring--Natürlichsprachliche Regie (z. B. "warm, gesprächig" oder "Nachrichtensprecher, ernst").

Gut zu wissen

Limits - Text: bis zu 5.000 Zeichen pro Anfrage - Audioabrechnung: 32 Ausgabetoken pro Sekunde erzeugter Audioausgabe - 130 Sprachen. Die Sprache des Textes wird automatisch erkannt. Stimmen - Die 30 Stimmen in der voice Liste sprechen jede unterstützte Sprache. - GET /v1/voices?model=gemini-3-8-flash-tts listet die vollständige Bibliothek von mehr als 2.000 Stimmen an 30 Orten auf, mit Sprache, Akzent, Geschlecht, Tonhöhe und einer Beschreibung jeder Person. Filtern Sie sie mit language, gender, pitch oder q. Jede zurückgegebene ID funktioniert als voice oder voice2; wenn Sie auch language setzen, verwenden Sie die eigene Sprache der Stimme. Benutzerdefinierte Stimmen – Stellen Sie voice auf GET /v1/voices?model=gemini-3-8-flash-tts 0__ und übergeben Sie zwei Aufnahmen desselben erwachsenen Sprechers als https-URLs: GET /v1/voices?model=gemini-3-8-flash-tts 1__, 10 bis 30 Sekunden natürliche Sprache, und GET /v1/voices?model=gemini-3-8-flash-tts 2__, wobei der Sprecher sagt: "Ich bin der Besitzer dieser Stimme und ich stimme zu, dass Google diese Stimme zur Erstellung eines synthetischen Sprachmodells verwendet." Die Aussage wird in 30 Sprachen akzeptiert; GET /v1/voices?model=gemini-3-8-flash-tts 3__ auf diesem Parameter listet jede Formulierung auf. - Nehmen Sie beide in einem ruhigen Raum mit demselben Mikrofon auf. WAV, MP3, M4A, OGG, WEBM und FLAC werden akzeptiert, jeweils bis zu 15 MB. - Die Antwort enthält GET /v1/voices?model=gemini-3-8-flash-tts 4__ und GET /v1/voices?model=gemini-3-8-flash-tts 5__. Geben Sie die GET /v1/voices?model=gemini-3-8-flash-tts 6__ als GET /v1/voices?model=gemini-3-8-flash-tts 7__ oder GET /v1/voices?model=gemini-3-8-flash-tts 8__ die Stimme 7 Tage lang ohne neue Aufnahmen wiederverwenden. Jeder mit der ID kann die Stimme verwenden, bis sie abläuft, also halten Sie sie privat. Vortragsrichtung - Geben Sie die Anweisung für den gesamten Abschnitt in GET /v1/voices?model=gemini-3-8-flash-tts 9__ statt im Text an, zum Beispiel "warm, unbeeilt und beruhigend". - Platzieren Sie Gesangstags an der Stelle, wo der Klang vorkommen soll. Verwenden Sie diese englischen Tags auch dann, wenn der Text in einer anderen Sprache vorliegt: nur '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__'.

Gemini 3.8 Flash TTS API: häufige Fragen

Wie viel kostet die Gemini 3.8 Flash TTS API?

Auf EmpirioLabs wird Gemini 3.8 Flash TTS nach Verbrauch abgerechnet: Eingabe $2.60 pro 1M Prompt-Token; Output $46.80 pro 1 Million generierter Token. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet Gemini 3.8 Flash TTS?

Gemini 3.8 Flash TTS wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich Gemini 3.8 Flash TTS im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt Gemini 3.8 Flash TTS im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen Gemini 3.8 Flash TTS API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.