Gemini 2.5 Flash TTS API

Niedrige Latenz text-to-speech mit Single- und Multi-Sprecher-Stimmen und steuerbarem Stil, Akzent und ausdrucksstarken Ton für Produktions-Apps.

GoogleAudiogenerationVeröffentlicht 20. Mai 2025Proprietärer Endpoint

Über Gemini 2.5 Flash TTS

Niedrige Latenz text-to-speech mit Single- und Multi-Sprecher-Stimmen und steuerbarem Stil, Akzent und ausdrucksstarken Ton für Produktions-Apps.

Auch bekannt als Gemini Flash TTS, Google Gemini 2.5 Flash TTS, Gemini-2.5-Flash-TTS, gemini-2-5-flash-tts

text to speechmulti speakermultilingual

Gemini 2.5 Flash TTS Spezifikationen

Modell-ID
gemini-2-5-flash-tts
Anbieter
Google
Kategorie
Audiogeneration
Veröffentlicht
20. Mai 2025
Eingabe
Text
Ausgabe
Audio
Endpoints
POST/v1/audio/speech
Alternative Modell-IDs
gemini-2.5-flash-ttsgoogle/gemini-2.5-flash-tts

Gemini 2.5 Flash TTS API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M prompte Token
$1.50
Ausgabe
pro 1M generierte Token
$30.00
Auf der vollständigen Preisseite vergleichen

So rufst du die Gemini 2.5 Flash TTS API auf

Gemini 2.5 Flash TTS erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID gemini-2-5-flash-tts. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2-5-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-2-5-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige Gemini 2.5 Flash TTS API-Referenz

Gemini 2.5 Flash TTS API-Parameter

Request-Parameter, die die Gemini 2.5 Flash TTS API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring--Text zum Umwandeln in Sprache. Für den Multi-Lautsprecher-Modus präfixieren Sie Zeilen mit Lautsprecher1: / Lautsprecher2:.
modeenumsinglesingle, multiSingle = eine Stimme, Multi = Zweistimmiger Dialog (verwendet Voice + Voice2 + Sprechernamen).
languagestringen-US-BCP-47 Sprachtag (en-US, es-ES, etc.) für Aussprachehinweise.
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Hauptstimmname (z. B. Kore, Puck, Aoede). Lassen Sie das Standardergebnis leer.
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...Zweiter Sprachname für den Multi-Lautsprecher-Modus.
speaker1_namestringSpeaker1-Anzeigename, der im Eingangspräfix von Lautsprecher 1 verwendet wird (Standard: Lautsprecher1).
speaker2_namestringSpeaker2-Anzeigename, der im Eingangspräfix für Lautsprecher 2 verwendet wird (Standard: Lautsprecher2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWAudio-Dateiformat (mp3, wav, opus, flac usw.).
speednumber10.25 bis 2Wiedergaberate. 1.0 = natürlich; <1 langsamer, >1 schneller.
volume_gainnumber0-96 bis 16Ausgangsverstärkung in dB. 0 = unverändert.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000Ausgabe-Abtastrate in Hz (8000, 16000, 24000, 44100, 48000).
style_promptstring--Natürlichsprachliche Regie (z. B. "warm, gesprächig" oder "Nachrichtensprecher, ernst").

Gut zu wissen

Modes - Einzellautsprecher - Mehrsprachler (max. 2 Stimmen) - Text muss im Format SpeakerName: text sein Limits - Text + Stilaufforderung: jeweils 4.000 Bytes - Audioabrechnung: ~32 Token pro Sekunde des erzeugten Audios (~10-15 chars/s) Stimmen und Sprachen - 30+ Sprachoptionen in emotional/tonal Zeichen - 24+ Sprachlokale werden unterstützt Ausgabeformate - MP3, WAV, OGG

Gemini 2.5 Flash TTS API: häufige Fragen

Wie viel kostet die Gemini 2.5 Flash TTS API?

Auf EmpirioLabs wird Gemini 2.5 Flash TTS nach Verbrauch abgerechnet: Input $1.50 pro 1M prompte Token; Output $30.00 pro 1M generierte Token. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet Gemini 2.5 Flash TTS?

Gemini 2.5 Flash TTS wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich Gemini 2.5 Flash TTS im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt Gemini 2.5 Flash TTS im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen Gemini 2.5 Flash TTS API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.