Zuhause Blog

Wie man Gemini 3.8 Flash TTS und Flash-Lite TTS verwendet

Gemini 3.8 Flash TTS und Flash-Lite TTS über API

Sep 23, 2026

EmpirioLabs AI

Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS sind auf EmpirioLabs verfügbar. Beide verwandeln Text in Sprache durch POST /v1/audio/speech, stream Audio durch POST /v1/audio/speech:stream, und greifen auf dieselbe Bibliothek von mehr als 2.000 Stimmen. Beide arbeiten in der API und im Playground.

Die beiden Modelle

  • gemini-3-8-flash-tts ist für kreative Leitung konzipiert: Erzählung, Hörbücher, Figuren und Zweisprecher-Szenen. Es umfasst 130 Sprachen.
  • gemini-3-8-flash-lite-tts ist für hochvolumige Arbeiten wie Sprachagenten, Synchronisation und Bulk-Audio konzipiert, mit einer niedrigeren Geschwindigkeit für erzeugtes Audio. Es deckt 101 Sprachen ab.

Beide Modelle verwenden denselben Request-Body, daher ist das Wechseln zwischen ihnen eine Änderung von modell.

Deine erste Bitte

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -H "Inhaltstyp: application/json" \ -d '{ "model": "gemini-3-8-flash-tts", "input": "Willkommen zurück. <kurze Pause> Das hat sich diese Woche geändert.", "Stimme": "Kore", "style_prompt": "warm und unbeeilt" }'

Die Antwort enthält eine signierte URL zum generierten Audio. Das Standardformat ist WAV mit 24.000 Hz. Gesetzt output_format zu MP3, OGG, ALAW, oder MULAW, und sample_rate bis zu 8.000, 16.000, 22.050, 24.000, 44.100 oder 48.000 Hz.

Regie der Aufführung

  • Stilrichtung. style_prompt setzt den Ton für die gesamte Passage, zum Beispiel "ruhig und beruhigend" oder "begeisterter Sportkommentator".
  • Stimm-Tags. Tags wie <laugh>, <sigh>, <breath>, und <kurze Pause> Geh dort, wo der Ton passieren sollte. Die vollständige Liste findest du auf dem Eingabe Parameter in der Modellreferenz. Verwenden Sie die englischen Tags, auch wenn der Text in einer anderen Sprache ist.
  • Hervorhebung. Schreibe ein Wort groß, um es zu betonen.

Dialog mit zwei Sprechern

Setz Modus zu Multi, wähle für jeden Sprecher eine Stimme mit Stimme und Stimme2, und beginnt jede Zeile mit dem Namen des Sprechers und einem Doppelkolon. Die Namen müssen übereinstimmen speaker1_name und speaker2_name, die standardmäßig auf Speaker1 und Speaker2.

{ "model": "gemini-3-8-flash-lite-tts", "mode": "multi", "speaker1_name": "Maya", "speaker2_name": "Theo", "voice": "Aoede", "voice2": "Puck", "input": "Maya: Ist die Lieferung angekommen?\nTheo: Ja.<laugh> Jede Kiste, pünktlich." }

Die Wahl einer Stimme

Die 30 Stimmen in der Stimme Listen wie Kore, Puck, Charon und Aoede sprechen jede unterstützte Sprache. Die vollständige Bibliothek enthält mehr als 2.000 Stimmen an 30 Orten, jede mit Sprache, Akzent, Geschlecht, Tonhöhe und Beschreibung. List sie auf mit KOMM /v1/voices und filtern durch Sprache, Geschlecht, Pitch, oder einem Suchbegriff mit q:

curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY"

Jede Sprach-ID, die das Angebot zurückgibt, funktioniert in Stimme und Stimme2.

Streaming

POST /v1/audio/speech:stream nimmt denselben Körper und gibt Server-Gesendete Ereignisse zurück: audio.chunk Ereignisse, die base64 16-Bit-PCM bei 24.000 Hz tragen, während das Audio erzeugt wird, dann eins audio.done Event mit einem Link zur vollständigen Datei im gewünschten Format.

Betriebshinweise

  1. Skripte, die für Gemini 3.1 Flash TTS geschrieben wurden, müssen ihre Tags neu geschrieben werden. Die 3.8-Modelle verwenden Winkelklammer-Tags wie <whispers> und <laugh> Anstelle der eckigen Klammer-Tags, die 3.1 verwendet. Aktualisieren Sie die Tags, wenn Sie ein Skript verschieben.
  2. Eine Bibliotheksstimme behält ihre eigene Sprache. Wenn du dich setzt Sprache zusammen mit einer Bibliotheksstimme muss es der Ort dieser Stimme sein: fr-fr-advisor-1 mit en-US wird abgelehnt. Die 30 mehrsprachigen Stimmen akzeptieren jede Sprache.
  3. Die Dialogbeschriftungen müssen mit den Namen der Sprecher übereinstimmen. In Multi Modus, Text vor der ersten beschrifteten Zeile wird abgelehnt, und eine Zeile, deren Bezeichnung keiner der beiden entspricht speaker1_name Noch speaker2_name wird als Teil der vorherigen Runde gelesen.
  4. Geschwindigkeit gilt für vollständige Dateien. Der Streaming-Endpunkt lehnt ein Geschwindigkeit außer 1.0. Fordern Sie die Datei von ab ab POST /v1/audio/speech Wenn du eine andere Geschwindigkeit brauchst.

Preisgestaltung

Beide Modelle sind Pay-as-you-go, ohne Abonnement. Eine Anfrage wird für die Eingabetext-Token und die generierte Audio-Token mit 32 Audio-Token pro Sekunde Sprache abgerechnet, und Flash-Lite hat die niedrigere Rate für generierte Audio. Aktuelle Tarife sind auf den Modellseiten für Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS und auf der preisseite.

Beginnen Sie mit dem Bau

Versuch es mal Gemini 3.8 Flash TTS oder Gemini 3.8 Flash-Lite TTS in der Playground und die API-Referenz für Flash und Flash-Lite.

Für Echtzeit-Sprachgespräche aus derselben Familie siehe Wie man Gemini 3.8 Live und Live erweitertes Denken verwendet.

Offenlegung: Dieser Artikel wurde mit KI-Unterstützung geschrieben und von EmpirioLabs AI überprüft.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.