Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS sind auf EmpirioLabs verfügbar. Beide verwandeln Text in Sprache durch POST /v1/audio/speech, stream Audio durch POST /v1/audio/speech:stream, und greifen auf dieselbe Bibliothek von mehr als 2.000 Stimmen. Beide arbeiten in der API und im Playground.
Die beiden Modelle
gemini-3-8-flash-ttsist für kreative Leitung konzipiert: Erzählung, Hörbücher, Figuren und Zweisprecher-Szenen. Es umfasst 130 Sprachen.gemini-3-8-flash-lite-ttsist für hochvolumige Arbeiten wie Sprachagenten, Synchronisation und Bulk-Audio konzipiert, mit einer niedrigeren Geschwindigkeit für erzeugtes Audio. Es deckt 101 Sprachen ab.
Beide Modelle verwenden denselben Request-Body, daher ist das Wechseln zwischen ihnen eine Änderung von modell.
Deine erste Bitte
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -H "Inhaltstyp: application/json" \ -d '{ "model": "gemini-3-8-flash-tts", "input": "Willkommen zurück. <kurze Pause> Das hat sich diese Woche geändert.", "Stimme": "Kore", "style_prompt": "warm und unbeeilt" }'
Die Antwort enthält eine signierte URL zum generierten Audio. Das Standardformat ist WAV mit 24.000 Hz. Gesetzt output_format zu MP3, OGG, ALAW, oder MULAW, und sample_rate bis zu 8.000, 16.000, 22.050, 24.000, 44.100 oder 48.000 Hz.
Regie der Aufführung
- Stilrichtung.
style_promptsetzt den Ton für die gesamte Passage, zum Beispiel "ruhig und beruhigend" oder "begeisterter Sportkommentator". - Stimm-Tags. Tags wie
<laugh>,<sigh>,<breath>, und<kurze Pause>Geh dort, wo der Ton passieren sollte. Die vollständige Liste findest du auf demEingabeParameter in der Modellreferenz. Verwenden Sie die englischen Tags, auch wenn der Text in einer anderen Sprache ist. - Hervorhebung. Schreibe ein Wort groß, um es zu betonen.
Dialog mit zwei Sprechern
Setz Modus zu Multi, wähle für jeden Sprecher eine Stimme mit Stimme und Stimme2, und beginnt jede Zeile mit dem Namen des Sprechers und einem Doppelkolon. Die Namen müssen übereinstimmen speaker1_name und speaker2_name, die standardmäßig auf Speaker1 und Speaker2.
{ "model": "gemini-3-8-flash-lite-tts", "mode": "multi", "speaker1_name": "Maya", "speaker2_name": "Theo", "voice": "Aoede", "voice2": "Puck", "input": "Maya: Ist die Lieferung angekommen?\nTheo: Ja.<laugh> Jede Kiste, pünktlich." }
Die Wahl einer Stimme
Die 30 Stimmen in der Stimme Listen wie Kore, Puck, Charon und Aoede sprechen jede unterstützte Sprache. Die vollständige Bibliothek enthält mehr als 2.000 Stimmen an 30 Orten, jede mit Sprache, Akzent, Geschlecht, Tonhöhe und Beschreibung. List sie auf mit KOMM /v1/voices und filtern durch Sprache, Geschlecht, Pitch, oder einem Suchbegriff mit q:
curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY"
Jede Sprach-ID, die das Angebot zurückgibt, funktioniert in Stimme und Stimme2.
Streaming
POST /v1/audio/speech:stream nimmt denselben Körper und gibt Server-Gesendete Ereignisse zurück: audio.chunk Ereignisse, die base64 16-Bit-PCM bei 24.000 Hz tragen, während das Audio erzeugt wird, dann eins audio.done Event mit einem Link zur vollständigen Datei im gewünschten Format.
Betriebshinweise
- Skripte, die für Gemini 3.1 Flash TTS geschrieben wurden, müssen ihre Tags neu geschrieben werden. Die 3.8-Modelle verwenden Winkelklammer-Tags wie
<whispers>und<laugh>Anstelle der eckigen Klammer-Tags, die 3.1 verwendet. Aktualisieren Sie die Tags, wenn Sie ein Skript verschieben. - Eine Bibliotheksstimme behält ihre eigene Sprache. Wenn du dich setzt
Sprachezusammen mit einer Bibliotheksstimme muss es der Ort dieser Stimme sein:fr-fr-advisor-1miten-USwird abgelehnt. Die 30 mehrsprachigen Stimmen akzeptieren jede Sprache. - Die Dialogbeschriftungen müssen mit den Namen der Sprecher übereinstimmen. In
MultiModus, Text vor der ersten beschrifteten Zeile wird abgelehnt, und eine Zeile, deren Bezeichnung keiner der beiden entsprichtspeaker1_nameNochspeaker2_namewird als Teil der vorherigen Runde gelesen. Geschwindigkeitgilt für vollständige Dateien. Der Streaming-Endpunkt lehnt einGeschwindigkeitaußer 1.0. Fordern Sie die Datei von ab abPOST /v1/audio/speechWenn du eine andere Geschwindigkeit brauchst.
Preisgestaltung
Beide Modelle sind Pay-as-you-go, ohne Abonnement. Eine Anfrage wird für die Eingabetext-Token und die generierte Audio-Token mit 32 Audio-Token pro Sekunde Sprache abgerechnet, und Flash-Lite hat die niedrigere Rate für generierte Audio. Aktuelle Tarife sind auf den Modellseiten für Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS und auf der preisseite.
Beginnen Sie mit dem Bau
Versuch es mal Gemini 3.8 Flash TTS oder Gemini 3.8 Flash-Lite TTS in der Playground und die API-Referenz für Flash und Flash-Lite.
Für Echtzeit-Sprachgespräche aus derselben Familie siehe Wie man Gemini 3.8 Live und Live erweitertes Denken verwendet.
Offenlegung: Dieser Artikel wurde mit KI-Unterstützung geschrieben und von EmpirioLabs AI überprüft.



