Zuhause Blog

Wie man die TTS 2 Flash API verwendet

Wie man die TTS 2 Flash API verwendet

Sep 4, 2026

EmpirioLabs AI

TTS 2 Flash ist auf EmpirioLabs verfügbar. Inworld brachte die Realtime TTS-2-Familie in die allgemeine Verfügbarkeit, und Flash ist das latenzorientierte Mitglied davon. Es hält eine einzelne Sprachidentität über 200+ Sprachen und Orte, streamt Audio während der Synthese und kann Zeitstempel pro Wort oder Zeichen zurückgeben. Realtime TTS-2, das qualitätsorientierte Modell derselben Familie, ist parallel zur Plattform verfügbar.

Was TTS 2 Flash unterstützt

Flash nimmt Text auf und gibt Audio zurück. Es deckt 200+ Sprachen und Orte mit einer Sprachidentität ab, sodass dieselbe Sprach-ID ihren Charakter behält, wenn man die Sprache wechselt, einschließlich des Wechsels während einer Generation. Die Ausgabe erscheint als MP3, WAV, OGG, FLAC, PCM, A-law oder mu-law mit Abtastraten von 8 kHz bis 48 kHz.

Das Sprach-Dropdown-Menü zeigt 20 handverlesene Presets an. Das ist eine Bequemlichkeitsliste, nicht der Katalog: Geben Sie alle anderen Sprach-IDs, einschließlich regionaler und geklonter Stimmen, durch voice_id, und ruf das Endpunkt der Stimmen auf, um aufzuzählen, was verfügbar ist.

Wie man TTS 2 Flash aufruft

Verwenden Sie den OpenAI-kompatiblen Sprachendpunkt und setzen Sie modell zu tts-2-flash:

curl https://api.empiriolabs.ai/v1/audio/speech \ -h 'Autorisierung: Träger $EMPIRIOLABS_API_KEY' \ -H 'Inhaltstyp: application/json' \ -d '{ "model": "tts-2-flash", "input": "Hallo und vielen Dank für Ihren Anruf. Wie kann ich Ihnen heute helfen?", "voice": "Ashley", "language": "en-US", "output_format": "MP3" }'

Die Antwort enthält eine signierte URL für das generierte Audio plus einen Nutzungsblock mit der abgerechneten Zeichenanzahl. Die Abrechnung erfolgt pro Zeichen der Eingabe, daher verfolgt die Kosten den gesendeten Text und nicht die Länge des zurückkommenden Audios.

Streaming

Für Sprachagenten und alles, was Audio abspielt, während es noch produziert wird, posten Sie auf die Streaming-Variante desselben Endpunkts. Es gibt servergesendete Ereignisse zurück: audio.chunk Events, die Base64-Audio in der Synthese übertragen, optional audio.timestamps Ereignisse, wenn man nach Wort- oder Charakterzeitpunkten fragte, und ein finales audio.done Ereignis mit einer Wiederholungs-URL und dem Nutzungsblock. Setzen timestamp_type zu WORT oder CHARAKTER wenn du Untertitel oder eine Highlight-UI verwendest.

Wahl zwischen TTS 2 und TTS 2 Flash

Beide Modelle teilen sich die gleiche Wunschform, dieselben Stimmen und die gleiche Sprachabdeckung, sodass der Wechsel eine Ein-Wort-Änderung zu modell. Der entscheidende Unterschied bei der Auswahl ist die Lieferkontrolle.

Echtzeit-TTS-2 akzeptiert eine einfache englische Sprachanweisung: Öffnen Sie den Text mit einer Bracketed-Instruktion und das Modell führt die Zeile auf diese Weise aus, anstatt die Anweisung laut vorzulesen. Es versteht sowohl kurze Anweisungen als auch freie Briefs.

{ "model": "tts-2", "input": "[Sprich warm, als würdest du einen alten Freund begrüßen] Guten Morgen, schön, dich wiederzusehen.", "Stimme": "Ashley" }

TTS 2 Flash verwendet diese Richtung nicht. Senden Sie denselben geklammerten Text an Flash und er wird ignoriert, also greifen Sie zu TTS 2, wenn die Leistung zählt, und zu Flash, wenn Latenz und Lautstärke zählen. Bei Flash Shape Delivery mit dem Geschwindigkeit und temperatur Kontrolle stattdessen.

Notizen, die man vor dem ersten Anruf kennen sollte,

  • Die Sprachleitung ist nur in TTS 2. Flash ignoriert eine in Klammern gesetzte Direktive stillschweigend, anstatt sie abzulehnen, sodass ein für TTS 2 geschriebener Prompt auf Flash ausgeführt wird und einfach ungelenkt zurückkommt.
  • Der Richtungstext wird abgerechnet. Die in Klammern gesetzte Anweisung zählt auch für die Zeichensumme der Anfrage, auch wenn sie nie ausgesprochen wird, also halte die Briefings kurz.
  • Das Limit pro Anfrage beträgt 2.000 Zeichen. Blockiere längere Kopien an Satzgrenzen am Client und verkette das Audio, anstatt einen langen Block zu senden.
  • Die Textnormalisierung ist standardmäßig aktiviert. Zahlen, Daten und Abkürzungen werden in gesprochene Form erweitert, was auch bedeutet, dass die abgestellte Zeichenanzahl die Länge der gesendeten Zeichenkette übersteigen kann. Schalten Sie es aus, wenn Sie den Text bereits selbst normalisiert haben.

Beginn

Probier TTS 2 Flash in der Spielplatzlesen sie die API-Referenz, oder siehe aktuelle Zinssätze auf der modellblatt.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.