TTS 2 Flash API

Latenz-erste Echtzeit-Sprachsynthese, die eine Sprachidentität über 200+ Sprachen hinweg hält, abgestimmt auf hochvolumige Streaming-Workloads.

InworldAudiogenerationVeröffentlicht 2. Sept. 2026Proprietärer EndpointNeu

Über TTS 2 Flash

Latenz-erste Echtzeit-Sprachsynthese, die eine Sprachidentität über 200+ Sprachen hinweg hält, abgestimmt auf hochvolumige Streaming-Workloads.

Auch bekannt als Inworld TTS 2 Flash

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingual

TTS 2 Flash Spezifikationen

Modell-ID
tts-2-flash
Anbieter
Inworld
Kategorie
Audiogeneration
Veröffentlicht
2. Sept. 2026
Eingabe
Text
Ausgabe
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Alternative Modell-IDs
inworld-tts-2-flash

TTS 2 Flash API-PreiseSpare bis zu 30%

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Synthese
pro 1 Million Zeichen
$15.00$10.50
Auf der vollständigen Preisseite vergleichen

So rufst du die TTS 2 Flash API auf

TTS 2 Flash erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID tts-2-flash. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2-flash",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2-flash", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige TTS 2 Flash API-Referenz

TTS 2 Flash API-Parameter

Request-Parameter, die die TTS 2 Flash API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring-max. 2000Texte zum Synthesizen. Maximal 2.000 Zeichen pro Anfrage; Chunk-längere Kopie an Satzgrenzen auf dem Client. Dieses Modell wendet keine Klammer-Lieferrichtung an;...
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Sprachvoreinstellung. 20 handverlesene Stimmen, die Englisch, Spanisch, Portugiesisch, Hindi und verschiedene Akzente abdecken. Für den vollständigen Sprachkatalog...
voice_idstring--Freiformige Sprach-ID. Überschreibt die Sprache, wenn sie gesetzt ist. Nutzen Sie diese, um jede Stimme jenseits der kuratierten 20-voreingestellten Liste...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47-Sprachcode. Dieses Modell enthält eine Sprachidentität über 200+ Sprachen und Orte, sodass Sie jeden unterstützten Code hier eingeben können, auch wenn er...
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWAudio-container/codec. WAV = LINEAR16 im RIFF (allgegenwärtig). MP3 / OGG = komprimiert. PCM = headerless raw, nützlich für gehackte Echtzeitwiedergabe. FLAC =...
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000Die Ausgabe-Abtastrate in Hz. 24000 ist Inworlds Standardvorbild und entspricht dem Trainingsmaß ihrer Sprachmodelle; Erhöhung auf 48.000 für die Sendequalität.
speednumber10.5 bis 1.5Sprechratemultiplikator. 0,5 = halbe Geschwindigkeit, 1,5 = 50 % schneller.
temperaturenumber10.1 bis 2Ausdrucksstärke / Variabilität der Stimme. Lower = konsistenter / "flach"; höher = ausdrucksstärker, aber mehr Variation zwischen den Renders.
bit_ratenumber12800032000 bis 320000Bitrate in BPS für MP3 / OGG_OPUS. Ignoriert für andere Codierungen.
apply_text_normalizationenumONON, OFFWenn ON ist, erweitert Inworld Zahlen, Abkürzungen und Daten in gesprochene Form ("5 USD" → "fünf US-Dollar").
timestamp_typeenumNONENONE, WORD, CHARACTERWenn kein Symbol ist, enthält die Antwort Zeitstempel pro Wort oder Zeichen in timestamp_info. Nützlich für Bildunterschriften und Highlight-UIs.

Gut zu wissen

Limits - Maximale Eingabe: 2.000 Zeichen pro Anfrage (längere Textabschnitte an Satzgrenzen) - WebSocket: 20 gleichzeitige Verbindungen, 5 contexts/connection - Per-WS-Nachricht: 1.000 Zeichen Sprachrichtung - Dieses Modell wendet keine in Klammern eingeklammerte Klarenglisch-Lieferrichtung an. Verwenden Sie TTS 2, wenn Sie es benötigen, oder gestalten Sie die Zustellung hier mit den speed- und temperature-Steuerungen. Latenz - p90 TTFB: unter 25 ms (Inworld-Benchmark) Stimmen - Eine Sprachidentität, die über 200+ Sprachen und Orte hinweg gehalten wird, einschließlich Sprachwechsel mitten in der Generation - Kuratierte Presets im Dropdown-Menü; übergeben Sie jede andere Sprach-ID über voice_id

TTS 2 Flash API: häufige Fragen

Wie viel kostet die TTS 2 Flash API?

Auf EmpirioLabs wird TTS 2 Flash nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet TTS 2 Flash?

TTS 2 Flash wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich TTS 2 Flash im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt TTS 2 Flash im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen TTS 2 Flash API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.