
Echtzeit-Sprachmodell mit einfacher englischer Sprachsteuerung, einer Sprachidentität in 100+ Sprachen und Streaming-time-to-first-audio unter 200 ms.
Echtzeit-Sprachmodell mit einfacher englischer Sprachsteuerung, einer Sprachidentität in 100+ Sprachen und Streaming-time-to-first-audio unter 200 ms.
Auch bekannt als Inworld TTS 2, TTS-2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
TTS 2 erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID tts-2. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die TTS 2 API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | max. 2000 | Text zur Synthese. Maximal 2.000 Zeichen pro Anfrage; Längere Texte an Satzgrenzen beim Klienten. |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | Sprachvoreinstellung. 20 handverlesene Stimmen, die Englisch, Spanisch, Portugiesisch, Hindi und verschiedene Akzente abdecken. Für den vollständigen Sprachkatalog... |
| voice_id | string | - | - | Freiformige Sprach-ID. Überschreibt die Sprache, wenn sie gesetzt ist. Nutzen Sie diese, um jede Stimme jenseits der kuratierten 20-voreingestellten Liste... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47 Sprachcode. Dieses Modell hält eine Stimmidentität über 100+ Sprachen hinweg; Geben Sie hier alle unterstützten Codes, auch wenn sie nicht im Dropdown-Menü stehen. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | Audio-container/codec. WAV = LINEAR16 im RIFF (allgegenwärtig). MP3 / OGG = komprimiert. PCM = headerless raw, nützlich für gehackte Echtzeitwiedergabe. FLAC =... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | Die Ausgabe-Abtastrate in Hz. 24000 ist Inworlds Standardvorbild und entspricht dem Trainingsmaß ihrer Sprachmodelle; Erhöhung auf 48.000 für die Sendequalität. |
| speed | number | 1 | 0.5 bis 1.5 | Sprechratemultiplikator. 0,5 = halbe Geschwindigkeit, 1,5 = 50 % schneller. |
| temperature | number | 1 | 0.1 bis 2 | Ausdrucksstärke / Variabilität der Stimme. Lower = konsistenter / "flach"; höher = ausdrucksstärker, aber mehr Variation zwischen den Renders. |
| bit_rate | number | 128000 | 32000 bis 320000 | Bitrate in BPS für MP3 / OGG_OPUS. Ignoriert für andere Codierungen. |
| apply_text_normalization | enum | ON | ON, OFF | Wenn ON ist, erweitert Inworld Zahlen, Abkürzungen und Daten in gesprochene Form ("5 USD" → "fünf US-Dollar"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | Wenn kein Symbol ist, enthält die Antwort Zeitstempel pro Wort oder Zeichen in timestamp_info. Nützlich für Bildunterschriften und Highlight-UIs. |
Limits - Maximale Eingabe: 2.000 Zeichen pro Anfrage (längere Textabschnitte an Satzgrenzen) - WebSocket: 20 gleichzeitige Verbindungen, 5 contexts/connection - Per-WS-Nachricht: 1.000 Zeichen Latenz - p90 TTFB: unter 200 ms (Inworld-Benchmark) Stimmen - Eine Sprachidentität über 100+ Sprachen verteilt - Kuratierte Presets im Dropdown-Menü; Geben Sie jede andere Sprach-ID über voice_id durch – eine klare Sprachanweisung zur Steuerung von Ton und Darbietung
Auf EmpirioLabs wird TTS 2 nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
TTS 2 wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt TTS 2 im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.