
Sprachsynthese in Broadcast-Qualität mit reichhaltiger ausdrucksstarker Prosodie, 271+ Stimmen in 15 Sprachen und Echtzeit-SSE-Streaming mit Zeitstempeln pro Wort.
Sprachsynthese in Broadcast-Qualität mit reichhaltiger ausdrucksstarker Prosodie, 271+ Stimmen in 15 Sprachen und Echtzeit-SSE-Streaming mit Zeitstempeln pro Wort.
Auch bekannt als TTS Max, Inworld TTS 1.5 Max, TTS-1.5-Max, tts-1-5-max
tts-1-5-max/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-1.5-maxtts-1.5-maxLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
TTS 1.5 Max erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID tts-1-5-max. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-5-max",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-1-5-max", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die TTS 1.5 Max API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | max. 2000 | Text zur Synthese. Maximal 2.000 Zeichen pro Anfrage; Längere Texte an Satzgrenzen beim Klienten. |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | Sprachvoreinstellung. 20 handverlesene Stimmen, die Englisch + Spanisch + Portugiesisch + Hindi + verschiedene Akzente abdecken. Für den vollständigen 271-stimmigen... |
| voice_id | string | - | - | Freiformige Sprach-ID. Überschreibt die Sprache, wenn sie gesetzt ist. Nutzen Sie dies, um Stimmen außerhalb der kuratierten 20-voreingestellten Liste anzusprechen.... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47 Sprachcode. Inworld TTS 1.5 umfasst 15 Sprachen. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | Audio-container/codec. WAV = LINEAR16 im RIFF (allgegenwärtig). MP3 / OGG = komprimiert. PCM = headerless raw, nützlich für gehackte Echtzeitwiedergabe. FLAC =... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | Die Ausgabe-Abtastrate in Hz. 24000 ist Inworlds Standardvorbild und entspricht dem Trainingsmaß ihrer Sprachmodelle; Erhöhung auf 48.000 für die Sendequalität. |
| speed | number | 1 | 0.5 bis 1.5 | Sprechratemultiplikator. 0,5 = halbe Geschwindigkeit, 1,5 = 50 % schneller. |
| temperature | number | 1 | 0.1 bis 2 | Ausdrucksstärke / Variabilität der Stimme. Lower = konsistenter / "flach"; höher = ausdrucksstärker, aber mehr Variation zwischen den Renders. |
| bit_rate | number | 128000 | 32000 bis 320000 | Bitrate in BPS für MP3 / OGG_OPUS. Ignoriert für andere Codierungen. |
| apply_text_normalization | enum | ON | ON, OFF | Wenn ON ist, erweitert Inworld Zahlen, Abkürzungen und Daten in gesprochene Form ("5 USD" → "fünf US-Dollar"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | Wenn kein Symbol ist, enthält die Antwort Zeitstempel pro Wort oder Zeichen in timestamp_info. Nützlich für Bildunterschriften und Highlight-UIs. |
Limits - Max-Eingabe: 2.000 Zeichen pro Anfrage (längerer Text an Satzgrenzen) - WebSocket: 20 gleichzeitige Verbindungen, 5 contexts/connection Per-WS-Nachricht: 1.000 Zeichen Latenz - p90 TTFB: unter 250 ms (Inworld-Benchmark) Voices - 271+ benannte Presets in 15 Sprachen - 20 handverlesene Presets, die in der Dropdown-Datei angezeigt werden; Weitergabe einer anderen Sprach-ID über voice_id
Auf EmpirioLabs wird TTS 1.5 Max nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
TTS 1.5 Max wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt TTS 1.5 Max im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.