
Sub-130ms TTFB Sprachsynthese mit 271+ Stimmen in 15 Sprachen, expressive Prosodie und Echtzeit-SSE-Streaming für Sprachagenten mit niedriger Latenz.
Sub-130ms TTFB Sprachsynthese mit 271+ Stimmen in 15 Sprachen, expressive Prosodie und Echtzeit-SSE-Streaming für Sprachagenten mit niedriger Latenz.
Auch bekannt als TTS Mini, Inworld TTS 1.5 Mini, TTS-1.5-Mini, tts-1-5-mini
tts-1-5-mini/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-1.5-minitts-1.5-miniLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
TTS 1.5 Mini erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID tts-1-5-mini. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-5-mini",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-1-5-mini", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die TTS 1.5 Mini API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | max. 2000 | Text zur Synthese. Maximal 2.000 Zeichen pro Anfrage; Längere Texte an Satzgrenzen beim Klienten. |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | Sprachvoreinstellung. 20 handverlesene Stimmen, die Englisch + Spanisch + Portugiesisch + Hindi + verschiedene Akzente abdecken. Für den vollständigen 271-stimmigen... |
| voice_id | string | - | - | Freiformige Sprach-ID. Überschreibt die Sprache, wenn sie gesetzt ist. Nutzen Sie dies, um Stimmen außerhalb der kuratierten 20-voreingestellten Liste anzusprechen.... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47 Sprachcode. Inworld TTS 1.5 umfasst 15 Sprachen. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | Audio-container/codec. WAV = LINEAR16 im RIFF (allgegenwärtig). MP3 / OGG = komprimiert. PCM = headerless raw, nützlich für gehackte Echtzeitwiedergabe. FLAC =... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | Die Ausgabe-Abtastrate in Hz. 24000 ist Inworlds Standardvorbild und entspricht dem Trainingsmaß ihrer Sprachmodelle; Erhöhung auf 48.000 für die Sendequalität. |
| speed | number | 1 | 0.5 bis 1.5 | Sprechratemultiplikator. 0,5 = halbe Geschwindigkeit, 1,5 = 50 % schneller. |
| temperature | number | 1 | 0.1 bis 2 | Ausdrucksstärke / Variabilität der Stimme. Lower = konsistenter / "flach"; höher = ausdrucksstärker, aber mehr Variation zwischen den Renders. |
| bit_rate | number | 128000 | 32000 bis 320000 | Bitrate in BPS für MP3 / OGG_OPUS. Ignoriert für andere Codierungen. |
| apply_text_normalization | enum | ON | ON, OFF | Wenn ON ist, erweitert Inworld Zahlen, Abkürzungen und Daten in gesprochene Form ("5 USD" → "fünf US-Dollar"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | Wenn kein Symbol ist, enthält die Antwort Zeitstempel pro Wort oder Zeichen in timestamp_info. Nützlich für Bildunterschriften und Highlight-UIs. |
Limits - Max-Eingabe: 2.000 Zeichen pro Anfrage (längerer Text an Satzgrenzen) - WebSocket: 20 gleichzeitige Verbindungen, 5 contexts/connection Per-WS-Nachricht: 1.000 Zeichen Latenz - p90 TTFB: unter 130 ms (Inworld-Benchmark) Voices - 271+ benannte Presets in 15 Sprachen - 20 handverlesene Presets in der Dropdown-Datei; Weitergabe einer beliebigen anderen Sprach-ID über voice_id
Auf EmpirioLabs wird TTS 1.5 Mini nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
TTS 1.5 Mini wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt TTS 1.5 Mini im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.