TTS 1.5 Max API

Sprachsynthese in Broadcast-Qualität mit reichhaltiger ausdrucksstarker Prosodie, 271+ Stimmen in 15 Sprachen und Echtzeit-SSE-Streaming mit Zeitstempeln pro Wort.

InworldAudiogenerationVeröffentlicht 21. Jan. 2026Proprietärer Endpoint

Über TTS 1.5 Max

Sprachsynthese in Broadcast-Qualität mit reichhaltiger ausdrucksstarker Prosodie, 271+ Stimmen in 15 Sprachen und Echtzeit-SSE-Streaming mit Zeitstempeln pro Wort.

Auch bekannt als TTS Max, Inworld TTS 1.5 Max, TTS-1.5-Max, tts-1-5-max

multi speakerreal timestreamingword timestampscharacter timestampsmultilingualexpressive prosodybroadcast quality

TTS 1.5 Max Spezifikationen

Modell-ID
tts-1-5-max
Anbieter
Inworld
Kategorie
Audiogeneration
Veröffentlicht
21. Jan. 2026
Eingabe
Text
Ausgabe
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Alternative Modell-IDs
inworld-tts-1.5-maxtts-1.5-max

TTS 1.5 Max API-PreiseSpare bis zu 15%

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Synthese
pro 1M Zeichen
$35.00$29.75
Auf der vollständigen Preisseite vergleichen

So rufst du die TTS 1.5 Max API auf

TTS 1.5 Max erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID tts-1-5-max. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-5-max",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-1-5-max", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige TTS 1.5 Max API-Referenz

TTS 1.5 Max API-Parameter

Request-Parameter, die die TTS 1.5 Max API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring-max. 2000Text zur Synthese. Maximal 2.000 Zeichen pro Anfrage; Längere Texte an Satzgrenzen beim Klienten.
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Sprachvoreinstellung. 20 handverlesene Stimmen, die Englisch + Spanisch + Portugiesisch + Hindi + verschiedene Akzente abdecken. Für den vollständigen 271-stimmigen...
voice_idstring--Freiformige Sprach-ID. Überschreibt die Sprache, wenn sie gesetzt ist. Nutzen Sie dies, um Stimmen außerhalb der kuratierten 20-voreingestellten Liste anzusprechen....
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47 Sprachcode. Inworld TTS 1.5 umfasst 15 Sprachen.
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWAudio-container/codec. WAV = LINEAR16 im RIFF (allgegenwärtig). MP3 / OGG = komprimiert. PCM = headerless raw, nützlich für gehackte Echtzeitwiedergabe. FLAC =...
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000Die Ausgabe-Abtastrate in Hz. 24000 ist Inworlds Standardvorbild und entspricht dem Trainingsmaß ihrer Sprachmodelle; Erhöhung auf 48.000 für die Sendequalität.
speednumber10.5 bis 1.5Sprechratemultiplikator. 0,5 = halbe Geschwindigkeit, 1,5 = 50 % schneller.
temperaturenumber10.1 bis 2Ausdrucksstärke / Variabilität der Stimme. Lower = konsistenter / "flach"; höher = ausdrucksstärker, aber mehr Variation zwischen den Renders.
bit_ratenumber12800032000 bis 320000Bitrate in BPS für MP3 / OGG_OPUS. Ignoriert für andere Codierungen.
apply_text_normalizationenumONON, OFFWenn ON ist, erweitert Inworld Zahlen, Abkürzungen und Daten in gesprochene Form ("5 USD" → "fünf US-Dollar").
timestamp_typeenumNONENONE, WORD, CHARACTERWenn kein Symbol ist, enthält die Antwort Zeitstempel pro Wort oder Zeichen in timestamp_info. Nützlich für Bildunterschriften und Highlight-UIs.

Gut zu wissen

Limits - Max-Eingabe: 2.000 Zeichen pro Anfrage (längerer Text an Satzgrenzen) - WebSocket: 20 gleichzeitige Verbindungen, 5 contexts/connection Per-WS-Nachricht: 1.000 Zeichen Latenz - p90 TTFB: unter 250 ms (Inworld-Benchmark) Voices - 271+ benannte Presets in 15 Sprachen - 20 handverlesene Presets, die in der Dropdown-Datei angezeigt werden; Weitergabe einer anderen Sprach-ID über voice_id

TTS 1.5 Max API: häufige Fragen

Wie viel kostet die TTS 1.5 Max API?

Auf EmpirioLabs wird TTS 1.5 Max nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet TTS 1.5 Max?

TTS 1.5 Max wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich TTS 1.5 Max im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt TTS 1.5 Max im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen TTS 1.5 Max API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.