TTS 2 API

Echtzeit-Sprachmodell mit einfacher englischer Sprachsteuerung, einer Sprachidentität in 100+ Sprachen und Streaming-time-to-first-audio unter 200 ms.

InworldAudiogenerationVeröffentlicht 5. Mai 2026Proprietärer EndpointNeu

Über TTS 2

Echtzeit-Sprachmodell mit einfacher englischer Sprachsteuerung, einer Sprachidentität in 100+ Sprachen und Streaming-time-to-first-audio unter 200 ms.

Auch bekannt als Inworld TTS 2, TTS-2

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosody

TTS 2 Spezifikationen

Modell-ID
tts-2
Anbieter
Inworld
Kategorie
Audiogeneration
Veröffentlicht
5. Mai 2026
Eingabe
Text
Ausgabe
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Alternative Modell-IDs
inworld-tts-2

TTS 2 API-PreiseSpare bis zu 12%

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Synthese
pro 1M Zeichen
$25.00$22.00
Auf der vollständigen Preisseite vergleichen

So rufst du die TTS 2 API auf

TTS 2 erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID tts-2. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige TTS 2 API-Referenz

TTS 2 API-Parameter

Request-Parameter, die die TTS 2 API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring-max. 2000Text zur Synthese. Maximal 2.000 Zeichen pro Anfrage; Längere Texte an Satzgrenzen beim Klienten.
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Sprachvoreinstellung. 20 handverlesene Stimmen, die Englisch, Spanisch, Portugiesisch, Hindi und verschiedene Akzente abdecken. Für den vollständigen Sprachkatalog...
voice_idstring--Freiformige Sprach-ID. Überschreibt die Sprache, wenn sie gesetzt ist. Nutzen Sie diese, um jede Stimme jenseits der kuratierten 20-voreingestellten Liste...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47 Sprachcode. Dieses Modell hält eine Stimmidentität über 100+ Sprachen hinweg; Geben Sie hier alle unterstützten Codes, auch wenn sie nicht im Dropdown-Menü stehen.
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWAudio-container/codec. WAV = LINEAR16 im RIFF (allgegenwärtig). MP3 / OGG = komprimiert. PCM = headerless raw, nützlich für gehackte Echtzeitwiedergabe. FLAC =...
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000Die Ausgabe-Abtastrate in Hz. 24000 ist Inworlds Standardvorbild und entspricht dem Trainingsmaß ihrer Sprachmodelle; Erhöhung auf 48.000 für die Sendequalität.
speednumber10.5 bis 1.5Sprechratemultiplikator. 0,5 = halbe Geschwindigkeit, 1,5 = 50 % schneller.
temperaturenumber10.1 bis 2Ausdrucksstärke / Variabilität der Stimme. Lower = konsistenter / "flach"; höher = ausdrucksstärker, aber mehr Variation zwischen den Renders.
bit_ratenumber12800032000 bis 320000Bitrate in BPS für MP3 / OGG_OPUS. Ignoriert für andere Codierungen.
apply_text_normalizationenumONON, OFFWenn ON ist, erweitert Inworld Zahlen, Abkürzungen und Daten in gesprochene Form ("5 USD" → "fünf US-Dollar").
timestamp_typeenumNONENONE, WORD, CHARACTERWenn kein Symbol ist, enthält die Antwort Zeitstempel pro Wort oder Zeichen in timestamp_info. Nützlich für Bildunterschriften und Highlight-UIs.

Gut zu wissen

Limits - Maximale Eingabe: 2.000 Zeichen pro Anfrage (längere Textabschnitte an Satzgrenzen) - WebSocket: 20 gleichzeitige Verbindungen, 5 contexts/connection - Per-WS-Nachricht: 1.000 Zeichen Latenz - p90 TTFB: unter 200 ms (Inworld-Benchmark) Stimmen - Eine Sprachidentität über 100+ Sprachen verteilt - Kuratierte Presets im Dropdown-Menü; Geben Sie jede andere Sprach-ID über voice_id durch – eine klare Sprachanweisung zur Steuerung von Ton und Darbietung

TTS 2 API: häufige Fragen

Wie viel kostet die TTS 2 API?

Auf EmpirioLabs wird TTS 2 nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet TTS 2?

TTS 2 wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich TTS 2 im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt TTS 2 im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen TTS 2 API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.