TTS 2 API

Das Echtzeit-Sprachmodell, das die Sprechrichtung in einfachem Englisch wählt, eine Sprachidentität über 200+ Sprachen hinweg hält und mit Wortzeitstempeln streamt.

InworldAudiogenerationVeröffentlicht 5. Mai 2026Proprietärer Endpoint

Über TTS 2

Das Echtzeit-Sprachmodell, das die Sprechrichtung in einfachem Englisch wählt, eine Sprachidentität über 200+ Sprachen hinweg hält und mit Wortzeitstempeln streamt.

Auch bekannt als Inworld TTS 2

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosodyvoice direction

TTS 2 Spezifikationen

Modell-ID
tts-2
Anbieter
Inworld
Kategorie
Audiogeneration
Veröffentlicht
5. Mai 2026
Eingabe
Text
Ausgabe
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Alternative Modell-IDs
inworld-tts-2

TTS 2 API-PreiseSpare bis zu 12%

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Synthese
pro 1 Million Zeichen
$25.00$22.00
Auf der vollständigen Preisseite vergleichen

So rufst du die TTS 2 API auf

TTS 2 erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID tts-2. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige TTS 2 API-Referenz

TTS 2 API-Parameter

Request-Parameter, die die TTS 2 API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring-max. 2000Text zur Synthesize. Maximal 2.000 Zeichen pro Anfrage; längere Texte an Satzgrenzen auf dem Client. Öffnen Sie optional den Text mit einer in Klammern gesetzten...
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Sprachvoreinstellung. 20 handverlesene Stimmen, die Englisch, Spanisch, Portugiesisch, Hindi und verschiedene Akzente abdecken. Für den vollständigen Sprachkatalog...
voice_idstring--Freiformige Sprach-ID. Überschreibt die Sprache, wenn sie gesetzt ist. Nutzen Sie diese, um jede Stimme jenseits der kuratierten 20-voreingestellten Liste...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47-Sprachcode. Dieses Modell enthält eine Sprachidentität über 200+ Sprachen und Orte, sodass Sie jeden unterstützten Code hier eingeben können, auch wenn er...
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWAudio-container/codec. WAV = LINEAR16 im RIFF (allgegenwärtig). MP3 / OGG = komprimiert. PCM = headerless raw, nützlich für gehackte Echtzeitwiedergabe. FLAC =...
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000Die Ausgabe-Abtastrate in Hz. 24000 ist Inworlds Standardvorbild und entspricht dem Trainingsmaß ihrer Sprachmodelle; Erhöhung auf 48.000 für die Sendequalität.
speednumber10.5 bis 1.5Sprechratemultiplikator. 0,5 = halbe Geschwindigkeit, 1,5 = 50 % schneller.
temperaturenumber10.1 bis 2Ausdrucksstärke / Variabilität der Stimme. Lower = konsistenter / "flach"; höher = ausdrucksstärker, aber mehr Variation zwischen den Renders.
bit_ratenumber12800032000 bis 320000Bitrate in BPS für MP3 / OGG_OPUS. Ignoriert für andere Codierungen.
apply_text_normalizationenumONON, OFFWenn ON ist, erweitert Inworld Zahlen, Abkürzungen und Daten in gesprochene Form ("5 USD" → "fünf US-Dollar").
timestamp_typeenumNONENONE, WORD, CHARACTERWenn kein Symbol ist, enthält die Antwort Zeitstempel pro Wort oder Zeichen in timestamp_info. Nützlich für Bildunterschriften und Highlight-UIs.

Gut zu wissen

Grenzen - Maximale Eingabe: 2.000 Zeichen pro Anfrage (längerer Text an Satzgrenzen) - WebSocket: 20 gleichzeitige Verbindungen, 5 contexts/connection - Per-WS-Nachricht: 1.000 Zeichen Sprachrichtung - Öffnen Sie den Text mit einer Bracket-Anweisung in einfachem Englisch, um die Auslieferung zu steuern, zum Beispiel [whispering], [excited] oder [Speak warmly, like you are greeting an old friend] - Der geklammerte Text wird als Richtung behandelt und nicht laut vorgelesen - Richtungstext zählt zum abgeregelten Zeichenbetrag, halten Sie ihn also kurz Latenz - p90 TTFB: unter 100 ms (Inworld-Benchmark) Stimmen - Eine Sprachidentität über 200+ Sprachen und Orte verteilt, einschließlich Sprachwechsel mitten in der Generierung - Kuratierte Voreinstellungen im Dropdown-Menü; beliebige andere Sprach-IDs über voice_id

TTS 2 API: häufige Fragen

Wie viel kostet die TTS 2 API?

Auf EmpirioLabs wird TTS 2 nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet TTS 2?

TTS 2 wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich TTS 2 im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt TTS 2 im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen TTS 2 API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.