StepAudio 3 TTS API

Sprachsynthese auf menschlicher Ebene in sechs Sprachen, mit 12 Systemstimmen, natürlicher Sprachübertragung und Streaming-Wiedergabe.

StepFunAudiogenerationVeröffentlicht 9. Sept. 2026InternationalProprietärer EndpointNeu

Über StepAudio 3 TTS

Sprachsynthese auf menschlicher Ebene in sechs Sprachen, mit 12 Systemstimmen, natürlicher Sprachübertragung und Streaming-Wiedergabe.

Die Zeichenzählung folgt den Preisen von StepFun: Ein chinesisches Zeichen zählt als ein Zeichen, zwei englische Buchstaben als ein Zeichen und zwei Satzzeichen als ein Zeichen.

Auch bekannt als StepFun StepAudio 3 TTS

text to speechcontextual ttsvoice controlmultilingual

StepAudio 3 TTS Spezifikationen

Modell-ID
stepaudio-3-tts
Autor
StepFun
Kategorie
Audiogeneration
Veröffentlicht
9. Sept. 2026
Eingabe
Text
Ausgabe
Audio
Region
International
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:stream
Alternative Modell-IDs
stepfun/stepaudio-3-tts

StepAudio 3 TTS API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Synthese
pro 10.000 Zeichen
$0.36
Auf der vollständigen Preisseite vergleichen

So rufst du die StepAudio 3 TTS API auf

StepAudio 3 TTS erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID stepaudio-3-tts. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige StepAudio 3 TTS API-Referenz

StepAudio 3 TTS API-Parameter

Request-Parameter, die die StepAudio 3 TTS API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring-max. 1000Text zur Synthese. Maximal 1.000 Zeichen. Inhalt in Klammern wird als Lieferanweisung behandelt und nicht gesprochen.
voiceenumlively-girllively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v...Offizielle StepFun-Stimme. Benutzerdefinierte geklonte Sprach-IDs werden ebenfalls über die API akzeptiert.
instructionstring-max. 500Globale Emotions- oder Stilorientierung für den gesamten Text, in natürlicher Sprache. Maximal 500 Zeichen.
speednumber10.5 bis 2Sprachgeschwindigkeit.
volumenumber10.1 bis 2Lautstärke ausgeben.
languageenumenen, zh, ja, ko, fr, esZielsprache. Japanisch, Koreanisch, Französisch und Spanisch sind in der Vorschau.
response_formatenummp3mp3, wav, flac, opus, pcmAudioformat ausgeben.
sample_rateenum240008000, 16000, 22050, 24000Ausgabe-Abtastrate in Hz.
markdown_filterbooleanfalse-Entferne die Markdown-Syntax von der Eingabe, bevor sie ausgesprochen wird.
pronunciation_mapstring--Optionale Aussprache-Überschreibungen, als Objekt mit einem Tonarray von "written/spoken"-Regeln.

Gut zu wissen

Die maximale Eingabe beträgt 1.000 Zeichen. Inhalte in Klammern werden als Lieferanweisung behandelt und nicht gesprochen. Verwenden Sie die Anleitung für globale Emotions- oder Stilorientierung, bis zu 500 Zeichen. Zwölf Systemstimmen sind verfügbar, und eine benutzerdefinierte geklonte Sprach-ID wird ebenfalls akzeptiert. Anerkannte Sprachen sind Chinesisch, Englisch, Japanisch, Koreanisch, Französisch und Spanisch, mit anderen Sprachen als Chinesisch und Englisch in der Vorschau. Ausgabeformate sind mp3, wav, flac, opus und pcm mit 8000, 16000, 22050 oder 24000 Hz. Wav wird als vollständige Datei zurückgegeben und nicht gestreamt. Dieses Modell unterstützt voice_label nicht.

StepAudio 3 TTS API: häufige Fragen

Wie viel kostet die StepAudio 3 TTS API?

Auf EmpirioLabs wird StepAudio 3 TTS nach Verbrauch abgerechnet: Synthese $0.36 pro 10.000 Zeichen. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet StepAudio 3 TTS?

StepAudio 3 TTS wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich StepAudio 3 TTS im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt StepAudio 3 TTS im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen StepAudio 3 TTS API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.