
StepFun text-to-speech Modell mit offiziellen Stimmen, individuell geklonten Stimmen und Stimmtag-Steuerung.
StepFun text-to-speech Modell mit offiziellen Stimmen, individuell geklonten Stimmen und Stimmtag-Steuerung.
Die Zeichenzählung folgt den Preisen von StepFun: Ein chinesisches Zeichen zählt als ein Zeichen, zwei englische Buchstaben als ein Zeichen und zwei Satzzeichen als ein Zeichen.
Auch bekannt als StepFun Step TTS 2, Step-TTS-2
step-tts-2/v1/audio/speechstepfun/step-tts-2Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
Step TTS 2 erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID step-tts-2. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "step-tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die Step TTS 2 API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | max. 1000 | Text zur Synthese. Maximal 1.000 Zeichen. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Audioformat ausgeben. |
| speed | number | 1 | 0.5 bis 2 | Sprachgeschwindigkeit. |
| volume | number | 1 | 0.1 bis 2 | Lautstärke ausgeben. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Ausgabe-Abtastrate in Hz. |
| voice_label | object | - | - | Emotions- und Sprechstil-Tags für step-tts-2. |
| pronunciation_map | object | - | - | Optionale Aussprache-Mapping. |
| markdown_filter | boolean | false | - | Filtere Markdown-Syntax vor der Synthese. |
Die maximale Eingabe beträgt 1.000 Zeichen. Unterstützt offizielle Sprach-IDs, benutzerdefinierte geklonte Stimmen, voice_label Emotions-Tags und voice_label-Style-Tags. Der Instruktionsparameter gilt nur für stepaudio-2.5-tts.
Auf EmpirioLabs wird Step TTS 2 nach Verbrauch abgerechnet: Synthese $0.40 pro 10.000 Zeichen. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
Step TTS 2 wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt Step TTS 2 im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.