
Contextual StepFun text-to-speech Modell mit natürlicher Sprachrichtung und expressiver Darbietung.
Contextual StepFun text-to-speech Modell mit natürlicher Sprachrichtung und expressiver Darbietung.
Die Zeichenzählung folgt den Preisen von StepFun: Ein chinesisches Zeichen zählt als ein Zeichen, zwei englische Buchstaben als ein Zeichen und zwei Satzzeichen als ein Zeichen.
Auch bekannt als StepAudio TTS, StepFun StepAudio 2.5 TTS, StepAudio-2.5-TTS, stepaudio-2-5-tts
stepaudio-2-5-tts/v1/audio/speechstepaudio-2.5-ttsstepfun/stepaudio-2-5-ttsstepfun/stepaudio-2.5-ttsLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
StepAudio 2.5 TTS erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID stepaudio-2-5-tts. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-2-5-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die StepAudio 2.5 TTS API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | max. 1000 | Text zur Synthese. Maximal 1.000 Zeichen. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Audioformat ausgeben. |
| speed | number | 1 | 0.5 bis 2 | Sprachgeschwindigkeit. |
| volume | number | 1 | 0.1 bis 2 | Lautstärke ausgeben. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Ausgabe-Abtastrate in Hz. |
| instruction | string | - | max. 200 | Globale Emotion oder Stilorientierung. Nur von StepAudio 2.5 TTS unterstützt. |
| pronunciation_map | object | - | - | Optionale Aussprache-Mapping. |
| markdown_filter | boolean | false | - | Filtere Markdown-Syntax vor der Synthese. |
Die maximale Eingabe beträgt 1.000 Zeichen. Inhalte in Klammern werden als Anweisungen behandelt und nicht ausgesprochen. Nutze Anweisungen für globale Emotions- oder Stilorientierung. StepAudio 2.5 TTS unterstützt voice_label nicht.
Auf EmpirioLabs wird StepAudio 2.5 TTS nach Verbrauch abgerechnet: Synthese $0.85 pro 10.000 Zeichen. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
StepAudio 2.5 TTS wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt StepAudio 2.5 TTS im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.