StepAudio 3 Gen API

Erzeugt Dialoge, Soundeffekte, Ambiente und Hintergrundmusik zusammen in einem Clip aus einer geschriebenen Szene.

StepFunAudiogenerationVeröffentlicht 9. Sept. 2026InternationalProprietärer EndpointNeu

Über StepAudio 3 Gen

Erzeugt Dialoge, Soundeffekte, Ambiente und Hintergrundmusik zusammen in einem Clip aus einer geschriebenen Szene.

Die Zeichenzählung folgt den Preisen von StepFun: Ein chinesisches Zeichen zählt als ein Zeichen, zwei englische Buchstaben als ein Zeichen und zwei Satzzeichen als ein Zeichen.

Auch bekannt als StepFun StepAudio 3 Gen

audio generationtext to speechsound effectsvoice control

StepAudio 3 Gen Spezifikationen

Modell-ID
stepaudio-3-gen
Autor
StepFun
Kategorie
Audiogeneration
Veröffentlicht
9. Sept. 2026
Eingabe
Text
Ausgabe
Audio
Region
International
Endpoints
POST/v1/audio/generations
Alternative Modell-IDs
stepaudio-3-gen-previewstepfun/stepaudio-3-gen

StepAudio 3 Gen API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Erzeugung
pro 10.000 Zeichen
$0.36
Auf der vollständigen Preisseite vergleichen

So rufst du die StepAudio 3 Gen API auf

StepAudio 3 Gen läuft über POST /v1/audio/generations. Der Request liefert sofort eine job_id; frage GET /v1/jobs/{job_id} ab, bis der Job abgeschlossen ist, und lies die Ausgabe-URLs aus dem Ergebnis. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL: Job senden
curl https://api.empiriolabs.ai/v1/audio/generations \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-gen",
    "prompt": "Describe what you want StepAudio 3 Gen to generate."
  }'
cURL: Ergebnis abfragen
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/generations",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-gen",
        "prompt": "Describe what you want StepAudio 3 Gen to generate.",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
Vollständige StepAudio 3 Gen API-Referenz

StepAudio 3 Gen API-Parameter

Request-Parameter, die die StepAudio 3 Gen API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
promptstring--Die zu erzeugende Szene. Wickle einen Soundeffekt oder ein Musikstück in eckige Klammern und eine Abgaberichtung in Klammern.
instructionstring-max. 500Globale Anleitungen für Setting, Hintergrundmusik und emotionalen Ton. Maximal 500 Zeichen.
rolesstring--Optionale Lautsprecher, als Objekte mit Namen und Sprachbeschreibung. Alle Namen und Beschreibungen zusammen sind auf 500 Zeichen begrenzt.
scriptsstring--Optionale geordnete Zeilen, als Objekte mit Sprecher und Text. Maximal auf insgesamt 1.000 Zeichen. Verwenden Sie dies statt Prompt für Mehrsprecher-Szenen.
response_formatenummp3mp3, wav, flac, opus, pcmAudioformat ausgeben.
sample_rateenum240008000, 16000, 22050, 24000, 48000Ausgabe-Abtastrate in Hz.
speednumber10.5 bis 2Sprachgeschwindigkeit.
volumenumber10.1 bis 2Lautstärke ausgeben.
text_normalizationenumstandardstandard, enhancedWie Zahlen, Daten und Symbole laut vorgelesen werden.

Gut zu wissen

Beschreiben Sie eine Szene und das Modell führt sie als einen fertigen Clip vor: gesprochene Zeilen, Soundeffekte, Ambiance und Hintergrundmusik zusammen. Senden Sie einen Prompt oder verwenden Sie Rollen und Skripte zur Steuerung mehrerer Lautsprecher. Wickeln Sie einen Soundeffekt oder Musikhinweis in eckigen Klammern und eine Lieferanweisung in Klammern. Rollen und Instruktion sind auf jeweils 500 Zeichen begrenzt, Skripte auf 1.000. Ausgabeformate sind mp3, wav, flac, opus und pcm. Referenzstimmen und Stimmklonen sind bei diesem Modell nicht verfügbar. Dieses Modell befindet sich in der Vorschau und seine Fähigkeiten können sich ändern.

StepAudio 3 Gen API: häufige Fragen

Wie viel kostet die StepAudio 3 Gen API?

Auf EmpirioLabs wird StepAudio 3 Gen nach Verbrauch abgerechnet: Erzeugung $0.36 pro 10.000 Zeichen. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet StepAudio 3 Gen?

StepAudio 3 Gen wird über POST /v1/audio/generations auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich StepAudio 3 Gen im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt StepAudio 3 Gen im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen StepAudio 3 Gen API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.