StepAudio 3 ASR Max API

Kontextbewusste Transkription von Eigennamen, Fachbegriffen, Dialekten und schwierigen Tonarten einschließlich Flüstern, schneller Sprache und Gesang.

StepFunTranskriptionVeröffentlicht 31. Aug. 2026InternationalProprietärer EndpointNeu

Über StepAudio 3 ASR Max

Kontextbewusste Transkription von Eigennamen, Fachbegriffen, Dialekten und schwierigen Tonarten einschließlich Flüstern, schneller Sprache und Gesang.

EmpirioLabs gibt das Standard-/v1/audio/transcriptions-Endpunkt frei und liefert das endgültige Transkript im normalen Transkriptionsantwortformat.

Auch bekannt als StepFun StepAudio 3 ASR Max

transcriptionspeech to textmultilingual

StepAudio 3 ASR Max Spezifikationen

Modell-ID
stepaudio-3-asr-max
Autor
StepFun
Kategorie
Transkription
Veröffentlicht
31. Aug. 2026
Eingabe
Audio
Ausgabe
Text
Region
International
Endpoints
POST/v1/audio/transcriptions
Alternative Modell-IDs
stepfun/stepaudio-3-asr-max

StepAudio 3 ASR Max API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Transkription
pro Stunde Audio
$0.24
Auf der vollständigen Preisseite vergleichen

So rufst du die StepAudio 3 ASR Max API auf

StepAudio 3 ASR Max läuft über POST /v1/audio/transcriptions. Der Request liefert sofort eine job_id; frage GET /v1/jobs/{job_id} ab, bis der Job abgeschlossen ist, und lies die Ausgabe-URLs aus dem Ergebnis. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL: Job senden
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-asr-max",
    "audio_url": "https://example.com/meeting-recording.mp3"
  }'
cURL: Ergebnis abfragen
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/transcriptions",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-asr-max",
        "audio_url": "https://example.com/meeting-recording.mp3",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
Vollständige StepAudio 3 ASR Max API-Referenz

StepAudio 3 ASR Max API-Parameter

Request-Parameter, die die StepAudio 3 ASR Max API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
filestring--Audiodatei-Upload zur Transkription.
file_urlstring--Öffentliche URL zu einer Audiodatei.
audio_base64string--Base64-Audionutzlast für JSON-Anfragen.
enable_itnbooleantrue-Aktivieren Sie die umgedrehte Textnormalisierung, die Zahlen, Daten und Währung in ihrer schriftlichen Form schreibt.
formatenumwavwav, mp3, ogg, m4a, pcmAudio-Container-Format.
codecstring--PCM-Codec wie pcm_s16le.
ratenumber--PCM-Abtastrate in Hz.
bitsnumber--PCM-Bittiefe.
channelnumber--PCM-Kanalanzahl.

Gut zu wissen

Unterstützt WAV, mp3, ogg, m4a und PCM-Eingaben. PCM-Anfragen sollten Codec, Abtastrate, Bittiefe und Kanalanzahl enthalten. Die Sprache wird automatisch erkannt und kann nicht eingestellt werden; Chinesisch, Englisch, Japanisch, Koreanisch, Französisch und Spanisch werden erkannt, mit anderen Sprachen als Chinesisch und Englisch in der Vorschau. Die inverse Textnormalisierung ist standardmäßig aktiviert und kann mit enable_itn deaktiviert werden. Hotwords und Wortzeitstempel sind bei diesem Modell nicht verfügbar. Audio wird nach seiner gemessenen Dauer berechnet, mit einer Mindeststunde von einer Sekunde.

StepAudio 3 ASR Max API: häufige Fragen

Wie viel kostet die StepAudio 3 ASR Max API?

Auf EmpirioLabs wird StepAudio 3 ASR Max nach Verbrauch abgerechnet: Transkription $0.24 pro Stunde Audio. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet StepAudio 3 ASR Max?

StepAudio 3 ASR Max wird über POST /v1/audio/transcriptions auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich StepAudio 3 ASR Max im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt StepAudio 3 ASR Max im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen StepAudio 3 ASR Max API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.