Zuhause Blog

Wie man die StepAudio 3 ASR Max API verwendet

StepAudio 3 ASR Max über API-Abdeckung

Sep 15, 2026

EmpirioLabs AI

Kurze Antwort: StepAudio 3 ASR Max ist das größte Spracherkennungsmodell von StepFun, das auf EmpirioLabs über den Standard-Transkriptionsendpunkt verfügbar ist. Posten Sie eine Audiodatei an POST /v1/audio/transcriptions mit Modell: "stepaudio-3-asr-max" Und du bekommst das Transkript zurück. Es erkennt die gesprochene Sprache von selbst, sodass es keine Sprache gibt, die man wählen kann.

Deine erste Bitte

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -F "model=stepaudio-3-asr-max" \ -F "file=@meeting.mp3"

Du kannst auch JSON mit einer file_url Zeigen auf eine öffentlich zugängliche Datei oder base64-Audio in audio_base64.

Wofür es gebaut ist

Dies ist die Genauigkeitsstufe der StepFun-Erkennungsfamilie. Sie basiert auf einem großen Sprachmodell und nutzt daher Kontext statt nur Klang, um die Teile zu lösen, die gewöhnliche Transkription falsch macht:

  • Personen- und Ortsnamen, Arzneimittelnamen, technische Begriffe und Homophone
  • Fachvokabular in Bereichen wie Recht, Finanzen, Medizin, Automobil und Software
  • Akzentiertes Sprechen, Flüstern, sehr schnelle Sprache und Sätze mit unterschiedlichen Sprachen
  • Gesang und Sprache über Hintergrundmusik

Wenn Sie gewöhnliche saubere Sprache in Lautstärke transkribieren, StepAudio 2.5 ASR ist die günstigere Option in derselben Familie und teilt diesen Endpunkt.

Eingangsformate

Senden WAV, mp3, ogg, M4A, oder PCM. Echte PCM-Bedürfnisse Codec, Zinssatz, Bits, und Kanal daneben; tragen die Containerformate diese Informationen selbst.

Zahlenformatierung

Inverse Textnormalisierung ist standardmäßig aktiviert, sodass gesprochene Zahlen, Daten und Währung so geschrieben werden, wie man sie tippen würde. Schalte es aus mit enable_itn: falsch um stattdessen die wörtlichen Worte zu bekommen.

enable_itnTranskript
Stimmt (Standard)Der Umsatz stieg im vergangenen Jahr in allen Regionen um 12 %.
falschDie Einnahmen stiegen im vergangenen Jahr in allen Regionen um zwölf Prozent.

Drei Dinge, die Menschen erwischen,

  1. Es gibt keine Spracheinstellung. ASR Max identifiziert die Sprache selbst und transkribiert darin. Japanischer Ton kommt auf Japanisch zurück, egal was du passierst, also baue keinen Sprachselektor auf diesem Modell auf. Chinesisch, Englisch, Japanisch, Koreanisch, Französisch und Spanisch werden erkannt, wobei alles außerhalb von Chinesisch und Englisch in der Vorschau ist.
  2. Hotwords und Wortzeitstempel sind hier nicht verfügbar. Beide sind auf StepAudio 2.5 ASR verfügbar. Wenn du eine benutzerdefinierte Vokabelliste oder ein Timing pro Wort brauchst, nutze stattdessen dieses Modell.
  3. Lange Akten werden akzeptiert und nach ihrer tatsächlichen Länge abgerechnet. Das Laden folgt der gemessenen Dauer des gesendeten Audios, mit einer Mindeststunde von einer Sekunde, daher lohnt es sich, die Stille an der Vorder- und Rückseite einer Aufnahme zu kürzen.

Preisgestaltung

Die Abrechnung erfolgt pro Stunde Audio, Pay-as-you-go, ohne Abo und ohne Mindestverpflichtung. Der Live-Tarif ist auf dem modellblatt und die preisseite.

Probier es aus, ohne Code zu schreiben

Fügen Sie eine Datei in StepAudio 3 ASR Max im playground und lesen Sie das Transkript direkt nach. Vollständige Parameterreferenz: docs.empiriolabs.ai/models/stepaudio-3-asr-max.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.