Kurze Antwort: StepAudio 3 ASR Max ist das größte Spracherkennungsmodell von StepFun, das auf EmpirioLabs über den Standard-Transkriptionsendpunkt verfügbar ist. Posten Sie eine Audiodatei an POST /v1/audio/transcriptions mit Modell: "stepaudio-3-asr-max" Und du bekommst das Transkript zurück. Es erkennt die gesprochene Sprache von selbst, sodass es keine Sprache gibt, die man wählen kann.
Deine erste Bitte
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -F "model=stepaudio-3-asr-max" \ -F "file=@meeting.mp3"
Du kannst auch JSON mit einer file_url Zeigen auf eine öffentlich zugängliche Datei oder base64-Audio in audio_base64.
Wofür es gebaut ist
Dies ist die Genauigkeitsstufe der StepFun-Erkennungsfamilie. Sie basiert auf einem großen Sprachmodell und nutzt daher Kontext statt nur Klang, um die Teile zu lösen, die gewöhnliche Transkription falsch macht:
- Personen- und Ortsnamen, Arzneimittelnamen, technische Begriffe und Homophone
- Fachvokabular in Bereichen wie Recht, Finanzen, Medizin, Automobil und Software
- Akzentiertes Sprechen, Flüstern, sehr schnelle Sprache und Sätze mit unterschiedlichen Sprachen
- Gesang und Sprache über Hintergrundmusik
Wenn Sie gewöhnliche saubere Sprache in Lautstärke transkribieren, StepAudio 2.5 ASR ist die günstigere Option in derselben Familie und teilt diesen Endpunkt.
Eingangsformate
Senden WAV, mp3, ogg, M4A, oder PCM. Echte PCM-Bedürfnisse Codec, Zinssatz, Bits, und Kanal daneben; tragen die Containerformate diese Informationen selbst.
Zahlenformatierung
Inverse Textnormalisierung ist standardmäßig aktiviert, sodass gesprochene Zahlen, Daten und Währung so geschrieben werden, wie man sie tippen würde. Schalte es aus mit enable_itn: falsch um stattdessen die wörtlichen Worte zu bekommen.
enable_itn | Transkript |
|---|---|
Stimmt (Standard) | Der Umsatz stieg im vergangenen Jahr in allen Regionen um 12 %. |
falsch | Die Einnahmen stiegen im vergangenen Jahr in allen Regionen um zwölf Prozent. |
Drei Dinge, die Menschen erwischen,
- Es gibt keine Spracheinstellung. ASR Max identifiziert die Sprache selbst und transkribiert darin. Japanischer Ton kommt auf Japanisch zurück, egal was du passierst, also baue keinen Sprachselektor auf diesem Modell auf. Chinesisch, Englisch, Japanisch, Koreanisch, Französisch und Spanisch werden erkannt, wobei alles außerhalb von Chinesisch und Englisch in der Vorschau ist.
- Hotwords und Wortzeitstempel sind hier nicht verfügbar. Beide sind auf StepAudio 2.5 ASR verfügbar. Wenn du eine benutzerdefinierte Vokabelliste oder ein Timing pro Wort brauchst, nutze stattdessen dieses Modell.
- Lange Akten werden akzeptiert und nach ihrer tatsächlichen Länge abgerechnet. Das Laden folgt der gemessenen Dauer des gesendeten Audios, mit einer Mindeststunde von einer Sekunde, daher lohnt es sich, die Stille an der Vorder- und Rückseite einer Aufnahme zu kürzen.
Preisgestaltung
Die Abrechnung erfolgt pro Stunde Audio, Pay-as-you-go, ohne Abo und ohne Mindestverpflichtung. Der Live-Tarif ist auf dem modellblatt und die preisseite.
Probier es aus, ohne Code zu schreiben
Fügen Sie eine Datei in StepAudio 3 ASR Max im playground und lesen Sie das Transkript direkt nach. Vollständige Parameterreferenz: docs.empiriolabs.ai/models/stepaudio-3-asr-max.



