Accueil Blog

Comment utiliser l’API ASR Max de StepAudio 3

StepAudio 3 ASR Max via une couverture API

Sep 15, 2026

EmpirioLabs AI

Réponse courte: StepAudio 3 ASR Max est le plus grand modèle de reconnaissance vocale de StepFun, disponible sur EmpirioLabs via le point de terminaison de transcription standard. Publiez un fichier audio à APRÈS /v1/audio/transcriptions avec Modèle: « stepaudio-3-asr-max » Et vous récupérez la transcription. Elle détecte la langue parlée toute seule, donc il n’y a pas de langue à choisir.

Votre première demande

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -F « modèle=stepaudio-3-asr-max » \ -F « file=@meeting.mp3 »

Vous pouvez aussi envoyer du JSON avec un file_url pointer vers un fichier accessible publiquement, ou un audio base64 dans audio_base64.

À quoi il est construit

C’est le niveau de précision de la famille de reconnaissance StepFun. Il est construit sur un grand modèle de langage, il utilise donc le contexte plutôt que le son seul pour résoudre les parties où la transcription ordinaire se trompe:

  • Noms de personnes et de lieux, noms de médicaments, termes techniques et homophones
  • Vocabulaire spécialisé dans des domaines tels que le juridique, la finance, le médical, l’automobile et le logiciel
  • Parole accentuée, chuchotements, discours très rapide, et phrases en langage mixte
  • Chant et discours sur musique de fond

Si vous transcrivez un discours ordinaire et clair à volume, StepAudio 2.5 ASR est l’option la moins chère dans la même famille et partage ce point final.

Formats d’entrée

Envoyer WAV, mp3, ogg, M4A, ou PCM. Besoins bruts en PCM Codec, Taux, bits, et Chaîne à côté de celui-ci; les formats conteneurs transportent eux-mêmes cette information.

Formatage numérique

La normalisation inverse du texte est activée par défaut, donc les chiffres parlés, les dates et la monnaie sont écrits comme une personne les taperait. Désactivez-le avec enable_itn: faux pour obtenir les mots littéraux à la place.

enable_itnTranscription
Vrai (par défaut)Le chiffre d’affaires a augmenté de 12 % dans toutes les régions l’année dernière.
fauxLes revenus ont augmenté de douze pour cent dans toutes les régions l’année dernière.

Trois choses qui prennent les gens par surprise

  1. Il n’y a pas de réglage linguistique. ASR Max identifie la langue elle-même et y transcrit. L’audio japonais revient en japonais quoi que vous passiez, donc ne construisez pas de sélecteur de langue par-dessus ce modèle. Le chinois, l’anglais, le japonais, le coréen, le français et l’espagnol sont reconnus, avec tout ce qui est en dehors du chinois et de l’anglais en aperçu.
  2. Les mots forts et les horodatages ne sont pas disponibles ici. Les deux existent sur StepAudio 2.5 ASR. Si vous avez besoin d’une liste de vocabulaire personnalisée ou d’un timing par mot, utilisez ce modèle à la place.
  3. Les dossiers longs sont acceptés et facturés selon leur longueur réelle. La charge suit la durée mesurée de l’audio que vous envoyez, avec un minimum d’une seconde, donc il vaut la peine de supprimer le silence à l’avant et à l’arrière d’un enregistrement.

Prix

La facturation est par heure d’audio, payez à l’usage, sans abonnement et sans engagement minimum. Le tarif en direct est indiqué sur le page modèle et les page de prix.

Essayez sans écrire de code

Déposer un fichier dans StepAudio 3 ASR Max dans le playground et relis la transcription tout de suite. Référence complète des paramètres: docs.empiriolabs.ai/models/stepaudio-3-asr-max.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.