StepAudio 3 ASR Max API

Transcription contextuelle pour les noms propres, les termes techniques, les dialectes et l’audio difficile incluant chuchotements, parole rapide et chant.

StepFunTranscriptionPublié 31 août 2026InternationalEndpoint propriétaireNouveau

À propos de StepAudio 3 ASR Max

Transcription contextuelle pour les noms propres, les termes techniques, les dialectes et l’audio difficile incluant chuchotements, parole rapide et chant.

EmpirioLabs expose le point de /v1/audio/transcriptions standard et retourne la transcription finale dans le format de réponse de transcription normal.

Aussi connu sous le nom StepFun StepAudio 3 ASR Max

transcriptionspeech to textmultilingual

Caractéristiques de StepAudio 3 ASR Max

ID du modèle
stepaudio-3-asr-max
Auteur
StepFun
Catégorie
Transcription
Publié
31 août 2026
Entrée
Audio
Sortie
Texte
Région
International
Endpoints
POST/v1/audio/transcriptions
Identifiants de modèle alternatifs
stepfun/stepaudio-3-asr-max

Tarifs de l'API StepAudio 3 ASR Max

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Transcription
par heure d’audio
$0.24
Comparer sur la page complète des tarifs

Comment appeler l'API StepAudio 3 ASR Max

StepAudio 3 ASR Max fonctionne via POST /v1/audio/transcriptions. La requête renvoie immédiatement un job_id ; interrogez GET /v1/jobs/{job_id} jusqu'à la fin du job et lisez les URLs de sortie dans le résultat. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL : envoyer le job
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-asr-max",
    "audio_url": "https://example.com/meeting-recording.mp3"
  }'
cURL : interroger le résultat
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/transcriptions",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-asr-max",
        "audio_url": "https://example.com/meeting-recording.mp3",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
Référence complète de l'API StepAudio 3 ASR Max

Paramètres de l'API StepAudio 3 ASR Max

Paramètres de requête pris en charge par l'API StepAudio 3 ASR Max sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
filestring--Téléchargement de fichier audio pour transcription.
file_urlstring--URL publique d’un fichier audio.
audio_base64string--Charge utile audio Base64 pour les requêtes JSON.
enable_itnbooleantrue-Activez la normalisation inverse du texte, qui écrit les chiffres, les dates et la monnaie sous leur forme écrite.
formatenumwavwav, mp3, ogg, m4a, pcmFormat conteneur audio.
codecstring--Codec PCM comme pcm_s16le.
ratenumber--Taux d’échantillonnage PCM en Hz.
bitsnumber--Profondeur de bits PCM.
channelnumber--Nombre de canaux PCM.

Bon à savoir

Prend en compte les entrées wav, mp3, ogg, m4a et pcm. Les requêtes PCM doivent inclure le codec, la fréquence d’échantillonnage, la profondeur de bits et le nombre de canaux. La langue est détectée automatiquement et ne peut pas être réglée; le chinois, l’anglais, le japonais, le coréen, le français et l’espagnol sont reconnus, avec d’autres langues que le chinois et l’anglais en aperçu. La normalisation inverse du texte est activée par défaut et peut être désactivée avec enable_itn. Les mots d’actualité et les horodatages des mots ne sont pas disponibles sur ce modèle. L’audio est facturé selon sa durée mesurée, avec un minimum d’une seconde.

API StepAudio 3 ASR Max : questions fréquentes

Combien coûte l'API StepAudio 3 ASR Max ?

Sur EmpirioLabs, StepAudio 3 ASR Max est facturé à l'usage : Transcription $0.24 par heure d’audio. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint StepAudio 3 ASR Max utilise-t-il ?

StepAudio 3 ASR Max est servi via POST /v1/audio/transcriptions sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer StepAudio 3 ASR Max dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute StepAudio 3 ASR Max dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API StepAudio 3 ASR Max ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.