
Transcription contextuelle pour les noms propres, les termes techniques, les dialectes et l’audio difficile incluant chuchotements, parole rapide et chant.
Transcription contextuelle pour les noms propres, les termes techniques, les dialectes et l’audio difficile incluant chuchotements, parole rapide et chant.
EmpirioLabs expose le point de /v1/audio/transcriptions standard et retourne la transcription finale dans le format de réponse de transcription normal.
Aussi connu sous le nom StepFun StepAudio 3 ASR Max
stepaudio-3-asr-max/v1/audio/transcriptionsstepfun/stepaudio-3-asr-maxTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
StepAudio 3 ASR Max fonctionne via POST /v1/audio/transcriptions. La requête renvoie immédiatement un job_id ; interrogez GET /v1/jobs/{job_id} jusqu'à la fin du job et lisez les URLs de sortie dans le résultat. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Paramètres de requête pris en charge par l'API StepAudio 3 ASR Max sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| file | string | - | - | Téléchargement de fichier audio pour transcription. |
| file_url | string | - | - | URL publique d’un fichier audio. |
| audio_base64 | string | - | - | Charge utile audio Base64 pour les requêtes JSON. |
| enable_itn | boolean | true | - | Activez la normalisation inverse du texte, qui écrit les chiffres, les dates et la monnaie sous leur forme écrite. |
| format | enum | wav | wav, mp3, ogg, m4a, pcm | Format conteneur audio. |
| codec | string | - | - | Codec PCM comme pcm_s16le. |
| rate | number | - | - | Taux d’échantillonnage PCM en Hz. |
| bits | number | - | - | Profondeur de bits PCM. |
| channel | number | - | - | Nombre de canaux PCM. |
Prend en compte les entrées wav, mp3, ogg, m4a et pcm. Les requêtes PCM doivent inclure le codec, la fréquence d’échantillonnage, la profondeur de bits et le nombre de canaux. La langue est détectée automatiquement et ne peut pas être réglée; le chinois, l’anglais, le japonais, le coréen, le français et l’espagnol sont reconnus, avec d’autres langues que le chinois et l’anglais en aperçu. La normalisation inverse du texte est activée par défaut et peut être désactivée avec enable_itn. Les mots d’actualité et les horodatages des mots ne sont pas disponibles sur ce modèle. L’audio est facturé selon sa durée mesurée, avec un minimum d’une seconde.
Sur EmpirioLabs, StepAudio 3 ASR Max est facturé à l'usage : Transcription $0.24 par heure d’audio. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
StepAudio 3 ASR Max est servi via POST /v1/audio/transcriptions sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute StepAudio 3 ASR Max dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.