
Modèle de reconnaissance vocale en streaming StepFun pour la transcription audio chinoise et anglaise.
Modèle de reconnaissance vocale en streaming StepFun pour la transcription audio chinoise et anglaise.
EmpirioLabs expose le point de /v1/audio/transcriptions standard et retourne la transcription finale dans le format de réponse de transcription normal.
Aussi connu sous le nom StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asrTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
StepAudio 2.5 ASR fonctionne via POST /v1/audio/transcriptions. La requête renvoie immédiatement un job_id ; interrogez GET /v1/jobs/{job_id} jusqu'à la fin du job et lisez les URLs de sortie dans le résultat. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Paramètres de requête pris en charge par l'API StepAudio 2.5 ASR sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| file | audio | - | - | Téléchargement de fichier audio pour transcription. |
| file_url | string | - | - | URL publique d’un fichier audio. |
| audio_base64 | string | - | - | Charge utile audio Base64 pour les requêtes JSON. |
| language | enum | en | en, zh | Langage de reconnaissance. |
| hotwords | array | - | - | Liste optionnelle de mots hotword. |
| enable_itn | boolean | true | - | Activez la normalisation inverse du texte. |
| enable_timestamp | boolean | false | - | Retournez les champs d’horodatage des événements StepFun SSE lorsque disponibles. |
| format | enum | wav | wav, mp3, ogg, pcm | Format conteneur audio. |
| codec | string | - | - | Codec PCM comme pcm_s16le. |
| rate | integer | 16000 | 8000 à 48000 | Taux d’échantillonnage PCM en Hz. |
| bits | integer | 16 | 8 à 32 | Profondeur de bits PCM. |
| channel | integer | 1 | 1 à 8 | Nombre de canaux PCM. |
Prend en charge, les entrées wav, mp3, ogg et pcm. Les requêtes PCM doivent inclure le codec, la fréquence d’échantillonnage, la profondeur de bits et le nombre de canaux. Le langage de reconnaissance prend en charge le chinois et l’anglais. La sortie horodatage est disponible via enable_timestamp.
Sur EmpirioLabs, StepAudio 2.5 ASR est facturé à l'usage : Transcription $0.022 par heure d’audio. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
StepAudio 2.5 ASR est servi via POST /v1/audio/transcriptions sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute StepAudio 2.5 ASR dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.