
Modelo de reconocimiento de voz en streaming StepFun para transcripción de audio en chino e inglés.
Modelo de reconocimiento de voz en streaming StepFun para transcripción de audio en chino e inglés.
EmpirioLabs expone el punto final estándar de /v1/audio/transcriptions y devuelve la transcripción final en el formato normal de respuesta de transcripción.
También conocido como StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asrTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
StepAudio 2.5 ASR funciona a través de POST /v1/audio/transcriptions. La solicitud devuelve un job_id de inmediato; consulta GET /v1/jobs/{job_id} hasta que el trabajo termine y lee las URLs de salida del resultado. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Parámetros de solicitud compatibles con la API de StepAudio 2.5 ASR en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| file | audio | - | - | Carga de archivo de audio para transcripción. |
| file_url | string | - | - | URL pública de un archivo de audio. |
| audio_base64 | string | - | - | Carga útil de audio Base64 para solicitudes JSON. |
| language | enum | en | en, zh | Lenguaje de reconocimiento. |
| hotwords | array | - | - | Lista opcional de palabras calientes. |
| enable_itn | boolean | true | - | Activa la normalización inversa de texto. |
| enable_timestamp | boolean | false | - | Devuelve los campos de marca de tiempo de los eventos de StepFun SSE cuando estén disponibles. |
| format | enum | wav | wav, mp3, ogg, pcm | Formato contenedor de audio. |
| codec | string | - | - | Códec PCM como pcm_s16le. |
| rate | integer | 16000 | 8000 a 48000 | Frecuencia de muestreo PCM en Hz. |
| bits | integer | 16 | 8 a 32 | Profundidad de bits PCM. |
| channel | integer | 1 | 1 a 8 | Recuento de canales PCM. |
Soporta entrada wav, mp3, ogg y pcm. Las solicitudes PCM deben incluir códec, tasa de muestreo, profundidad de bits y recuento de canales. El idioma de reconocimiento admite chino e inglés. La salida con marca de tiempo está disponible a través de enable_timestamp.
En EmpirioLabs, StepAudio 2.5 ASR se factura por uso: Transcripción $0.022 por hora de audio. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
StepAudio 2.5 ASR se sirve a través de POST /v1/audio/transcriptions en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta StepAudio 2.5 ASR en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.