StepAudio 3 ASR Max API

Transcripción contextual para nombres propios, términos técnicos, dialectos y audio difícil que incluye susurros, habla rápida y canto.

StepFunTranscripciónLanzado 31 ago 2026InternationalEndpoint propietarioNuevo

Acerca de StepAudio 3 ASR Max

Transcripción contextual para nombres propios, términos técnicos, dialectos y audio difícil que incluye susurros, habla rápida y canto.

EmpirioLabs expone el punto final estándar de /v1/audio/transcriptions y devuelve la transcripción final en el formato normal de respuesta de transcripción.

También conocido como StepFun StepAudio 3 ASR Max

transcriptionspeech to textmultilingual

Especificaciones de StepAudio 3 ASR Max

ID del modelo
stepaudio-3-asr-max
Autor
StepFun
Categoría
Transcripción
Lanzado
31 ago 2026
Entrada
Audio
Salida
Texto
Región
International
Endpoints
POST/v1/audio/transcriptions
IDs de modelo alternativos
stepfun/stepaudio-3-asr-max

Precios de la API de StepAudio 3 ASR Max

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Transcripción
por hora de audio
$0.24
Comparar en la página completa de precios

Cómo llamar a la API de StepAudio 3 ASR Max

StepAudio 3 ASR Max funciona a través de POST /v1/audio/transcriptions. La solicitud devuelve un job_id de inmediato; consulta GET /v1/jobs/{job_id} hasta que el trabajo termine y lee las URLs de salida del resultado. Consigue una clave de API en el panel de EmpirioLabs.

cURL: enviar el trabajo
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-asr-max",
    "audio_url": "https://example.com/meeting-recording.mp3"
  }'
cURL: consultar el resultado
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/transcriptions",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-asr-max",
        "audio_url": "https://example.com/meeting-recording.mp3",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
Referencia completa de la API de StepAudio 3 ASR Max

Parámetros de la API de StepAudio 3 ASR Max

Parámetros de solicitud compatibles con la API de StepAudio 3 ASR Max en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
filestring--Carga de archivo de audio para transcripción.
file_urlstring--URL pública de un archivo de audio.
audio_base64string--Carga útil de audio Base64 para solicitudes JSON.
enable_itnbooleantrue-Activa la normalización inversa de texto, que escribe números, fechas y moneda en su forma escrita.
formatenumwavwav, mp3, ogg, m4a, pcmFormato contenedor de audio.
codecstring--Códec PCM como pcm_s16le.
ratenumber--Frecuencia de muestreo PCM en Hz.
bitsnumber--Profundidad de bits PCM.
channelnumber--Recuento de canales PCM.

Información útil

Soporta entrada wav, mp3, ogg, m4a y pcm. Las peticiones PCM deben incluir códec, tasa de muestreo, profundidad de bits y recuento de canales. El idioma se detecta automáticamente y no puede configurarse; se reconocen chino, inglés, japonés, coreano, francés y español, con idiomas distintos al chino e inglés en vista previa. La normalización inversa de texto está activada por defecto y puede desactivarse con enable_itn. No hay palabras calientes ni marcas de tiempo de palabra disponibles en este modelo. El audio se factura por su duración medida, con un mínimo de un segundo.

API de StepAudio 3 ASR Max: preguntas frecuentes

¿Cuánto cuesta la API de StepAudio 3 ASR Max?

En EmpirioLabs, StepAudio 3 ASR Max se factura por uso: Transcripción $0.24 por hora de audio. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa StepAudio 3 ASR Max?

StepAudio 3 ASR Max se sirve a través de POST /v1/audio/transcriptions en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar StepAudio 3 ASR Max en el navegador antes de integrar?

Sí. El playground de EmpirioLabs ejecuta StepAudio 3 ASR Max en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.

¿Cómo consigo una clave de API de StepAudio 3 ASR Max?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.