Inicio Blog

Cómo usar la API ASR Max de StepAudio 3

StepAudio 3 ASR Max mediante cubierta API

Sep 15, 2026

EmpirioLabs AI

Respuesta corta: StepAudio 3 ASR Max es el mayor modelo de reconocimiento de voz de StepFun, disponible en EmpirioLabs a través del endpoint estándar de transcripción. Enviar un archivo de audio a DESPUÉS /v1/audio/transcriptions con modelo: "stepaudio-3-asr-max" Y recibes la transcripción de vuelta. Detecta el idioma hablado por sí solo, así que no hay un idioma que elegir.

Tu primera petición

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -F "modelo=stepaudio-3-asr-max" \ -F "file=@meeting.mp3"

También puedes enviar JSON con un file_url apuntando a un archivo accesible públicamente, o a Base64 Audio en audio_base64.

Para qué está construido

Este es el nivel de precisión de la familia de reconocimiento StepFun. Está construido sobre un modelo de lenguaje grande, por lo que utiliza el contexto en lugar del sonido solo para resolver las partes en las que la transcripción ordinaria falla:

  • Nombres de personas y lugares, nombres de medicamentos, términos técnicos y homófonos
  • Vocabulario especializado en ámbitos como jurídico, finanzas, médico, automoción y software
  • Habla con acento, susurros, habla muy rápida y frases en lenguas mixtas
  • Canto y discurso sobre música de fondo

Si transcribes un habla limpia ordinaria a volumen, StepAudio 2.5 ASR es la opción más barata de la misma familia y comparte este punto final.

Formatos de entrada

Enviar WAW, mp3, Ogg, M4A, o PCM. Necesidades de PCM en bruto Códec, Índice, bits, y Canal junto a ella; los formatos de contenedor llevan esa información por sí mismos.

Formato numérico

La normalización inversa del texto está activada por defecto, así que los números hablados, fechas y moneda aparecen escritos como lo haría una persona. Desactivarlo con enable_itn: falso para que consigan las palabras literales en su lugar.

enable_itnTranscripción
Cierto (por defecto)Los ingresos aumentaron un 12% en todas las regiones el año pasado.
falsoLos ingresos aumentaron un doce por ciento en todas las regiones el año pasado.

Tres cosas que pillan a la gente desprevenida

  1. No hay configuración de idioma. ASR Max identifica el idioma y transcribe en él. El audio japonés vuelve al japonés pase lo que pase, así que no construyas un selector de idioma sobre este modelo. Se reconocen chino, inglés, japonés, coreano, francés y español, con todo lo que no sea chino e inglés en vista previa.
  2. Aquí no están disponibles las palabras calientes ni las marcas de tiempo de las palabras. Ambos existen en StepAudio 2.5 ASR. Si necesitas una lista de vocabulario personalizada o un tiempo por palabra, usa ese modelo en su lugar.
  3. Se aceptan archivos largos y se facturan según su longitud real. La carga sigue la duración medida del audio que envías, con un mínimo de un segundo, así que compensar el silencio de la parte frontal y trasera de una grabación merece la pena.

Precios

La facturación es por hora de audio, paga según la marcha, sin suscripción y sin compromiso mínimo. La tarifa en directo está en el página modelo y el página de precios.

Pruébalo sin escribir código

Suelta un archivo en StepAudio 3 ASR Max en el playground y lee la transcripción de vuelta directamente. Referencia completa de parámetros: docs.empiriolabs.ai/models/stepaudio-3-asr-max.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.