Casa Blog

Como Usar a API StepAudio 3 ASR Max

StepAudio 3 ASR Max via API cover

Sep 15, 2026

EmpirioLabs AI

Resposta curta: StepAudio 3 ASR Max é o maior modelo de reconhecimento de fala do StepFun, disponível em EmpirioLabs através do endpoint padrão de transcrição. Publique um arquivo de áudio para PÓS-/v1/audio/transcriptions com modelo: "stepaudio-3-asr-max" E você recebe a transcrição de volta. Ela detecta a língua falada sozinha, então não há idioma para escolher.

Seu primeiro pedido

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -F "modelo=stepaudio-3-asr-max" \ -F "file=@meeting.mp3"

Você também pode enviar JSON com um file_url apontando para um arquivo acessível publicamente, ou áudio base64 em audio_base64.

Para que foi feito

Este é o nível de precisão da família de reconhecimento StepFun. Ele é construído sobre um grande modelo de linguagem, então usa contexto em vez de som apenas para resolver as partes que a transcrição comum erra:

  • Nomes de pessoas e lugares, nomes de medicamentos, termos técnicos e homófonos
  • Vocabulário especializado em áreas como jurídico, financeiro, médico, automotivo e software
  • Fala com sotaque, sussurros, fala muito rápida e frases em línguas mistas
  • Canto e discurso sobre música de fundo

Se você está transcrevendo fala limpa comum em volume, StepAudio 2.5 ASR é a opção mais barata da mesma família e compartilha esse endpoint.

Formatos de entrada

Enviar WAV, mp3, ogg, M4A, ou PCM. Necessidades brutas de PCM Codec, Taxa, bits, e Canal junto com ela; os formatos de contêiner carregam essas informações por si mesmos.

Formatação numérica

A normalização inversa do texto está ativada por padrão, então números falados, datas e moeda retornam escritos do jeito que uma pessoa digitaria. Desligue com enable_itn: falso para pegar as palavras literais em vez disso.

enable_itnTranscrição
Verdade (padrão)A receita aumentou 12% em todas as regiões no ano passado.
falsoA receita aumentou doze por cento em todas as regiões no ano passado.

Três coisas que pegam as pessoas de surpresa

  1. Não há configuração de idioma. O ASR Max identifica o idioma e transcreve nele. O áudio japonês retorna em japonês qualquer coisa que você passar, então não construa um seletor de idioma sobre esse modelo. Chinês, inglês, japonês, coreano, francês e espanhol são reconhecidos, com tudo fora do chinês e inglês em prévia.
  2. Palavras diretas e datas de data não estão disponíveis aqui. Ambos existem no StepAudio 2.5 ASR. Se você precisar de uma lista de vocabulário personalizada ou temporização por palavra, use esse modelo em vez disso.
  3. Arquivos longos são aceitos e faturados pelo seu tamanho real. O carregamento segue a duração medida do áudio que você envia, com um mínimo de um segundo, então vale a pena cortar o silêncio da frente e do verso da gravação.

Preços

A cobrança é por hora de áudio, pague conforme você utiliza, sem assinatura e sem compromisso mínimo. A tarifa ao vivo está no página do modelo e o página de preços.

Tente sem escrever código

Coloque um arquivo em StepAudio 3 ASR Max no playground e leia a transcrição diretamente. Referência completa do parâmetro: docs.empiriolabs.ai/models/stepaudio-3-asr-max.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.