블로그

StepAudio 3 ASR Max API 사용 방법

StepAudio 3 ASR Max API 커버를 통해

Sep 15, 2026

EmpirioLabs AI

간단한 답변: 스텝오디오 3 ASR 맥스 StepFun에서 가장 큰 음성 인식 모델로, 표준 전사 엔드포인트를 통해 EmpirioLabs 제공됩니다. 오디오 파일을 게시하기 /v1/audio/transcriptions 이후 이름 * 모델: "stepaudio-3-asr-max" 그리고 대본을 다시 받게 됩니다. 스스로 구어체를 감지하기 때문에 선택할 언어가 없습니다.

당신의 첫 번째 요청

curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "인증: 베어러 $EMPIRIOLABS_API_KEY" \ -f "model=stepaudio-3-asr-max" \ -F "file=@meeting.mp3"

또한 JSON과 함께 보낼 수도 있습니다 file_url 공개적으로 접근 가능한 파일을 가리키거나, base64 오디오 audio_base64·.

이 엔진이 만들어진 목적은 무엇인가요

이것이 StepFun 인식 계열 중 정확도 단계입니다. 이 모듈은 대규모 언어 모델 위에 구축되어 있어, 일반적인 전사가 잘못 나오는 부분을 소리만이 아니라 맥락을 사용해 해결합니다:

  • 인명 및 지명, 약명, 전문 용어, 동음이의어
  • 법률, 금융, 의료, 자동차, 소프트웨어 등 다양한 분야의 전문 용어를 보유하고 있습니다
  • 억양이 있는 말투, 속삭임, 매우 빠른 말투, 그리고 혼합된 언어 문장
  • 배경 음악 위에서 노래와 대사

평범한 깨끗한 말을 볼륨으로 옮기고 있다면, 스텝오디오 2.5 ASR 같은 계열 내에서 더 저렴한 옵션이며 이 엔드포인트를 공유합니다.

입력 형식

지원하다 와브·, MP3·, OGG·, M4a, 또는 PCM. 원시 PCM 필요 코덱·, 요금·, 조각들, 그리고 채널 이와 함께; 컨테이너 형식들도 그 정보를 담고 있습니다.

번호 형식

역텍스트 정규화는 기본적으로 켜져 있어서, 말한 숫자, 날짜, 통화가 사람이 타이핑하는 방식으로 작성되어 돌아옵니다. 다음으로 끄세요 enable_itn: 거짓 대신 문자 그대로의 단어를 얻기 위해서였다.

enable_itn대본
맞아요 (기본값)지난해 모든 지역에서 매출이 12% 증가했습니다.
거짓지난해 모든 지역에서 매출이 12% 증가했습니다.

사람들을 잡아내는 세 가지 이유

  1. 언어 설정은 없습니다. ASR Max는 언어 자체를 식별하고 그 언어로 전사합니다. 일본어 오디오는 통과하면 일본어로 돌아오므로, 이 모델 위에 언어 선택기를 만들지 마세요. 중국어, 영어, 일본어, 한국어, 프랑스어, 스페인어가 인식되며, 중국어와 영어 외의 모든 언어는 미리보기로 제공됩니다.
  2. 핫워드와 단어 타임스탬프는 여기서 제공되지 않습니다. 두 가지 모두 StepAudio 2.5 ASR에 있습니다. 맞춤 어휘 목록이나 단어별 타이밍이 필요하다면 그 모델을 사용하세요.
  3. 긴 파일은 실제 길이로 청구됩니다. 충전은 보내는 오디오의 측정된 지속 시간에 따라 진행되며, 최소 1초가 걸리므로, 녹음 앞뒤의 무음을 줄이는 것이 좋습니다.

제품정보

요금은 오디오 시간당 요금제이며, 구독료나 최소 약정 없이 사용당 지불합니다. 라이브 요금은 모델 페이지 그리고 가격표·.

코드를 작성하지 않고 시도해 보세요

파일을 넣으세요 playground에서 StepAudio 3 ASR 맥스 그리고 바로 다시 읽어보세요. 전체 매개변수 참고: docs.empiriolabs.ai/models/stepaudio-3-asr-max·.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.