StepFun은 중국어 및 영어 오디오 전사를 위한 스트리밍 음성 인식 모델입니다.
EmpirioLabs 표준 /v1/audio/transcriptions 엔드포인트를 노출하고 최종 전사본을 일반 전사 응답 형식으로 반환합니다.
다른 이름 StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asrEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
StepAudio 2.5 ASR은(는) POST /v1/audio/transcriptions로 실행됩니다. 요청은 즉시 job_id를 반환하며, 작업이 완료될 때까지 GET /v1/jobs/{job_id}을 폴링한 뒤 결과에서 출력 URL을 읽으세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs에서 StepAudio 2.5 ASR API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| file | audio | - | - | 오디오 파일 업로드 중 전사를 위한 것입니다. |
| file_url | string | - | - | 오디오 파일의 공개 URL. |
| audio_base64 | string | - | - | JSON 요청용 Base64 오디오 페이로드. |
| language | enum | en | en, zh | 인식 언어. |
| hotwords | array | - | - | 선택적 핫워드 목록. |
| enable_itn | boolean | true | - | 역텍스트 정규화를 활성화하세요. |
| enable_timestamp | boolean | false | - | StepFun SSE 이벤트에서 가능한 타임스탬프 필드를 반환하세요. |
| format | enum | wav | wav, mp3, ogg, pcm | 오디오 컨테이너 형식. |
| codec | string | - | - | pcm_s16le 같은 PCM 코덱. |
| rate | integer | 16000 | 8000 ~ 48000 | PCM 샘플링 속도는 Hz 단위입니다. |
| bits | integer | 16 | 8 ~ 32 | PCM 비트 깊이. |
| channel | integer | 1 | 1 ~ 8 | PCM 채널 수. |
wav, mp3, ogg, pcm 입력을 지원합니다. PCM 요청에는 코덱, 샘플 속도, 비트 깊이, 채널 수를 포함해야 합니다. 인식 언어는 중국어와 영어를 지원합니다. 타임스탬프 출력은 enable_timestamp를 통해 제공됩니다.
EmpirioLabs에서 StepAudio 2.5 ASR은(는) 종량제로 청구됩니다: 이름 * $0.022 오디오 시간당. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
StepAudio 2.5 ASR은(는) api.empiriolabs.ai의 POST /v1/audio/transcriptions를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 StepAudio 2.5 ASR을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.