StepAudio 2.5 ASR Stream API

소켓을 통한 실시간 전사, 화자가 말하는 동안 부분적인 결과를 반환하고, 음성 활동 감지로 각 문장을 표시합니다.

StepFun전사출시 2026년 7월 16일International독점 엔드포인트신규

StepAudio 2.5 ASR Stream 소개

소켓을 통한 실시간 전사, 화자가 말하는 동안 부분적인 결과를 반환하고, 음성 활동 감지로 각 문장을 표시합니다.

EmpirioLabs 표준 /v1/audio/transcriptions 엔드포인트를 노출하고 최종 전사본을 일반 전사 응답 형식으로 반환합니다.

다른 이름 StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream

transcriptionspeech to textrealtimestreaming asr

StepAudio 2.5 ASR Stream 사양

모델 ID
stepaudio-2-5-asr-stream
개발사
StepFun
카테고리
전사
출시
2026년 7월 16일
입력
오디오
출력
텍스트
리전
International
엔드포인트
WEBSOCKET/v1/realtime
대체 모델 ID
stepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-stream

StepAudio 2.5 ASR Stream API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
전사
오디오 시간당
$0.18
전체 가격 페이지에서 비교

StepAudio 2.5 ASR Stream API 호출 방법

StepAudio 2.5 ASR Stream 은(는) HTTP 엔드포인트가 아니라 wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream 의 WebSocket에서 실시간 오디오 스트림을 전사합니다. 모델 ID stepaudio-2-5-asr-stream 로 연결하고 핸드셰이크 시 EmpirioLabs API 키를 Authorization: Bearer 헤더로 보내세요. base64 16비트 PCM 오디오를 추가하면 말하는 도중에도 전사 이벤트를 받을 수 있습니다. 브라우저는 WebSocket에 헤더를 설정할 수 없으므로 이 연결은 서버에서 열고 오디오는 자체 소켓으로 브라우저에 중계하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
StepAudio 2.5 ASR Stream API 전체 레퍼런스

StepAudio 2.5 ASR Stream API 파라미터

EmpirioLabs에서 StepAudio 2.5 ASR Stream API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
input_audio_formatenumpcm16pcm16Encoding of the audio you append to the input buffer: base64 16-bit PCM.
languagestring--Optional language hint. Omit to let the model detect it.

알아두면 좋은 점

wss@api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream에서 웹소켓을 통한 실시간 전사가 일반 Authorization Bearer 헤더로 인증됩니다. 16kHz pcm16 오디오를 input_audio_buffer.append와 함께 스트리밍하고, 스피커가 계속 말하는 동안 일부 결과를 읽어주며, 서버 측 음성 활동 감지로 각 문장이 끝나는 지점을 표시합니다. 라이브 자막과 음성 입력에 이 기능을 사용하세요; 완성된 녹음의 경우 POST /v1/audio/transcriptions가 한 통화에서 전체 대본을 반환합니다. 청구는 스트리밍하는 오디오 길이에 따라 결정되며, 세션이 종료될 때 정산됩니다.

StepAudio 2.5 ASR Stream API: 자주 묻는 질문

StepAudio 2.5 ASR Stream API 비용은 얼마인가요?

EmpirioLabs에서 StepAudio 2.5 ASR Stream은(는) 종량제로 청구됩니다: 전사 $0.18 오디오 시간당. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

StepAudio 2.5 ASR Stream은(는) 어떤 엔드포인트를 사용하나요?

StepAudio 2.5 ASR Stream은(는) api.empiriolabs.aiWEBSOCKET /v1/realtime를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 StepAudio 2.5 ASR Stream을(를) 사용해 볼 수 있나요?

StepAudio 2.5 ASR Stream 은(는) 요청과 응답이 아니라 WebSocket으로 동작하므로 실시간 음성 퀵스타트 부터 시작하세요. EmpirioLabs API 키와 모델 ID stepaudio-2-5-asr-stream 로 서버에서 연결한 뒤 오디오를 양방향으로 스트리밍하면 됩니다.

StepAudio 2.5 ASR Stream API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.