소켓을 통한 실시간 전사, 화자가 말하는 동안 부분적인 결과를 반환하고, 음성 활동 감지로 각 문장을 표시합니다.
EmpirioLabs 표준 /v1/audio/transcriptions 엔드포인트를 노출하고 최종 전사본을 일반 전사 응답 형식으로 반환합니다.
다른 이름 StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream
stepaudio-2-5-asr-stream/v1/realtimestepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-streamEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
StepAudio 2.5 ASR Stream 은(는) HTTP 엔드포인트가 아니라 wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream 의 WebSocket에서 실시간 오디오 스트림을 전사합니다. 모델 ID stepaudio-2-5-asr-stream 로 연결하고 핸드셰이크 시 EmpirioLabs API 키를 Authorization: Bearer 헤더로 보내세요. base64 16비트 PCM 오디오를 추가하면 말하는 도중에도 전사 이벤트를 받을 수 있습니다. 브라우저는 WebSocket에 헤더를 설정할 수 없으므로 이 연결은 서버에서 열고 오디오는 자체 소켓으로 브라우저에 중계하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())EmpirioLabs에서 StepAudio 2.5 ASR Stream API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Encoding of the audio you append to the input buffer: base64 16-bit PCM. |
| language | string | - | - | Optional language hint. Omit to let the model detect it. |
wss@api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream에서 웹소켓을 통한 실시간 전사가 일반 Authorization Bearer 헤더로 인증됩니다. 16kHz pcm16 오디오를 input_audio_buffer.append와 함께 스트리밍하고, 스피커가 계속 말하는 동안 일부 결과를 읽어주며, 서버 측 음성 활동 감지로 각 문장이 끝나는 지점을 표시합니다. 라이브 자막과 음성 입력에 이 기능을 사용하세요; 완성된 녹음의 경우 POST /v1/audio/transcriptions가 한 통화에서 전체 대본을 반환합니다. 청구는 스트리밍하는 오디오 길이에 따라 결정되며, 세션이 종료될 때 정산됩니다.
EmpirioLabs에서 StepAudio 2.5 ASR Stream은(는) 종량제로 청구됩니다: 전사 $0.18 오디오 시간당. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
StepAudio 2.5 ASR Stream은(는) api.empiriolabs.ai의 WEBSOCKET /v1/realtime를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
StepAudio 2.5 ASR Stream 은(는) 요청과 응답이 아니라 WebSocket으로 동작하므로 실시간 음성 퀵스타트 부터 시작하세요. EmpirioLabs API 키와 모델 ID stepaudio-2-5-asr-stream 로 서버에서 연결한 뒤 오디오를 양방향으로 스트리밍하면 됩니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.