StepAudio 2.5 Realtime API

말하기 인(in), 나음(voice) 한 소켓 위에서 말하는 방식, 그리고 어조와 페이싱에 대한 준언어적 이해.

StepFun오디오 생성256K 컨텍스트출시 2026년 7월 16일International독점 엔드포인트신규

StepAudio 2.5 Realtime 소개

말하기 인(in), 나음(voice) 한 소켓 위에서 말하는 방식, 그리고 어조와 페이싱에 대한 준언어적 이해.

세션은 요청 매개변수 대신 소켓을 통한 session.update 이벤트로 구성됩니다.

다른 이름 StepAudio Realtime, StepFun StepAudio 2.5 Realtime

realtimespeech to speechaudio inaudio outvoice control

StepAudio 2.5 Realtime 사양

모델 ID
stepaudio-2-5-realtime
개발사
StepFun
카테고리
오디오 생성
출시
2026년 7월 16일
컨텍스트 창
256K 토큰
최대 출력
131,072 토큰
입력
오디오텍스트
출력
오디오텍스트
리전
International
엔드포인트
WEBSOCKET/v1/realtime
대체 모델 ID
stepaudio-2.5-realtimestepfun/stepaudio-2-5-realtime

StepAudio 2.5 Realtime API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
입력
1M 프롬프트 토큰당
$1.50
제품정보
생성된 토큰 1M 단위
$10.00
암묵적 캐시 읽기
1M 캐시된 입력 토큰당
$0.30
전체 가격 페이지에서 비교

StepAudio 2.5 Realtime API 호출 방법

StepAudio 2.5 Realtime 은(는) HTTP 엔드포인트가 아니라 wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime 의 WebSocket에서 실시간 대화를 진행합니다. 모델 ID stepaudio-2-5-realtime 로 연결하고 핸드셰이크 시 EmpirioLabs API 키를 Authorization: Bearer 헤더로 보내세요. 오디오는 base64 16비트 PCM으로 양방향 전송됩니다. 브라우저는 WebSocket에 헤더를 설정할 수 없으므로 이 연결은 서버에서 열고 오디오는 자체 소켓으로 브라우저에 중계하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
StepAudio 2.5 Realtime API 전체 레퍼런스

StepAudio 2.5 Realtime API 파라미터

EmpirioLabs에서 StepAudio 2.5 Realtime API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
voiceenumsoft-spoken-gentlemansoft-spoken-gentleman, magnetic-voiced-male, vibrant-youth, l...세션 보이스는 모델이 오디오를 생성하기 전에 session.update로 설정됩니다. 모델이 말을 마치면 변경할 수 없으며, 다른 값은 거부됩니다.
instructionsstring--세션 시스템 지침: 페르소나, 말하는 스타일, 그리고 경계.
modalitiesstring["text","audio"]-세션의 대응 방식.
volume_rationumber10.1 ~ 2음성 응답의 음량은 기본값에 비해 크게 나뉩니다. 수락 범위는 0.1에서 2.0입니다.
input_audio_formatenumpcm16pcm16당신이 보내는 오디오의 인코딩. 16비트 PCM.
output_audio_formatenumpcm16pcm16모델이 반환하는 오디오 인코딩. 16비트 PCM.
turn_detectionstring{"type":"server_vad"}-서버 측 음성 활동 감지. 사용자가 말을 멈췄을 때 모델을 결정하고 모델이 응답해야 합니다. 이 기능이 없으면 모델은 듣지만 응답하지 않으니, 운전 중에 input_audio_buffer.commit와 response.create로 스스로 돌지 않는 한 켜두세요.

알아두면 좋은 점

wss@api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-realtime에서 웹소켓을 통한 풀듀플렉스 음성, 일반 인증 베어러 헤더로 인증됨. 오디오는 pcm16 입력 및 출력 방식이다. 모델은 말하는 동안 듣기 때문에 응답 중간에 중단될 수 있으며, 서버 측 음성 활동 감지가 응답 시점을 결정한다. 첫 번째 오디오 전에 session.update로 음성 설정을 하라; 모델이 말한 후에는 변경할 수 없으며, 나열된 7개의 음성 중 하나만 허용된다. 대화는 중국어와 영어만 가능하다. 완료된 각 턴은 모델이 보고한 사용량에 따라 별도로 청구된다.

StepAudio 2.5 Realtime API: 자주 묻는 질문

StepAudio 2.5 Realtime API 비용은 얼마인가요?

EmpirioLabs에서 StepAudio 2.5 Realtime은(는) 종량제로 청구됩니다: 입력 $1.50 1M 프롬프트 토큰당; 제품정보 $10.00 생성된 토큰 1M 단위; 암묵적 캐시 읽기 $0.30 1M 캐시된 입력 토큰당. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

StepAudio 2.5 Realtime의 컨텍스트 윈도우는 얼마인가요?

StepAudio 2.5 Realtime은(는) 256K 토큰 컨텍스트 윈도우를 지원합니다 (응답당 최대 131,072 출력 토큰).

StepAudio 2.5 Realtime은(는) 어떤 엔드포인트를 사용하나요?

StepAudio 2.5 Realtime은(는) api.empiriolabs.ai의 WEBSOCKET /v1/realtime를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 StepAudio 2.5 Realtime을(를) 사용해 볼 수 있나요?

EmpirioLabs 플레이그라운드 를 열고 Start session 을 누르면 브라우저에서 바로 사용해 볼 수 있습니다. StepAudio 2.5 Realtime 은(는) 요청과 응답이 아니라 WebSocket으로 동작하므로 직접 연동할 때는 실시간 음성 퀵스타트 부터 시작하세요. EmpirioLabs API 키와 모델 ID stepaudio-2-5-realtime 로 서버에서 연결한 뒤 오디오를 양방향으로 스트리밍하면 됩니다.

StepAudio 2.5 Realtime API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.