
소켓을 통한 실시간 전사, 화자가 말하는 동안 부분적인 단어를 스트리밍하고, 매 정지마다 정착된 문장을 토큰당 가격으로 제공합니다.
소켓을 통한 실시간 전사, 화자가 말하는 동안 부분적인 단어를 스트리밍하고, 매 정지마다 정착된 문장을 토큰당 가격으로 제공합니다.
소켓을 통해 16kHz pcm16 오디오를 스트리밍하세요. 스피커가 말하는 동안 부분적인 결과가 도착합니다.
다른 이름 Qwen Audio ASR Stream, Alibaba Cloud Qwen Audio 3.1 ASR Stream
qwen-audio-3-1-asr-stream/v1/realtimeqwen-audio-3.1-asr-streamalibaba/qwen-audio-3-1-asr-streamEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
Qwen Audio 3.1 ASR Stream 은(는) HTTP 엔드포인트가 아니라 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream 의 WebSocket에서 실시간 오디오 스트림을 전사합니다. 모델 ID qwen-audio-3-1-asr-stream 로 연결하고 핸드셰이크 시 EmpirioLabs API 키를 Authorization: Bearer 헤더로 보내세요. base64 16비트 PCM 오디오를 추가하면 말하는 도중에도 전사 이벤트를 받을 수 있습니다. 브라우저는 WebSocket에 헤더를 설정할 수 없으므로 이 연결은 서버에서 열고 오디오는 자체 소켓으로 브라우저에 중계하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())EmpirioLabs에서 Qwen Audio 3.1 ASR Stream API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | 입력 버퍼에 추가하는 오디오 인코딩: base64 16비트 PCM, 모노, 16 kHz. |
연결 중 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream에서 WebSocket을 통한 실시간 전사, 일반 Authorization Bearer 헤더로 인증됨. 오디오 전송 스트림 16 kHz 모노 pcm16 오디오와 input_audio_buffer.append. 음성 활동 감지가 각 문장의 끝을 결정하므로 커밋이 없습니다. 응답 결과 conversation.item.input_audio_transcription.delta 이벤트가 화자가 계속 말하는 동안 이미 문장을 전달하고, conversation.item.input_audio_transcription.completed 정식 문장을 각 정지마다 전달합니다. 청구 입력 및 출력 토큰은 1M당 가격이 책정되며, 완성된 각 문장은 모델이 보고하는 사용량에 따라 별도로 청구됩니다.
EmpirioLabs에서 Qwen Audio 3.1 ASR Stream은(는) 종량제로 청구됩니다: 입력 $1.86 1M 오디오 입력 토큰당; 제품정보 $1.40 생성된 토큰 1M 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
Qwen Audio 3.1 ASR Stream은(는) api.empiriolabs.ai의 WEBSOCKET /v1/realtime를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
EmpirioLabs 플레이그라운드 를 열고 Start session 을 누르면 브라우저에서 바로 사용해 볼 수 있습니다. Qwen Audio 3.1 ASR Stream 은(는) 요청과 응답이 아니라 WebSocket으로 동작하므로 직접 연동할 때는 실시간 음성 퀵스타트 부터 시작하세요. EmpirioLabs API 키와 모델 ID qwen-audio-3-1-asr-stream 로 서버에서 연결한 뒤 오디오를 양방향으로 스트리밍하면 됩니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.