Qwen Audio 3.1 ASR Message API

음성 메시지와 음성 입력을 소켓을 통해 조율된 전사로, 화자가 멈추면 각 발화를 하나의 완전한 전사본으로 반환합니다.

Alibaba Cloud전사출시 2026년 9월 21일Singapore독점 엔드포인트신규

Qwen Audio 3.1 ASR Message 소개

음성 메시지와 음성 입력을 소켓을 통해 조율된 전사로, 화자가 멈추면 각 발화를 하나의 완전한 전사본으로 반환합니다.

소켓을 통해 16 kHz pcm16 오디오를 스트리밍하세요. 스피커가 일시정지할 때마다 각 발화는 원고로 반환됩니다.

다른 이름 Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message

transcriptionspeech to textrealtimemultilingual

Qwen Audio 3.1 ASR Message 사양

모델 ID
qwen-audio-3-1-asr-message
개발사
Alibaba Cloud
카테고리
전사
출시
2026년 9월 21일
입력
오디오
출력
텍스트
리전
Singapore
엔드포인트
WEBSOCKET/v1/realtime
대체 모델 ID
qwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-message

Qwen Audio 3.1 ASR Message API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
입력
1M 오디오 입력 토큰당
$1.86
제품정보
생성된 토큰 1M 단위
$1.40
전체 가격 페이지에서 비교

Qwen Audio 3.1 ASR Message API 호출 방법

Qwen Audio 3.1 ASR Message 은(는) HTTP 엔드포인트가 아니라 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message 의 WebSocket에서 실시간 오디오 스트림을 전사합니다. 모델 ID qwen-audio-3-1-asr-message 로 연결하고 핸드셰이크 시 EmpirioLabs API 키를 Authorization: Bearer 헤더로 보내세요. base64 16비트 PCM 오디오를 추가하면 말하는 도중에도 전사 이벤트를 받을 수 있습니다. 브라우저는 WebSocket에 헤더를 설정할 수 없으므로 이 연결은 서버에서 열고 오디오는 자체 소켓으로 브라우저에 중계하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Qwen Audio 3.1 ASR Message API 전체 레퍼런스

Qwen Audio 3.1 ASR Message API 파라미터

EmpirioLabs에서 Qwen Audio 3.1 ASR Message API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
input_audio_formatenumpcm16pcm16입력 버퍼에 추가하는 오디오 인코딩: base64 16비트 PCM, 모노, 16 kHz.

알아두면 좋은 점

연결 중 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message에서 WebSocket을 통한 음성 메시지 전사, 일반 인증 베어러 헤더로 인증됨. 오디오 전송 input_audio_buffer.append 포함된 16 kHz 모노 pcm16 오디오 스트림. 음성 활동 감지가 각 발화의 종료 지점을 결정하므로 전송할 커밋이 없습니다. 응답 결과 각 발화는 화자가 일시정지하면 하나의 conversation.item.input_audio_transcription.completed 이벤트로 전체적으로 도착합니다. 이 모델은 화자가 말하는 동안 부분적인 결과를 보내지 않습니다; 실시간 자막의 경우 qwen-audio-3-1-asr-stream을 사용하세요. 청구 입력 및 출력 토큰은 1M당 가격이 책정되며, 완료된 각 발화는 모델이 보고한 사용량에 따라 별도로 청구됩니다.

Qwen Audio 3.1 ASR Message API: 자주 묻는 질문

Qwen Audio 3.1 ASR Message API 비용은 얼마인가요?

EmpirioLabs에서 Qwen Audio 3.1 ASR Message은(는) 종량제로 청구됩니다: 입력 $1.86 1M 오디오 입력 토큰당; 제품정보 $1.40 생성된 토큰 1M 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

Qwen Audio 3.1 ASR Message은(는) 어떤 엔드포인트를 사용하나요?

Qwen Audio 3.1 ASR Message은(는) api.empiriolabs.ai의 WEBSOCKET /v1/realtime를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 Qwen Audio 3.1 ASR Message을(를) 사용해 볼 수 있나요?

EmpirioLabs 플레이그라운드 를 열고 Start session 을 누르면 브라우저에서 바로 사용해 볼 수 있습니다. Qwen Audio 3.1 ASR Message 은(는) 요청과 응답이 아니라 WebSocket으로 동작하므로 직접 연동할 때는 실시간 음성 퀵스타트 부터 시작하세요. EmpirioLabs API 키와 모델 ID qwen-audio-3-1-asr-message 로 서버에서 연결한 뒤 오디오를 양방향으로 스트리밍하면 됩니다.

Qwen Audio 3.1 ASR Message API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.