Qwen 오디오 3.1 ASR, Qwen 오디오 3.1 ASR 스트림, Qwen 오디오 3.1 ASR 메시지가 EmpirioLabs에서 이용 가능합니다. ASR은 녹음된 오디오를 전사합니다. /v1/audio/transcriptions 이후. ASR 스트림 및 ASR 메시지 실시간 오디오 전사 WSS://api.empiriolabs.ai/v1/realtime. 세 가지 모두 API와 Playground에서 작동합니다.
세 가지 모델
qwen-audio-3-1-asr짧은 클립과 긴 녹음을 전사하고, 문장 구간과 단어 타임스탬프를 첨부하여 전사본을 반환합니다. 언어는 중국어 방언을 포함해 자동으로 감지됩니다.qwen-audio-3-1-asr-stream실시간 자막을 위해 만들어졌습니다. 화자가 말하는 동안 문장을 멀리 보내고, 멈출 때마다 확정된 문장을 보냅니다.qwen-audio-3-1-asr-message음성 메시지와 음성 입력을 위해 설계되었습니다. 화자가 잠시 멈추면 각 발화를 하나의 완전한 전사로 반환하며, 부분적인 결과는 없습니다.
녹음 필사
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H "인증: 베어러 $EMPIRIOLABS_API_KEY" \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3
JSON 몸체가 audio_url 또는 audio_base64 파일 업로드 대신 작동합니다. 답변은 다음과 같습니다:
{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "status": "processing", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }
일자리를 설문조사해 현황 이야. 지원하다::
curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -h "인증: 베어러 $EMPIRIOLABS_API_KEY"
대본이 나왔어요 결과.텍스트, 문장 구간은 다음과 같다 결과.세그먼트 그리고 단어 타임스탬프는 result.words. 짧은 클립은 몇 초 만에 끝나고; 긴 녹화는 더 오래 걸립니다.
WebSocket을 통한 실시간 전사
실시간 엔드포인트를 열고, 모델을 쿼리 스트링에 넣고 API 키를 핸드셰이크에 입력하세요:
wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream 권한: 베어러 YOUR_EMPIRIOLABS_API_KEY
16 kHz, 16비트 모노 PCM 오디오를 base64 인치로 스트리밍하세요 input_audio_buffer.append 이벤트를 수행합니다. 커밋을 보내는 것은 없습니다: 모델은 각 문장이 끝나는 지점을 그 뒤에 이어지는 일시정지에서 감지합니다.
{"type": "input_audio_buffer.append", "audio": "<base64 PCM>"}
대본은 다음과 같은 사건으로 도착합니다:
- 부분 결과.
conversation.item.input_audio_transcription.delta이 문장은 지금까지 이어집니다본문화자가 계속 말하는 동안에. ASR 스트림만. - 확정된 결과.
conversation.item.input_audio_transcription.completed완성된 문장 또는 발화를 다음과 같이 운반한다.대본. 두 모델 모두 그렇습니다.
운용 노트
- 모든 전사 요청은 짧은 클립조차도 일자리를 반환합니다. 첫 번째 응답은 다음과 같이
작업 id, 녹취록이 아니라. 읽어봐결과.텍스트출처빨리 /v1/jobs/<job_id>한 번현황이야.지원하다·. - 전시
본문각 부분 사건에서 합류하는 대신델타가치관. ASR 스트림에서,본문지금까지 항상 문장 전체가 이 문장을 차지하기 때문에, 매번 이벤트에서 표시된 줄을 이 문장으로 교체하면 실시간 캡션이 정확해집니다. - ASR 메시지는 스피커가 잠시 멈출 때까지 무음입니다. 부분적인 결과는 보내지 않아서 누군가 말하는 동안 이벤트가 발생하지 않습니다. 실시간 자막은 ASR Stream을 사용하세요.
- 마지막 말 후에 잠시 침묵을 흘리세요. 모델이 화자가 멈추는 소리를 들으면 문장이 안정됩니다. 마지막 단어 이후에도 잠시 오디오를 계속 보내고
지원하다소켓을 닫기 전에 이벤트를 발생시키거나, 마지막 문장이 사라집니다.
제품정보
세 가지 모델 모두 구독이 필요 없는 사용량 기반 요금입니다. 각 모델은 토큰 단위로 요금이 책정되며, 오디오 입력과 전사 출력에 각각 요금이 적용되며, 캐시 입력 계층은 없습니다. ASR은 각 요청마다 요금을 청구합니다; ASR 스트림과 ASR 메시지는 완성된 문장이나 발화마다 요금을 청구합니다. 라이브 모델은 ASR보다 요금이 높으므로, 화자가 말하는 동안 결과가 필요 없는 녹음에는 ASR을 사용하세요. 현재 요금은 모델 페이지에 있습니다. Qwen 오디오 3.1 ASR·, ASR 스트림 그리고 ASR 메시지, 그리고 가격표·.
건설 시작
시도해 봐 Qwen 오디오 3.1 ASR Playground 녹화된 영상을 업로드하거나 ASR 스트림 그리고 ASR 메시지 세션 시작을 클릭하고 말하는 방식으로 말합니다. 각 모델의 API 참조는 ASR·, ASR 스트림 그리고 ASR 메시지, 전체 이벤트 테이블은 실시간 음성 API 가이드.
같은 가족의 음성 대화에 대해서는 다음을 참조하세요 Qwen3.8 옴니 플래시 실시간 및 Qwen 오디오 3.1 사용 방법·.
공개: 이 문서는 AI 지원으로 작성되었으며 EmpirioLabs AI에 의해 검토되었습니다.



