Qwen Audio 3.1 ASR、Qwen Audio 3.1 ASRストリーム、Qwen Audio 3.1 ASRメッセージはEmpirioLabsで利用可能です。 ASRは録音された音声を文字起こしします。 ポスト/v1/audio/transcriptions.ASRストリームとASRメッセージはライブ音声を文字起こしします。 WSS://api.empiriolabs.ai/v1/realtime.これら3つともAPIとPlaygroundの両方で動作します。
3つのモデル
qwen-audio-3-1-asr短いクリップや長い録音を書き起こし、文のセグメントや単語のタイムスタンプを添えて書き起こしを返します。言語は自動的に検出され、中国の方言も含まれます。qwen-audio-3-1-asr-streamライブキャプション用に設計されています。話者が話している間に文を遠くに送り、間を挟むごとに定着文を送ります。qwen-audio-3-1-asr-message音声メッセージと音声入力のために設計されています。話者が一時停止すると、各発話を一つの完全な書き起こしとして返し、部分的な結果はありません。
録音の書き起こし
curl https://api.empiriolabs.ai/v1/audio/transcriptions \ -H 「認証:ベアラー $EMPIRIOLABS_API_KEY」 \ -F model=qwen-audio-3-1-asr \ -F file=@meeting.mp3
JSON ボディ audio_url または audio_base64 ファイルのアップロードの代わりに機能します。返答は仕事です:
{ "job_id": "3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10", "status": "processing", "poll_url": "/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10" }
仕事をアンケートして 状況 は 完了完了:
curl https://api.empiriolabs.ai/v1/jobs/3b5e1c2a-9f1d-4e7a-8c61-2d4f0a9b7e10 \ -H 「Authorization: Bearer $EMPIRIOLABS_API_KEY」
書き起こしが入っています result.text、文の区間は 結果。セグメント そして単語のタイムスタンプは result.words(結果単語).短いクリップは数秒で終わり、長い録音はもっと時間がかかります。
WebSocketを通じたライブ文字起こし
リアルタイムエンドポイントを開き、モデルをクエリ文字列に、APIキーをハンドシェイクで開いてください:
wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream Authorization: Bearer YOUR_EMPIRIOLABS_API_KEY
16kHz、16ビットモノラルPCM音声をbase64インチでストリーミング input_audio_buffer.append イベント。送信するコミットはなく、モデルは各文の終わりをその後に続く間から検出します。
{"type": "input_audio_buffer.append", "audio": "<base64 PCM>"}
議事録は以下の出来事として届きます:
- 部分的な結果。
conversation.item.input_audio_transcription.deltaここまで文を連れて行っている本文話し手が話している間に。ASRストリームのみ。 - 決まった結果だ。
conversation.item.input_audio_transcription.completedは、書き起こし.両モデルとも。
作戦メモ
- すべての文字起こしリクエストは、たとえ短いクリップであっても、ジョブを返してきます。 最初の応答は
求人情報、書き起こしじゃない。読んでみろresult.text出典出て/v1/jobs/<job_id>一度だけ状況は完了完了お問い合わせ. - ディスプレイ
本文各部分イベントから合流する代わりにデルタ価値観。 ASRストリームで、本文これまでのところ、常に文全体が「」なので、毎回表示された行を「」に置き換えることで、ライブキャプションが正しく表示されます。 - ASRメッセージはスピーカーが一時停止するまで沈黙します。 部分的な結果は送られず、話している間にイベントが届くことはありません。ライブ字幕にはASR Streamをご利用ください。
- 最後の言葉の後に静寂の時間を流しましょう。 話者が止まるのをモデルが聞くと文が落ち着きます。最後の言葉の後も短く音声を送信し続け、
完了完了ソケットを閉じる前にイベントを発生させるか、最後の文が失われる。
料金について
3つのモデルはいずれも、サブスクリプション不要で従量課金制です。それぞれトークンごとに料金が設定されており、音声入力と文字出力それぞれ1つずつのレートがあり、キャッシュされた入力層はありません。ASRは各リクエストごとに請求します。ASRストリームとASRメッセージは、完了した文や発話ごとに請求します。ライブモデルはASRよりも料金が高いため、話者が話している間に結果が不要な録音にはASRをご利用ください。現在の料金はモデルページに記載されています。 Qwen オーディオ 3.1 ASR, ASRストリーム および ASRメッセージ、および プライシングページお問い合わせ.
建設を始めろ
試してみて Qwen オーディオ 3.1 ASR 録音をアップロードしてPlaygroundに行ったり、 ASRストリーム および ASRメッセージ セッション開始をクリックして話すことで、各モデルのAPI参照は ASR, ASRストリーム および ASRメッセージ、そして全イベントテーブルは リアルタイム音声API ガイド。
同じ家族のボイスチャットについては、こちらをご覧ください Qwen3.8 Omni Flash RealtimeおよびQwen Audio 3.1の使い方お問い合わせ.
ディスクロージャー:この記事は、EmpirioLabs AIによるAIの支援とレビューで書かれました.



