Qwen Audio 3.1 ASR Message API

音声メッセージと音声入力に合わせて調整された文字起こしで、話者が一時停止すると各発話を一つの完全な書き起こしとして返します。

Alibaba Cloud転写リリース 2026年9月21日Singapore独自エンドポイント新着

Qwen Audio 3.1 ASR Message について

音声メッセージと音声入力に合わせて調整された文字起こしで、話者が一時停止すると各発話を一つの完全な書き起こしとして返します。

ソケットを通じて16 kHzのpcm16音声をストリーミングします。スピーカーが一時停止すると、各発言はそのまま返されます。

別名 Qwen Audio ASR Message, Alibaba Cloud Qwen Audio 3.1 ASR Message

transcriptionspeech to textrealtimemultilingual

Qwen Audio 3.1 ASR Message の仕様

モデルID
qwen-audio-3-1-asr-message
開発元
Alibaba Cloud
カテゴリ
転写
リリース
2026年9月21日
入力
音声
出力
テキスト
リージョン
Singapore
エンドポイント
WEBSOCKET/v1/realtime
代替モデルID
qwen-audio-3.1-asr-messagealibaba/qwen-audio-3-1-asr-message

Qwen Audio 3.1 ASR Message API の料金

EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。

タイプ
仕様
料金
入力
1Mのオーディオ入力トークンあたり
$1.86
ソリューション
生成された1Mトークンあたり
$1.40
料金ページ全体で比較

Qwen Audio 3.1 ASR Message API の呼び出し方

Qwen Audio 3.1 ASR Message は HTTP エンドポイントではなく、wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message の WebSocket 上でライブ音声ストリームを文字起こしします。モデル ID qwen-audio-3-1-asr-message で接続し、ハンドシェイク時に EmpirioLabs の API キーを Authorization: Bearer ヘッダーとして送信してください。base64 の 16 ビット PCM 音声を追加すると、話している最中から文字起こしイベントを受け取れます。 ブラウザは WebSocket にヘッダーを設定できないため、この接続はサーバーから開き、音声は自前のソケットでブラウザへ中継してください。 EmpirioLabs ダッシュボードで API キーを取得してください。

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-message",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        import base64

        # 16-bit PCM microphone audio, base64 encoded, in small chunks.
        for chunk in read_microphone_chunks():
            await ws.send(json.dumps({
                "type": "input_audio_buffer.append",
                "audio": base64.b64encode(chunk).decode(),
            }))

        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"].endswith("input_audio_transcription.delta"):
                # "text" is settled transcript; "stash" is still in progress.
                if event.get("text"):
                    print(event["text"], end="", flush=True)

asyncio.run(main())
Qwen Audio 3.1 ASR Message API の完全リファレンス

Qwen Audio 3.1 ASR Message API のパラメーター

EmpirioLabs 上の Qwen Audio 3.1 ASR Message API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。

パラメータタイプデフォルト範囲 / 値説明
input_audio_formatenumpcm16pcm16入力バッファに追加するオーディオのエンコード:base64 16ビットPCM、モノラル、16kHz。

知っておくと便利

接続 wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-messageのWebSocketを経由した音声メッセージの文字起こし、通常のAuthorization Bearerヘッダーで認証されます。音声を送信 input_audio_buffer.append付きで16kHzのモノラルPCM16オーディオをストリーミング。音声活動検出が各発話の終了地点を決定するため、送信すべきコミットはありません。返ってくるもの 各発言は話者が一時停止すると一つのイベントとして一つconversation.item.input_audio_transcription.completedとして一括で届きます。このモデルは話者が話している間は部分的な結果を送信しません。ライブキャプションの場合はqwen-audio-3-1-asr-streamを用いてください。請求 入力トークンと出力トークンは1M単位で価格が設定され、完了した発言ごとにモデルが報告する使用量から個別に請求されます。

Qwen Audio 3.1 ASR Message API: よくある質問

Qwen Audio 3.1 ASR Message API の料金はいくらですか?

EmpirioLabs では Qwen Audio 3.1 ASR Message は従量課金です: 入力 $1.86 1Mのオーディオ入力トークンあたり; ソリューション $1.40 生成された1Mトークンあたり。このページのライブ料金表は常に API の請求額と一致します。

Qwen Audio 3.1 ASR Message はどのエンドポイントを使いますか?

Qwen Audio 3.1 ASR Message は api.empiriolabs.ai 上の WEBSOCKET /v1/realtime で提供され、標準的な Bearer トークン認証を使用します。

統合する前にブラウザで Qwen Audio 3.1 ASR Message を試せますか?

EmpirioLabs プレイグラウンド を開き、Start session を押すとブラウザーで試せます。Qwen Audio 3.1 ASR Message はリクエストとレスポンスではなく WebSocket 上で動作するため、組み込むときは リアルタイム音声クイックスタート から始めてください。EmpirioLabs の API キーとモデル ID qwen-audio-3-1-asr-message を使ってサーバーから接続し、音声を双方向にストリーミングします。

Qwen Audio 3.1 ASR Message の API キーはどうやって取得しますか?

EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。

より良いエンドポイントを使う準備はできていますか?

ご自身のモデルを当社のスタックに展開したい方は、ぜひご価格をご覧ください。