
ソケットでのライブ文字起こし、スピーカーが話す間に部分的な単語をストリーミングし、各間ごとに安定した文をストリーミングし、トークンごとに料金がかかります。
ソケットでのライブ文字起こし、スピーカーが話す間に部分的な単語をストリーミングし、各間ごとに安定した文をストリーミングし、トークンごとに料金がかかります。
ソケット経由で16kHzのPCM16オーディオをストリーミングします。スピーカーが話している間に部分的な結果が届きます。
別名 Qwen Audio ASR Stream, Alibaba Cloud Qwen Audio 3.1 ASR Stream
qwen-audio-3-1-asr-stream/v1/realtimeqwen-audio-3.1-asr-streamalibaba/qwen-audio-3-1-asr-streamEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
Qwen Audio 3.1 ASR Stream は HTTP エンドポイントではなく、wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream の WebSocket 上でライブ音声ストリームを文字起こしします。モデル ID qwen-audio-3-1-asr-stream で接続し、ハンドシェイク時に EmpirioLabs の API キーを Authorization: Bearer ヘッダーとして送信してください。base64 の 16 ビット PCM 音声を追加すると、話している最中から文字起こしイベントを受け取れます。 ブラウザは WebSocket にヘッダーを設定できないため、この接続はサーバーから開き、音声は自前のソケットでブラウザへ中継してください。 EmpirioLabs ダッシュボードで API キーを取得してください。
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())EmpirioLabs 上の Qwen Audio 3.1 ASR Stream API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | 入力バッファに追加するオーディオのエンコード:base64 16ビットPCM、モノラル、16kHz。 |
接続 WebSocketを経由したライブ文字起こしをwss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-asr-streamで、通常のAuthorization Bearerヘッダーで認証されます。音声を送信 16kHzモノラルpcm16音声をinput_audio_buffer.appendでストリーム送信。音声活動検出が各文の終了場所を決定するため、送信するコミットはありません。返ってくるもの 話者が話している間にconversation.item.input_audio_transcription.completedconversation.item.input_audio_transcription.deltaイベントが文を運び、各間で確定した文を伝えます。請求 入力トークンと出力トークンは1M単位で料金が設定され、完成した各文はモデルが報告する使用量から個別に請求されます。
EmpirioLabs では Qwen Audio 3.1 ASR Stream は従量課金です: 入力 $1.86 1Mのオーディオ入力トークンあたり; ソリューション $1.40 生成された1Mトークンあたり。このページのライブ料金表は常に API の請求額と一致します。
Qwen Audio 3.1 ASR Stream は api.empiriolabs.ai 上の WEBSOCKET /v1/realtime で提供され、標準的な Bearer トークン認証を使用します。
EmpirioLabs プレイグラウンド を開き、Start session を押すとブラウザーで試せます。Qwen Audio 3.1 ASR Stream はリクエストとレスポンスではなく WebSocket 上で動作するため、組み込むときは リアルタイム音声クイックスタート から始めてください。EmpirioLabs の API キーとモデル ID qwen-audio-3-1-asr-stream を使ってサーバーから接続し、音声を双方向にストリーミングします。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。