
バックグラウンドで推論しながら話し続ける音声会話、30の音声、ライブ映像入力、ツール呼び出し、調整可能な推論努力が特徴です。
バックグラウンドで推論しながら話し続ける音声会話、30の音声、ライブ映像入力、ツール呼び出し、調整可能な推論努力が特徴です。
セッションはリクエストパラメータではなく、ソケット上でセッション・アップデートイベントで設定されます。テキストトークンとオーディオトークンは別々の料金で請求されます。
別名 Gemini Live Extended Thinking, Google Gemini 3.8 Live Extended Thinking
gemini-3-8-live-extended-thinking/v1/realtimegemini-3.8-live-extended-thinkinggoogle/gemini-3.8-live-extended-thinkingEmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
Gemini 3.8 Live Extended Thinking は HTTP エンドポイントではなく、wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking の WebSocket 上でライブ会話を行います。モデル ID gemini-3-8-live-extended-thinking で接続し、ハンドシェイク時に EmpirioLabs の API キーを Authorization: Bearer ヘッダーとして送信してください。音声は base64 の 16 ビット PCM として双方向に流れます。 ブラウザは WebSocket にヘッダーを設定できないため、この接続はサーバーから開き、音声は自前のソケットでブラウザへ中継してください。 EmpirioLabs ダッシュボードで API キーを取得してください。
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())EmpirioLabs 上の Gemini 3.8 Live Extended Thinking API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| voice | enum | Puck | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | セッション用の話す音声。会話開始前にsession.updateで設定してください。会話開始後は変更できません。 |
| instructions | string | - | - | モデルの挙動や話し方に関するシステムガイダンス。会話が始まる前にsession.updateで設定してください。 |
| reasoning_effort | enum | medium | low, medium, high | モデルが話す間にバックグラウンドでどれだけ推理しているか。努力が高いほど出力トークンが増えます。会話が始まる前に設定してください。 |
| temperature | number | - | 0 から 2 | 温度を0から2までサンプリングします。値を下げると返信の安定性が高まります。会話が始まる前に設定してください。 |
| input_audio_format | enum | pcm16 | pcm16, pcm24 | 入力バッファに追加する音声のエンコード:pcm16はbase64の16ビットPCMで16kHz、pcm24は同じ24kHzです。 |
| output_audio_format | enum | pcm24 | pcm24 | モデルがストリーミングバックする音声のエンコード:16ビットPCM、24kHz。 |
| turn_detection | string | {"type":"server_vad"} | - | サーバー側の音声活動検出。話すのをやめたタイミングを判断し、モデルが応答するはずです。デフォルトでオンになっています。自分でinput_audio_buffer.commitでターンを終了するためにnullに設定してください。 |
接続 WebSocketを経由してwss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinkingでフルデュプレックス音声を送り、通常のAuthorization Bearerヘッダーで認証。最初の音声(音声、指示、ターン検出、ツール)を送信する前に、セッションをsession.update設定してください。これらの設定は会話開始時に修正されます。音声と映像を送信- マイク音声をイベントinput_audio_buffer.append追加:16ビットPCMで16kHz、または24kHzでinput_audio_formatpcm24に設定。- ライブ映像フレームをinput_image_buffer.appendイベントとして付け加え、base64のJPEGまたはPNG画像として。- 音声活動検出はデフォルトで有効なので、音声終了後約1秒間ストリーミングを続けてください。turn_detectionをnullに設定して、自分でinput_audio_buffer.commitで各ターンを終了します。声と言語 - voiceリストの30の声のうちの1つ、例えばPuck、Kore、Charonなどを使用してください。それ以外の値は拒否されます。- モデルはあなたが話す言語で応答します。応答 - 音声はresponse.audio.deltaイベントとしてストリーミングされ、16ビットPCMで24kHzで、単語は session.update 0__イベントとして行われます。あなた自身の音声も文字起こしされます。- モデルが応答している間に話すと中断されます。推論 session.update 1__モデルが話す際のバックグラウンドでどれだけ推論するかを設定します:低、中(デフォルト)、または高。会話が始まる前に設定してください。- モデルはしばしば最初に質問を認め、2ターン目で答えます。各ターンは独立して請求されます。ツール - JSON スキーマパラメータを用いた関数呼び出し。各結果は session.update 2__項目として session.update 3__と共に返します。請求音声トークンとテキストトークンは両方向に別々に価格設定され、ビデオフレームは入力トークンとして、推論トークンは出力トークンとして請求されます。完了した各ターンは、モデルが報告する使用状況から個別に請求され、あなたが割り込む返信も含まれます。
EmpirioLabs では Gemini 3.8 Live Extended Thinking は従量課金です: 入力:オーディオ $7.80 1Mのオーディオ入力トークンあたり; 入力 $2.60 1Mプロンプトトークンあたり; ソリューション $11.70 生成された1Mトークンあたり; 出力:オーディオ $31.20 生成された1Mの音声トークンあたり。このページのライブ料金表は常に API の請求額と一致します。
Gemini 3.8 Live Extended Thinking は 128K トークンのコンテキストウィンドウに対応しています(1回の応答あたり最大 65,536 出力トークン)。
Gemini 3.8 Live Extended Thinking は api.empiriolabs.ai 上の WEBSOCKET /v1/realtime で提供され、標準的な Bearer トークン認証を使用します。
EmpirioLabs プレイグラウンド を開き、Start session を押すとブラウザーで試せます。Gemini 3.8 Live Extended Thinking はリクエストとレスポンスではなく WebSocket 上で動作するため、組み込むときは リアルタイム音声クイックスタート から始めてください。EmpirioLabs の API キーとモデル ID gemini-3-8-live-extended-thinking を使ってサーバーから接続し、音声を双方向にストリーミングします。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。