ホーム ブログ

Gemini 3.8のLiveおよびLive Extended Thinkingの使い方

Gemini 3.8 LiveおよびAPIを使ったLive Extended Thinking(拡張思考)を

Sep 24, 2026

EmpirioLabs AI

Gemini 3.8 LiveとGemini 3.8 Live Extended ThinkingはEmpirioLabsで利用可能です。どちらもリアルタイム音声モデルで、WebSocketを開いてマイク音声をストリーミングし、音声が同じ接続で返事されます。

ジェミニ3.8ライブ は音声エージェントやライブ会話向けの低遅延オプションです。音声と並行してライブ映像フレームを受け付け、会話中にあなたの機能に電話をかけ、発信者が話す言語で応答します。

ジェミニ3.8 ライブ拡張思考 話す間は背景で理由を表示し、簡単な答え以上の質問には対応します。どの程度の説明かを設定します 理由 努力お問い合わせ.

Playgroundのどちらかを試してみてください: ジェミニ3.8ライブ または ライブ・エクステンデッド・シンキング.声を選び、「セッション開始」をクリックして話してください。

接続

プラットフォーム上のすべてのリアルタイムモデルは、 モデル クエリパラメータ。EmpirioLabsAPIキーでハンドシェイクを認証します:

wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live Authorization: Bearer YOUR_EMPIRIOLABS_API_KEY

このプロトコルは広く使われているリアルタイムイベント形式に従っています。セッションを次のように設定します session.update 最初の音声を送信する前に、マイク音声を付け加えてください。 input_audio_buffer.append、そして返信を読んでください response.audio.delta、その書き起こしは response.audio_transcript.デルタお問い合わせ.

{"type": "session.update", "session": { "voice": "Kore", "instructions": "あなたは簡潔な旅行助手です。" }}

音声は両方向に16ビットPCMです:マイクから16 kHz、または input_audio_format 設定 PCM24、そして応答は24kHzです。音声活動検出は最初からオンになっているため、発信者が話すのをやめたときにモデルは応答し、返信の上で話すと中断されます。

ビデオフレーム

両方のモデルは、呼び出し元が示したものを確認できます。カメラや画面からframesをbase64のJPEGまたはPNG画像としてそれぞれのバッファに送信し、同じターンで質問します。

{"type": "input_image_buffer.append", "image": "<base64 JPEG または PNG>"}

関数呼び出し

関数を宣言する session.update JSON スキーマパラメータを使います。モデルが1を呼び出したとき、あなたは response.function_call_arguments.done と call_id、関数名とその引数を返します。結果を function_call_output アイテムとモデルは話し続けます。

拡張思考に関する推論

{"type": "session.update", "session": {"reasoning_effort": "high"}}

理由 努力 受け入れる ロー, メディア (デフォルト)または 高く.モデルはしばしば最初に質問を認め、その後2回目の回答で答えるので、最初の質問の後は引き続き聞き続けてください 返信完了お問い合わせ.

料金について

両モデルとも、モデルが報告した使用量から完了したターンごとに請求し、音声トークンとテキストトークンは両方向に別々の料金が設定されています。ビデオフレームは入力トークンとして、推論請求は出力トークンとして請求されます。拡張思考は毎ターン多くの入力トークンを報告するため、同じ会話でもライブ時よりもコストが高くなります。現在の料金は ジェミニ3.8ライブ および ライブ・エクステンデッド・シンキング モデルページや プライシングページお問い合わせ.

初回セッション前に知っておくべきこと

  • 話す前にセッションを設定しましょう。 音声、指示、ターン検出、ツール、温度、推論の努力は会話開始時に固定されます。後で変更するとエラーが返されます。代わりに新しいセッションを開いてください。
  • リストに載っている30の声のうちの1つを使ってください。 Puckがデフォルトです。それ以外の値はエラーで拒否されます。
  • 言語設定はありません。 モデルは発信者が話す言語で応答します。
  • 発信者が止まった後も短時間配信を続けてください。 音声活動検出はターン終了を判断するために短い沈黙が必要で、最後の単語で音声をカットしたクライアントは返信を待ちます。
  • 新しいソケットは新しい会話です。 再接続したクライアントが以前の文脈を必要とする場合は、自分のトランスクリプトを保管してください。

イベントテーブル、ボイスリスト、音声フォーマットは リアルタイム音声API ドキュメンツ。同じ家族のtext-to-speechについては、こちらをご覧ください Gemini 3.8 Flash TTSおよびFlash-Lite TTSの使い方.両方のライブモデルは現在販売中です。

ディスクロージャー:この記事は、EmpirioLabs AIによるAIの支援とレビューで書かれました.

より良いエンドポイントを使う準備はできていますか?

当社のモデルをご覧いただくか、ビジネスの問い合わせ、カスタム展開、その他何でもご連絡ください。