Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 在 EmpirioLabs 上可用。两者都是实时语音型号:你打开 WebSocket,流式麦克风音频,语音回复会在同一连接上流回。
双子座3.8现场版 是语音代理和实时对话的低延迟选项。它接受实时视频帧和音频,通话中调用你的功能,并用来电者所说的语言回复。
双子座3.8 实时延伸思维 在说话时背景中有理由,针对需要超越快速回答的问题。你可以用 推理(e)。 。 。.
试试Playground中的任一: 双子座3.8现场版 或 实时延伸思维.选一个声音,点击开始会话然后说话。
连接
平台上的每个实时模型都使用一个端点,通过 模型 查询参数。用你的EmpirioLabs API密钥认证握手:
wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live 授权:承载者YOUR_EMPIRIOLABS_API_KEY
该协议遵循广泛使用的实时事件格式。配置会话 session.update 在发送第一个音频之前,先加上麦克风音频 input_audio_buffer.append,并阅读回复 响应.音频.delta,其转录记录为 response.audio_transcript.delta。 。 。.
{“type”: “session.update”, “session”: { “voice”: “Kore”, “instructions”: “你是一个简洁的旅行助理。” }}
音频双向都是16位PCM:麦克风输出16 kHz,或者用24 kHz input_audio_format 设置为 PCM24,24 kHz用于回复。语音活动检测从一开始就开启,因此当来电者停止说话时,模型会接听,而在回复上说话会中断。
视频帧
两个模型都能看到呼叫者展示的内容。从相机或屏幕上发送帧,作为base64的JPEG或PNG图像,放到各自的缓冲区,并在同一回合询问:
{“type”:“input_image_buffer.append”, “image”:“<base64 JPEG 或 PNG>”}
函数调用
声明函数 session.update 带有 JSON 模式参数。当模型调用 1 时,你会收到 response.function_call_arguments.done 其中 call_id, 函数名及其参数。返回结果为 function_call_output 而模型继续与它交谈。
扩展思维的推理
{“type”: “session.update”, “session”: {“reasoning_effort”: “high”}}
推理(e) 接受 低, (中文), 媒介 (默认值)或 高.模型通常先承认一个问题,然后在第二个回答中回答,所以在第一个问题之后继续倾听 回复已完成。 。 。.
定价
两种模型都根据模型报告的使用情况计费,音频标记和文本标记分别计费。视频帧作为输入标记计费,推理计费作为输出标记。扩展思维报告每回合更多的输入标记,因此同一对话在该回合的成本比实时通话更高。当前速率为 双子座3.8现场版 以及 实时延伸思维 模型页和 定价页面。 。 。.
第一次治疗前值得了解的事情
- 在发言前先设定好会谈时间。 语音、指令、转向检测、工具、温度和推理努力在对话开始后固定。之后更改它们会返回错误;请重新开启新会话。
- 使用列出的30个声音中的一个。 Puck 是默认值。其他值会被错误拒绝。
- 没有语言设置。 模型会用呼叫者的语言回答。
- 来电结束后继续短暂直播。 语音活动检测需要短暂的静默来判断回合结束,因此在最后一个词时切断音频的客户端等待回复。
- 一个新的插座就是新的对话。 如果重新连接的客户需要更早的上下文,请保留您自己的文字记录。
事件表、语音列表和音频格式均在 实时语音API 文件。同一家族的text-to-speech请参见 如何使用Gemini 3.8闪光TTS和Flash-Lite TTS.两款Live型号现已上市。
披露:这篇文章是在AI的协助下撰写的,并由EmpirioLabs AI审查.



