Casa Blog

Como Usar Gêmeos 3.8 Live e Pensamento Estendido ao Vivo

Gemini 3.8 Live e Live Extended Thinking via API

Sep 24, 2026

EmpirioLabs AI

Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking estão disponíveis no EmpirioLabs. Ambos são modelos de voz em tempo real: você abre um WebSocket, transmite áudio do microfone e a resposta falada é transmitida de volta pela mesma conexão.

Gemini 3.8 Live é a opção de baixa latência para agentes de voz e diálogos ao vivo. Aceita quadros de vídeo ao vivo junto com o áudio, chama suas funções durante a conversa e responde no idioma falado pelo chamador.

Gêmeos 3.8 Pensamento Estendido ao Vivo Razões em segundo plano enquanto fala, para perguntas que precisam de mais do que uma resposta rápida. Você define o quanto ela raciocina com raciocinação esforço.

Tente qualquer um dos Playground: Gemini 3.8 Live ou Pensamento Estendido ao Vivo. Escolha uma voz, clique em Iniciar sessão e converse.

Conexão

Todo modelo em tempo real na plataforma usa um endpoint, selecionado com o modelo Consulta parâmetro. Autentique o handshake com sua chave API EmpirioLabs:

wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live Autorização: Portador YOUR_EMPIRIOLABS_API_KEY

O protocolo segue o formato amplamente utilizado de eventos em tempo real. Configure a sessão com session.update Antes de enviar o primeiro áudio, adicione áudio do microfone com input_audio_buffer.append, e lê a resposta de response.audio.delta, com sua transcrição em response.audio_transcript.delta.

{"tipo": "session.update", "session": { "voz": "Kore", "instructions": "Você é um assistente de viagem conciso." }}

O áudio é PCM de 16 bits em ambas as direções: 16 kHz do seu microfone, ou 24 kHz com input_audio_format definir para PCM24, e 24 kHz para a resposta. A detecção de atividade de voz está ativada desde o início, então o modelo atende quando o chamador para de falar, e falar por cima de uma resposta interrompe.

Quadros de vídeo

Ambos os modelos podem ver o que o chamador mostra. Envie os quadros de uma câmera ou tela como imagens base64 JPEG ou PNG em seu próprio buffer, e pergunte sobre eles no mesmo turno:

{"tipo": "input_image_buffer.append", "imagem": "<base64 JPEG ou PNG>"}

Chamada de função

Declare funções em session.update com parâmetros do esquema JSON. Quando o modelo chama um, você recebe response.function_call_arguments.done com o call_id, o nome da função e seus argumentos. Devolva o resultado como um function_call_output item e o modelo continua falando com ele.

Raciocínio sobre o Pensamento Estendido

{"tipo": "session.update", "session": {"reasoning_effort": "high"}}

raciocinação esforço aceita baixo, Médio (o padrão) ou alto. O modelo geralmente reconhece uma pergunta primeiro e depois responde em uma segunda resposta, então continue ouvindo após a primeira response.done.

Preços

Ambos os modelos faturam cada turno completo a partir do uso que o modelo reporta, com taxas separadas para tokens de áudio e tokens de texto em ambas as direções. Quadros de vídeo faturam como tokens de entrada, e os de raciocínio como tokens de saída. O Pensamento Estendido reporta mais tokens de entrada a cada turno, então a mesma conversa custa mais nela do que no Live. As taxas atuais estão no Gemini 3.8 Live e Pensamento Estendido ao Vivo Páginas de modelos e no página de preços.

Coisas que valem a pena saber antes da primeira sessão

  • Defina a sessão antes de falar. A voz, instruções, detecção de turno, ferramentas, temperatura e esforço de raciocínio são corrigidos assim que a conversa começa. Mudá-los depois retorna um erro; abra uma nova sessão em vez disso.
  • Use uma das 30 vozes listadas. Puck é o padrão. Qualquer outro valor é recusado com erro.
  • Não há configuração de idioma. O modelo responde no idioma que o interlocutor fala.
  • Continue transmitindo brevemente depois que o interlocutor parar. A detecção de atividade de voz precisa de um breve silêncio para decidir que o turno acabou, então um cliente que corta o áudio na última palavra espera por uma resposta.
  • Um novo encaixe é uma conversa nova. Mantenha seu próprio histórico escolar caso um cliente que esteja se reconectando precise do contexto anterior.

Tabelas de eventos, a lista de vozes e os formatos de áudio estão no API de Voz em Tempo Real Docs. Para text-to-speech da mesma família, veja Como usar o Gemini 3.8 Flash TTS e o Flash-Lite TTS. Ambos os modelos Live já estão disponíveis.

Divulgação: Este artigo foi escrito com assistência de IA e revisado por EmpirioLabs IA.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.