홈 블로그

Gemini 3.8 라이브 및 라이브 확장 사고 사용 방법

Gemini 3.8 라이브 및 API를 통한 라이브 확장 사고

Sep 24, 2026

EmpirioLabs AI

Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking은 EmpirioLabs에서 이용 가능합니다. 두 모델 모두 실시간 음성 모델입니다: WebSocket을 열면 마이크 오디오를 스트리밍하면 음성 응답이 같은 연결로 다시 스트리밍됩니다.

제미니 3.8 라이브 음성 상담원과 실시간 대화를 위한 저지연 옵션입니다. 오디오 옆에 라이브 영상 프레임을 받고, 대화 중에 당신의 기능을 호출하며, 발신자가 사용하는 언어로 응답합니다.

제미니 3.8 라이브 확장 사고 말하는 동안 배경에서 이유를 입력하며, 빠른 답변 이상이 필요한 질문에 대해. 논리 정도를 다음과 같이 설정합니다 이유 effort·.

Playground 중 어느 쪽이든 시도해 보세요: 제미니 3.8 라이브 또는 라이브 확장된 사고. 목소리를 선택해서 세션 시작을 클릭한 후 대화하세요.

연결

플랫폼 내 모든 실시간 모델은 하나의 엔드포인트를 사용하며, 이 엔드포인트는 모델 번호: 쿼리 파라미터. EmpirioLabs API 키로 핸드셰이크를 인증하세요:

wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live 권한: 베어러 YOUR_EMPIRIOLABS_API_KEY

이 프로토콜은 널리 사용되는 실시간 이벤트 형식을 따릅니다. 세션을 다음과 같이 구성하세요 세션.업데이트 첫 번째 오디오를 보내기 전에 마이크 오디오를 다음에 추가하세요. input_audio_buffer.append, 그리고 답변을 읽어보세요 응답.오디오.델타, 그 전사본은 response.audio_transcript.델타·.

{"type": "session.update", "session": { "voice": "Kore", "instructions": "당신은 간결한 여행 보조원입니다." }}

오디오는 양방향 모두 16비트 PCM입니다: 마이크에서 16 kHz, 또는 24 kHz input_audio_format 다음 PCM24, 응답은 24 kHz입니다. 음성 활동 감지는 처음부터 켜져 있어, 발신자가 말을 멈추면 모델이 응답하고, 응답 위에 말하면 대화가 중단됩니다.

비디오 프레임

두 모델 모두 호출자가 보여주는 것을 볼 수 있습니다. 카메라나 화면에서 프레임을 base64 JPEG 또는 PNG 이미지로 각자의 버퍼에 보내고, 같은 턴에 질문하세요:

{"type": "input_image_buffer.append", "image": "<base64 JPEG 또는 PNG>"}

함수 호출

함수를 선언한다 세션.업데이트 JSON 스키마 매개변수를 사용해 response.function_call_arguments.done with the call_id, 함수 이름과 그 인자입니다. 결과를 반환합니다. function_call_output 그 아이템과 모델은 계속 대화를 이어갑니다.

확장적 사고에 대한 추론

{"type": "session.update", "session": {"reasoning_effort": "high"}}

이유 effort 수락 낮게·, 중간 (기본값) 또는 하이. 모델은 종종 먼저 질문을 인정하고 두 번째 답변으로 답하므로, 첫 번째 질문 이후에도 계속 귀 기울여 보세요 응답.완료·.

제품정보

두 모델 모두 완료된 턴마다 모델이 보고한 사용량을 기준으로 요금을 청구하며, 오디오 토큰과 텍스트 토큰은 양방향으로 별도로 요금을 청구합니다. 비디오 프레임은 입력 토큰으로, 추론 비용은 출력 토큰으로 청구됩니다. Extended Thinking은 매 턴마다 더 많은 입력 토큰을 보고하므로, 같은 대화가 Live보다 더 많은 비용이 발생합니다. 현재 요금은 제미니 3.8 라이브 그리고 라이브 확장된 사고 모델 페이지와 가격표·.

첫 세션 전에 알아야 할 것들

  • 말하기 전에 세션을 설정하세요. 대화가 시작되면 음성, 지시, 방향 감지, 도구, 온도, 추론 노력은 고정됩니다. 나중에 변경하면 오류가 발생합니다; 대신 새 세션을 열어라.
  • 30개의 목소리 중 하나를 사용하세요. Puck이 기본값입니다. 다른 값은 오류가 발생하면 거부됩니다.
  • 언어 설정은 없습니다. 모델은 발신자가 사용하는 언어로 응답합니다.
  • 전화가 끊긴 후에도 잠시 계속 스트리밍하세요. 음성 활동 감지는 턴이 끝났다고 판단하기 위해 짧은 무음이 필요하므로, 마지막 단어에서 오디오를 끊는 클라이언트는 응답을 기다립니다.
  • 새로운 소켓은 새로운 대화입니다. 재연결되는 클라이언트가 이전 맥락이 필요하다면 본인이 직접 녹취록을 보관하세요.

이벤트 테이블, 음성 목록, 오디오 형식은 실시간 음성 API 의사들. 같은 가족 출신 text-to-speech 보면 참고하세요 Gemini 3.8 플래시 TTS 및 플래시-라이트 TTS 사용 방법. 두 라이브 모델 모두 현재 구매 가능합니다.

공개: 이 문서는 AI 지원으로 작성되었으며 EmpirioLabs AI에 의해 검토되었습니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.