블로그

GLM 5.3 플래시 API 사용 방법

GLM 5.3 플래시 API 사용 방법

Aug 26, 2026

EmpirioLabs AI

GLM 5.3 플래시는 Z.ai의 GLM-5 계열 중 최초의 네이티브 멀티모달 모델로, 이전에 Ox Alpha라는 이름으로 미리보기 후 2026년 8월 26일 MIT 라이선스 하에 출시되었습니다. 이 mixture-of-experts는 320B-A18B 모델로, 멀티모달 코퍼스로 학습되었으며, Z.ai 이 모델이 GLM 5.2보다 훨씬 저렴한 가격으로 코딩 및 에이전트 벤치마크 전반에서 뛰어난 성능을 보였으며, 결과는 훨씬 더 큰 프런티어 코딩 모델에 근접합니다.

GLM 5.3 플래시는 오늘 EmpirioLabs OpenAI 호환 API를 통해 텍스트, 이미지, 비디오, 파일 입력, 1M 토큰 컨텍스트, 최대 128K 출력 토큰, 함수 호출, JSON 모드 구조화 출력, 내장 웹 검색, 스트리밍을 지원합니다. 한번 해봐. 뚱 베어 또는 OpenAI 호환 클라이언트에서 호출. 전체 사양과 현재 비율은 GLM 5.3 플래시 모델 페이지 그리고 API 문서·.

제품정보

청구는 사용량 기반으로, 입력 및 출력 토큰은 토큰별로 측정되며, 내장된 웹 검색마다 호출당 소액의 수수료가 추가되어 실제로 검색이 실행될 때만 적용됩니다. 별도의 캐시 티어는 없습니다. 현재 토큰당 요금은 항상 모델 페이지 그리고 가격표, 당신이 청구 된 것과 동기화에 머물.

퀵스타트

EmpirioLabs 기본 URL에서 OpenAI SDK를 포인트로 전달 glm-5-3-flash 모형으로:

openai에서 가져오기 OpenAI 클라이언트 = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "이 빌드 로그 스크린샷에서 무엇이 실패하고 있나요?"}, {"type": "image_url", "image_url": {"url": "https://example.com/build-log.png"}}, ], ], reasoning_effort="low",) print(resp.choices[0].message.content)

동일 모델에서 id가 작동합니다 /v1/responses 에, 인류형 /v1/messages 에, 그리고 구글 호환 /v1beta/models/glm-5-3-flash:생성 콘텐츠 경로. 대체 ID glm-5.3-flash·, zai/glm-5.3-flash, 그리고 zhipu/glm-5.3-flash 같은 모델로 결의하세요.

멀티모달 입력

이미지, 동영상, 파일은 표준 콘텐츠-파트 배열에 속합니다: image_url 이미지의 경우, video_url 비디오에 대해, 그리고 file_url 문서에 대한 설명입니다. 공개 https URL(권장)이나 base64 데이터 URL을 전달하세요. Z.ai 모델은 에이전트 비전 작업에 적합하게 자리 잡습니다: 인터페이스, 렌더링된 출력, 상호작용 피드백을 읽을 수 있어 코드, 브라우저, GUI 간의 루프를 닫습니다.

회사연혁

GLM 5.3 플래시는 네이티브 데이터를 노출합니다 이유 effort 세 가지 레벨로 조작: 낮게 가벼운 추론을 위해, 하이 추론 강화를 위해, 그리고 최대 깊은 추론을 위해서. 기본값은 최대Z.ai 복잡한 코딩과 장기 범위 에이전트 작업에 권장하는 방법입니다. 강등으로 낮게 짧고 지연에 민감한 회전을 위한 것입니다.

웹 검색 및 도구

설치하기 tool_web_search 에맞아요 모델이 답변하기 전에 웹을 검색하게 하고, 다음과 같이 결과를 좁히는 방법이 있습니다 search_recency_filter·, search_domain_filter, 그리고 백작. 함수 호출은 표준 OpenAI를 사용합니다 도구 array, 그리고 tool_stream 툴 호출 인자가 생성되는 동안 스트리밍합니다.

첫 통화 전에 알아야 할 사항들

  • 추론은 끌 수 없기 때문에 항상 산출 비용의 일부가 됩니다. 이유 effort 오직 수락만 한다 낮게·, 하이, 그리고 최대. 다른 수준을 요청하거나 사고를 비활성화해 달라는 요청은 실패하지 않고 가장 가까운 지원 수준에서 제공되므로, 다른 GLM 모델용 코드가 계속 작동하도록 합니다. 추론 토큰은 출력 토큰으로 청구되며, 최대 한 단어 답변만으로도 대부분의 예산을 생각하는 데 쓸 수 있으니 보내세요 낮게 사소한 호출에 대해 명시적으로 말이죠.
  • 구조화된 출력은 스키마 강제가 아니라 JSON 모드입니다. 사용 response_format 이름 * {"type": "json_object"} 그리고 프롬프트에서 원하는 필드를 설명하세요. JSON 스키마를 제공하는 것은 허용되지만 강제되지는 않으니, 형태를 가정하기보다는 결과를 직접 검증하세요.
  • 미디어 부품은 서비스가 가져올 수 있는 URL이어야 합니다. 모델이 페치를 합니다 image_url·, video_url, 그리고 file_url 스스로를 타겟팅하므로, 로그인이나 사설 네트워크 뒤에 있는 URL은 요청을 실패시킵니다. 미디어가 공개적으로 접근 불가능할 경우, 대신 base64 데이터 URL로 인라인에 넣으세요.

다음 행보

자주 묻는 질문 뚱 베어 코드를 작성하지 않고 GLM 5.3 플래시를 시도하려면 다음을 읽으세요. API 참조 전체 매개변수 목록을 보시거나 다음 항목을 탐색하세요 모델 카탈로그 다른 라인업들과 비교하기 위해서요.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.