GLM 5.1 API

202K 컨텍스트, 128K 출력, 도구 호출, 구조 출력 및 캐시 지원이있는 Long-context Zhipu AI reasoning 모델.

Z.ai텍스트 생성202K 컨텍스트출시 2026년 4월 7일China독점 엔드포인트

GLM 5.1 소개

202K 컨텍스트, 128K 출력, 도구 호출, 구조 출력 및 캐시 지원이있는 Long-context Zhipu AI reasoning 모델.

노트: - 중국 배포 모드에서 Alibaba Cloud Model Studio에 의해 봉사 - Context window: 202K 토큰 - 최대 출력: 128K 토큰 - 지원 기능 호출, 구조 출력 및 컨텍스트 캐시 - 구성 된 출력은 enable thinking=false와 함께 실행해야합니다 - 웹 검색, 일괄 처리, 접두사 오염, 또는 미세 조정을 지원하지 않습니다

다른 이름 Z.ai GLM 5.1, GLM-5.1, glm-5-1

reasoningfunction callingcache

GLM 5.1 사양

모델 ID
glm-5-1
제공자
Z.ai
카테고리
텍스트 생성
출시
2026년 4월 7일
컨텍스트 창
202K 토큰
입력
텍스트
출력
텍스트
구조화된 출력
JSON Schema
리전
China
엔드포인트
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-5-1:generateContent

GLM 5.1 API 요금최대 41% 절약

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
이름 *
1M 신속한 토큰 당
$1.40<=32K $0.825$1.4032K-200K $1.10
제품정보
1M 생성 토큰
$4.40<=32K $3.301$4.4032K-200K $3.851
Implicit 캐시 읽기
1M 캐시된 입력 토큰 당
$0.26<=32K $0.165$0.2632K-200K $0.22
Web Search (Linkup)
per call when invoked
$0.013
전체 가격 페이지에서 비교

GLM 5.1 API 호출 방법

GLM 5.1은(는) OpenAI 호환 Chat Completions API를 제공합니다. 아무 OpenAI SDK나 EmpirioLabs API 키와 함께 https://api.empiriolabs.ai/v1로 지정하고 모델 ID glm-5-1를 사용하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5-1",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="glm-5-1",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
GLM 5.1 API 전체 레퍼런스

GLM 5.1 API 파라미터

EmpirioLabs에서 GLM 5.1 API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
max_tokensinteger40961 ~ 128000생성할 수 있는 최대 출력 토큰 수.
temperaturenumber10 ~ 2무작위성을 제어합니다. 값이 낮을수록 응답이 더 결정론적이어집니다.
top_pnumber0.950 ~ 1핵 샘플링 컷오프.
top_kinteger201 ~ 100샘플링은 상위 K 토큰으로 제한합니다.
repetition_penaltynumber10.1 ~ 2반복 토큰을 불이익으로 처리합니다.
reasoning_effortenummediumnone, low, medium, high, max추론 노력 수준. 어떤 것도 사고를 막지 못한다. 로우, 미디엄, 하이, 최대는 선택한 모델에 맞춘 제한된 사고 예산을 설정합니다. OpenAI 스타일의 reasoning_effort 필드로 전송되었고, 모델 서비스에 대한 enable_thinking와 thinking_budget로 번역되었습니다.
enable_thinkingbooleantrue-모델이 답변하기 전에 논리적으로 생각할 시간을 주세요. 엄격한 구조화된 출력을 위해 이 기능을 비활성화하세요.
thinking_budgetinteger327681 ~ 38912생각할 때 내용을 추론할 수 있는 최대 토큰이 활성화되어 있습니다.
tool_streambooleanfalse-스트리밍할 때 함수-호출 인자를 점진적으로 스트리밍하세요.
toolsarray[]-OpenAI 호환 함수 호출 도구 정의.
tool_choiceobject--OpenAI 호환 도구 선택 제어.
parallel_tool_callsbooleantrue-지원될 경우 한 턴에 여러 도구 호출을 허용하세요.
stoparray--선택적으로 정지 시퀀스가 있습니다.
response_formatenum--출력을 JSON으로 제한하세요. 유효한 JSON 객체에 대해 JSON 모드를 사용하거나, 제공한 스키마와 일치하는 출력 강제 JSON 스키마를 사용하세요.
문서에 파라미터 2개 더 있음

GLM 5.1 API: 자주 묻는 질문

GLM 5.1 API 비용은 얼마인가요?

EmpirioLabs에서 GLM 5.1은(는) 종량제로 청구됩니다. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

GLM 5.1의 컨텍스트 윈도우는 얼마인가요?

GLM 5.1은(는) 202K 토큰 컨텍스트 윈도우를 지원합니다.

GLM 5.1 API는 OpenAI와 호환되나요?

네. GLM 5.1은(는) OpenAI 호환 Chat Completions API를 제공하므로, 기존 OpenAI SDK에서 base_urlhttps://api.empiriolabs.ai/v1로 지정하고 모델 ID를 glm-5-1로 설정하면 바로 동작합니다.

통합하기 전에 브라우저에서 GLM 5.1을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 GLM 5.1을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

GLM 5.1 API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.