
1M 토큰 컨텍스트, 이미지 및 비디오 입력, 항상 연결된 추론, 네이티브 웹 검색, 툴 호출을 지원하는 네이티브 멀티모달 플래시 모델입니다.
1M 토큰 컨텍스트, 이미지 및 비디오 입력, 항상 연결된 추론, 네이티브 웹 검색, 툴 호출을 지원하는 네이티브 멀티모달 플래시 모델입니다.
참고: - 컨텍스트 창: 1M 토큰 - 최대 출력: 128K 토큰 - 텍스트, 이미지, 비디오, 파일 입력 수신 - 항상 이유 표시; 사고는 비활성화할 수 없습니다 - 추론 노력: 낮음, 높음, 최대값(복잡한 코딩에 최대 권장) - 다른 노력 요청이나 사고 종료 요청은 가장 가까운 지원 수준에서 제공됩니다 - 내장 웹 검색 기능이 사용 시 요청당 $0.033 증가 - 함수 호출, 구조화 출력(JSON 모드), 스트리밍 지원
다른 이름 GLM Flash, Z.ai GLM 5.3 Flash
glm-5-3-flash/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-5-3-flash:generateContentglm-5.3-flashzai/glm-5.3-flashzhipu/glm-5.3-flashEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
GLM 5.3 Flash은(는) OpenAI 호환 Chat Completions API를 제공합니다. 아무 OpenAI SDK나 EmpirioLabs API 키와 함께 https://api.empiriolabs.ai/v1로 지정하고 모델 ID glm-5-3-flash를 사용하세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5-3-flash",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="glm-5-3-flash",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)EmpirioLabs에서 GLM 5.3 Flash API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| max_tokens | integer | 65536 | 1 ~ 131072 | 생성할 수 있는 최대 출력 토큰 수. |
| temperature | number | 1 | 0 ~ 1 | 무작위성을 제어합니다. 값이 낮을수록 응답이 더 결정론적이어집니다. |
| top_p | number | 0.95 | 0.01 ~ 1 | 핵 샘플링 컷오프. |
| reasoning_effort | enum | max | low, high, max | GLM 5.3 플래시 추론 노력. 이 모델은 항상 추론적이며 끌 수 없습니다. 낮은 것은 가볍고, 높음은 강화되며, 최대는 깊은 추론입니다. 복잡한 코딩에는 Max가 추천됩니다. |
| do_sample | boolean | true | - | 샘플링을 활성화하세요. 탐욕적이고 결정론적인 출력(온도와 top_p은 무시)을 위해 끄세요. |
| tool_web_search | boolean | false | - | 내장 웹 검색 기능을 활성화하세요. 사용 시 요청당 $0.033 추가 정보가 발생합니다. |
| search_recency_filter | enum | noLimit | oneDay, oneWeek, oneMonth, oneYear, noLimit | 웹 검색 결과를 최신 시간 창으로 제한하세요. |
| count | integer | 10 | 1 ~ 50 | 웹 검색이 활성화되었을 때 검색할 수 있는 웹 검색 결과 수. |
| search_domain_filter | string | - | - | 웹 검색을 특정 도메인으로 제한하세요. |
| search_prompt | string | - | - | 검색 결과를 요약하는 데 사용되는 선택적 프롬프트. |
| search_result | boolean | true | - | 웹 검색이 활성화되면 응답에서 웹 검색 결과 메타데이터를 반환하세요. |
| tool_stream | boolean | false | - | 스트리밍할 때 함수-호출 인자를 점진적으로 스트리밍하세요. |
| tools | array | [] | - | OpenAI 호환 함수 호출 도구 정의. |
| tool_choice | object | - | - | OpenAI 호환 도구 선택 제어. |
EmpirioLabs에서 GLM 5.3 Flash은(는) 종량제로 청구됩니다: 이름 * $0.075 1M 신속한 토큰 당; 제품정보 $0.25 1M 생성 토큰; 웹 검색 $0.033 요청시. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
GLM 5.3 Flash은(는) 1M 토큰 컨텍스트 윈도우를 지원합니다 (응답당 최대 131,072 출력 토큰).
네. GLM 5.3 Flash은(는) OpenAI 호환 Chat Completions API를 제공하므로, 기존 OpenAI SDK에서 base_url을 https://api.empiriolabs.ai/v1로 지정하고 모델 ID를 glm-5-3-flash로 설정하면 바로 동작합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 GLM 5.3 Flash을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.