GLM 5.3 是 Z.ai 的旗舰编码和代理模型,于 2026 年 8 月 14 日发布。它运行在与GLM 5.2相同的基础模型上,但提升来自于延长的训练后运行,而非新的预训练运行:Z.ai 报告其自有代码工作台上比GLM 5.2提升了50%,开源模型在Terminal Bench 3.0和Agents' Last Exam中取得了state-of-the-art结果。
GLM 5.3 现已通过兼容 OpenAI 的 API 上线EmpirioLabs,支持文本输入输出、1M 代币上下文、最多 128K 个输出代币、函数调用、JSON 模式结构化输出、内置网页搜索和流媒体功能。试试在 操场 或者从任何 OpenAI 兼容客户端调用它。 全部谱率和当前率 GLM 5.3 型号页面 页:1 API 文档。 。 。.
定价
计费基于使用:输入和输出令牌按令牌计费,每个内置的网页搜索都会增加少量每次通话费用,仅在搜索实际运行时生效。没有单独的缓存层级。当前的每个令牌费率始终存在于 模型页面 页:1 定价页面,它与你被控的罪行保持同步.
快速启动
将 OpenAI SDK 指向 EmpirioLabs 基础 URL并通过 glm-5-3 作为模式:
从 openai 导入 OpenAI 客户端 = OpenAI( base_url=“https://api.empiriolabs.ai/v1", api_key=”YOUR_EMPIRIOLABS_API_KEY“, ) resp = client.chat.completions.create( model=”glm-5-3“, messages=[ {”role“: ”user“, ”content“: ”查找该工作池中的竞赛条件并提出修复方案。“}, ], reasoning_effort=”max“, ) print(resp.choices[0].message.content)
同一个型号ID也适用于 /v1/responses (英语),类人形态 /v1/messages (英语),以及谷歌兼容的 /v1beta/models/glm-5-3:生成内容 路线。替代身份 GLM-5.3, (中文), zai/glm-5.3, 和 zhipu/glm-5.3 解析到同一个模型。
作出合理努力
GLM 5.3 暴露了原生用户 推理(e) 控制有三个层次: 低 对于轻量级推理, 高 用于增强推理,以及 最大数 为了深层的推理。默认为 最大数这正是 Z.ai 推荐用于复杂编码和长视野代理工作的做法。降级至。 低 用于短暂且对延迟敏感的转弯。
网页搜索与工具
设定 tool_web_search (英语) 到 确实如此 让模型在回答前先搜索网络,并缩小范围,用 search_recency_filter, (中文), search_domain_filter, 和 伯爵.函数调用使用标准的OpenAI 工具 数组,以及 tool_stream 在工具调用参数生成时进行流式传输。
第一次打电话前值得了解的事情
- 推理无法关闭,所以它始终是你产出账单的一部分。 与GLM 5.2不同,该型号没有思考关闭模式,
推理(e)只接受低, (中文),高, 和最大数.请求不同级别或关闭思维的请求会在最近的支持级别被送达,而非失败,因此为GLM 5.2编写的代码能够持续工作。推理代币作为输出代币计费,且在最大数即使是一个单词的回答,也可能花费大部分产出预算思考,所以发送低专门用于琐碎的呼叫。 - 结构化输出是JSON模式,不是模式强制。 用途
response_format与{“类型”:“json_object”}并描述你想在提示中看到的字段。提供 JSON Schema 是被接受但不强制执行的,所以你应该在自己这边验证结果,而不是假设形状。 - 它仅提供文字。 图片、视频和文件部分被拒绝。使用视觉模型,如GLM 5.3 Flash进行多模态输入。
下一步该去哪里
打开 操场 要尝试不写代码的GLM 5.3,请阅读 API 参考 如需查看完整参数列表,或浏览 型号目录 用来和其他节目做个比较。



