GLM-5.2是Z.ai的旗舰推理和编码模型,于2026年6月13日发布. 它以可调整的推理努力将 one-million-token 上下文窗口对齐,这样可以拨打模型在回答之前的思考有多难,它用内置的网络搜索和工具调用来传送. Z.ai将其定位为保持强一般推理的编码第一模型,并建议为复杂,多步骤的工程工作作出最大推理努力.
GLM-5.2今天通过一个OpenAI兼容的API在EmpirioLabs上直播,包含文字输入和输出,1M令牌上下文,最多128K输出令牌,函数调用,JSON模式结构输出,以及流线. 试试看 操场 或者从任何 OpenAI 兼容客户端调用它。 全部谱率和当前率 GLM-5.2 模型页面 页:1 API 文档。 。 。.
定价
计费是基于用法的:输入和输出的令牌是每个令牌计数的,每个内置的网络搜索都增加了一个小的每调费,只在搜索实际运行时才适用. 没有单独的缓存级 。 现时每户费率一直维持在 模型页面 页:1 定价页面,它与你被控的罪行保持同步.
快速启动
将 OpenAI SDK 指向 EmpirioLabs 基础 URL并通过 glm-5-2 (英语) 作为模式:
从 Openai 导入 OpenAI 客户端 = OpenAI(碱基 url=" https://api.empiriolabs.ai/v1", api key="YOUR EMPRIOLABS API KEY", resp=客户端. chat.creats.creatures. glm-5-2),消息=[{'作用':"用户","内容":"将这个Python 环路重置为列表理解和解释原因."],推理 effort="高",打印(resp.choices [0].mesage.cont)
作出合理努力
GLM-5.2 暴露一个本地人 推理(e) 控制级别从 最小值 上限 最大数外加时 无 完全停止思维 默认是 最大数,Z.ai建议进行复杂的编码。 在简单转弯或设定时降低更快、更便宜的答复率 启用 思考 为最不近情理的路线而造假。 当模型思考时,推理会和答案一起返回,这样你就可以显示或隐藏它.
网络搜索
设定 tool_web_search (英语) 真正让GLM-5.2将现场结果引向答案。 模式决定何时进行搜索,引用其使用内容,每名通话费仅在搜索运行时适用. 离开它 完全离线推理.
很高兴知道
对于严格结构化的输出,运行时思维被禁用,所以模型返回干净的JSON没有间断的推理痕迹. GLM-5.2是文本输入和文本输出:为了图像或视频理解,从中选择一种多式联运模式 目录. one-million-token 上下文舒适地保存了大型代码库,长本,以及单项请求中的多文件重构.



