长康文本 Zhipu AI 推理模型有202K上下文,128K输出,工具调用,结构输出,以及缓存支持.
注: - Alibaba Cloud Model Studio在中国部署模式下服务 - 上下文窗口: 202K 令牌 - 最大输出: 128K 令牌 - 支持函数调用,结构化输出,以及上下文缓存 - 结构化输出运行时应当启用 thinking=false - 不支持网页搜索,批次,前缀续作,或微调
也称为 Z.ai GLM 5.1, GLM-5.1, glm-5-1
glm-5-1/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-5-1:generateContent来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
GLM 5.1 提供 OpenAI 兼容的 Chat Completions API。用你的 EmpirioLabs API 密钥把任意 OpenAI SDK 指向 https://api.empiriolabs.ai/v1,并使用模型 ID glm-5-1。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5-1",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="glm-5-1",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)EmpirioLabs 上 GLM 5.1 API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| max_tokens | integer | 4096 | 1 到 128000 | 最大输出令牌数。 |
| temperature | number | 1 | 0 到 2 | 控制随机性。较低的数值使响应更具确定性。 |
| top_p | number | 0.95 | 0 到 1 | 核采样截止。 |
| top_k | integer | 20 | 1 到 100 | 限制抽样只能使用顶层的K代币。 |
| repetition_penalty | number | 1 | 0.1 到 2 | 重复标记会被惩罚。 |
| reasoning_effort | enum | medium | none, low, medium, high, max | 推理努力程度。没有人能让思考失效。低、中、高和最大设定了根据所选模型大小的有界思维预算。以类似OpenAI的 reasoning_effort 字段形式发送,转换为模型服务的enable_thinking和thinking_budget。 |
| enable_thinking | boolean | true | - | 让模型先思考再回答。禁用它以获得严格结构化输出。 |
| thinking_budget | integer | 32768 | 1 到 38912 | 开启了思考时用于推理内容的最大代币。 |
| tool_stream | boolean | false | - | 流式流时,函数调用参数是逐步递增的。 |
| tools | array | [] | - | 兼容 OpenAI 的函数调用工具定义。 |
| tool_choice | object | - | - | 兼容OpenAI的工具选择控制。 |
| parallel_tool_calls | boolean | true | - | 支持时,允许在一个助手回合内调用多个工具。 |
| stop | array | - | - | 可选的停车序列。 |
| response_format | enum | - | - | 将输出限制为JSON。对任何有效的 JSON 对象使用 JSON 模式,或者用 JSON 模式强制输出与你提供的模式相符的模式。 |
在 EmpirioLabs,GLM 5.1 按量计费。本页的实时价格表始终与 API 的实际计费一致。
GLM 5.1 支持 202K token 的上下文窗口。
兼容。GLM 5.1 提供 OpenAI 兼容的 Chat Completions API,现有 OpenAI SDK 只需把 base_url 指向 https://api.empiriolabs.ai/v1 并把模型 ID 设为 glm-5-1 即可使用。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 GLM 5.1,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。