
Modelo de texto GLM-4.5 leve livre para raciocínio, codificação, chat de longa duração e tarefas de linguagem geral.
Modelo de texto GLM-4.5 leve livre para raciocínio, codificação, chat de longa duração e tarefas de linguagem geral.
O uso do token base é gratuito. Built-in busca web é opcional através de tool_web_search e adiciona $0.033 por solicitação quando habilitado. Suporta ferramentas de função, tool choice auto, JSON response format, controles de pensamento, temperatura, top p, do sample, max tokens, stop e streaming.
Também conhecido como GLM Flash, Z.ai GLM 4.5 Flash, GLM-4.5-Flash, glm-4-5-flash
glm-4-5-flash/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-4-5-flash:generateContentglm-4.5-flashzai/glm-4.5-flashzhipu/glm-4.5-flashTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
GLM 4.5 Flash atende a API Chat Completions compatível com OpenAI. Aponte qualquer SDK OpenAI para https://api.empiriolabs.ai/v1 com sua chave de API EmpirioLabs e use o id de modelo glm-4-5-flash. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-4-5-flash",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="glm-4-5-flash",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parâmetros de requisição suportados pela API GLM 4.5 Flash na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| temperature | number | 0.6 | 0 a 1 | Temperatura de amostragem. Valores mais baixos são mais determinísticos. GLM-4.7-Flash e GLM-4.6V-Flash como padrão para 1.0; GLM-4.5-Flash tem como padrão 0.6. |
| top_p | number | 0.95 | 0.01 a 1 | Amostragem do núcleo com a probabilidade de massa. Z.AI documenta um padrão de 0,95 para as séries GLM-4.7, GLM-4.6 e GLM-4.5. |
| max_tokens | number | 4096 | 1 a 98304 | Tokens máximos de saída para GLM-4.5-Flash: 98304. |
| stop | array | - | - | Lista de palavras de parada. Z.AI atualmente suporta uma cadeia de um stop em formato de array. |
| do_sample | boolean | true | - | Ative a amostragem. Quando falso, temperatura e top_p não afetam a geração. |
| enable_thinking | boolean | true | - | Controles Z.AI modo pensamento. Ativado é o padrão; O GLM-4.5-Flash decide automaticamente se deve pensar quando ativado. |
| thinking | object | - | - | Objeto de pensamento avançado. Use {"type":"enabled"} ou {"type":"disabled"}. O GLM-4.5-Flash decide automaticamente se deve pensar quando ativado. |
| tools | array | - | - | Ferramentas funcionais e a ferramenta web_search embutida são suportadas. |
| tool_choice | enum | auto | auto | Determina se o modelo pode usar ferramentas. Z.AI documentos de seleção automática de ferramentas; Omita ferramentas para desabilitar o uso de ferramentas. |
| tool_web_search | boolean | false | - | Ative a busca web embutida. Adiciona $0.033 por requisição quando ativado. |
| search_result | boolean | true | - | Retorne metadados estruturados dos resultados da busca web quando a busca na web estiver habilitada. |
| search_prompt | string | - | - | Instrução opcional para resumir resultados de busca web recuperados. |
| count | number | 10 | 1 a 50 | Número de resultados de busca na web para recuperar. |
| search_domain_filter | string | - | - | Lista branca opcional de domínios para resultados de busca na web. |
O uso do token base é gratuito. Built-in busca web é opcional através de tool_web_search e adiciona $0.033 por solicitação quando habilitado.
Na EmpirioLabs, GLM 4.5 Flash é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
GLM 4.5 Flash suporta uma janela de contexto de 200K tokens com até 98.304 tokens de saída por resposta.
Sim. GLM 4.5 Flash atende a API Chat Completions compatível com OpenAI, então SDKs OpenAI existentes funcionam apontando base_url para https://api.empiriolabs.ai/v1 e definindo o id de modelo glm-4-5-flash.
Sim. O playground da EmpirioLabs executa GLM 4.5 Flash no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.