GLM-5.2 é o modelo principal de raciocínio e codificação de Z.ai, lançado em 13 de junho de 2026. Ele emparelha uma janela de contexto one-million-token com esforço de raciocínio ajustável, para que você possa discar o quão difícil o modelo pensa antes de responder, e ele envia com built-in web busca e chamada de ferramenta. Z.ai posiciona-o como um primeiro modelo de codificação que mantém forte raciocínio geral, e recomenda o máximo esforço de raciocínio para trabalhos complexos de engenharia multi-passos.
O GLM-5.2 está ao vivo no EmpirioLabs hoje através de uma API compatível com OpenAI, com entrada e saída de texto, um contexto de token 1M, até 128K tokens de saída, chamada de função, saída estruturada em modo JSON e streaming. Experimenta-o na playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo GLM-5.2 e o Documentos de API.
Preços
A cobrança é baseada no uso: os tokens de entrada e saída são medidos por token, e cada busca web embutida adiciona uma pequena taxa por chamada que se aplica apenas quando a busca realmente é executada. Não existe um nível de cache separado. As taxas atuais por token sempre estão disponíveis no página do modelo e o página de preços, que permanecem em sincronia com o que você é cobrado.
Início rápido
Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe glm-5-2 como modelo:
de openai import OpenAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1", api key="YOUR EMPIRIOLABS API KEY",) resp = client.chat.completions.create(model=" glm-5-2 ", messages=[ {"role": "user", "content": "Refactore este laço Python em uma compreensão de lista e explique por quê."}, ], rational effort="high",) print(resp.choices[0].messsage.content)
Esforço de fundamentação
GLM-5.2 expõe um nativo raciocinação esforço controlo com níveis de mínimo até max, mais nenhum para desligar completamente o pensamento. O padrão é max, que Z.ai recomenda para codificação complexa. Baixe o esforço para respostas mais rápidas e mais baratas em curvas simples, ou definir activar pensar false para o caminho de menor latência. Quando o modelo pensa, o raciocínio é retornado ao lado da resposta para que você possa mostrá-lo ou escondê-lo.
Pesquisa Web
Definir tool_web_search para verdadeiro para deixar GLM-5.2 puxar resultados vivos em sua resposta. O modelo decide quando pesquisar, cita o que ele usou, e a taxa por chamada só se aplica quando uma busca é executada. Deixe-o desligado para raciocínio totalmente offline.
É bom saber
Para saída estruturada estrita, execute com thinking disabled para que o modelo retorne limpo JSON sem um traço de raciocínio interleaved. GLM-5.2 é texto e texto: para compreensão de imagem ou vídeo, escolha um modelo multimodal do catálogo. O contexto one-million-token contém confortavelmente grandes bases de código, transcrições longas e refatores de múltiplos arquivos em uma única solicitação.



