Casa Blog

Como usar a API GLM-5.2

GLM-5.2 através da capa API

Jun 16, 2026

EmpirioLabs AI

GLM-5.2 é o modelo principal de raciocínio e codificação de Z.ai, lançado em 13 de junho de 2026. Ele emparelha uma janela de contexto one-million-token com esforço de raciocínio ajustável, para que você possa discar o quão difícil o modelo pensa antes de responder, e ele envia com built-in web busca e chamada de ferramenta. Z.ai posiciona-o como um primeiro modelo de codificação que mantém forte raciocínio geral, e recomenda o máximo esforço de raciocínio para trabalhos complexos de engenharia multi-passos.

O GLM-5.2 está ao vivo no EmpirioLabs hoje através de uma API compatível com OpenAI, com entrada e saída de texto, um contexto de token 1M, até 128K tokens de saída, chamada de função, saída estruturada em modo JSON e streaming. Experimenta-o na playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo GLM-5.2 e o Documentos de API.

Preços

A cobrança é baseada no uso: os tokens de entrada e saída são medidos por token, e cada busca web embutida adiciona uma pequena taxa por chamada que se aplica apenas quando a busca realmente é executada. Não existe um nível de cache separado. As taxas atuais por token sempre estão disponíveis no página do modelo e o página de preços, que permanecem em sincronia com o que você é cobrado.

Início rápido

Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe glm-5-2 como modelo:

de openai import OpenAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1", api key="YOUR EMPIRIOLABS API KEY",) resp = client.chat.completions.create(model=" glm-5-2 ", messages=[ {"role": "user", "content": "Refactore este laço Python em uma compreensão de lista e explique por quê."}, ], rational effort="high",) print(resp.choices[0].messsage.content)

Esforço de fundamentação

GLM-5.2 expõe um nativo raciocinação esforço controlo com níveis de mínimo até max, mais nenhum para desligar completamente o pensamento. O padrão é max, que Z.ai recomenda para codificação complexa. Baixe o esforço para respostas mais rápidas e mais baratas em curvas simples, ou definir activar pensar false para o caminho de menor latência. Quando o modelo pensa, o raciocínio é retornado ao lado da resposta para que você possa mostrá-lo ou escondê-lo.

Pesquisa Web

Definir tool_web_search para verdadeiro para deixar GLM-5.2 puxar resultados vivos em sua resposta. O modelo decide quando pesquisar, cita o que ele usou, e a taxa por chamada só se aplica quando uma busca é executada. Deixe-o desligado para raciocínio totalmente offline.

É bom saber

Para saída estruturada estrita, execute com thinking disabled para que o modelo retorne limpo JSON sem um traço de raciocínio interleaved. GLM-5.2 é texto e texto: para compreensão de imagem ou vídeo, escolha um modelo multimodal do catálogo. O contexto one-million-token contém confortavelmente grandes bases de código, transcrições longas e refatores de múltiplos arquivos em uma única solicitação.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.