GLM-5.2 est le modèle de raisonnement et de codage phare de Z.ai, publié le 13 juin 2026. Il jumele une fenêtre de contexte one-million-token avec un effort de raisonnement réglable, de sorte que vous pouvez composer à quel point le modèle pense avant qu'il réponde, et il est livré avec la recherche web intégrée et l'appel d'outils. Z.ai le considère comme un premier modèle de codage qui maintient un raisonnement général fort et recommande un effort maximum de raisonnement pour des travaux d'ingénierie complexes et en plusieurs étapes.
GLM-5.2 est en direct sur EmpirioLabs aujourd'hui grâce à une API compatible OpenAI, avec entrée et sortie texte, un contexte de jeton 1M, jusqu'à 128K jetons de sortie, appel de fonction, sortie structurée en mode JSON et streaming. Essaie dans le aire de jeux ou appelez-le d'un client compatible OpenAI. L'ensemble de la spec et les taux actuels vivent sur le Page modèle GLM-5.2 et les Docs API.
Prix
La facturation est basée sur l’utilisation: les jetons d’entrée et de sortie sont mesurés par jeton, et chaque recherche web intégrée ajoute un petit frais par appel qui ne s’applique que lorsqu’une recherche est effectivement effectuée. Il n’y a pas de niveau de cache séparé. Les taux actuels par jeton sont toujours présents sur le page modèle et les page de prix, qui restent en phase avec ce qui vous est facturé.
Démarrer rapidement
Pointez n'importe quel SDK OpenAI à l'URL de base d'EmpirioLabs et passez glm-5-2 comme modèle:
openAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1", api key="YOUR EMPRIOLABS API KEY",) resp = client.chat.completions.create(model=" glm-5-2 ", messages=[ {"role": "user", "content": "Refactor this Python loop into a list compilation and exply why."}, ], raisonal effort="high",) print(resp.choices[0].message.content)
Efforts de motivation
GLM-5.2 expose un indigène raisonnement effort contrôle avec des niveaux de minimale jusqu'à maxplus aucune d'éteindre complètement la pensée. Par défaut: max, que Z.ai recommande pour le codage complexe. Réduire l'effort pour des réponses plus rapides, moins chères sur des tours simples, ou ensemble considérer à faux pour le chemin le plus bas. Quand le modèle pense, le raisonnement est retourné à côté de la réponse afin que vous puissiez le montrer ou le cacher.
Recherche Web
Jeu tool_web_search de laisser GLM-5.2 tirer des résultats en direct dans sa réponse. Le modèle décide du moment de la recherche, cite ce qu'il a utilisé, et les frais par appel ne s'appliquent que lorsqu'une recherche est effectuée. Laissez tomber pour un raisonnement complètement hors ligne.
Bon à savoir
Pour une sortie structurée stricte, exécutez avec la pensée désactivée de sorte que le modèle retourne JSON propre sans trace de raisonnement entrelacé. GLM-5.2 est text in et text out: pour la compréhension de l'image ou de la vidéo, choisissez un modèle multimodal dans le catalogue. Le contexte one-million-token contient confortablement de grandes bases de code, de longues transcriptions et des refacteurs multi-fichier en une seule requête.



