Zuhause Blog

So verwenden Sie die GLM-5.2 API

GLM-5.2 über API Cover

Jun 16, 2026

EmpirioLabs AI

GLM-5.2 ist Z.ai Flaggschiff Argumentation und Codierung Modell, veröffentlicht am 13. Juni 2026. Es verbindet ein one-million-token Kontextfenster mit einstellbarem Argumentationsaufwand, so dass Sie wählen können, wie hart das Modell denkt, bevor es antwortet, und es wird mit integrierter Websuche und Tool-Aufruf ausgeliefert. Z.ai positioniert es als ein Codierungsmodell, das eine starke allgemeine Argumentation beibehält und maximalen Argumentationsaufwand für komplexe, mehrstufige Engineering-Arbeit empfiehlt.

GLM-5.2 ist live auf EmpirioLabs heute über eine OpenAI-kompatible API, mit Text-Eingabe und -Ausgabe, einem 1M-Token-Kontext, bis zu 128K Output-Token, Funktionsaufruf, JSON-Modus strukturierte Ausgabe und Streaming. Probieren Sie es in der spielplatz oder rufen Sie es von einem OpenAI-kompatiblen Client auf. Die volle Spec und aktuelle Preise leben auf der GLM-5.2 Modellseite und die API-Doku.

Preisgestaltung

Die Abrechnung basiert auf der Verwendung: Eingabe- und Ausgabetoken werden pro Token gemessen, und jede integrierte Websuche erhebt eine kleine Gebühr pro Anruf, die nur dann gilt, wenn eine Suche tatsächlich durchgeführt wird. Es gibt keine separate Cache-Schicht. Die aktuellen Pro-Token-Raten gelten immer auf dem modellblatt und die preisseite, die synchron mit dem bleiben, was ihnen aufgeladen wird.

Quickstart

Zeigen Sie ein OpenAI SDK auf die EmpirioLabs-Basis-URL und übergeben Sie glm-5-2 als modell:

aus openai import OpenAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1", api key="YOUR EMPIRIOLABS API KEY",) resp = client.chat.completions.create(model=" glm-5-2 ", messages=[{"role": "user", "content": "Refactor this Python loop into a list comprehension and explain why."}, ], reasoning effort="high",) print(resp.choices[0]message.content)

Begründungsaufwand

GLM-5.2 zeigt einen Native reasoning effort kontrolle mit niveaus von minimal bis zu max, plus nicht um das Denken völlig abzuschalten. Der Default ist max, die Z.ai für komplexe Codierung empfiehlt. Verringern Sie den Aufwand für schnellere, billigere Antworten auf einfache Runden oder setzen enable thinking für den Pfad mit der niedrigsten Latenz. Wenn das Modell denkt, wird die Argumentation neben der Antwort zurückgegeben, damit Sie sie zeigen oder verstecken können.

Web-Suche

Setz tool_web_search gLM-5.2 zieht Live-Ergebnisse in seine Antwort. Das modell entscheidet, wann es sucht, nennt, was es verwendet hat, und die pro-call-gebühr gilt nur, wenn eine suche läuft. Lassen Sie es für vollständig offline Argumentation aus.

Gut zu wissen

Führen Sie für eine streng strukturierte Ausgabe mit deaktiviertem Denken aus, damit das Modell sauberes JSON ohne eine verschachtelte Argumentationsspur zurückgibt. GLM-5.2 ist Text in und Text aus: zum Bild- oder Videoverständnis wählen Sie ein multimodales Modell aus dem katalogDer one-million-token Kontext enthält bequem große Codebasen, lange Transkripte und Multi-Datei-Refactoren in einer einzigen Anforderung.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.