GLM 5.3 ist das Flaggschiff-Codierungs- und Agentic-Modell von Z.ai, das am 14. August 2026 veröffentlicht wurde. Es läuft auf demselben Basismodell wie GLM 5.2, wobei die Fortschritte durch eine verlängerte Post-Training statt durch einen neuen Pretraining-Lauf erzielt werden: Z.ai meldet eine Verbesserung der Codierung um 50 % gegenüber GLM 5.2 auf seinem eigenen Code Bench sowie state-of-the-art Ergebnisse bei Open-Source-Modellen auf Terminal Bench 3.0 und Agents' Last Exam.
GLM 5.3 ist heute über eine OpenAI-kompatible API auf EmpirioLabs verfügbar, mit Texteingabe und -ausgabe, einem 1M Token-Kontext, bis zu 128K Ausgabetokens, Funktionsaufrufen, JSON-Modus-strukturierter Ausgabe, integrierter Websuche und Streaming. Probier es in der spielplatz oder rufen Sie es von einem OpenAI-kompatiblen Client auf. Die volle Spec und aktuelle Preise leben auf der GLM 5.3 Modellseite und die API-Doku.
Preisgestaltung
Die Abrechnung basiert auf der Verwendung: Eingabe- und Ausgabetoken werden pro Token gemessen, und jede integrierte Websuche erhebt eine kleine Gebühr pro Anruf, die nur dann gilt, wenn eine Suche tatsächlich durchgeführt wird. Es gibt keine separate Cache-Schicht. Die aktuellen Pro-Token-Raten gelten immer auf dem modellblatt und die preisseite, die synchron mit dem bleiben, was ihnen aufgeladen wird.
Quickstart
Zeigen Sie ein OpenAI SDK auf die EmpirioLabs-Basis-URL und übergeben Sie glm-5-3 als modell:
von openai-import OpenAI-Client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3", messages=[ {"role": "user", "content": "Finde die Rennbedingung in diesem Worker-Pool und schlage eine Lösung vor."}, ], reasoning_effort="max",) print(resp.choices[0].message.content)
Dasselbe Modell, auf dem ID funktioniert, /v1/responses, die anthropische Form /v1/messages, und die Google-kompatiblen /v1beta/models/glm-5-3:generateContent Route. Alternative IDs GLM-5.3, zai/glm-5.3, und zhipu/glm-5.3 Entscheide dich auf dasselbe Modell.
Begründungsaufwand
GLM 5.3 stellt einen Native frei. reasoning effort Steuerung mit drei Ebenen: Niedrig Aus leichter Argumentation, hoch für erweitertes Denken und max Aus tiefgründigem Denken. Der Standard ist max, was Z.ai für komplexes Codieren und Langzeit-Agentenarbeit empfiehlt. Drop zu Niedrig Kurze, latenzempfindliche Wendungen.
Websuche und -tools
Setz tool_web_search zu Stimmt damit das Modell das Web vor der Antwort durchsuchen und die Ergebnisse mit eingrenzt mit search_recency_filter, search_domain_filter, und Graf. Funktionsaufrufe verwenden den Standard-OpenAI Werkzeuge Array, und tool_stream strömt Tool-Call-Argumente, sobald sie erzeugt werden.
Dinge, die es wert sind, vor Ihrem ersten Anruf zu wissen
- Das Denken kann nicht ausgeschaltet werden, daher ist es immer Teil deiner Ausgaberechnung. Im Gegensatz zu GLM 5.2 hat dieses Modell keinen Thinking-Off-Modus, und
reasoning effortnimmt nur an.Niedrig,hoch, undmax. Eine Anfrage, die eine andere Ebene verlangt oder das Denken zur Deaktivierung verlangt, wird auf der nächstgelegenen unterstützten Ebene ausgeliefert, anstatt fehlzuschlagen, sodass Code für GLM 5.2 weiterhin funktioniert. Reasoning-Token werden als Ausgabetoken abgestellt, und beimaxSelbst eine Ein-Wort-Antwort kann den Großteil ihres Output-Budgets mit Nachdenken verbringen, also senden Sie esNiedrigAusdrücklich für triviale Anrufe. - Strukturierte Ausgabe ist im JSON-Modus, nicht im Schema-Enforcement. Verwendung
response_formatmit{"type": "json_object"}und beschreibe die Felder, die du im Prompt möchtest. Die Bereitstellung eines JSON-Schemas wird akzeptiert, aber nicht durchgesetzt, also validiere das Ergebnis auf deiner Seite, anstatt die Form anzunehmen. - Es ist nur Text. Bilder, Videos und Dateiteile werden abgelehnt. Verwenden Sie ein Vision-Modell wie GLM 5.3 Flash für multimodale Eingaben.
Wohin als Nächstes gehen
Offen spielplatz um GLM 5.3 ohne Code zu versuchen, lesen Sie das API-Referenz für die vollständige Parameterliste oder durchsuchen Sie die Modellkatalog um es mit dem Rest der Besetzung zu vergleichen.



