Zuhause Blog

Wie man die GLM 5.3 Flash API verwendet

Wie man die GLM 5.3 Flash API verwendet

Aug 26, 2026

EmpirioLabs AI

GLM 5.3 Flash ist das erste nativ multimodale Modell der GLM-5-Familie von Z.ai, das am 26. August 2026 unter der MIT-Lizenz nach einer früheren Vorschau als Ox Alpha veröffentlicht wurde. Es handelt sich um ein 320B-A18B-mixture-of-experts, das auf einem multimodalen Korpus trainiert wurde, und Z.ai berichtet, dass es GLM 5.2 in Codierungs- und agentischen Benchmarks zu einem Bruchteil des Preises übertrifft, mit Ergebnissen, die deutlich größere Frontier-Coding-Modelle erreichen.

GLM 5.3 Flash ist heute über eine OpenAI-kompatible API auf EmpirioLabs verfügbar, mit Text-, Bild-, Video- und Dateieingaben, einem 1M Token-Kontext, bis zu 128K Ausgabetokens, Funktionsaufrufen, strukturierter Ausgabe im JSON-Modus, integrierter Websuche und Streaming. Probier es in der spielplatz oder rufen Sie es von einem OpenAI-kompatiblen Client auf. Die volle Spec und aktuelle Preise leben auf der GLM 5.3 Flash-Modellseite und die API-Doku.

Preisgestaltung

Die Abrechnung basiert auf der Verwendung: Eingabe- und Ausgabetoken werden pro Token gemessen, und jede integrierte Websuche erhebt eine kleine Gebühr pro Anruf, die nur dann gilt, wenn eine Suche tatsächlich durchgeführt wird. Es gibt keine separate Cache-Schicht. Die aktuellen Pro-Token-Raten gelten immer auf dem modellblatt und die preisseite, die synchron mit dem bleiben, was ihnen aufgeladen wird.

Quickstart

Zeigen Sie ein OpenAI SDK auf die EmpirioLabs-Basis-URL und übergeben Sie glm-5-3-flash als modell:

from openai import OpenAI-Client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "Was fehlt in diesem Screenshot des Build-Logs?"}, {"type": "image_url", "image_url": {"url": "https://example.com/build-log.png"}}, ]}, ], reasoning_effort="low",) print(resp.choices[0].message.content)

Dasselbe Modell, auf dem ID funktioniert, /v1/responses, die anthropische Form /v1/messages, und die Google-kompatiblen /v1beta/models/glm-5-3-flash:generateContent Route. Alternative IDs glm-5.3-flash, zai/glm-5.3-flash, und zhipu/glm-5.3-flash Entscheide dich auf dasselbe Modell.

Multimodaler Eingang

Bilder, Videos und Dateien fahren im Standard-Inhaltsteile-Array: image_url für Bilder, video_url für Video, und file_url für Dokumente. Übergeben Sie eine öffentliche HTTPS-URL (empfohlen) oder eine base64-Daten-URL. Z.ai positioniert das Modell für agentische Visionsarbeit: Es kann Schnittstellen, gerenderte Ausgaben und Interaktionsfeedback lesen, was die Schleife zwischen Code, Browsern und GUIs schließt.

Begründungsaufwand

GLM 5.3 Flash belichtet einen nativen Bildschirm reasoning effort Steuerung mit drei Ebenen: Niedrig Aus leichter Argumentation, hoch für erweitertes Denken und max Aus tiefgründigem Denken. Der Standard ist max, was Z.ai für komplexes Codieren und Langzeit-Agentenarbeit empfiehlt. Drop zu Niedrig Kurze, latenzempfindliche Wendungen.

Websuche und -tools

Setz tool_web_search zu Stimmt damit das Modell das Web vor der Antwort durchsuchen und die Ergebnisse mit eingrenzt mit search_recency_filter, search_domain_filter, und Graf. Funktionsaufrufe verwenden den Standard-OpenAI Werkzeuge Array, und tool_stream strömt Tool-Call-Argumente, sobald sie erzeugt werden.

Dinge, die es wert sind, vor Ihrem ersten Anruf zu wissen

  • Das Denken kann nicht ausgeschaltet werden, daher ist es immer Teil deiner Ausgaberechnung. reasoning effort nimmt nur an. Niedrig, hoch, und max. Eine Anfrage, die eine andere Ebene verlangt oder denkt, deaktiviert zu werden, wird auf der nächstgelegenen unterstützten Ebene ausgeliefert, anstatt auszufallen, sodass Code für andere GLM-Modelle weiterhin funktioniert. Reasoning-Token werden als Ausgabetoken abgestellt, und bei max Selbst eine Ein-Wort-Antwort kann den Großteil ihres Output-Budgets mit Nachdenken verbringen, also senden Sie es Niedrig Ausdrücklich für triviale Anrufe.
  • Strukturierte Ausgabe ist im JSON-Modus, nicht im Schema-Enforcement. Verwendung response_format mit {"type": "json_object"} und beschreibe die Felder, die du im Prompt möchtest. Die Bereitstellung eines JSON-Schemas wird akzeptiert, aber nicht durchgesetzt, also validiere das Ergebnis auf deiner Seite, anstatt die Form anzunehmen.
  • Medienteile sollten URLs sein, die der Dienst abrufen kann. Das Modell holt image_url, video_url, und file_url target sich selbst, sodass eine URL hinter einem Login oder einem privaten Netzwerk die Anfrage fehlschlägt. Wenn das Medium nicht öffentlich erreichbar ist, werden sie stattdessen als base64-Daten-URL eingeblendet.

Wohin als Nächstes gehen

Offen spielplatz um GLM 5.3 Flash ohne Code zu schreiben, lesen Sie das API-Referenz für die vollständige Parameterliste oder durchsuchen Sie die Modellkatalog um es mit dem Rest der Besetzung zu vergleichen.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.