GLM 4.7 Flash API

Kostenloses, leichtes GLM-4.7-Textmodell für Codierung, Argumentation, Langkontextschreiben und allgemeinen Chat.

Z.aiTextgenerierung200K KontextVeröffentlicht 19. Jan. 2026SingaporeProprietärer Endpoint

Über GLM 4.7 Flash

Kostenloses, leichtes GLM-4.7-Textmodell für Codierung, Argumentation, Langkontextschreiben und allgemeinen Chat.

Base Token Nutzung ist kostenlos. Die integrierte Websuche ist optional über tool_web_search und fügt $0.033 pro Anforderung hinzu, wenn sie aktiviert ist. Unterstützt Funktionstools, tool choice auto, JSON response format, think control, tool stream, temperature, top p, do sample, max tokens, stop und streaming.

Auch bekannt als GLM Flash, Z.ai GLM 4.7 Flash, GLM-4.7-Flash, glm-4-7-flash

reasoningfunction callingweb search

GLM 4.7 Flash Spezifikationen

Modell-ID
glm-4-7-flash
Anbieter
Z.ai
Kategorie
Textgenerierung
Veröffentlicht
19. Jan. 2026
Kontextfenster
200K Token
Max. Ausgabe
131.072 Token
Eingabe
Text
Ausgabe
Text
Strukturierte Ausgabe
JSON-Modus
Region
Singapore
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-4-7-flash:generateContent
Alternative Modell-IDs
glm-4.7-flashzai/glm-4.7-flashzhipu/glm-4.7-flash

GLM 4.7 Flash API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Eingabe
pro 1M prompte Token
Kostenlos
Ausgabe
pro 1M generierte Token
Kostenlos
Impliziter Cache Read
pro 1M zwischengespeicherte Eingangstoken
Kostenlos
Web-Suche
pro Anfrage, wenn aktiviert
$0.033
Auf der vollständigen Preisseite vergleichen

So rufst du die GLM 4.7 Flash API auf

GLM 4.7 Flash bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID glm-4-7-flash. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-4-7-flash",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="glm-4-7-flash",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Vollständige GLM 4.7 Flash API-Referenz

GLM 4.7 Flash API-Parameter

Request-Parameter, die die GLM 4.7 Flash API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
temperaturenumber10 bis 1Temperatur wird geprochen. Niedrigere Werte sind deterministischer. GLM-4.7-Flash und GLM-4.6V-Flash sind standardmäßig auf 1.0 eingestellt; GLM-4.5-Flash steht...
top_pnumber0.950.01 bis 1Kernprobenwahrscheinlichkeitsmasse. Z.AI dokumentiert einen Standard von 0,95 für die GLM-4.7-, GLM-4.6- und GLM-4.5-Serien.
max_tokensnumber40961 bis 131072Maximale Ausgabetoken für GLM-4.7-Flash: 131072.
stoparray--Hör auf mit der Wortliste. Z.AI unterstützt derzeit eine Ein-Stopp-String in Array-Form.
do_samplebooleantrue-Aktivieren Sie das Sampling. Wenn falsch, beeinflussen Temperatur und top_p die Erzeugung nicht.
enable_thinkingbooleantrue-Kontrolliert Z.AI Denkmodus. Aktiviert ist der Standard und lässt GLM-4.7-Flash denken; Deaktiviere es für einfache, latenzarme Drehungen.
thinkingobject--Fortschrittliches Denkobjekt. Verwenden Sie {"type":"enabled"} oder {"type":"disabled"}. GLM-4.7-Flash denkt, wenn es aktiviert ist.
toolsarray--Funktionswerkzeuge und das integrierte web_search-Tool werden unterstützt.
tool_choiceenumautoautoKontrolliert, ob das Modell Werkzeuge verwenden darf. Z.AI Dokumente automatische Werkzeugauswahl; Weglassen Sie Werkzeuge, um die Werkzeugnutzung zu deaktivieren.
tool_streambooleanfalse-Das Stream-Funktionsaufruf-Tool gibt aus, wenn der Stream true ist. Z.AI Dokumente tool_stream für GLM-4.6 und neuere Modelle.
tool_web_searchbooleanfalse-Aktivieren Sie die integrierte Websuche. Fügt $0.033 pro Anfrage hinzu, wenn sie aktiviert ist.
search_resultbooleantrue-Geben Sie strukturierte Websuchergebnismetadaten zurück, wenn die Websuche aktiviert ist.
search_promptstring--Optionale Anleitung zur Zusammenfassung der abgerufenen Websuchergebnisse.
countnumber101 bis 50Anzahl der zu abrufenden Websuchergebnisse.
3 weitere Parameter in den Docs

Gut zu wissen

Base Token Nutzung ist kostenlos. Die integrierte Websuche ist optional über tool_web_search und fügt $0.033 pro Anforderung hinzu, wenn sie aktiviert ist.

GLM 4.7 Flash API: häufige Fragen

Wie viel kostet die GLM 4.7 Flash API?

Auf EmpirioLabs wird GLM 4.7 Flash nach Verbrauch abgerechnet. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Wie groß ist das Kontextfenster von GLM 4.7 Flash?

GLM 4.7 Flash unterstützt ein Kontextfenster von 200K Token mit bis zu 131.072 Ausgabe-Token pro Antwort.

Ist die GLM 4.7 Flash API OpenAI-kompatibel?

Ja. GLM 4.7 Flash bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID glm-4-7-flash verwendest.

Kann ich GLM 4.7 Flash im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt GLM 4.7 Flash im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen GLM 4.7 Flash API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.