
Nativ multimodales Flash-Modell mit einem 1-Millionen-Token-Kontext, Bild- und Videoeingabe, ständigem Denken, nativer Websuche und Werkzeugaufrufen.
Nativ multimodales Flash-Modell mit einem 1-Millionen-Token-Kontext, Bild- und Videoeingabe, ständigem Denken, nativer Websuche und Werkzeugaufrufen.
Anmerkungen: - Kontextfenster: 1 Mio. Tokens - Maximaler Ausgang: 128.000 Tokens - Akzeptiert Text-, Bild-, Video- und Dateieingaben - Immer begründet; Denken kann nicht deaktiviert werden – Schlussfolgerungsaufwand: niedrig, hoch oder maximal (maximal empfohlen für komplexes Programmieren) – Eine Anfrage für eine andere Anstrengung oder zum Ausschalten des Denkens wird auf der nächstgelegenen unterstützten Ebene bereitgestellt – Eingebaute Websuche fügt bei Verwendung $0.033 pro Anfrage hinzu – Unterstützt Funktionsaufrufe, strukturierte Ausgabe (JSON-Modus) und Streaming
Auch bekannt als GLM Flash, Z.ai GLM 5.3 Flash
glm-5-3-flash/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-5-3-flash:generateContentglm-5.3-flashzai/glm-5.3-flashzhipu/glm-5.3-flashLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
GLM 5.3 Flash bedient die OpenAI-kompatible Chat Completions API. Richte ein beliebiges OpenAI SDK mit deinem EmpirioLabs API-Schlüssel auf https://api.empiriolabs.ai/v1 und verwende die Modell-ID glm-5-3-flash. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5-3-flash",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="glm-5-3-flash",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Request-Parameter, die die GLM 5.3 Flash API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| max_tokens | integer | 65536 | 1 bis 131072 | Maximale Anzahl der zu generierenden Ausgabetoken. |
| temperature | number | 1 | 0 bis 1 | Kontrolliert Zufall. Niedrigere Werte machen die Antworten deterministischer. |
| top_p | number | 0.95 | 0.01 bis 1 | Kernproben-Cutoff. |
| reasoning_effort | enum | max | low, high, max | GLM 5.3 Flash-Schlussfolgerung. Dieses Modell argumentiert immer und kann nicht ausgeschaltet werden. Niedrig ist leicht, hoch ist verbessert und Max ist... |
| do_sample | boolean | true | - | Aktivieren Sie das Sampling. Schalten Sie es für gierige deterministische Ausgaben aus (Temperatur und top_p werden ignoriert). |
| tool_web_search | boolean | false | - | Aktivieren Sie die integrierte Websuche. Fügt $0.033 pro Anfrage hinzu, wenn man es nutzt. |
| search_recency_filter | enum | noLimit | oneDay, oneWeek, oneMonth, oneYear, noLimit | Beschränke die Websuchergebnisse auf ein aktuelles Fenster. |
| count | integer | 10 | 1 bis 50 | Anzahl der Websuchergebnisse, die abgerufen werden müssen, wenn die Websuche aktiviert ist. |
| search_domain_filter | string | - | - | Beschränke die Websuche auf eine bestimmte Domäne. |
| search_prompt | string | - | - | Optionaler Prompt, der verwendet wird, um abgerufene Websuchergebnisse zusammenzufassen. |
| search_result | boolean | true | - | Geben Sie die Metadaten der Websuchergebnisse in der Antwort zurück, wenn die Websuche aktiviert ist. |
| tool_stream | boolean | false | - | Streame Funktionsaufruf-Argumente inkrementell, wenn du streamst. |
| tools | array | [] | - | OpenAI-kompatible Funktionsaufruf-Werkzeugdefinitionen. |
| tool_choice | object | - | - | OpenAI-kompatible Werkzeugwahlsteuerung. |
Auf EmpirioLabs wird GLM 5.3 Flash nach Verbrauch abgerechnet: Eingabe $0.075 pro 1M Prompt-Token; Output $0.25 pro 1 Million generierter Token; Web-Suche $0.033 auf Wunsch. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
GLM 5.3 Flash unterstützt ein Kontextfenster von 1M Token mit bis zu 131.072 Ausgabe-Token pro Antwort.
Ja. GLM 5.3 Flash bedient die OpenAI-kompatible Chat Completions API. Bestehende OpenAI SDKs funktionieren, indem du base_url auf https://api.empiriolabs.ai/v1 setzt und als Modell-ID glm-5-3-flash verwendest.
Ja. Der EmpirioLabs Playground führt GLM 5.3 Flash im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.