GLM 5.3 Z.ai का प्रमुख कोडिंग और एजेंट मॉडल है, जिसे 14 अगस्त, 2026 को रिलीज़ किया गया था। यह जीएलएम 5.2 के समान बेस मॉडल पर चलता है, जिसमें एक नए प्रीट्रेनिंग रन के बजाय विस्तारित पोस्ट-ट्रेनिंग से लाभ होता है: Z.ai अपने स्वयं के कोड बेंच पर जीएलएम 5.2 पर कोडिंग में 50% सुधार की रिपोर्ट करता है, साथ ही टर्मिनल बेंच 3.0 और एजेंटों की अंतिम परीक्षा पर ओपन-सोर्स मॉडल के बीच state-of-the-art परिणाम भी हैं।
GLM 5.3 आज EmpirioLabs पर एक OpenAI-संगत API के माध्यम से लाइव है, जिसमें टेक्स्ट इनपुट और आउटपुट, 1M टोकन संदर्भ, 128K आउटपुट टोकन, फ़ंक्शन कॉलिंग, JSON मोड संरचित आउटपुट, अंतर्निहित वेब खोज और स्ट्रीमिंग शामिल है। इसे में आज़माएं खेल इसे किसी भी OpenAI-compatible क्लाइंट से कॉल करें। पूर्ण कल्पना और वर्तमान दरों पर रहते हैं जीएलएम 5.3 मॉडल पेज और एपीआई डॉक।.
मूल्य निर्धारण
बिलिंग उपयोग आधारित है: इनपुट और आउटपुट टोकन प्रति टोकन मीटर किए जाते हैं, और प्रत्येक अंतर्निहित वेब खोज एक छोटा प्रति-कॉल शुल्क जोड़ती है जो केवल तभी लागू होती है जब कोई खोज वास्तव में चलती है। कोई अलग कैश टियर नहीं है। वर्तमान प्रति-टोकन दरें हमेशा मॉडल पेज और मूल्य निर्धारण पृष्ठ, जो आप जो चार्ज कर रहे हैं उसके साथ सिंक में रहते हैं।.
क्विकस्टार्ट
EmpirioLabs आधार URL पर किसी भी OpenAI SDK को इंगित करें और पास करें glm-5-3 मॉडल के रूप में:
OpenAI आयात से OpenAI क्लाइंट = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(मॉडल ="glm-5-3", messages=[ {"role": "उपयोगकर्ता", "सामग्री": "इस वर्कर पूल में दौड़ की स्थिति ढूंढें और एक फिक्स का प्रस्ताव करें। "}, ], reasoning_effort="अधिकतम",) print(resp.choices[0].message.content)
वही मॉडल आईडी काम करती है TOKEN, मानवशास्त्रीय आकार का TOKEN, और Google-संगत /v1beta/models/glm-5-3:generateContent मार्ग। वैकल्पिक आईडी जीएलएम-5.3, zai/glm-5.3, और zhipu/glm-5.3 एक ही मॉडल के लिए हल करें।
प्रयास
जीएलएम 5.3 एक मूल निवासी को उजागर करता है तर्क effort तीन स्तरों के साथ नियंत्रण: संख्या आदि हल्के तर्क के लिए, उच्च उन्नत तर्क के लिए, और अधिकतम गहरे तर्क के लिए। डिफ़ॉल्ट है अधिकतम, जो कि Z.ai जटिल कोडिंग और लंबे क्षितिज एजेंट के काम के लिए अनुशंसा करता है। करने के लिए ड्रॉप करें संख्या आदि संक्षेप में, विलंबता-संवेदनशील मोड़ों के लिए।
वेब खोज और उपकरण
सेट TOKEN सेवा मेरे सच जवाब देने से पहले मॉडल को वेब पर खोज करने दें, और परिणामों को संकीर्ण करें search_recency_filter, search_domain_filter, और गिनती. फ़ंक्शन कॉलिंग मानक OpenAI का उपयोग करती है उपकरण सरणी, और tool_stream स्ट्रीम टूल-कॉल तर्कों के रूप में वे उत्पादित होते हैं।
आपकी पहली कॉल से पहले जानने लायक बातें
- रीजनिंग को बंद नहीं किया जा सकता है, इसलिए यह हमेशा आपके आउटपुट बिल का हिस्सा होता है। जीएलएम 5.2 के विपरीत, इस मॉडल में कोई सोच-बंद मोड नहीं है, और
तर्क effortकेवल स्वीकार करता हैसंख्या आदि,उच्च, औरअधिकतम. एक अनुरोध जो एक अलग स्तर के लिए पूछता है, या अक्षम होने के लिए सोचता है, असफल होने के बजाय निकटतम समर्थित स्तर पर परोसा जाता है, इसलिए जीएलएम 5.2 के लिए लिखा गया कोड काम करता रहता है। रीजनिंग टोकन बिल आउटपुट टोकन के रूप में, और परअधिकतमयहां तक कि एक शब्द का उत्तर भी अपने आउटपुट बजट की अधिकांश सोच में खर्च कर सकता है, इसलिए भेजेंसंख्या आदिस्पष्ट रूप से तुच्छ कॉल के लिए। - संरचित आउटपुट JSON मोड है, स्कीमा प्रवर्तन नहीं। उपयोग
response_formatसाथ{"प्रकार": "json_object"}और प्रॉम्प्ट में इच्छित फ़ील्ड का वर्णन करें। JSON स्कीमा की आपूर्ति स्वीकार की जाती है लेकिन लागू नहीं की जाती है, इसलिए आकार ग्रहण करने के बजाय अपनी तरफ से परिणाम को मान्य करें। - यह केवल पाठ है। छवियाँ, वीडियो और फ़ाइल भागों को अस्वीकार कर दिया जाता है। मल्टीमॉडल इनपुट के लिए GLM 5.3 फ्लैश जैसे विजन मॉडल का उपयोग करें।
आगे कहां जाना है
ओपन खेल कोड लिखे बिना GLM 5.3 आज़माने के लिए, पढ़ें एपीआई संदर्भ पूर्ण पैरामीटर सूची के लिए, या ब्राउज़ करें मॉडल कैटलॉग बाकी लाइनअप के साथ इसकी तुलना करने के लिए।



