घर ब्लॉग

Kimi K3 बनाम GLM 5.3 बनाम Qwen3.8 Max बनाम DeepSeek V4 Pro: सेल्फ-प्लेइंग फ्लैपी बर्ड और मिसाइल कमांड

Kimi K3 बनाम GLM 5.3 बनाम Qwen3.8 Max बनाम DeepSeek V4 Pro: सेल्फ-प्लेइंग फ्लैपी बर्ड और मिसाइल कमांड

Oct 6, 2026

EmpirioLabs AI

हम डालते हैं किमी K3, जीएलएम 5.3, Qwen3.8 अधिकतम 0902 तथा डीपसीक V4 प्रो 0813 दो एक-शॉट कोडिंग परीक्षणों में एक दूसरे के खिलाफ, सभी EmpirioLabs पर चलते हैं। प्रत्येक एक ही संकेत, एक प्रयास, कोई संपादन या पुन: प्रयास नहीं, और प्रत्येक परिणाम एक वास्तविक ब्राउज़र में लाइव प्रस्तुत किया गया।

चार तरफ़ा तुलना देखें

चश्मा एक नज़र में

किमी K3जीएलएम 5.3Qwen3.8 अधिकतम 0902डीपसीक V4 प्रो 0813
निर्मातामूनशॉट एआईZ.aiअलीबाबाडीपसीक
संदर्भ विंडो1,000,000 टोकन1,000,000 टोकन1,000,000 टोकन1,000,000 टोकन
इनपुटपाठ, चित्र और वीडियोटेक्स्टपाठ, चित्र और वीडियोटेक्स्ट
प्रयासअधिकतम तकअधिकतम तकअधिकतम तकअधिकतम तक
संरचित आउटपुटसख्त JSON स्कीमाJSON मोडसख्त JSON स्कीमासख्त JSON स्कीमा
इनपुट मूल्य$3.00 प्रति 1M टोकन$1.40 प्रति 1M टोकन$2.00 प्रति 1M टोकन$1.32 प्रति 1M टोकन
उत्पादन मूल्य$15.00 प्रति 1M टोकन$4.40 प्रति 1M टोकन$6.00 प्रति 1M टोकन$3.96 प्रति 1M टोकन

हमने इसे कैसे चलाया

प्रत्येक मॉडल को दो कार्यों के लिए समान संकेत प्राप्त हुआ: एक फ्लैपी बर्ड गेम बनाएं जो खुद को एक HTML फ़ाइल में खेलता है; एक मिसाइल कमांड गेम बनाएं जो खुद को एक HTML फ़ाइल में खेलता है। प्रत्येक कार्य ने एक एकल स्व-निहित HTML फ़ाइल के लिए कहा, जिसमें कोई बाहरी पुस्तकालय नहीं होता है जो अपने आप एनिमेट करता है। सभी चार मॉडल reasoning_effort: "अधिकतम" 65,536 टोकन आउटपुट बजट के साथ, एक शॉट, कोई पुनरावृत्ति नहीं। प्रत्येक पैनल पर लाइन की गिनती और tokens-per-second रीडआउट को वास्तविक एपीआई कॉल से मापा जाता है, और प्रत्येक परिणाम वह फ़ाइल होती है जिसे मॉडल लौटाता है, जैसा है वैसा ही प्रस्तुत किया जाता है।

क्या देखना है

डीपलक V4 प्रो 0813 ने अपनी फाइलों को सबसे तेजी से लगभग 115 टोकन प्रति सेकंड पर लौटाया। डीपलक V4 प्रो 0813 ने सबसे लंबी फाइलें लिखीं, औसतन लगभग 920 लाइनें, और किमी K3 सबसे कॉम्पैक्ट, लगभग 490। GLM 5.3 ने सबसे अधिक आउटपुट टोकन का उपयोग किया, लगभग 59,000 प्रति कार्य इसके तर्क सहित। देखें कि प्रत्येक मॉडल अपने दृश्य को कैसे जीवंत करता है: गति, विवरण और यह अपने आप कैसे चलता रहता है। हम विजेता घोषित नहीं कर रहे हैं। क्लिप चलाएं और अपने स्वयं के उपयोग के मामले के लिए आउटपुट का न्याय करें।

EmpirioLabs पर एक ही परीक्षण चलाएं

curl https://api.empiriolabs.ai/v1/chat/completions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "kimi-k3", "reasoning_effort": "अधिकतम", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "एक फ्लैपी बर्ड गेम बनाएं जो खुद को एक HTML फ़ाइल में खेलता है।

विनिमय करना मॉडल सेवा मेरे glm-5-3, qwen3-8-max-0902 या deepseek-v4-pro-0813 दूसरों के खिलाफ एक ही अनुरोध चलाने के लिए, या उन्हें अंतःक्रियात्मक रूप से आजमाएं खेल।.

अक्सर पूछे जाने वाले प्रश्नों

क्या परिणाम संपादित या पुन: प्रयास किए गए थे?

नहीं। प्रत्येक मॉडल को समान संकेत के साथ प्रति कार्य एक प्रयास मिला, और प्रदान किया गया परिणाम बिल्कुल वही फ़ाइल है जो उसने लौटाई थी।

अधिकतम तर्क क्यों?

एक निष्पक्ष सिर से सिर तक प्रत्येक मॉडल को उसके सर्वश्रेष्ठ रूप में दिखाता है। चारों EmpirioLabs पर एक reasoning_effort नियंत्रण को उजागर करते हैं, इसलिए चारों उच्चतम सेटिंग पर दौड़े।

मुझे किस मॉडल का उपयोग करना चाहिए?

डीपसीक V4 प्रो 0813 का आउटपुट मूल्य यहां चारों में से सबसे कम है। निर्णय लेने से पहले प्रत्येक के खिलाफ अपना कार्यभार चलाएं: एक ही अनुरोध सभी चार के लिए काम करता है और केवल मॉडल का नाम बदल दिया गया है।

इसे अजमाएं

खेल का मैदान (c) सभी मॉडल (c) मूल्य निर्धारण

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।