घर ब्लॉग

Kimi K3 बनाम GLM 5.3 बनाम Qwen3.8 Max vs DeepSeek V4 Pro: चार वन-शॉट कोडिंग टेस्ट

Kimi K3 बनाम GLM 5.3 बनाम Qwen3.8 Max vs DeepSeek V4 Pro: चार वन-शॉट कोडिंग टेस्ट

Oct 4, 2026

EmpirioLabs AI

हम डालते हैं किमी K3, जीएलएम 5.3, Qwen3.8 मैक्स तथा डीपसीक V4 प्रो 0813 चार एक-शॉट कोडिंग परीक्षणों में एक-दूसरे के खिलाफ, सभी EmpirioLabs पर चलते हैं। प्रत्येक एक ही संकेत, एक प्रयास, कोई संपादन या पुन: प्रयास नहीं, और प्रत्येक परिणाम एक वास्तविक ब्राउज़र में लाइव प्रस्तुत किया गया।

चार तरफ़ा तुलना देखें

चश्मा एक नज़र में

किमी K3जीएलएम 5.3Qwen3.8 मैक्सडीपसीक V4 प्रो 0813
निर्मातामूनशॉट एआईZ.aiअलीबाबाडीपसीक
संदर्भ विंडो1,000,000 टोकन1,000,000 टोकन1,000,000 टोकन1,000,000 टोकन
इनपुटपाठ, चित्र और वीडियोटेक्स्टपाठ, चित्र और वीडियोटेक्स्ट
रीजनिंग कंट्रोलreasoning_effort, अधिकतम करने के लिए कमreasoning_effort, अधिकतम करने के लिए कमreasoning_effort, अधिकतम करने के लिए कोई नहींreasoning_effort, अधिकतम करने के लिए कोई नहीं
संरचित आउटपुटसख्त JSON स्कीमाJSON मोडसख्त JSON स्कीमासख्त JSON स्कीमा
इनपुट मूल्य$3.00 प्रति 1M टोकन$1.40 प्रति 1M टोकन$2.00 प्रति 1M टोकन$1.32 प्रति 1M टोकन
उत्पादन मूल्य$15.00 प्रति 1M टोकन$4.40 प्रति 1M टोकन$6.00 प्रति 1M टोकन$3.96 प्रति 1M टोकन

हमने इसे कैसे चलाया

प्रत्येक मॉडल को चार कार्यों के लिए समान संकेत प्राप्त हुआ: एक भूलभुलैया जो उत्पन्न होती है और फिर एक एनिमेटेड ए * खोज, एक गिरती रेत सिमुलेशन, लहरों की सवारी करने वाली सेलबोट के साथ एक महासागर सूर्यास्त, और रात में एक खिड़की से नीचे चलने वाली बारिश। प्रत्येक कार्य ने एक एकल स्व-निहित HTML फ़ाइल के लिए कहा जिसमें कोई बाहरी पुस्तकालय नहीं था। सभी चार मॉडल दौड़े reasoning_effort: "अधिकतम" 65,536 टोकन आउटपुट बजट के साथ, एक शॉट, कोई पुनरावृत्ति नहीं। प्रत्येक पैनल पर लाइन की गिनती और tokens-per-second रीडआउट को वास्तविक एपीआई कॉल से मापा जाता है, और प्रत्येक परिणाम वह फ़ाइल होती है जिसे मॉडल लौटाता है, जैसा है वैसा ही प्रस्तुत किया जाता है।

क्या देखना है

डीपलक V4 प्रो 0813 ने अपनी फ़ाइलों को सबसे तेजी से लगभग 100 टोकन प्रति सेकंड पर लौटाया। Qwen3.8 मैक्स ने सबसे लंबी फाइलें लिखीं, औसतन लगभग 540 लाइनें, और किमी K3 सबसे कॉम्पैक्ट, लगभग 360। GLM 5.3 ने सबसे अधिक आउटपुट टोकन का उपयोग किया, लगभग 47,000 प्रति कार्य इसके तर्क सहित। देखें कि कैसे प्रत्येक मॉडल भूलभुलैया खोज को एनिमेट करता है, रेत को ढेर करता है, लहरों को हिलाता है और बारिश की बूंदों को विलय करता है। हम विजेता घोषित नहीं कर रहे हैं। क्लिप चलाएं और अपने स्वयं के उपयोग के मामले के लिए आउटपुट का न्याय करें।

EmpirioLabs पर एक ही परीक्षण चलाएं

curl https://api.empiriolabs.ai/v1/chat/completions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "kimi-k3", "reasoning_effort": "अधिकतम", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "एक भूलभुलैया बनाएं जो एक एकल HTML फ़ाइल में खुद को उत्पन्न और हल करती है।

विनिमय करना मॉडल सेवा मेरे glm-5-3, qwen3-8-max या deepseek-v4-pro-0813 दूसरों के खिलाफ एक ही अनुरोध चलाने के लिए, या उन्हें अंतःक्रियात्मक रूप से आजमाएं खेल।.

अक्सर पूछे जाने वाले प्रश्नों

क्या परिणाम संपादित या पुन: प्रयास किए गए थे?

नहीं। प्रत्येक मॉडल को समान संकेत के साथ प्रति कार्य एक प्रयास मिला, और प्रदान किया गया परिणाम बिल्कुल वही फ़ाइल है जो उसने लौटाई थी।

अधिकतम तर्क क्यों?

एक निष्पक्ष सिर से सिर तक प्रत्येक मॉडल को उसके सर्वश्रेष्ठ रूप में दिखाता है। चारों EmpirioLabs पर एक reasoning_effort नियंत्रण को उजागर करते हैं, इसलिए चारों उच्चतम सेटिंग पर दौड़े।

मुझे किस मॉडल का उपयोग करना चाहिए?

डीपलक वी4 प्रो 0813 की प्रति-टोकन कीमत चार में सबसे कम है और यहां सबसे तेज जवाब दिया गया है। Kimi K3 और Qwen3.8 Max छवियों और वीडियो के साथ-साथ टेक्स्ट भी स्वीकार करते हैं। GLM 5.3 कीमत पर डीपसीक के करीब बैठता है। निर्णय लेने से पहले प्रत्येक के खिलाफ अपना कार्यभार चलाएं।

इसे अजमाएं

खेल का मैदान (c) सभी मॉडल (c) मूल्य निर्धारण

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।