हम डालते हैं किमी K3, जीएलएम 5.3, Qwen3.8 मैक्स तथा डीपसीक V4 प्रो 0813 चार एक-शॉट कोडिंग परीक्षणों में एक-दूसरे के खिलाफ, सभी EmpirioLabs पर चलते हैं। प्रत्येक एक ही संकेत, एक प्रयास, कोई संपादन या पुन: प्रयास नहीं, और प्रत्येक परिणाम एक वास्तविक ब्राउज़र में लाइव प्रस्तुत किया गया।
चार तरफ़ा तुलना देखें
चश्मा एक नज़र में
| किमी K3 | जीएलएम 5.3 | Qwen3.8 मैक्स | डीपसीक V4 प्रो 0813 | |
|---|---|---|---|---|
| निर्माता | मूनशॉट एआई | Z.ai | अलीबाबा | डीपसीक |
| संदर्भ विंडो | 1,000,000 टोकन | 1,000,000 टोकन | 1,000,000 टोकन | 1,000,000 टोकन |
| इनपुट | पाठ, चित्र और वीडियो | टेक्स्ट | पाठ, चित्र और वीडियो | टेक्स्ट |
| रीजनिंग कंट्रोल | reasoning_effort, अधिकतम करने के लिए कम | reasoning_effort, अधिकतम करने के लिए कम | reasoning_effort, अधिकतम करने के लिए कोई नहीं | reasoning_effort, अधिकतम करने के लिए कोई नहीं |
| संरचित आउटपुट | सख्त JSON स्कीमा | JSON मोड | सख्त JSON स्कीमा | सख्त JSON स्कीमा |
| इनपुट मूल्य | $3.00 प्रति 1M टोकन | $1.40 प्रति 1M टोकन | $2.00 प्रति 1M टोकन | $1.32 प्रति 1M टोकन |
| उत्पादन मूल्य | $15.00 प्रति 1M टोकन | $4.40 प्रति 1M टोकन | $6.00 प्रति 1M टोकन | $3.96 प्रति 1M टोकन |
हमने इसे कैसे चलाया
प्रत्येक मॉडल को चार कार्यों के लिए समान संकेत प्राप्त हुआ: एक भूलभुलैया जो उत्पन्न होती है और फिर एक एनिमेटेड ए * खोज, एक गिरती रेत सिमुलेशन, लहरों की सवारी करने वाली सेलबोट के साथ एक महासागर सूर्यास्त, और रात में एक खिड़की से नीचे चलने वाली बारिश। प्रत्येक कार्य ने एक एकल स्व-निहित HTML फ़ाइल के लिए कहा जिसमें कोई बाहरी पुस्तकालय नहीं था। सभी चार मॉडल दौड़े reasoning_effort: "अधिकतम" 65,536 टोकन आउटपुट बजट के साथ, एक शॉट, कोई पुनरावृत्ति नहीं। प्रत्येक पैनल पर लाइन की गिनती और tokens-per-second रीडआउट को वास्तविक एपीआई कॉल से मापा जाता है, और प्रत्येक परिणाम वह फ़ाइल होती है जिसे मॉडल लौटाता है, जैसा है वैसा ही प्रस्तुत किया जाता है।
क्या देखना है
डीपलक V4 प्रो 0813 ने अपनी फ़ाइलों को सबसे तेजी से लगभग 100 टोकन प्रति सेकंड पर लौटाया। Qwen3.8 मैक्स ने सबसे लंबी फाइलें लिखीं, औसतन लगभग 540 लाइनें, और किमी K3 सबसे कॉम्पैक्ट, लगभग 360। GLM 5.3 ने सबसे अधिक आउटपुट टोकन का उपयोग किया, लगभग 47,000 प्रति कार्य इसके तर्क सहित। देखें कि कैसे प्रत्येक मॉडल भूलभुलैया खोज को एनिमेट करता है, रेत को ढेर करता है, लहरों को हिलाता है और बारिश की बूंदों को विलय करता है। हम विजेता घोषित नहीं कर रहे हैं। क्लिप चलाएं और अपने स्वयं के उपयोग के मामले के लिए आउटपुट का न्याय करें।
EmpirioLabs पर एक ही परीक्षण चलाएं
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "kimi-k3", "reasoning_effort": "अधिकतम", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "एक भूलभुलैया बनाएं जो एक एकल HTML फ़ाइल में खुद को उत्पन्न और हल करती है।
विनिमय करना मॉडल सेवा मेरे glm-5-3, qwen3-8-max या deepseek-v4-pro-0813 दूसरों के खिलाफ एक ही अनुरोध चलाने के लिए, या उन्हें अंतःक्रियात्मक रूप से आजमाएं खेल।.
अक्सर पूछे जाने वाले प्रश्नों
क्या परिणाम संपादित या पुन: प्रयास किए गए थे?
नहीं। प्रत्येक मॉडल को समान संकेत के साथ प्रति कार्य एक प्रयास मिला, और प्रदान किया गया परिणाम बिल्कुल वही फ़ाइल है जो उसने लौटाई थी।
अधिकतम तर्क क्यों?
एक निष्पक्ष सिर से सिर तक प्रत्येक मॉडल को उसके सर्वश्रेष्ठ रूप में दिखाता है। चारों EmpirioLabs पर एक reasoning_effort नियंत्रण को उजागर करते हैं, इसलिए चारों उच्चतम सेटिंग पर दौड़े।
मुझे किस मॉडल का उपयोग करना चाहिए?
डीपलक वी4 प्रो 0813 की प्रति-टोकन कीमत चार में सबसे कम है और यहां सबसे तेज जवाब दिया गया है। Kimi K3 और Qwen3.8 Max छवियों और वीडियो के साथ-साथ टेक्स्ट भी स्वीकार करते हैं। GLM 5.3 कीमत पर डीपसीक के करीब बैठता है। निर्णय लेने से पहले प्रत्येक के खिलाफ अपना कार्यभार चलाएं।
इसे अजमाएं
खेल का मैदान (c) सभी मॉडल (c) मूल्य निर्धारण



