हम डालते हैं किमी K3, जीएलएम 5.3, Qwen3.8 अधिकतम 0902 तथा डीपसीक V4 प्रो 0813 तीन एक-शॉट कोडिंग परीक्षणों में एक दूसरे के खिलाफ, सभी EmpirioLabs पर चलते हैं। प्रत्येक एक ही संकेत, एक प्रयास, कोई संपादन या पुन: प्रयास नहीं, और प्रत्येक परिणाम एक वास्तविक ब्राउज़र में लाइव प्रस्तुत किया गया।
चार तरफ़ा तुलना देखें
चश्मा एक नज़र में
| किमी K3 | जीएलएम 5.3 | Qwen3.8 अधिकतम 0902 | डीपसीक V4 प्रो 0813 | |
|---|---|---|---|---|
| निर्माता | मूनशॉट एआई | Z.ai | अलीबाबा | डीपसीक |
| संदर्भ विंडो | 1,000,000 टोकन | 1,000,000 टोकन | 1,000,000 टोकन | 1,000,000 टोकन |
| इनपुट | पाठ, चित्र और वीडियो | टेक्स्ट | पाठ, चित्र और वीडियो | टेक्स्ट |
| प्रयास | अधिकतम तक | अधिकतम तक | अधिकतम तक | अधिकतम तक |
| संरचित आउटपुट | सख्त JSON स्कीमा | JSON मोड | सख्त JSON स्कीमा | सख्त JSON स्कीमा |
| इनपुट मूल्य | $3.00 प्रति 1M टोकन | $1.40 प्रति 1M टोकन | $2.00 प्रति 1M टोकन | $1.32 प्रति 1M टोकन |
| उत्पादन मूल्य | $15.00 प्रति 1M टोकन | $4.40 प्रति 1M टोकन | $6.00 प्रति 1M टोकन | $3.96 प्रति 1M टोकन |
हमने इसे कैसे चलाया
प्रत्येक मॉडल को तीन कार्यों के लिए समान संकेत प्राप्त हुआ: एक एकल HTML फ़ाइल में एक जीवित मछलीघर का निर्माण करें; एक एकल HTML फ़ाइल में बादलों के माध्यम से उड़ने वाले एक पेपर हवाई जहाज का निर्माण करें; एक एकल HTML फ़ाइल में इसके चारों ओर चलने वाली कार के साथ एक छोटा ग्रह बनाएं। प्रत्येक कार्य ने एक एकल स्व-निहित HTML फ़ाइल के लिए कहा जिसमें कोई बाहरी पुस्तकालय नहीं है जो अपने आप एनिमेट करता है। सभी चार मॉडल चले reasoning_effort: "अधिकतम" 65,536 टोकन आउटपुट बजट के साथ, एक शॉट, कोई पुनरावृत्ति नहीं। प्रत्येक पैनल पर लाइन की गिनती और tokens-per-second रीडआउट को वास्तविक एपीआई कॉल से मापा जाता है, और प्रत्येक परिणाम वह फ़ाइल होती है जिसे मॉडल लौटाता है, जैसा है वैसा ही प्रस्तुत किया जाता है।
क्या देखना है
डीपलक वी4 प्रो 0813 ने अपनी फाइलों को सबसे तेजी से लगभग 114 टोकन प्रति सेकंड पर लौटाया। जीएलएम 5.3 ने सबसे लंबी फाइलें लिखीं, औसतन लगभग 710 लाइनें, और किमी के3 सबसे कॉम्पैक्ट, लगभग 450। जीएलएम 5.3 ने सबसे अधिक आउटपुट टोकन का उपयोग किया, लगभग 54,000 प्रति कार्य इसके तर्क सहित। देखें कि प्रत्येक मॉडल अपने दृश्य को कैसे जीवंत करता है: गति, विवरण और यह अपने आप कैसे चलता रहता है। हम विजेता घोषित नहीं कर रहे हैं। क्लिप चलाएं और अपने स्वयं के उपयोग के मामले के लिए आउटपुट का न्याय करें।
EmpirioLabs पर एक ही परीक्षण चलाएं
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "kimi-k3", "reasoning_effort": "अधिकतम", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "एकल HTML फ़ाइल में एक जीवित मछलीघर बनाएं।
विनिमय करना मॉडल सेवा मेरे glm-5-3, qwen3-8-max-0902 या deepseek-v4-pro-0813 दूसरों के खिलाफ एक ही अनुरोध चलाने के लिए, या उन्हें अंतःक्रियात्मक रूप से आजमाएं खेल।.
अक्सर पूछे जाने वाले प्रश्नों
क्या परिणाम संपादित या पुन: प्रयास किए गए थे?
नहीं। प्रत्येक मॉडल को समान संकेत के साथ प्रति कार्य एक प्रयास मिला, और प्रदान किया गया परिणाम बिल्कुल वही फ़ाइल है जो उसने लौटाई थी।
अधिकतम तर्क क्यों?
एक निष्पक्ष सिर से सिर तक प्रत्येक मॉडल को उसके सर्वश्रेष्ठ रूप में दिखाता है। चारों EmpirioLabs पर एक reasoning_effort नियंत्रण को उजागर करते हैं, इसलिए चारों उच्चतम सेटिंग पर दौड़े।
मुझे किस मॉडल का उपयोग करना चाहिए?
डीपसीक V4 प्रो 0813 का आउटपुट मूल्य यहां चारों में से सबसे कम है। निर्णय लेने से पहले प्रत्येक के खिलाफ अपना कार्यभार चलाएं: एक ही अनुरोध सभी चार के लिए काम करता है और केवल मॉडल का नाम बदल दिया गया है।
इसे अजमाएं
खेल का मैदान (c) सभी मॉडल (c) मूल्य निर्धारण



