हम डालते हैं किमी K3, जीएलएम 5.3, Qwen3.8 अधिकतम 0902 तथा डीपसीक V4 प्रो 0813 दो एक-शॉट कोडिंग परीक्षणों में एक दूसरे के खिलाफ, सभी EmpirioLabs पर चलते हैं। प्रत्येक एक ही संकेत, एक प्रयास, कोई संपादन या पुन: प्रयास नहीं, और प्रत्येक परिणाम एक वास्तविक ब्राउज़र में लाइव प्रस्तुत किया गया।
चार तरफ़ा तुलना देखें
चश्मा एक नज़र में
| किमी K3 | जीएलएम 5.3 | Qwen3.8 अधिकतम 0902 | डीपसीक V4 प्रो 0813 | |
|---|---|---|---|---|
| निर्माता | मूनशॉट एआई | Z.ai | अलीबाबा | डीपसीक |
| संदर्भ विंडो | 1,000,000 टोकन | 1,000,000 टोकन | 1,000,000 टोकन | 1,000,000 टोकन |
| इनपुट | पाठ, चित्र और वीडियो | टेक्स्ट | पाठ, चित्र और वीडियो | टेक्स्ट |
| प्रयास | अधिकतम तक | अधिकतम तक | अधिकतम तक | अधिकतम तक |
| संरचित आउटपुट | सख्त JSON स्कीमा | JSON मोड | सख्त JSON स्कीमा | सख्त JSON स्कीमा |
| इनपुट मूल्य | $3.00 प्रति 1M टोकन | $1.40 प्रति 1M टोकन | $2.00 प्रति 1M टोकन | $1.32 प्रति 1M टोकन |
| उत्पादन मूल्य | $15.00 प्रति 1M टोकन | $4.40 प्रति 1M टोकन | $6.00 प्रति 1M टोकन | $3.96 प्रति 1M टोकन |
हमने इसे कैसे चलाया
प्रत्येक मॉडल को दो कार्यों के लिए समान संकेत प्राप्त हुआ: एक फ्लैपी बर्ड गेम बनाएं जो खुद को एक HTML फ़ाइल में खेलता है; एक मिसाइल कमांड गेम बनाएं जो खुद को एक HTML फ़ाइल में खेलता है। प्रत्येक कार्य ने एक एकल स्व-निहित HTML फ़ाइल के लिए कहा, जिसमें कोई बाहरी पुस्तकालय नहीं होता है जो अपने आप एनिमेट करता है। सभी चार मॉडल reasoning_effort: "अधिकतम" 65,536 टोकन आउटपुट बजट के साथ, एक शॉट, कोई पुनरावृत्ति नहीं। प्रत्येक पैनल पर लाइन की गिनती और tokens-per-second रीडआउट को वास्तविक एपीआई कॉल से मापा जाता है, और प्रत्येक परिणाम वह फ़ाइल होती है जिसे मॉडल लौटाता है, जैसा है वैसा ही प्रस्तुत किया जाता है।
क्या देखना है
डीपलक V4 प्रो 0813 ने अपनी फाइलों को सबसे तेजी से लगभग 115 टोकन प्रति सेकंड पर लौटाया। डीपलक V4 प्रो 0813 ने सबसे लंबी फाइलें लिखीं, औसतन लगभग 920 लाइनें, और किमी K3 सबसे कॉम्पैक्ट, लगभग 490। GLM 5.3 ने सबसे अधिक आउटपुट टोकन का उपयोग किया, लगभग 59,000 प्रति कार्य इसके तर्क सहित। देखें कि प्रत्येक मॉडल अपने दृश्य को कैसे जीवंत करता है: गति, विवरण और यह अपने आप कैसे चलता रहता है। हम विजेता घोषित नहीं कर रहे हैं। क्लिप चलाएं और अपने स्वयं के उपयोग के मामले के लिए आउटपुट का न्याय करें।
EmpirioLabs पर एक ही परीक्षण चलाएं
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "kimi-k3", "reasoning_effort": "अधिकतम", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "एक फ्लैपी बर्ड गेम बनाएं जो खुद को एक HTML फ़ाइल में खेलता है।
विनिमय करना मॉडल सेवा मेरे glm-5-3, qwen3-8-max-0902 या deepseek-v4-pro-0813 दूसरों के खिलाफ एक ही अनुरोध चलाने के लिए, या उन्हें अंतःक्रियात्मक रूप से आजमाएं खेल।.
अक्सर पूछे जाने वाले प्रश्नों
क्या परिणाम संपादित या पुन: प्रयास किए गए थे?
नहीं। प्रत्येक मॉडल को समान संकेत के साथ प्रति कार्य एक प्रयास मिला, और प्रदान किया गया परिणाम बिल्कुल वही फ़ाइल है जो उसने लौटाई थी।
अधिकतम तर्क क्यों?
एक निष्पक्ष सिर से सिर तक प्रत्येक मॉडल को उसके सर्वश्रेष्ठ रूप में दिखाता है। चारों EmpirioLabs पर एक reasoning_effort नियंत्रण को उजागर करते हैं, इसलिए चारों उच्चतम सेटिंग पर दौड़े।
मुझे किस मॉडल का उपयोग करना चाहिए?
डीपसीक V4 प्रो 0813 का आउटपुट मूल्य यहां चारों में से सबसे कम है। निर्णय लेने से पहले प्रत्येक के खिलाफ अपना कार्यभार चलाएं: एक ही अनुरोध सभी चार के लिए काम करता है और केवल मॉडल का नाम बदल दिया गया है।
इसे अजमाएं
खेल का मैदान (c) सभी मॉडल (c) मूल्य निर्धारण



