घर ब्लॉग

Qwen3.8 फ्लैश बनाम डीपसीक v4.1 फ्लैश बनाम MiMo V2.6 फ्लैश बनाम स्टेप 3.7 फ्लैश: चार कोडिंग परीक्षण

Qwen3.8 फ्लैश बनाम डीपसीक v4.1 फ्लैश बनाम MiMo V2.6 फ्लैश बनाम स्टेप 3.7 फ्लैश: चार कोडिंग परीक्षण

Oct 7, 2026

EmpirioLabs AI

हम डालते हैं Qwen3.8 फ्लैश, डीपसीक v4.1 फ्लैश, MiMo V2.6 फ्लैश तथा चरण 3.7 फ्लैश चार एक-शॉट कोडिंग परीक्षणों में एक-दूसरे के खिलाफ, सभी EmpirioLabs पर चलते हैं। एक ही संकेत, एक शॉट, कोई संपादन नहीं, और प्रत्येक परिणाम एक वास्तविक ब्राउज़र में लाइव प्रदान किया गया।

चार तरफ़ा तुलना देखें

चश्मा एक नज़र में

Qwen3.8 फ्लैशडीपसीक v4.1 फ्लैशMiMo V2.6 फ्लैशचरण 3.7 फ्लैश
निर्माताअलीबाबाडीपसीकशाओमीस्टेपफन
संदर्भ विंडो1,000,000 टोकन1,000,000 टोकन1,000,000 टोकन256,000 टोकन
इनपुटपाठ, चित्र और वीडियोपाठ और चित्रपाठ, चित्र, वीडियो और ऑडियोपाठ, चित्र और वीडियो
तर्कपूर्ण आधारअधिकतम तक प्रयासअधिकतम तक प्रयासचालू या बंद सोचनाअधिकतम तक प्रयास
संरचित आउटपुटसख्त JSON स्कीमाJSON मोडसख्त JSON स्कीमाJSON मोड
इनपुट मूल्य$0.16 प्रति 1M टोकन$0.30 प्रति 1M टोकन$0.14 प्रति 1M टोकन$0.20 प्रति 1M टोकन
उत्पादन मूल्य$0.47 प्रति 1M टोकन$1.20 प्रति 1M टोकन$0.28 प्रति 1M टोकन$1.15 प्रति 1M टोकन

हमने इसे कैसे चलाया

प्रत्येक मॉडल को चार कार्यों के लिए समान संकेत प्राप्त हुआ: एक एकल HTML फ़ाइल में रात में एक फेरिस व्हील का निर्माण करें; एक एकल HTML फ़ाइल में लकड़ी से बने ओवन में पिज्जा बेकिंग का निर्माण करें; एक एकल HTML फ़ाइल में एक खिलौना ट्रेन सेट बनाएं; एक एकल HTML फ़ाइल में समुद्र तट पर उड़ने वाली पतंगों का निर्माण करें। प्रत्येक कार्य ने एक एकल स्व-निहित HTML फ़ाइल के लिए कहा, जिसमें कोई बाहरी पुस्तकालय नहीं होता है जो अपने आप एनिमेट होता है। Qwen3.8 फ्लैश, डीपसीक v4.1 फ्लैश और चरण 3.7 फ्लैश पर चला reasoning_effort: "अधिकतम"; MiMo V2.6 फ्लैश, जिसमें कोई प्रयास सेटिंग नहीं है, सोच के साथ चला। प्रत्येक मॉडल में 65,536 टोकन आउटपुट बजट और प्रति कार्य एक शॉट था। प्रत्येक पैनल पर लाइन की गिनती और tokens-per-second रीडआउट को वास्तविक एपीआई कॉल से मापा जाता है, और प्रत्येक परिणाम वह फ़ाइल होती है जिसे मॉडल लौटाता है, जैसा है वैसा ही प्रस्तुत किया जाता है।

क्या देखना है

डीपसीक V4.1 फ्लैश ने अपनी फाइलों को सबसे तेजी से लगभग 191 टोकन प्रति सेकंड पर लौटाया। MiMo V2.6 फ्लैश ने सबसे लंबी फाइलें लिखीं, औसतन लगभग 930 लाइनें, और चरण 3.7 फ्लैश सबसे कॉम्पैक्ट, लगभग 490। Qwen3.8 फ्लैश ने सबसे अधिक आउटपुट टोकन का उपयोग किया, लगभग 48,000 प्रति कार्य इसके तर्क सहित। देखें कि प्रत्येक मॉडल अपने दृश्य को कैसे जीवंत करता है: गति, विवरण और यह अपने आप कैसे चलता रहता है। हम विजेता घोषित नहीं कर रहे हैं। क्लिप चलाएं और अपने स्वयं के उपयोग के मामले के लिए आउटपुट का न्याय करें।

EmpirioLabs पर एक ही परीक्षण चलाएं

curl https://api.empiriolabs.ai/v1/chat/completions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "qwen3-8-flash", "reasoning_effort": "अधिकतम", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "रात में एक एकल HTML फ़ाइल में एक फेरिस व्हील बनाएं।

विनिमय करना मॉडल सेवा मेरे deepseek-v4-1-flash, mimo-v2-6-flash या step-3-7-flash दूसरों के खिलाफ एक ही अनुरोध चलाने के लिए, या उन्हें अंतःक्रियात्मक रूप से आजमाएं खेल।.

अक्सर पूछे जाने वाले प्रश्नों

क्या परिणाम संपादित या पुन: प्रयास किए गए थे?

नहीं। प्रत्येक पैनल पहली फ़ाइल है जिसे मॉडल ने उस प्रॉम्प्ट के लिए लौटाया है, जो बिल्कुल लौटाया गया है। एक अनुरोध जो बिना फ़ाइल के वापस आया था, उसे फिर से भेजा गया था।

उच्चतम तर्क सेटिंग क्यों?

एक निष्पक्ष सिर से सिर तक प्रत्येक मॉडल को उसके सबसे अच्छे रूप में दिखाता है, इसलिए प्रत्येक अपनी उच्चतम तर्क सेटिंग पर चला: Qwen3.8 फ्लैश, डीपसीक V4.1 फ्लैश और स्टेप 3.7 फ्लैश के लिए अधिकतम प्रयास, MiMo V2.6 फ्लैश के लिए सोच रहा है।

मुझे किस मॉडल का उपयोग करना चाहिए?

MiMo V2.6 फ्लैश का आउटपुट मूल्य यहां चारों में से सबसे कम है। निर्णय लेने से पहले प्रत्येक के खिलाफ अपना कार्यभार चलाएं: केवल मॉडल का नाम बदलने के साथ एक ही अनुरोध चारों के लिए काम करता है।

इसे अजमाएं

खेल का मैदान (c) सभी मॉडल (c) मूल्य निर्धारण

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।