हम डालते हैं Qwen3.8 फ्लैश, डीपसीक v4.1 फ्लैश, MiMo V2.6 फ्लैश तथा चरण 3.7 फ्लैश चार एक-शॉट कोडिंग परीक्षणों में एक-दूसरे के खिलाफ, सभी EmpirioLabs पर चलते हैं। एक ही संकेत, एक शॉट, कोई संपादन नहीं, और प्रत्येक परिणाम एक वास्तविक ब्राउज़र में लाइव प्रदान किया गया।
चार तरफ़ा तुलना देखें
चश्मा एक नज़र में
| Qwen3.8 फ्लैश | डीपसीक v4.1 फ्लैश | MiMo V2.6 फ्लैश | चरण 3.7 फ्लैश | |
|---|---|---|---|---|
| निर्माता | अलीबाबा | डीपसीक | शाओमी | स्टेपफन |
| संदर्भ विंडो | 1,000,000 टोकन | 1,000,000 टोकन | 1,000,000 टोकन | 256,000 टोकन |
| इनपुट | पाठ, चित्र और वीडियो | पाठ और चित्र | पाठ, चित्र, वीडियो और ऑडियो | पाठ, चित्र और वीडियो |
| तर्कपूर्ण आधार | अधिकतम तक प्रयास | अधिकतम तक प्रयास | चालू या बंद सोचना | अधिकतम तक प्रयास |
| संरचित आउटपुट | सख्त JSON स्कीमा | JSON मोड | सख्त JSON स्कीमा | JSON मोड |
| इनपुट मूल्य | $0.16 प्रति 1M टोकन | $0.30 प्रति 1M टोकन | $0.14 प्रति 1M टोकन | $0.20 प्रति 1M टोकन |
| उत्पादन मूल्य | $0.47 प्रति 1M टोकन | $1.20 प्रति 1M टोकन | $0.28 प्रति 1M टोकन | $1.15 प्रति 1M टोकन |
हमने इसे कैसे चलाया
प्रत्येक मॉडल को चार कार्यों के लिए समान संकेत प्राप्त हुआ: एक एकल HTML फ़ाइल में रात में एक फेरिस व्हील का निर्माण करें; एक एकल HTML फ़ाइल में लकड़ी से बने ओवन में पिज्जा बेकिंग का निर्माण करें; एक एकल HTML फ़ाइल में एक खिलौना ट्रेन सेट बनाएं; एक एकल HTML फ़ाइल में समुद्र तट पर उड़ने वाली पतंगों का निर्माण करें। प्रत्येक कार्य ने एक एकल स्व-निहित HTML फ़ाइल के लिए कहा, जिसमें कोई बाहरी पुस्तकालय नहीं होता है जो अपने आप एनिमेट होता है। Qwen3.8 फ्लैश, डीपसीक v4.1 फ्लैश और चरण 3.7 फ्लैश पर चला reasoning_effort: "अधिकतम"; MiMo V2.6 फ्लैश, जिसमें कोई प्रयास सेटिंग नहीं है, सोच के साथ चला। प्रत्येक मॉडल में 65,536 टोकन आउटपुट बजट और प्रति कार्य एक शॉट था। प्रत्येक पैनल पर लाइन की गिनती और tokens-per-second रीडआउट को वास्तविक एपीआई कॉल से मापा जाता है, और प्रत्येक परिणाम वह फ़ाइल होती है जिसे मॉडल लौटाता है, जैसा है वैसा ही प्रस्तुत किया जाता है।
क्या देखना है
डीपसीक V4.1 फ्लैश ने अपनी फाइलों को सबसे तेजी से लगभग 191 टोकन प्रति सेकंड पर लौटाया। MiMo V2.6 फ्लैश ने सबसे लंबी फाइलें लिखीं, औसतन लगभग 930 लाइनें, और चरण 3.7 फ्लैश सबसे कॉम्पैक्ट, लगभग 490। Qwen3.8 फ्लैश ने सबसे अधिक आउटपुट टोकन का उपयोग किया, लगभग 48,000 प्रति कार्य इसके तर्क सहित। देखें कि प्रत्येक मॉडल अपने दृश्य को कैसे जीवंत करता है: गति, विवरण और यह अपने आप कैसे चलता रहता है। हम विजेता घोषित नहीं कर रहे हैं। क्लिप चलाएं और अपने स्वयं के उपयोग के मामले के लिए आउटपुट का न्याय करें।
EmpirioLabs पर एक ही परीक्षण चलाएं
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "qwen3-8-flash", "reasoning_effort": "अधिकतम", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "रात में एक एकल HTML फ़ाइल में एक फेरिस व्हील बनाएं।
विनिमय करना मॉडल सेवा मेरे deepseek-v4-1-flash, mimo-v2-6-flash या step-3-7-flash दूसरों के खिलाफ एक ही अनुरोध चलाने के लिए, या उन्हें अंतःक्रियात्मक रूप से आजमाएं खेल।.
अक्सर पूछे जाने वाले प्रश्नों
क्या परिणाम संपादित या पुन: प्रयास किए गए थे?
नहीं। प्रत्येक पैनल पहली फ़ाइल है जिसे मॉडल ने उस प्रॉम्प्ट के लिए लौटाया है, जो बिल्कुल लौटाया गया है। एक अनुरोध जो बिना फ़ाइल के वापस आया था, उसे फिर से भेजा गया था।
उच्चतम तर्क सेटिंग क्यों?
एक निष्पक्ष सिर से सिर तक प्रत्येक मॉडल को उसके सबसे अच्छे रूप में दिखाता है, इसलिए प्रत्येक अपनी उच्चतम तर्क सेटिंग पर चला: Qwen3.8 फ्लैश, डीपसीक V4.1 फ्लैश और स्टेप 3.7 फ्लैश के लिए अधिकतम प्रयास, MiMo V2.6 फ्लैश के लिए सोच रहा है।
मुझे किस मॉडल का उपयोग करना चाहिए?
MiMo V2.6 फ्लैश का आउटपुट मूल्य यहां चारों में से सबसे कम है। निर्णय लेने से पहले प्रत्येक के खिलाफ अपना कार्यभार चलाएं: केवल मॉडल का नाम बदलने के साथ एक ही अनुरोध चारों के लिए काम करता है।
इसे अजमाएं
खेल का मैदान (c) सभी मॉडल (c) मूल्य निर्धारण



