Wir haben Qwen3.8 Flash, DeepSeek V4.1 Flash, MiMo V2.6 Flash und Schritt 3.7 Blitz gegeneinander in vier One-Shot-Coding-Tests, die alle auf EmpirioLabs laufen. Jeder Prompt ist derselbe, One-Shot, keine Bearbeitungen, und jedes Ergebnis wird live in einem echten Browser gerendert.
Sieh dir den Vier-Wege-Vergleich an
Specs auf einen Blick
| Qwen3.8 Flash | DeepSeek V4.1 Flash | MiMo V2.6 Flash | Schritt 3.7 Blitz | |
|---|---|---|---|---|
| Schöpfer | Alibaba | DeepSeek | Xiaomi | StepFun |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token | 1.000.000 Token | 256.000 Token |
| Eingabe | Text, Bilder und Video | Text und Bilder | Text, Bilder, Video und Audio | Text, Bilder und Video |
| Begründung | Kraft bis zum Maximum | Kraft bis zum Maximum | An- oder ausdenken | Kraft bis zum Maximum |
| Strukturierte Ausgabe | Striktes JSON-Schema | JSON-Modus | Striktes JSON-Schema | JSON-Modus |
| Eingangspreis | $0.16 pro 1 Million Token | $0.30 pro 1 Million Token | $0.14 pro 1 Million Token | $0.20 pro 1 Million Token |
| Produktionspreis | $0.47 pro 1 Million Token | $1.20 pro 1 Million Token | $0.28 pro 1 Million Token | $1.15 pro 1 Million Token |
Wie wir es geführt haben
Jedes Modell erhielt die identische Aufforderung für vier Aufgaben: ein Riesenrad nachts in einer einzigen HTML-Datei bauen; eine Pizza in einem Holzofen in einer einzigen HTML-Datei bauen; ein Spielzeug-Eisenbahn-Set in einer einzigen HTML-Datei bauen; Drachen bauen, die über einen Strand fliegen, in einer einzigen HTML-Datei. Jede Aufgabe verlangte eine einzelne, eigenständige HTML-Datei ohne externe Bibliotheken, die sich von selbst animiert. Qwen3.8 Flash, DeepSeek v4.1 Flash und Step 3.7 Flash liefen bei reasoning_effort: "max"; MiMo V2.6 Flash, das eine Einstellung ohne Aufwand hat, lief mit Thinking on aus. Jedes Modell hatte ein Ausgabebudget von 65.536 Token und eine Aufnahme pro Aufgabe. Die Zeilenzahlen und tokens-per-second Auslesungen auf jedem Panel werden aus den echten API-Aufrufen gemessen, und jedes Ergebnis ist die Datei, die das Modell zurückgegeben hat, gerendert wie es ist.
Worauf man achten sollte
DeepSeek V4.1 Flash lieferte seine Dateien am schnellsten, mit etwa 191 Token pro Sekunde. MiMo V2.6 Flash schrieb die längsten Dateien, durchschnittlich etwa 930 Zeilen, und Step 3.7 Flash die kompakteste, etwa 490. Qwen3.8 Flash verwendete die meisten Ausgabetokens, etwa 48.000 pro Aufgabe einschließlich der Begründung. Beobachten Sie, wie jedes Modell seine Szene zum Leben erweckt: die Bewegung, die Details und wie es von selbst läuft. Wir erklären keinen Gewinner. Spielen Sie den Clip und beurteilen Sie die Ausgaben für Ihren eigenen Anwendungsfall.
Führe denselben Test bei EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -h "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -H "Inhalt-Typ: application/json" \ -d '{ "model": "qwen3-8-flash", "reasoning_effort": "max", "messages": [{"role": "user", "content": "Baue nachts ein Riesenrad in einer einzigen HTML-Datei."}] }'
Swap modell zu deepseek-v4-1-flash, mimo-v2-6-flash oder step-3-7-flash dieselbe Anfrage gegen die anderen auszuführen oder sie interaktiv in der spielplatz.
Häufig gestellte Fragen
Wurden die Ergebnisse bearbeitet oder erneut versucht?
Nein. Jedes Panel ist die erste Datei, die das Modell für diesen Prompt zurückgegeben hat, genau wie zurückgegeben. Eine Anfrage, die ohne Datei zurückkam, wurde erneut gesendet.
Warum die höchste Denkeinstellung?
Ein fairer Kopf-an-Kopf-Vergleich zeigt jedes Modell von seiner besten Seite, daher lief jedes auf seiner höchsten Denkeinstellung: maximaler Aufwand für Qwen3.8 Flash, DeepSeek V4.1 Flash und Step 3.7 Flash, denke an MiMo V2.6 Flash.
Welches Modell sollte ich verwenden?
MiMo V2.6 Flash hat hier den niedrigsten Ausgabepreis von den vieren. Führe deine eigene Arbeitslast gegen jedes einzelne aus, bevor du entscheidest: Die gleiche Anfrage funktioniert für alle vier, nur mit geändertem Modellnamen.



