Wir haben Kimi K3, GLM 5.3, Qwen3.8 Max und DeepSeek V4 Pro 0813 gegeneinander in vier One-Shot-Coding-Tests, die alle auf EmpirioLabs laufen. Jeder Prompt gleich, ein Versuch, keine Bearbeitungen oder Wiederholungen, und jedes Ergebnis wird live in einem echten Browser gerendert.
Sieh dir den Vier-Wege-Vergleich an
Specs auf einen Blick
| Kimi K3 | GLM 5.3 | Qwen3.8 Max | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| Schöpfer | Moonshot KI | Z.ai | Alibaba | DeepSeek |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token | 1.000.000 Token | 1.000.000 Token |
| Eingabe | Text, Bilder und Video | Text | Text, Bilder und Video | Text |
| Schlussfolgerungskontrolle | reasoning_effort, von niedrig bis maximal | reasoning_effort, von niedrig bis maximal | reasoning_effort, keiner bis maximal | reasoning_effort, keiner bis maximal |
| Strukturierte Ausgabe | Striktes JSON-Schema | JSON-Modus | Striktes JSON-Schema | Striktes JSON-Schema |
| Eingangspreis | $3.00 pro 1 Million Token | $1.40 pro 1 Million Token | $2.00 pro 1 Million Token | $1.32 pro 1 Million Token |
| Produktionspreis | $15.00 pro 1 Million Token | $4.40 pro 1 Million Token | $6.00 pro 1 Million Token | $3.96 pro 1 Million Token |
Wie wir es geführt haben
Jedes Modell erhielt denselben Prompt für vier Aufgaben: ein Labyrinth, das sich selbst generiert und dann mit einer animierten A*-Suche löst, einer Fallsand-Simulation, einem Meeresuntergang mit einem Segelboot, das auf den Wellen reitet, und Regen, der nachts ein Fenster hinunterläuft. Jede Aufgabe verlangte eine einzelne, eigenständige HTML-Datei ohne externe Bibliotheken. Alle vier Modelle liefen auf reasoning_effort: "max" Mit einem Ausgabebudget von 65.536 Tokens, One-Shot, keine Wiederholungen. Die Zeilenzählungen und tokens-per-second Auslesungen auf jedem Panel werden aus den echten API-Aufrufen gemessen, und jedes Ergebnis ist die Datei, die das Modell zurückgegeben hat, so gerendert.
Worauf man achten sollte
DeepSeek V4 Pro 0813 lieferte seine Dateien am schnellsten, mit etwa 100 Token pro Sekunde. Qwen3.8 Max schrieb die längsten Dateien, im Durchschnitt etwa 540 Zeilen, und Kimi K3 die kompakteste, etwa 360. GLM 5.3 verwendete die meisten Ausgabetoken, etwa 47.000 pro Aufgabe einschließlich der Begründung. Beobachten Sie, wie jedes Modell die Labyrinthsuche animiert, den Sand stapelt, die Wellen bewegt und die Regentropfen zusammenführt. Wir erklären keinen Gewinner. Spielen Sie den Clip und bewerten Sie die Ausgaben für Ihren eigenen Anwendungsfall.
Führe denselben Test bei EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -h "Authorization: Bearer $EMPIRIOLABS_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "kimi-k3", "reasoning_effort": "max", "messages": [{"role": "user", "content": "Baue ein Labyrinth, das sich selbst in einer einzigen HTML-Datei generiert und löst."}] }'
Swap modell zu glm-5-3, qwen3-8-max oder deepseek-v4-pro-0813 dieselbe Anfrage gegen die anderen auszuführen oder sie interaktiv in der spielplatz.
Häufig gestellte Fragen
Wurden die Ergebnisse bearbeitet oder erneut versucht?
Nein. Jedes Modell bekam pro Aufgabe einen Versuch mit demselben Prompt, und das gerenderte Ergebnis ist genau die Datei, die es zurückgegeben hat.
Warum maximales Schließen?
Ein fairer Kopf-an-Kopf-Vergleich zeigt jedes Modell von seiner besten Seite. Alle vier zeigen eine reasoning_effort Steuerung auf EmpirioLabs, sodass alle vier auf der höchsten Stufe liefen.
Welches Modell sollte ich verwenden?
DeepSeek V4 Pro 0813 hat den niedrigsten Preis pro Token der vier und hat hier am schnellsten geantwortet. Kimi K3 und Qwen3.8 Max akzeptieren Bilder und Videos sowie Text. GLM 5.3 liegt preislich nahe an DeepSeek. Vergleichen Sie Ihre eigene Arbeitsbelastung mit jedem einzelnen Modell, bevor Sie sich entscheiden.



