Nous mettons Kimi K3, GLM 5.3, Qwen3.8 Max 0902 et DeepSeek V4 Pro 0813 En concurrence les uns contre les autres sur deux tests de codage one-shot, tous exécutés sur EmpirioLabs. Même invite chacun, une tentative, aucune modification ni tentative, et chaque résultat affiché en direct dans un vrai navigateur.
Regardez la comparaison à quatre
Des lunettes en un coup d’œil
| Kimi K3 | GLM 5.3 | Qwen3.8 Max 0902 | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| Fabricant | IA Moonshot | Z.ai | Alibaba | DeepSeek |
| Fenêtre de contexte | 1 000 000 de jetons | 1 000 000 de jetons | 1 000 000 de jetons | 1 000 000 de jetons |
| Entrée | Texte, images et vidéo | Texte | Texte, images et vidéo | Texte |
| Efforts de motivation | Jusqu’au maximum | Jusqu’au maximum | Jusqu’au maximum | Jusqu’au maximum |
| Sortie structurée | Schéma JSON strict | Mode JSON | Schéma JSON strict | Schéma JSON strict |
| Prix d’entrée | $3.00 par 1M de jetons | $1.40 par 1M de jetons | $2.00 par 1M de jetons | $1.32 par 1M de jetons |
| Prix de production | $15.00 par 1M de jetons | $4.40 par 1M de jetons | $6.00 par 1M de jetons | $3.96 par 1M de jetons |
Comment nous l’avons géré
Chaque modèle recevait la même invite pour deux tâches: créer un jeu Flappy Bird qui se joue lui-même dans un seul fichier HTML; créer un jeu Missile Command qui se joue lui-même dans un seul fichier HTML. Chaque tâche demandait un fichier HTML autonome unique sans bibliothèques externes qui s’anime de lui-même. Les quatre modèles fonctionnaient à reasoning_effort: « max » avec un budget de sortie de 65 536 jetons, un seul coup, sans retentions. Le nombre de lignes et les lectures de tokens-per-second sur chaque panneau sont mesurés à partir des appels API réels, et chaque résultat est le fichier retourné par le modèle, rendu tel quel.
Que chercher
DeepSeek V4 Pro 0813 a renvoyé ses fichiers le plus rapidement, à environ 115 jetons par seconde. DeepSeek V4 Pro 0813 a écrit les fichiers les plus longs, environ 920 lignes en moyenne, et Kimi K3 le plus compact, environ 490. GLM 5.3 a utilisé le plus de jetons de sortie, environ 59 000 par tâche, y compris son raisonnement. Observez comment chaque modèle donne vie à sa scène: le mouvement, le détail et comment il continue de fonctionner de lui-même. Nous ne déclarons pas un gagnant. Lancez le clip et jugez les sorties selon votre propre cas d’usage.
Fais le même test sur EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « kimi-k3 », « reasoning_effort »: « max », « messages »: [{"rôle »: « utilisateur », « contenu »: « Créez un jeu Flappy Bird qui se joue lui-même dans un seul fichier HTML."}] }'
Échange modèle à glm-5-3, qwen3-8-max-0902 ou deepseek-v4-pro-0813 de faire passer la même requête contre les autres, ou de les essayer de manière interactive dans le aire de jeux.
Questions fréquemment posées
Les résultats ont-ils été édités ou réessayés ?
Non. Chaque modèle avait une tentative par tâche avec la même invite, et le résultat rendu était exactement le fichier qu’il avait renvoyé.
Pourquoi le raisonnement max ?
Un bon comparatif direct montre chaque modèle à son meilleur. Les quatre exposent un contrôle reasoning_effort sur EmpirioLabs, donc les quatre ont fonctionné au réglage le plus élevé.
Quel modèle devrais-je utiliser ?
Le DeepSeek V4 Pro 0813 a le prix de sortie le plus bas des quatre ici. Faites comparer votre propre charge de travail à chaque option avant de décider: la même demande fonctionne pour les quatre avec seulement le nom du modèle changé.
Essaie
Terrain de jeu - Oui Tous les modèles - Oui Prix



