Nous mettons Kimi K3, GLM 5.3, Qwen3.8 Max 0902 et DeepSeek V4 Pro 0813 En concurrence l’un contre l’autre lors de trois tests de codage one-shot, tous exécutés sur EmpirioLabs. Même invite chacun, une tentative, aucune modification ni tentative, et chaque résultat affiché en direct dans un vrai navigateur.
Regardez la comparaison à quatre
Des lunettes en un coup d’œil
| Kimi K3 | GLM 5.3 | Qwen3.8 Max 0902 | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| Fabricant | IA Moonshot | Z.ai | Alibaba | DeepSeek |
| Fenêtre de contexte | 1 000 000 de jetons | 1 000 000 de jetons | 1 000 000 de jetons | 1 000 000 de jetons |
| Entrée | Texte, images et vidéo | Texte | Texte, images et vidéo | Texte |
| Efforts de motivation | Jusqu’au maximum | Jusqu’au maximum | Jusqu’au maximum | Jusqu’au maximum |
| Sortie structurée | Schéma JSON strict | Mode JSON | Schéma JSON strict | Schéma JSON strict |
| Prix d’entrée | $3.00 par 1M de jetons | $1.40 par 1M de jetons | $2.00 par 1M de jetons | $1.32 par 1M de jetons |
| Prix de production | $15.00 par 1M de jetons | $4.40 par 1M de jetons | $6.00 par 1M de jetons | $3.96 par 1M de jetons |
Comment nous l’avons géré
Chaque modèle recevait la même consigne pour trois tâches: construire un aquarium vivant dans un seul fichier HTML; construire un avion en papier volant à travers des nuages dans un seul fichier HTML; construire une petite planète avec une voiture qui la contournait dans un seul fichier HTML. Chaque tâche demandait un seul fichier HTML autonome sans bibliothèques externes qui s’anime de lui-même. Les quatre modèles fonctionnaient à reasoning_effort: « max » avec un budget de sortie de 65 536 jetons, un seul coup, sans retentions. Le nombre de lignes et les lectures de tokens-per-second sur chaque panneau sont mesurés à partir des appels API réels, et chaque résultat est le fichier retourné par le modèle, rendu tel quel.
Que chercher
DeepSeek V4 Pro 0813 a renvoyé ses fichiers le plus rapidement, à environ 114 jetons par seconde. GLM 5.3 a écrit les fichiers les plus longs, environ 710 lignes en moyenne, et Kimi K3 le plus compact, environ 450. GLM 5.3 a utilisé le plus de jetons de sortie, environ 54 000 par tâche, y compris son raisonnement. Observez comment chaque modèle donne vie à sa scène: le mouvement, le détail et la façon dont il continue de fonctionner de manière autonome. Nous ne déclarons pas un gagnant. Lancez le clip et jugez les sorties selon votre propre cas d’usage.
Fais le même test sur EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « kimi-k3 », « reasoning_effort »: « max », « messages »: [{"rôle »: « utilisateur », « contenu »: « Construire un aquarium vivant dans un seul fichier HTML."}] }'
Échange modèle à glm-5-3, qwen3-8-max-0902 ou deepseek-v4-pro-0813 de faire passer la même requête contre les autres, ou de les essayer de manière interactive dans le aire de jeux.
Questions fréquemment posées
Les résultats ont-ils été édités ou réessayés ?
Non. Chaque modèle avait une tentative par tâche avec la même invite, et le résultat rendu était exactement le fichier qu’il avait renvoyé.
Pourquoi le raisonnement max ?
Un bon comparatif direct montre chaque modèle à son meilleur. Les quatre exposent un contrôle reasoning_effort sur EmpirioLabs, donc les quatre ont fonctionné au réglage le plus élevé.
Quel modèle devrais-je utiliser ?
Le DeepSeek V4 Pro 0813 a le prix de sortie le plus bas des quatre ici. Faites comparer votre propre charge de travail à chaque option avant de décider: la même demande fonctionne pour les quatre avec seulement le nom du modèle changé.
Essaie
Terrain de jeu - Oui Tous les modèles - Oui Prix



