Accueil Blog

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro: quatre tests de codage one-shot

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro: quatre tests de codage one-shot

Oct 4, 2026

EmpirioLabs AI

Nous mettons Kimi K3, GLM 5.3, Qwen3.8 Max et DeepSeek V4 Pro 0813 Des tests de codage uniques les uns contre les autres, tous exécutés sur EmpirioLabs. Même invite chacun, une tentative, aucune modification ni retentissement, et chaque résultat affiché en direct dans un vrai navigateur.

Regardez la comparaison à quatre

Des lunettes en un coup d’œil

Kimi K3GLM 5.3Qwen3.8 MaxDeepSeek V4 Pro 0813
FabricantIA MoonshotZ.aiAlibabaDeepSeek
Fenêtre de contexte1 000 000 de jetons1 000 000 de jetons1 000 000 de jetons1 000 000 de jetons
EntréeTexte, images et vidéoTexteTexte, images et vidéoTexte
Contrôle de raisonnementreasoning_effort, de bas à maximumreasoning_effort, de bas à maximumreasoning_effort, aucun à Maxreasoning_effort, aucun à Max
Sortie structuréeSchéma JSON strictMode JSONSchéma JSON strictSchéma JSON strict
Prix d’entrée$3.00 par 1M de jetons$1.40 par 1M de jetons$2.00 par 1M de jetons$1.32 par 1M de jetons
Prix de production$15.00 par 1M de jetons$4.40 par 1M de jetons$6.00 par 1M de jetons$3.96 par 1M de jetons

Comment nous l’avons géré

Chaque modèle recevait la même invite pour quatre tâches: un labyrinthe qui se génère puis se résout lui-même avec une recherche A* animée, une simulation de sable qui tombe, un coucher de soleil océanique avec un voilier chevauchant les vagues, et la pluie qui coule sur une fenêtre la nuit. Chaque tâche demandait un seul fichier HTML autonome sans bibliothèques externes. Les quatre modèles fonctionnaient à reasoning_effort: « max » avec un budget de sortie de 65 536 jetons, un seul coup, sans retentions. Le nombre de lignes et les lectures de tokens-per-second sur chaque panneau sont mesurés à partir des appels API réels, et chaque résultat est le fichier retourné par le modèle, rendu tel quel.

Que chercher

DeepSeek V4 Pro 0813 a renvoyé ses fichiers le plus rapidement, à environ 100 jetons par seconde. Qwen3.8 Max a écrit les fichiers les plus longs, environ 540 lignes en moyenne, et Kimi K3 le plus compact, environ 360. GLM 5.3 a utilisé le plus de jetons de sortie, environ 47 000 par tâche, y compris son raisonnement. Observez comment chaque modèle anime la recherche dans le labyrinthe, empile le sable, déplace les vagues et fusionne les gouttes de pluie. Nous ne déclarons pas un gagnant. Lancez le clip et jugez les sorties selon votre propre cas d’usage.

Fais le même test sur EmpirioLabs

curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-de-contenu: application/json » \ -d '{ « modèle »: « kimi-k3 », « reasoning_effort »: « max », « messages »: [{"rôle »: « utilisateur », « contenu »: « Construis un labyrinthe qui se génère et se résout lui-même dans un seul fichier HTML."}] }'

Échange modèle à glm-5-3, qwen3-8-max ou deepseek-v4-pro-0813 de faire passer la même requête contre les autres, ou de les essayer de manière interactive dans le aire de jeux.

Questions fréquemment posées

Les résultats ont-ils été édités ou réessayés ?

Non. Chaque modèle avait une tentative par tâche avec la même invite, et le résultat rendu était exactement le fichier qu’il avait renvoyé.

Pourquoi le raisonnement max ?

Un bon comparatif direct montre chaque modèle à son meilleur. Les quatre exposent un contrôle reasoning_effort sur EmpirioLabs, donc les quatre ont fonctionné au réglage le plus élevé.

Quel modèle devrais-je utiliser ?

DeepSeek V4 Pro 0813 a le prix par token le plus bas des quatre et a répondu le plus rapidement ici. Kimi K3 et Qwen3.8 Max acceptent les images et la vidéo ainsi que le texte. GLM 5.3 est proche de DeepSeek en termes de prix. Faites comparer votre propre charge de travail à chaque fois avant de décider.

Essaie

Terrain de jeu - Oui Tous les modèles - Oui Prix

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.