Accueil Blog

Qwen3.8 Flash vs DeepSeek V4.1 Flash vs MiMo V2.6 Flash vs Step 3.7 Flash: quatre tests de codage

Qwen3.8 Flash vs DeepSeek V4.1 Flash vs MiMo V2.6 Flash vs Step 3.7 Flash: quatre tests de codage

Oct 7, 2026

EmpirioLabs AI

Nous mettons Qwen3.8 Flash, DeepSeek V4.1 Flash, MiMo V2.6 Flash et Étape 3.7 Flash En concurrence les uns contre les autres sur quatre tests de codage one-shot, tous exécutés sur EmpirioLabs. Même invite chacun, un seul shot, aucune modification, et chaque résultat affiché en direct dans un vrai navigateur.

Regardez la comparaison à quatre

Des lunettes en un coup d’œil

Qwen3.8 FlashDeepSeek V4.1 FlashMiMo V2.6 FlashÉtape 3.7 Flash
FabricantAlibabaDeepSeekXiaomiStepFun
Fenêtre de contexte1 000 000 de jetons1 000 000 de jetons1 000 000 de jetons256 000 jetons
EntréeTexte, images et vidéoTexte et imagesTexte, images, vidéo et audioTexte, images et vidéo
RaisonnementEffort maximalEffort maximalPenser par moments ou des non-penséesEffort maximal
Sortie structuréeSchéma JSON strictMode JSONSchéma JSON strictMode JSON
Prix d’entrée$0.16 par 1M de jetons$0.30 par 1M de jetons$0.14 par 1M de jetons$0.20 par 1M de jetons
Prix de production$0.47 par 1M de jetons$1.20 par 1M de jetons$0.28 par 1M de jetons$1.15 par 1M de jetons

Comment nous l’avons géré

Chaque modèle recevait la même consigne pour quatre tâches: construire une grande roue la nuit dans un seul fichier HTML; construire une pizza en train de cuire dans un four à bois dans un seul fichier HTML; construire un train jouet dans un seul fichier HTML; construire des cerfs-volants au-dessus d’une plage dans un seul fichier HTML. Chaque tâche demandait un seul fichier HTML autonome sans bibliothèques externes qui s’anime de lui-même. Qwen3.8 Flash, DeepSeek V4.1 Flash et Step 3.7 Flash fonctionnaient à reasoning_effort: « max »; MiMo V2.6 Flash, qui a le réglage sans effort, fonctionnait avec la réflexion activée. Chaque modèle avait un budget de sortie de 65 536 jetons et un shot par tâche. Le nombre de lignes et les lectures tokens-per-second sur chaque panneau sont mesurés à partir des appels API réels, et chaque résultat est le fichier retourné par le modèle, rendu tel quel.

Que chercher

DeepSeek V4.1 Flash a renvoyé ses fichiers le plus rapidement, à environ 191 jetons par seconde. MiMo V2.6 Flash a écrit les fichiers les plus longs, environ 930 lignes en moyenne, et Step 3.7 Flash le plus compact, environ 490. Qwen3.8 Flash a utilisé le plus de jetons de sortie, environ 48 000 par tâche, y compris son raisonnement. Observez comment chaque modèle donne vie à sa scène: le mouvement, le détail et la façon dont elle continue de fonctionner seule. Nous ne déclarons pas un gagnant. Lancez le clip et jugez les sorties selon votre propre cas d’usage.

Fais le même test sur EmpirioLabs

curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-de-contenu: application/json » \ -d '{ « modèle »: « qwen3-8-flash », « reasoning_effort »: « max », « messages »: [{"rôle »: « utilisateur », « contenu »: « Construire une grande roue la nuit dans un seul fichier HTML."}] }'

Échange modèle à deepseek-v4-1-flash, mimo-v2-6-flash ou step-3-7-flash de faire passer la même requête contre les autres, ou de les essayer de manière interactive dans le aire de jeux.

Questions fréquemment posées

Les résultats ont-ils été édités ou réessayés ?

Non. Chaque panneau est le premier fichier que le modèle a renvoyé pour cette invite, rendu exactement comme renvoyé. Une requête qui est revenue sans fichier a été envoyée à nouveau.

Pourquoi le réglage de raisonnement le plus élevé ?

Un bon entretien directif montre chaque modèle à son meilleur, donc chacun fonctionnait à son niveau de raisonnement le plus élevé: effort maximal pour Qwen3.8 Flash, DeepSeek V4.1 Flash et Step 3.7 Flash, en pensant à MiMo V2.6 Flash.

Quel modèle devrais-je utiliser ?

La Flash MiMo V2.6 a le prix de sortie le plus bas des quatre ici. Faites jouer votre propre charge de travail sur chacune avant de décider: la même demande fonctionne pour les quatre avec seulement le nom du modèle changé.

Essaie

Terrain de jeu - Oui Tous les modèles - Oui Prix

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.