Nous mettons Qwen3.8 Flash, DeepSeek V4.1 Flash, MiMo V2.6 Flash et Étape 3.7 Flash En concurrence les uns contre les autres sur quatre tests de codage one-shot, tous exécutés sur EmpirioLabs. Même invite chacun, un seul shot, aucune modification, et chaque résultat affiché en direct dans un vrai navigateur.
Regardez la comparaison à quatre
Des lunettes en un coup d’œil
| Qwen3.8 Flash | DeepSeek V4.1 Flash | MiMo V2.6 Flash | Étape 3.7 Flash | |
|---|---|---|---|---|
| Fabricant | Alibaba | DeepSeek | Xiaomi | StepFun |
| Fenêtre de contexte | 1 000 000 de jetons | 1 000 000 de jetons | 1 000 000 de jetons | 256 000 jetons |
| Entrée | Texte, images et vidéo | Texte et images | Texte, images, vidéo et audio | Texte, images et vidéo |
| Raisonnement | Effort maximal | Effort maximal | Penser par moments ou des non-pensées | Effort maximal |
| Sortie structurée | Schéma JSON strict | Mode JSON | Schéma JSON strict | Mode JSON |
| Prix d’entrée | $0.16 par 1M de jetons | $0.30 par 1M de jetons | $0.14 par 1M de jetons | $0.20 par 1M de jetons |
| Prix de production | $0.47 par 1M de jetons | $1.20 par 1M de jetons | $0.28 par 1M de jetons | $1.15 par 1M de jetons |
Comment nous l’avons géré
Chaque modèle recevait la même consigne pour quatre tâches: construire une grande roue la nuit dans un seul fichier HTML; construire une pizza en train de cuire dans un four à bois dans un seul fichier HTML; construire un train jouet dans un seul fichier HTML; construire des cerfs-volants au-dessus d’une plage dans un seul fichier HTML. Chaque tâche demandait un seul fichier HTML autonome sans bibliothèques externes qui s’anime de lui-même. Qwen3.8 Flash, DeepSeek V4.1 Flash et Step 3.7 Flash fonctionnaient à reasoning_effort: « max »; MiMo V2.6 Flash, qui a le réglage sans effort, fonctionnait avec la réflexion activée. Chaque modèle avait un budget de sortie de 65 536 jetons et un shot par tâche. Le nombre de lignes et les lectures tokens-per-second sur chaque panneau sont mesurés à partir des appels API réels, et chaque résultat est le fichier retourné par le modèle, rendu tel quel.
Que chercher
DeepSeek V4.1 Flash a renvoyé ses fichiers le plus rapidement, à environ 191 jetons par seconde. MiMo V2.6 Flash a écrit les fichiers les plus longs, environ 930 lignes en moyenne, et Step 3.7 Flash le plus compact, environ 490. Qwen3.8 Flash a utilisé le plus de jetons de sortie, environ 48 000 par tâche, y compris son raisonnement. Observez comment chaque modèle donne vie à sa scène: le mouvement, le détail et la façon dont elle continue de fonctionner seule. Nous ne déclarons pas un gagnant. Lancez le clip et jugez les sorties selon votre propre cas d’usage.
Fais le même test sur EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-de-contenu: application/json » \ -d '{ « modèle »: « qwen3-8-flash », « reasoning_effort »: « max », « messages »: [{"rôle »: « utilisateur », « contenu »: « Construire une grande roue la nuit dans un seul fichier HTML."}] }'
Échange modèle à deepseek-v4-1-flash, mimo-v2-6-flash ou step-3-7-flash de faire passer la même requête contre les autres, ou de les essayer de manière interactive dans le aire de jeux.
Questions fréquemment posées
Les résultats ont-ils été édités ou réessayés ?
Non. Chaque panneau est le premier fichier que le modèle a renvoyé pour cette invite, rendu exactement comme renvoyé. Une requête qui est revenue sans fichier a été envoyée à nouveau.
Pourquoi le réglage de raisonnement le plus élevé ?
Un bon entretien directif montre chaque modèle à son meilleur, donc chacun fonctionnait à son niveau de raisonnement le plus élevé: effort maximal pour Qwen3.8 Flash, DeepSeek V4.1 Flash et Step 3.7 Flash, en pensant à MiMo V2.6 Flash.
Quel modèle devrais-je utiliser ?
La Flash MiMo V2.6 a le prix de sortie le plus bas des quatre ici. Faites jouer votre propre charge de travail sur chacune avant de décider: la même demande fonctionne pour les quatre avec seulement le nom du modèle changé.
Essaie
Terrain de jeu - Oui Tous les modèles - Oui Prix



