Nous mettons Kimi K3, DeepSeek V4 Pro 0813, MiniMax M3 et MiMo V2.6 Pro En concurrence les uns contre les autres à travers trois tests de codage one-shot, tous exécutés sur EmpirioLabs. Même invite chacun, un seul shot, aucune modification, et chaque résultat affiché en direct dans un vrai navigateur.
Regardez la comparaison à quatre
Des lunettes en un coup d’œil
| Kimi K3 | DeepSeek V4 Pro 0813 | MiniMax M3 | MiMo V2.6 Pro | |
|---|---|---|---|---|
| Fabricant | IA Moonshot | DeepSeek | MiniMax | Xiaomi |
| Fenêtre de contexte | 1 000 000 de jetons | 1 000 000 de jetons | 1 000 000 de jetons | 1 000 000 de jetons |
| Entrée | Texte, images et vidéo | Texte | Texte, images et vidéo | Texte, images, vidéo et audio |
| Raisonnement | Effort maximal | Effort maximal | Penser par moments ou des non-pensées | Penser par moments ou des non-pensées |
| Sortie structurée | Schéma JSON strict | Schéma JSON strict | Mode JSON | Schéma JSON strict |
| Prix d’entrée | $3.00 par 1M de jetons | $1.32 par 1M de jetons | $0.225 par 1 million de jetons jusqu’à 512K contexte, $0.45 plus haut | $0.435 par 1M de jetons |
| Prix de production | $15.00 par 1M de jetons | $3.96 par 1M de jetons | $0.90 par 1 million de jetons jusqu’à 512K contexte, $1.80 plus haut | $0.87 par 1M de jetons |
Comment nous l’avons géré
Chaque modèle recevait la même invite pour trois tâches: construire une machine à laver sur un cycle de centrifugage dans un seul fichier HTML; construire un time-lapse de croissance d’une plante dans un seul fichier HTML; construire du popcorn qui éclate dans un pot dans un seul fichier HTML. Chaque tâche demandait un seul fichier HTML autonome sans bibliothèques externes qui s’anime de manière autonome. Kimi K3 et DeepSeek V4 Pro 0813 fonctionnaient à reasoning_effort: « max »; MiniMax M3 et MiMo V2.6 Pro, qui ont le réglage sans effort, fonctionnaient avec réflexion. Chaque modèle avait un budget de sortie de 65 536 jetons et un shot par tâche. Le nombre de lignes et les lectures tokens-per-second sur chaque panneau sont mesurés à partir des vrais appels API, et chaque résultat est le fichier retourné par le modèle, rendu tel quel.
Que chercher
Le MiniMax M3 renvoyait ses fichiers le plus rapidement, à environ 114 jetons par seconde. MiMo V2.6 Pro écrivait les fichiers les plus longs, environ 1090 lignes en moyenne, et le MiniMax M3 le plus compact, environ 500. MiMo V2.6 Pro utilisait le plus de jetons de sortie, environ 42 000 par tâche, y compris son raisonnement. Observez comment chaque modèle donne vie à sa scène: le mouvement, le détail et la façon dont il continue de fonctionner de lui-même. Nous ne déclarons pas un gagnant. Lancez le clip et jugez les sorties selon votre propre cas d’usage.
Fais le même test sur EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « kimi-k3 », « reasoning_effort »: « max », « messages »: [{"rôle »: « utilisateur », « contenu »: « Construire une machine à laver sur un cycle de centrifugation dans un seul fichier HTML."}] }'
Échange modèle à deepseek-v4-pro-0813, Minimax-M3 ou mimo-v2-6-pro de faire passer la même requête contre les autres, ou de les essayer de manière interactive dans le aire de jeux.
Questions fréquemment posées
Les résultats ont-ils été édités ou réessayés ?
Non. Chaque panneau est le premier fichier que le modèle a renvoyé pour cette invite, rendu exactement comme renvoyé. Une requête qui est revenue sans fichier a été envoyée à nouveau.
Pourquoi le réglage de raisonnement le plus élevé ?
Un bon comparatif montre chaque modèle à son meilleur, donc chacun fonctionnait à son niveau de raisonnement le plus élevé: effort maximal pour Kimi K3 et DeepSeek V4 Pro 0813, en pensant à MiniMax M3 et MiMo V2.6 Pro.
Quel modèle devrais-je utiliser ?
MiMo V2.6 Pro a le prix de sortie le plus bas des quatre ici. Faites appliquer votre propre charge de travail à chaque fois avant de décider: la même demande fonctionne pour les quatre avec seulement le nom du modèle changé.
Essaie
Terrain de jeu - Oui Tous les modèles - Oui Prix



