Ponemos Kimi K3, DeepSeek V4 Pro 0813, MiniMax M3 y MiMo V2.6 Pro Enfrentándose entre sí en tres pruebas de código one-shot, todas ejecutándose en EmpirioLabs. Mismo prompt cada uno, one shot, sin ediciones y todos los resultados renderizados en vivo en un navegador real.
Mira la comparación a cuatro bandas
Especificaciones de un vistazo
| Kimi K3 | DeepSeek V4 Pro 0813 | MiniMax M3 | MiMo V2.6 Pro | |
|---|---|---|---|---|
| Maker | IA Moonshot | DeepSeek | MiniMax | Xiaomi |
| Ventana de contexto | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas |
| Entrada | Texto, imágenes y vídeo | Texto | Texto, imágenes y vídeo | Texto, imágenes, vídeo y audio |
| Razonamiento | Esfuerzo al máximo | Esfuerzo al máximo | Pensando en el momento o en el aire | Pensando en el momento o en el aire |
| Salida estructurada | Esquema JSON estricto | Esquema JSON estricto | Modo JSON | Esquema JSON estricto |
| Precio de entrada | $3.00 por cada 1M de fichas | $1.32 por cada 1M de fichas | $0.225 por 1 millón de tokens hasta 512K de contexto, $0.45 arriba | $0.435 por cada 1M de fichas |
| Precio de producción | $15.00 por cada 1M de fichas | $3.96 por cada 1M de fichas | $0.90 por 1 millón de tokens hasta 512K de contexto, $1.80 arriba | $0.87 por cada 1M de fichas |
Cómo lo gestionamos
Cada modelo recibía el mismo prompt para tres tareas: construir una lavadora en un ciclo de centrifugado en un solo archivo HTML; construir un time-lapse de crecimiento de planta en un solo archivo HTML; construir palomitas de maíz que explotaban en una maceta en un solo archivo HTML. Cada tarea pedía un único archivo HTML autónomo sin bibliotecas externas que se animara por sí solo. Kimi K3 y DeepSeek V4 Pro 0813 se ejecutaban en reasoning_effort: "max"; MiniMax M3 y MiMo V2.6 Pro, que no tienen opción de esfuerzo, funcionaban con el pensamiento activado. Cada modelo tenía un presupuesto de salida de 65.536 tokens y un disparo por tarea. El conteo de líneas y las lecturas de tokens-per-second en cada panel se miden a partir de las llamadas reales a la API, y cada resultado es el archivo que el modelo devolvió, renderizado tal cual.
Qué buscar
El MiniMax M3 devolvía sus archivos más rápido, con unos 114 tokens por segundo. MiMo V2.6 Pro escribía los archivos más largos, unas 1090 líneas de media, y el MiniMax M3 el más compacto, unas 500. MiMo V2.6 Pro usaba la mayor cantidad de tokens de salida, unos 42.000 por tarea, incluyendo su razonamiento. Observa cómo cada modelo da vida a su escena: el movimiento, el detalle y cómo sigue funcionando por sí solo. No estamos declarando un ganador. Ejecuta el clip y juzga las salidas según tu propio caso de uso.
Haz la misma prueba en EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "kimi-k3", "reasoning_effort": "max", "mensajes": [{"rol": "usuario", "contenido": "Construir una lavadora en un ciclo de centrifugado en un solo archivo HTML."}] }'
Intercambio modelo a deepseek-v4-pro-0813, Minimax-M3 o mimo-v2-6-pro para ejecutar la misma petición contra los demás, o intentarlos de forma interactiva en el parque infantil.
Preguntas frecuentes
¿Se editaron o volvieron a intentar los resultados?
No. Cada panel es el primer archivo que el modelo devolvió para ese prompt, renderizado exactamente como se devolvió. Se envió una solicitud que respondió sin archivo otra vez.
¿Por qué el nivel de razonamiento más alto?
Un comparativo justo muestra cada modelo en su mejor versión, así que cada uno funcionó con su mejor nivel de razonamiento: esfuerzo máximo para Kimi K3 y DeepSeek V4 Pro 0813, pensando en MiniMax M3 y MiMo V2.6 Pro.
¿Qué modelo debería usar?
MiMo V2.6 Pro tiene el precio de salida más bajo de los cuatro aquí. Ejecuta tu propia carga de trabajo con cada uno antes de decidir: la misma petición funciona para los cuatro solo cambiando el nombre del modelo.
Pruébalo
Playground Silencio Todos los modelos Silencio Precios



