Ponemos Qwen3.8 Flash, DeepSeek V4.1 Flash, MiMo V2.6 Flash y Paso 3.7 Flash Enfrentándose entre sí en cuatro pruebas de codificación one-shot, todas ejecutadas en EmpirioLabs. El mismo prompt cada uno, un solo shot, sin ediciones y todos los resultados renderizados en vivo en un navegador real.
Mira la comparación a cuatro bandas
Especificaciones de un vistazo
| Qwen3.8 Flash | DeepSeek V4.1 Flash | MiMo V2.6 Flash | Paso 3.7 Flash | |
|---|---|---|---|---|
| Maker | Alibaba | DeepSeek | Xiaomi | StepFun |
| Ventana de contexto | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas | 256.000 fichas |
| Entrada | Texto, imágenes y vídeo | Texto e imágenes | Texto, imágenes, vídeo y audio | Texto, imágenes y vídeo |
| Razonamiento | Esfuerzo al máximo | Esfuerzo al máximo | Pensando en el momento o en el aire | Esfuerzo al máximo |
| Salida estructurada | Esquema JSON estricto | Modo JSON | Esquema JSON estricto | Modo JSON |
| Precio de entrada | $0.16 por cada 1M de fichas | $0.30 por cada 1M de fichas | $0.14 por cada 1M de fichas | $0.20 por cada 1M de fichas |
| Precio de producción | $0.47 por cada 1M de fichas | $1.20 por cada 1M de fichas | $0.28 por cada 1M de fichas | $1.15 por cada 1M de fichas |
Cómo lo gestionamos
Cada modelo recibía el mismo prompt para cuatro tareas: construir una noria por la noche en un solo archivo HTML; construir una pizza horneándose en un horno de leña en un solo archivo HTML; construir un juego de trenes de juguete en un solo archivo HTML; construir cometas volando sobre una playa en un solo archivo HTML. Cada tarea pedía un único archivo HTML autónomo sin bibliotecas externas que se animara por sí solo. Qwen3.8 Flash, DeepSeek v4.1 Flash y Step 3.7 Flash funcionaban en reasoning_effort: "max"; MiMo V2.6 Flash, que tiene opción de no esfuerzo, se ejecutó pensando activamente. Cada modelo tenía un presupuesto de salida de 65.536 tokens y un disparo por tarea. El recuento de líneas y las lecturas de tokens-per-second en cada panel se miden a partir de las llamadas reales a la API, y cada resultado es el archivo que el modelo devolvió, renderizado tal cual.
Qué buscar
DeepSeek V4.1 Flash devolvió sus archivos más rápido, con unos 191 tokens por segundo. MiMo V2.6 Flash escribió los archivos más largos, unas 930 líneas de media, y Step 3.7 Flash el más compacto, unos 490. Qwen3.8 Flash usó la mayor cantidad de tokens de salida, unos 48.000 por tarea, incluyendo su razonamiento. Observa cómo cada modelo da vida a su escena: el movimiento, el detalle y cómo sigue funcionando por sí solo. No estamos declarando un ganador. Ejecuta el clip y juzga las salidas según tu propio caso de uso.
Haz la misma prueba en EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "qwen3-8-flash", "reasoning_effort": "max", "mensajes": [{"rol": "usuario", "contenido": "Construye una noria por la noche en un solo archivo HTML."}] }'
Intercambio modelo a deepseek-v4-1-flash, mimo-v2-6-flash o step-3-7-flash para ejecutar la misma petición contra los demás, o intentarlos de forma interactiva en el parque infantil.
Preguntas frecuentes
¿Se editaron o volvieron a intentar los resultados?
No. Cada panel es el primer archivo que el modelo devolvió para ese prompt, renderizado exactamente como se devolvió. Se envió una solicitud que respondió sin archivo otra vez.
¿Por qué el nivel de razonamiento más alto?
Un comparado justo muestra cada modelo en su mejor versión, así que cada uno funcionó con su configuración de razonamiento más alta: esfuerzo máximo para Flash Qwen3.8, Flash DeepSeek V4.1 y Flash Step 3.7, pensando en Flash MiMo V2.6.
¿Qué modelo debería usar?
MiMo V2.6 Flash tiene el precio de salida más bajo de los cuatro aquí. Ejecuta tu propia carga de trabajo con cada uno antes de decidir: la misma petición funciona para los cuatro con solo el nombre del modelo cambiado.
Pruébalo
Playground Silencio Todos los modelos Silencio Precios



