Ponemos Kimi K3, GLM 5.3, Qwen3.8 Max 0902 y DeepSeek V4 Pro 0813 Una contra otra en dos pruebas de codificación one-shot, todas ejecutándose en EmpirioLabs. Mismo prompt cada uno, un intento, sin ediciones ni intentos, y todos los resultados renderizados en vivo en un navegador real.
Mira la comparación a cuatro bandas
Especificaciones de un vistazo
| Kimi K3 | GLM 5.3 | Qwen3.8 Max 0902 | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| Maker | IA Moonshot | Z.ai | Alibaba | DeepSeek |
| Ventana de contexto | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas |
| Entrada | Texto, imágenes y vídeo | Texto | Texto, imágenes y vídeo | Texto |
| Reasoning effort | Hasta el máximo | Hasta el máximo | Hasta el máximo | Hasta el máximo |
| Salida estructurada | Esquema JSON estricto | Modo JSON | Esquema JSON estricto | Esquema JSON estricto |
| Precio de entrada | $3.00 por cada 1M de fichas | $1.40 por cada 1M de fichas | $2.00 por cada 1M de fichas | $1.32 por cada 1M de fichas |
| Precio de producción | $15.00 por cada 1M de fichas | $4.40 por cada 1M de fichas | $6.00 por cada 1M de fichas | $3.96 por cada 1M de fichas |
Cómo lo gestionamos
Cada modelo recibía la misma indicación para dos tareas: construir un juego de Flappy Bird que se juega solo en un solo archivo HTML; construir un juego de Missile Command que se juega solo en un solo archivo HTML. Cada tarea pedía un único archivo HTML autónomo sin bibliotecas externas que se animara por sí solo. Los cuatro modelos se ejecutaban en reasoning_effort: "max" con un presupuesto de salida de 65.536 tokens, un solo intento, sin intentos. El recuento de líneas y las lecturas de tokens-per-second en cada panel se miden a partir de las llamadas reales a la API, y cada resultado es el archivo que el modelo devolvió, renderizado tal cual.
Qué buscar
DeepSeek V4 Pro 0813 devolvió sus archivos más rápido, con unos 115 tokens por segundo. DeepSeek V4 Pro 0813 escribió los archivos más largos, unas 920 líneas de media, y Kimi K3 el más compacto, unos 490. GLM 5.3 usó más tokens de salida, unos 59.000 por tarea, incluyendo su razonamiento. Observa cómo cada modelo da vida a su escena: el movimiento, el detalle y cómo sigue funcionando por sí solo. No estamos declarando un ganador. Ejecuta el clip y juzga las salidas según tu propio caso de uso.
Haz la misma prueba en EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "kimi-k3", "reasoning_effort": "max", "mensajes": [{"rol": "usuario", "contenido": "Crea un juego de Flappy Bird que se juegue solo en un solo archivo HTML."}] }'
Intercambio modelo a glm-5-3, qwen3-8-max-0902 o deepseek-v4-pro-0813 para ejecutar la misma petición contra los demás, o intentarlos de forma interactiva en el parque infantil.
Preguntas frecuentes
¿Se editaron o volvieron a intentar los resultados?
No. Cada modelo tenía un intento por tarea con el mismo prompt, y el resultado renderizado era exactamente el archivo que devolvía.
¿Por qué maximizar el razonamiento?
Un comparativo justo muestra cada modelo en su mejor versión. Los cuatro muestran un control reasoning_effort en EmpirioLabs, por lo que los cuatro funcionaron en la configuración más alta.
¿Qué modelo debería usar?
DeepSeek V4 Pro 0813 tiene el precio de salida más bajo de los cuatro aquí. Haz tu propia carga de trabajo con cada uno antes de decidir: la misma petición funciona para los cuatro solo cambiando el nombre del modelo.
Pruébalo
Playground Silencio Todos los modelos Silencio Precios



