Nós colocamos Kimi K3, DeepSeek V4 Pro 0813, MiniMax M3 e MiMo V2.6 Pro Um contra o outro em três testes de codificação one-shot, todos rodando em EmpirioLabs. Mesmo prompt cada um, one shot, sem edições e todos os resultados renderizados ao vivo em um navegador real.
Assista à comparação entre quatro
Especificações em um olhar
| Kimi K3 | DeepSeek V4 Pro 0813 | MiniMax M3 | MiMo V2.6 Pro | |
|---|---|---|---|---|
| Criador | IA Moonshot | DeepSeek | MiniMax | Xiaomi |
| Janela de contexto | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas |
| Entrada | Texto, imagens e vídeo | Texto | Texto, imagens e vídeo | Texto, imagens, vídeo e áudio |
| Raciocínio | Esforço no máximo | Esforço no máximo | Pensando de forma intermitente ou desligada | Pensando de forma intermitente ou desligada |
| Saída estruturada | Esquema JSON Estrito | Esquema JSON Estrito | Modo JSON | Esquema JSON Estrito |
| Preço de entrada | $3.00 por 1M de tokens | $1.32 por 1M de tokens | $0.225 por 1M de tokens até 512K contexto, $0.45 acima | $0.435 por 1M de tokens |
| Preço de produção | $15.00 por 1M de tokens | $3.96 por 1M de tokens | $0.90 por 1M de tokens até 512K contexto, $1.80 acima | $0.87 por 1M de tokens |
Como administramos
Cada modelo recebia o mesmo prompt para três tarefas: construir uma máquina de lavar em um ciclo de centrifugação em um único arquivo HTML; construir um time-lapse de crescimento de planta em um único arquivo HTML; construir pipoca estourando em um vaso em um único arquivo HTML. Cada tarefa pedia um único arquivo HTML autônomo sem bibliotecas externas que se animava sozinho. Kimi K3 e DeepSeek V4 Pro 0813 rodavam em reasoning_effort: "Max"; MiniMax M3 e MiMo V2.6 Pro, que têm configuração sem esforço, rodaram com pensamento ativado. Cada modelo tinha um orçamento de saída de 65.536 tokens e um shot por tarefa. As contagens de linhas e as leituras tokens-per-second em cada painel são medidas a partir das chamadas reais de API, e cada resultado é o arquivo que o modelo retornou, renderizado como está.
O que observar
O MiniMax M3 retornava seus arquivos mais rápido, com cerca de 114 tokens por segundo. O MiMo V2.6 Pro escrevia os arquivos mais longos, cerca de 1090 linhas em média, e o MiniMax M3 o mais compacto, cerca de 500. O MiMo V2.6 Pro usava mais tokens de saída, cerca de 42.000 por tarefa, incluindo seu raciocínio. Observe como cada modelo dá vida à sua cena: o movimento, o detalhe e como ela continua rodando sozinha. Não estamos declarando um vencedor. Rode o clipe e avalie as saídas para seu próprio caso.
Faça o mesmo teste no EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-de-Conteúdo: application/json" \ -d '{ "modelo": "kimi-k3", "reasoning_effort": "max", "mensagens": [{"função": "usuário", "conteúdo": "Construa uma máquina de lavar em um ciclo de centrifugação em um único arquivo HTML."}] }'
Troca modelo para deepseek-v4-pro-0813, Minimax-M3 ou mimo-v2-6-pro para rodar a mesma solicitação contra os outros, ou tentá-los interativamente no playground.
Perguntas frequentes
Os resultados foram editados ou retentados?
Não. Cada painel é o primeiro arquivo que o modelo retornou para aquele prompt, renderizado exatamente como retornado. Um pedido que retornou sem um arquivo foi enviado novamente.
Por que a configuração de raciocínio mais alta?
Um comparativo justo mostra cada modelo em seu melhor, então cada um rodou em sua configuração máxima de raciocínio: esforço máximo para Kimi K3 e DeepSeek V4 Pro 0813, pensando em MiniMax M3 e MiMo V2.6 Pro.
Qual modelo devo usar?
O MiMo V2.6 Pro tem o menor preço de saída dos quatro aqui. Execute sua própria carga de trabalho em cada um antes de decidir: o mesmo pedido funciona para os quatro com apenas o nome do modelo alterado.



