Nós colocamos Kimi K3, GLM 5.3, Qwen3.8 Max 0902 e DeepSeek V4 Pro 0813 Um contra o outro em dois testes de codificação one-shot, todos rodando em EmpirioLabs. Mesma solicitação cada, uma tentativa, sem edições ou tentativas, e todos os resultados renderizados ao vivo em um navegador real.
Assista à comparação entre quatro
Especificações em um olhar
| Kimi K3 | GLM 5.3 | Qwen3.8 Max 0902 | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| Criador | IA Moonshot | Z.ai | Alibaba | DeepSeek |
| Janela de contexto | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas |
| Entrada | Texto, imagens e vídeo | Texto | Texto, imagens e vídeo | Texto |
| Esforço de fundamentação | Até o máximo | Até o máximo | Até o máximo | Até o máximo |
| Saída estruturada | Esquema JSON Estrito | Modo JSON | Esquema JSON Estrito | Esquema JSON Estrito |
| Preço de entrada | $3.00 por 1M de tokens | $1.40 por 1M de tokens | $2.00 por 1M de tokens | $1.32 por 1M de tokens |
| Preço de produção | $15.00 por 1M de tokens | $4.40 por 1M de tokens | $6.00 por 1M de tokens | $3.96 por 1M de tokens |
Como administramos
Cada modelo recebia o mesmo prompt para duas tarefas: construir um jogo Flappy Bird que se executasse sozinho em um único arquivo HTML; construir um jogo Missile Command que se executasse sozinho em um único arquivo HTML. Cada tarefa pedia um único arquivo HTML autônomo sem bibliotecas externas que se animasse sozinha. Todos os quatro modelos rodavam em reasoning_effort: "Max" com um orçamento de saída de 65.536 tokens, one shot, sem tentativas. As contagens de linhas e as leituras de tokens-per-second em cada painel são medidas a partir das chamadas reais da API, e cada resultado é o arquivo retornado pelo modelo, renderizado como está.
O que observar
O DeepSeek V4 Pro 0813 retornava seus arquivos mais rápido, com cerca de 115 tokens por segundo. O DeepSeek V4 Pro 0813 escrevia os arquivos mais longos, cerca de 920 linhas em média, e o Kimi K3 o mais compacto, cerca de 490. O GLM 5.3 usava mais tokens de saída, cerca de 59.000 por tarefa, incluindo seu raciocínio. Observe como cada modelo dá vida à sua cena: o movimento, o detalhe e como ele continua rodando sozinho. Não estamos declarando um vencedor. Rode o clipe e avalie as saídas para seu próprio caso de uso.
Faça o mesmo teste no EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-de-Conteúdo: application/json" \ -d '{ "modelo": "kimi-k3", "reasoning_effort": "max", "mensagens": [{"role": "user", "conteúdo": "Construa um jogo Flappy Bird que se execute sozinho em um único arquivo HTML."}] }'
Troca modelo para glm-5-3, qwen3-8-max-0902 ou deepseek-v4-pro-0813 para rodar a mesma solicitação contra os outros, ou tentá-los interativamente no playground.
Perguntas frequentes
Os resultados foram editados ou retentados?
Não. Cada modelo teve uma tentativa por tarefa com o mesmo prompt, e o resultado renderizado é exatamente o arquivo que ele retornou.
Por que maximizar a lógica?
Um confronto justo mostra cada modelo em seu melhor. Os quatro exibem um controle reasoning_effort sobre EmpirioLabs, então todos rodaram na configuração mais alta.
Qual modelo devo usar?
O DeepSeek V4 Pro 0813 tem o menor preço de saída dos quatro aqui. Teste sua própria carga de trabalho em cada um antes de decidir: o mesmo pedido funciona para os quatro com apenas o nome do modelo alterado.



