Nós colocamos Kimi K3, GLM 5.3, Qwen3.8 Max e DeepSeek V4 Pro 0813 Um contra o outro em quatro testes de codificação one-shot, todos rodando em EmpirioLabs. Mesma indicação para cada um, uma tentativa, sem edições ou tentativas, e todos os resultados renderizados ao vivo em um navegador real.
Assista à comparação entre quatro
Especificações em um olhar
| Kimi K3 | GLM 5.3 | Qwen3.8 Max | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| Criador | IA Moonshot | Z.ai | Alibaba | DeepSeek |
| Janela de contexto | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas |
| Entrada | Texto, imagens e vídeo | Texto | Texto, imagens e vídeo | Texto |
| Controle de raciocínio | reasoning_effort, de baixo a máximo | reasoning_effort, de baixo a máximo | reasoning_effort, nenhum para o máximo | reasoning_effort, nenhum para o máximo |
| Saída estruturada | Esquema JSON Estrito | Modo JSON | Esquema JSON Estrito | Esquema JSON Estrito |
| Preço de entrada | $3.00 por 1M de tokens | $1.40 por 1M de tokens | $2.00 por 1M de tokens | $1.32 por 1M de tokens |
| Preço de produção | $15.00 por 1M de tokens | $4.40 por 1M de tokens | $6.00 por 1M de tokens | $3.96 por 1M de tokens |
Como administramos
Cada modelo recebia o mesmo prompt para quatro tarefas: um labirinto que gerava e depois se resolvia sozinho com uma busca animada em A*, uma simulação de areia caindo, um pôr do sol no oceano com um veleiro surfando as ondas e chuva escorrendo por uma janela à noite. Cada tarefa pedia um único arquivo HTML autônomo, sem bibliotecas externas. Todos os quatro modelos rodavam em reasoning_effort: "Max" com um orçamento de saída de 65.536 tokens, one shot, sem tentativas. As contagens de linhas e as leituras de tokens-per-second em cada painel são medidas a partir das chamadas reais da API, e cada resultado é o arquivo retornado pelo modelo, renderizado como está.
O que observar
O DeepSeek V4 Pro 0813 retornava seus arquivos mais rápido, com cerca de 100 tokens por segundo. O Qwen3.8 Max escrevia os arquivos mais longos, cerca de 540 linhas em média, e o Kimi K3 o mais compacto, cerca de 360. O GLM 5.3 usava mais tokens de saída, cerca de 47.000 por tarefa, incluindo seu raciocínio. Observe como cada modelo anima a busca no labirinto, empilha a areia, move as ondas e funde as gotas de chuva. Não estamos declarando um vencedor. Rode o clipe e julgue os resultados para seu próprio caso de uso.
Faça o mesmo teste no EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-de-Conteúdo: application/json" \ -d '{ "modelo": "kimi-k3", "reasoning_effort": "max", "mensagens": [{"role": "user", "content": "Construa um labirinto que gera e resolve sozinho em um único arquivo HTML."}] }'
Troca modelo para glm-5-3, qwen3-8-max ou deepseek-v4-pro-0813 para rodar a mesma solicitação contra os outros, ou tentá-los interativamente no playground.
Perguntas frequentes
Os resultados foram editados ou retentados?
Não. Cada modelo teve uma tentativa por tarefa com o mesmo prompt, e o resultado renderizado é exatamente o arquivo que ele retornou.
Por que maximizar a lógica?
Um confronto justo mostra cada modelo em seu melhor. Os quatro exibem um controle reasoning_effort sobre EmpirioLabs, então todos rodaram na configuração mais alta.
Qual modelo devo usar?
DeepSeek V4 Pro 0813 tem o menor preço por token entre os quatro e respondeu mais rápido aqui. Kimi K3 e Qwen3.8 Max aceitam imagens e vídeo, além de texto. GLM 5.3 fica próximo do preço do DeepSeek. Compare sua própria carga de trabalho em cada um antes de decidir.



