Casa Blog

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro: um aquário, um avião de papel e um planeta minúsculo

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro: um aquário, um avião de papel e um planeta minúsculo

Oct 5, 2026

EmpirioLabs AI

Nós colocamos Kimi K3, GLM 5.3, Qwen3.8 Max 0902 e DeepSeek V4 Pro 0813 Um contra o outro em três testes de codificação one-shot, todos rodando em EmpirioLabs. Mesmo prompt para cada um, uma tentativa, sem edições ou tentativas, e todos os resultados renderizados ao vivo em um navegador real.

Assista à comparação entre quatro

Especificações em um olhar

Kimi K3GLM 5.3Qwen3.8 Max 0902DeepSeek V4 Pro 0813
CriadorIA MoonshotZ.aiAlibabaDeepSeek
Janela de contexto1.000.000 de fichas1.000.000 de fichas1.000.000 de fichas1.000.000 de fichas
EntradaTexto, imagens e vídeoTextoTexto, imagens e vídeoTexto
Esforço de fundamentaçãoAté o máximoAté o máximoAté o máximoAté o máximo
Saída estruturadaEsquema JSON EstritoModo JSONEsquema JSON EstritoEsquema JSON Estrito
Preço de entrada$3.00 por 1M de tokens$1.40 por 1M de tokens$2.00 por 1M de tokens$1.32 por 1M de tokens
Preço de produção$15.00 por 1M de tokens$4.40 por 1M de tokens$6.00 por 1M de tokens$3.96 por 1M de tokens

Como administramos

Cada modelo recebia o mesmo prompt para três tarefas: construir um aquário vivo em um único arquivo HTML; construir um avião de papel voando entre nuvens em um único arquivo HTML; construir um pequeno planeta com um carro circulando em um único arquivo HTML. Cada tarefa pedia um único arquivo HTML autônomo, sem bibliotecas externas, que se animava sozinho. Todos os quatro modelos rodavam em reasoning_effort: "Max" com um orçamento de saída de 65.536 tokens, one shot, sem tentativas. As contagens de linhas e as leituras de tokens-per-second em cada painel são medidas a partir das chamadas reais da API, e cada resultado é o arquivo retornado pelo modelo, renderizado como está.

O que observar

O DeepSeek V4 Pro 0813 retornou seus arquivos mais rápido, com cerca de 114 tokens por segundo. O GLM 5.3 escreveu os arquivos mais longos, cerca de 710 linhas em média, e o Kimi K3 o mais compacto, cerca de 450. O GLM 5.3 usou mais tokens de saída, cerca de 54.000 por tarefa, incluindo seu raciocínio. Observe como cada modelo dá vida à sua cena: o movimento, o detalhe e como ele continua rodando sozinho. Não estamos declarando um vencedor. Rode o clipe e avalie as saídas para seu próprio caso de uso.

Faça o mesmo teste no EmpirioLabs

curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "kimi-k3", "reasoning_effort": "max", "mensagens": [{"papel": "usuário", "conteúdo": "Construa um aquário vivo em um único arquivo HTML."}] }'

Troca modelo para glm-5-3, qwen3-8-max-0902 ou deepseek-v4-pro-0813 para rodar a mesma solicitação contra os outros, ou tentá-los interativamente no playground.

Perguntas frequentes

Os resultados foram editados ou retentados?

Não. Cada modelo teve uma tentativa por tarefa com o mesmo prompt, e o resultado renderizado é exatamente o arquivo que ele retornou.

Por que maximizar a lógica?

Um confronto justo mostra cada modelo em seu melhor. Os quatro exibem um controle reasoning_effort sobre EmpirioLabs, então todos rodaram na configuração mais alta.

Qual modelo devo usar?

O DeepSeek V4 Pro 0813 tem o menor preço de saída dos quatro aqui. Teste sua própria carga de trabalho em cada um antes de decidir: o mesmo pedido funciona para os quatro com apenas o nome do modelo alterado.

Experimente

Área de reprodução □ Todos os modelos □ Preços

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.