Casa Blog

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro: quatro testes de codificação one-shot

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro: quatro testes de codificação one-shot

Oct 4, 2026

EmpirioLabs AI

Nós colocamos Kimi K3, GLM 5.3, Qwen3.8 Max e DeepSeek V4 Pro 0813 Um contra o outro em quatro testes de codificação one-shot, todos rodando em EmpirioLabs. Mesma indicação para cada um, uma tentativa, sem edições ou tentativas, e todos os resultados renderizados ao vivo em um navegador real.

Assista à comparação entre quatro

Especificações em um olhar

Kimi K3GLM 5.3Qwen3.8 MaxDeepSeek V4 Pro 0813
CriadorIA MoonshotZ.aiAlibabaDeepSeek
Janela de contexto1.000.000 de fichas1.000.000 de fichas1.000.000 de fichas1.000.000 de fichas
EntradaTexto, imagens e vídeoTextoTexto, imagens e vídeoTexto
Controle de raciocínioreasoning_effort, de baixo a máximoreasoning_effort, de baixo a máximoreasoning_effort, nenhum para o máximoreasoning_effort, nenhum para o máximo
Saída estruturadaEsquema JSON EstritoModo JSONEsquema JSON EstritoEsquema JSON Estrito
Preço de entrada$3.00 por 1M de tokens$1.40 por 1M de tokens$2.00 por 1M de tokens$1.32 por 1M de tokens
Preço de produção$15.00 por 1M de tokens$4.40 por 1M de tokens$6.00 por 1M de tokens$3.96 por 1M de tokens

Como administramos

Cada modelo recebia o mesmo prompt para quatro tarefas: um labirinto que gerava e depois se resolvia sozinho com uma busca animada em A*, uma simulação de areia caindo, um pôr do sol no oceano com um veleiro surfando as ondas e chuva escorrendo por uma janela à noite. Cada tarefa pedia um único arquivo HTML autônomo, sem bibliotecas externas. Todos os quatro modelos rodavam em reasoning_effort: "Max" com um orçamento de saída de 65.536 tokens, one shot, sem tentativas. As contagens de linhas e as leituras de tokens-per-second em cada painel são medidas a partir das chamadas reais da API, e cada resultado é o arquivo retornado pelo modelo, renderizado como está.

O que observar

O DeepSeek V4 Pro 0813 retornava seus arquivos mais rápido, com cerca de 100 tokens por segundo. O Qwen3.8 Max escrevia os arquivos mais longos, cerca de 540 linhas em média, e o Kimi K3 o mais compacto, cerca de 360. O GLM 5.3 usava mais tokens de saída, cerca de 47.000 por tarefa, incluindo seu raciocínio. Observe como cada modelo anima a busca no labirinto, empilha a areia, move as ondas e funde as gotas de chuva. Não estamos declarando um vencedor. Rode o clipe e julgue os resultados para seu próprio caso de uso.

Faça o mesmo teste no EmpirioLabs

curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-de-Conteúdo: application/json" \ -d '{ "modelo": "kimi-k3", "reasoning_effort": "max", "mensagens": [{"role": "user", "content": "Construa um labirinto que gera e resolve sozinho em um único arquivo HTML."}] }'

Troca modelo para glm-5-3, qwen3-8-max ou deepseek-v4-pro-0813 para rodar a mesma solicitação contra os outros, ou tentá-los interativamente no playground.

Perguntas frequentes

Os resultados foram editados ou retentados?

Não. Cada modelo teve uma tentativa por tarefa com o mesmo prompt, e o resultado renderizado é exatamente o arquivo que ele retornou.

Por que maximizar a lógica?

Um confronto justo mostra cada modelo em seu melhor. Os quatro exibem um controle reasoning_effort sobre EmpirioLabs, então todos rodaram na configuração mais alta.

Qual modelo devo usar?

DeepSeek V4 Pro 0813 tem o menor preço por token entre os quatro e respondeu mais rápido aqui. Kimi K3 e Qwen3.8 Max aceitam imagens e vídeo, além de texto. GLM 5.3 fica próximo do preço do DeepSeek. Compare sua própria carga de trabalho em cada um antes de decidir.

Experimente

Área de reprodução □ Todos os modelos □ Preços

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.