Casa Blog

Qwen3.8 Flash vs DeepSeek V4.1 Flash vs MiMo V2.6 Flash vs Step 3.7 Flash: quatro testes de codificação

Qwen3.8 Flash vs DeepSeek V4.1 Flash vs MiMo V2.6 Flash vs Step 3.7 Flash: quatro testes de codificação

Oct 7, 2026

EmpirioLabs AI

Nós colocamos Qwen3.8 Flash, DeepSeek V4.1 Flash, MiMo V2.6 Flash e Passo 3.7 Flash Um contra o outro em quatro testes de codificação one-shot, todos rodando em EmpirioLabs. Mesmo prompt para cada um, one shot, sem edições e todos os resultados renderizados ao vivo em um navegador real.

Assista à comparação entre quatro

Especificações em um olhar

Qwen3.8 FlashDeepSeek V4.1 FlashMiMo V2.6 FlashPasso 3.7 Flash
CriadorAlibabaDeepSeekXiaomiStepFun
Janela de contexto1.000.000 de fichas1.000.000 de fichas1.000.000 de fichas256.000 fichas
EntradaTexto, imagens e vídeoTexto e imagensTexto, imagens, vídeo e áudioTexto, imagens e vídeo
RaciocínioEsforço no máximoEsforço no máximoPensando de forma intermitente ou desligadaEsforço no máximo
Saída estruturadaEsquema JSON EstritoModo JSONEsquema JSON EstritoModo JSON
Preço de entrada$0.16 por 1M de tokens$0.30 por 1M de tokens$0.14 por 1M de tokens$0.20 por 1M de tokens
Preço de produção$0.47 por 1M de tokens$1.20 por 1M de tokens$0.28 por 1M de tokens$1.15 por 1M de tokens

Como administramos

Cada modelo recebia o mesmo prompt para quatro tarefas: construir uma roda-gigante à noite em um único arquivo HTML; construir uma pizza assando em um forno a lenha em um único arquivo HTML; construir um trem de brinquedo em um único arquivo HTML; construir pipas voando sobre uma praia em um único arquivo HTML. Cada tarefa pedia um único arquivo HTML autônomo sem bibliotecas externas que se animasse sozinho. Qwen3.8 Flash, DeepSeek V4.1 Flash e Step 3.7 Flash rodavam em reasoning_effort: "Max"; O MiMo V2.6 Flash, que tem configuração sem esforço, rodou com pensamento em funcionamento. Cada modelo tinha um orçamento de saída de 65.536 tokens e um shot por tarefa. As contagens de linhas e as leituras tokens-per-second em cada painel são medidas a partir das chamadas reais de API, e cada resultado é o arquivo que o modelo retornou, renderizado como está.

O que observar

O Flash DeepSeek V4.1 retornava seus arquivos mais rápido, com cerca de 191 tokens por segundo. O Flash do MiMo V2.6 escrevia os arquivos mais longos, cerca de 930 linhas em média, e o Flash do Step 3.7 era o mais compacto, cerca de 490. O Flash do Qwen3.8 usava mais tokens de saída, cerca de 48.000 por tarefa, incluindo seu raciocínio. Observe como cada modelo dá vida à sua cena: o movimento, os detalhes e como ele continua rodando sozinho. Não estamos declarando um vencedor. Execute o clipe e avalie os resultados para seu próprio caso de uso.

Faça o mesmo teste no EmpirioLabs

curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "qwen3-8-flash", "reasoning_effort": "max", "mensagens": [{"papel": "usuário", "conteúdo": "Construa uma roda-gigante à noite em um único arquivo HTML."}] }'

Troca modelo para deepseek-v4-1-flash, mimo-v2-6-flash ou step-3-7-flash para rodar a mesma solicitação contra os outros, ou tentá-los interativamente no playground.

Perguntas frequentes

Os resultados foram editados ou retentados?

Não. Cada painel é o primeiro arquivo que o modelo retornou para aquele prompt, renderizado exatamente como retornado. Um pedido que retornou sem um arquivo foi enviado novamente.

Por que a configuração de raciocínio mais alta?

Um comparado justo mostra cada modelo em seu melhor, então cada um rodou em sua configuração de raciocínio mais alta: esforço máximo para o Flash Qwen3.8, Flash DeepSeek V4.1 e Flash Step 3.7, pensando no Flash do MiMo V2.6.

Qual modelo devo usar?

O MiMo V2.6 Flash tem o menor preço de saída dos quatro aqui. Faça sua própria carga de trabalho em cada um antes de decidir: o mesmo pedido funciona para os quatro, com apenas o nome do modelo alterado.

Experimente

Área de reprodução □ Todos os modelos □ Preços

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.