Nós colocamos Qwen3.8 Flash, DeepSeek V4.1 Flash, MiMo V2.6 Flash e Passo 3.7 Flash Um contra o outro em quatro testes de codificação one-shot, todos rodando em EmpirioLabs. Mesmo prompt para cada um, one shot, sem edições e todos os resultados renderizados ao vivo em um navegador real.
Assista à comparação entre quatro
Especificações em um olhar
| Qwen3.8 Flash | DeepSeek V4.1 Flash | MiMo V2.6 Flash | Passo 3.7 Flash | |
|---|---|---|---|---|
| Criador | Alibaba | DeepSeek | Xiaomi | StepFun |
| Janela de contexto | 1.000.000 de fichas | 1.000.000 de fichas | 1.000.000 de fichas | 256.000 fichas |
| Entrada | Texto, imagens e vídeo | Texto e imagens | Texto, imagens, vídeo e áudio | Texto, imagens e vídeo |
| Raciocínio | Esforço no máximo | Esforço no máximo | Pensando de forma intermitente ou desligada | Esforço no máximo |
| Saída estruturada | Esquema JSON Estrito | Modo JSON | Esquema JSON Estrito | Modo JSON |
| Preço de entrada | $0.16 por 1M de tokens | $0.30 por 1M de tokens | $0.14 por 1M de tokens | $0.20 por 1M de tokens |
| Preço de produção | $0.47 por 1M de tokens | $1.20 por 1M de tokens | $0.28 por 1M de tokens | $1.15 por 1M de tokens |
Como administramos
Cada modelo recebia o mesmo prompt para quatro tarefas: construir uma roda-gigante à noite em um único arquivo HTML; construir uma pizza assando em um forno a lenha em um único arquivo HTML; construir um trem de brinquedo em um único arquivo HTML; construir pipas voando sobre uma praia em um único arquivo HTML. Cada tarefa pedia um único arquivo HTML autônomo sem bibliotecas externas que se animasse sozinho. Qwen3.8 Flash, DeepSeek V4.1 Flash e Step 3.7 Flash rodavam em reasoning_effort: "Max"; O MiMo V2.6 Flash, que tem configuração sem esforço, rodou com pensamento em funcionamento. Cada modelo tinha um orçamento de saída de 65.536 tokens e um shot por tarefa. As contagens de linhas e as leituras tokens-per-second em cada painel são medidas a partir das chamadas reais de API, e cada resultado é o arquivo que o modelo retornou, renderizado como está.
O que observar
O Flash DeepSeek V4.1 retornava seus arquivos mais rápido, com cerca de 191 tokens por segundo. O Flash do MiMo V2.6 escrevia os arquivos mais longos, cerca de 930 linhas em média, e o Flash do Step 3.7 era o mais compacto, cerca de 490. O Flash do Qwen3.8 usava mais tokens de saída, cerca de 48.000 por tarefa, incluindo seu raciocínio. Observe como cada modelo dá vida à sua cena: o movimento, os detalhes e como ele continua rodando sozinho. Não estamos declarando um vencedor. Execute o clipe e avalie os resultados para seu próprio caso de uso.
Faça o mesmo teste no EmpirioLabs
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "qwen3-8-flash", "reasoning_effort": "max", "mensagens": [{"papel": "usuário", "conteúdo": "Construa uma roda-gigante à noite em um único arquivo HTML."}] }'
Troca modelo para deepseek-v4-1-flash, mimo-v2-6-flash ou step-3-7-flash para rodar a mesma solicitação contra os outros, ou tentá-los interativamente no playground.
Perguntas frequentes
Os resultados foram editados ou retentados?
Não. Cada painel é o primeiro arquivo que o modelo retornou para aquele prompt, renderizado exatamente como retornado. Um pedido que retornou sem um arquivo foi enviado novamente.
Por que a configuração de raciocínio mais alta?
Um comparado justo mostra cada modelo em seu melhor, então cada um rodou em sua configuração de raciocínio mais alta: esforço máximo para o Flash Qwen3.8, Flash DeepSeek V4.1 e Flash Step 3.7, pensando no Flash do MiMo V2.6.
Qual modelo devo usar?
O MiMo V2.6 Flash tem o menor preço de saída dos quatro aqui. Faça sua própria carga de trabalho em cada um antes de decidir: o mesmo pedido funciona para os quatro, com apenas o nome do modelo alterado.



