首页 博客

Qwen3.8 闪存 vs DeepSeek V4.1 闪存 vs MiMo V2.6 闪存 vs Step 3.7 闪存:四项编码测试

Qwen3.8 闪存 vs DeepSeek V4.1 闪存 vs MiMo V2.6 闪存 vs Step 3.7 闪存:四项编码测试

Oct 7, 2026

EmpirioLabs AI

我们放下了 Qwen 3.8 闪电侠, (中文), DeepSeek V4.1 闪存, (中文), MiMo V2.6 闪光灯 以及 步骤3.7 闪光 在四个一次性编程测试中相互竞争,全部运行在EmpirioLabs上。每个测试都用相同的提示,一次性,没有编辑,所有结果都实时在真实浏览器中渲染。

观看四向对比

规格一览

Qwen 3.8 闪电侠DeepSeek V4.1 闪存MiMo V2.6 闪光灯步骤3.7 闪光
制造者阿里巴巴深搜小米步舞乐趣
上下文窗口1,000,000 代币1,000,000 代币1,000,000 代币256,000代币
输入文本、图片与视频文本与图片文本、图像、视频和音频文本、图片与视频
推理努力达到最大努力达到最大思考是否关机努力达到最大
结构化输出严格 JSON 模式JSON 模式严格 JSON 模式JSON 模式
投入价格每100万个代币$0.16每100万个代币$0.30每100万个代币$0.14每100万个代币$0.20
产出价格每100万个代币$0.47每100万个代币$1.20每100万个代币$0.28每100万个代币$1.15

我们的运行方式

每个模型都收到相同的提示,分别是四个任务:在单个HTML文件中建造夜晚摩天轮;在单个HTML文件中制作一个木火烤炉中的披萨;在一个HTML文件中制作玩具火车套装;在单个HTML文件中制作飞越海滩的风筝。每个任务都要求一个独立且无外部库的独立HTML文件,且该文件本身会动画。Qwen3.8 Flash、DeepSeek v4.1 Flash和Step 3.7 Flash运行于 reasoning_effort:“max”;MiMo V2.6 Flash 没有 effort 设置,运行时可思考。每个模型的 token 输出预算为 65,536,每个任务只做一次。每个面板的行数和 tokens-per-second 读数是基于真实 API 调用测量的,每个结果都是模型返回的文件,按原样渲染。

需要注意什么

DeepSeek V4.1 Flash 返回文件的速度最快,约为每秒 191 个令牌。MiMo V2.6 Flash 写入文件最长,平均约 930 行,Step 3.7 Flash 最为紧凑,约 490 行。Qwen3.8 Flash 使用最多输出令牌,每个任务约 48,000 个,包括其推理。观察每个模型如何赋予场景生命:动态、细节以及它如何独立运行。我们不是在宣布赢家。运行该片段,根据你的实际使用情况判断输出。

对EmpirioLabs做同样的测试

curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:持有者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “qwen3-8-flash”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “在一个HTML文件中建造夜晚摩天轮。”}] }'

交换 模型 到 deepseek-v4-1-flash, (中文), mimo-v2-6-flash 或 step-3-7-flash 对其他请求执行相同请求,或在 操场。 。 。.

常见问题解答

结果被编辑或重试了吗?

不是。每个面板都是模型在该提示下返回的第一个文件,渲染时完全按返回的样子渲染。如果没有文件,请求会再次发送。

为什么选择最高推理设置?

公平的一对一比较显示每个模型的最佳状态,因此它们都以最高推理设置运行:Qwen3.8闪电,DeepSeek V4.1闪电,Step 3.7闪光,MiMo V2.6闪光。

我应该用哪个型号?

MiMo V2.6闪存在这里的输出价格是四款中最低的。在决定之前,先对比一下你的工作负载:这四个版本都适用,只是型号名称不同。

试试看吧

游戏场 | 所有型号 | 定价

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。