我们放下了 Qwen 3.8 闪电侠, (中文), DeepSeek V4.1 闪存, (中文), MiMo V2.6 闪光灯 以及 步骤3.7 闪光 在四个一次性编程测试中相互竞争,全部运行在EmpirioLabs上。每个测试都用相同的提示,一次性,没有编辑,所有结果都实时在真实浏览器中渲染。
观看四向对比
规格一览
| Qwen 3.8 闪电侠 | DeepSeek V4.1 闪存 | MiMo V2.6 闪光灯 | 步骤3.7 闪光 | |
|---|---|---|---|---|
| 制造者 | 阿里巴巴 | 深搜 | 小米 | 步舞乐趣 |
| 上下文窗口 | 1,000,000 代币 | 1,000,000 代币 | 1,000,000 代币 | 256,000代币 |
| 输入 | 文本、图片与视频 | 文本与图片 | 文本、图像、视频和音频 | 文本、图片与视频 |
| 推理 | 努力达到最大 | 努力达到最大 | 思考是否关机 | 努力达到最大 |
| 结构化输出 | 严格 JSON 模式 | JSON 模式 | 严格 JSON 模式 | JSON 模式 |
| 投入价格 | 每100万个代币$0.16 | 每100万个代币$0.30 | 每100万个代币$0.14 | 每100万个代币$0.20 |
| 产出价格 | 每100万个代币$0.47 | 每100万个代币$1.20 | 每100万个代币$0.28 | 每100万个代币$1.15 |
我们的运行方式
每个模型都收到相同的提示,分别是四个任务:在单个HTML文件中建造夜晚摩天轮;在单个HTML文件中制作一个木火烤炉中的披萨;在一个HTML文件中制作玩具火车套装;在单个HTML文件中制作飞越海滩的风筝。每个任务都要求一个独立且无外部库的独立HTML文件,且该文件本身会动画。Qwen3.8 Flash、DeepSeek v4.1 Flash和Step 3.7 Flash运行于 reasoning_effort:“max”;MiMo V2.6 Flash 没有 effort 设置,运行时可思考。每个模型的 token 输出预算为 65,536,每个任务只做一次。每个面板的行数和 tokens-per-second 读数是基于真实 API 调用测量的,每个结果都是模型返回的文件,按原样渲染。
需要注意什么
DeepSeek V4.1 Flash 返回文件的速度最快,约为每秒 191 个令牌。MiMo V2.6 Flash 写入文件最长,平均约 930 行,Step 3.7 Flash 最为紧凑,约 490 行。Qwen3.8 Flash 使用最多输出令牌,每个任务约 48,000 个,包括其推理。观察每个模型如何赋予场景生命:动态、细节以及它如何独立运行。我们不是在宣布赢家。运行该片段,根据你的实际使用情况判断输出。
对EmpirioLabs做同样的测试
curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:持有者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “qwen3-8-flash”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “在一个HTML文件中建造夜晚摩天轮。”}] }'
交换 模型 到 deepseek-v4-1-flash, (中文), mimo-v2-6-flash 或 step-3-7-flash 对其他请求执行相同请求,或在 操场。 。 。.
常见问题解答
结果被编辑或重试了吗?
不是。每个面板都是模型在该提示下返回的第一个文件,渲染时完全按返回的样子渲染。如果没有文件,请求会再次发送。
为什么选择最高推理设置?
公平的一对一比较显示每个模型的最佳状态,因此它们都以最高推理设置运行:Qwen3.8闪电,DeepSeek V4.1闪电,Step 3.7闪光,MiMo V2.6闪光。
我应该用哪个型号?
MiMo V2.6闪存在这里的输出价格是四款中最低的。在决定之前,先对比一下你的工作负载:这四个版本都适用,只是型号名称不同。



