我们放下了 Kimi K3, (中文), DeepSeek V4 Pro 0813, (中文), MiniMax M3 以及 MiMo V2.6 Pro 在三次一次性编程测试中相互竞争,全部运行在EmpirioLabs上。每个提示词相同,一次性,无编辑,且所有结果均在真实浏览器中实时渲染。
观看四向对比
规格一览
| Kimi K3 | DeepSeek V4 Pro 0813 | MiniMax M3 | MiMo V2.6 Pro | |
|---|---|---|---|---|
| 制造者 | 登月计划 AI | 深搜 | 迷你极限 | 小米 |
| 上下文窗口 | 1,000,000 代币 | 1,000,000 代币 | 1,000,000 代币 | 1,000,000 代币 |
| 输入 | 文本、图片与视频 | 正文 | 文本、图片与视频 | 文本、图像、视频和音频 |
| 推理 | 努力达到最大 | 努力达到最大 | 思考是否关机 | 思考是否关机 |
| 结构化输出 | 严格 JSON 模式 | 严格 JSON 模式 | JSON 模式 | 严格 JSON 模式 |
| 投入价格 | 每100万个代币$3.00 | 每100万个代币$1.32 | $0.225每100万个代币最多可达51.2万的上下文,$0.45如上所述 | 每100万个代币$0.435 |
| 产出价格 | 每100万个代币$15.00 | 每100万个代币$3.96 | $0.90每100万个代币最多可达51.2万的上下文,$1.80如上所述 | 每100万个代币$0.87 |
我们的运行方式
每个模型都收到相同的三个任务提示:在单个 HTML 文件中构建一台旋转洗衣机;在单个 HTML 文件中制作植物生长延时摄影;在单个 HTML 文件中制作爆米花。每个任务要求一个独立且无外部库、独立动画的 HTML 文件。Kimi K3 和 DeepSeek V4 Pro 0813 运行于 reasoning_effort:“max”;MiniMax M3 和 MiMo V2.6 Pro 没有工作设置,运行时还能思考。每个模型的代币输出预算为 65,536,每个任务只能拍摄一次。每个面板的行数和 tokens-per-second 读数是基于真实的 API 调用来测量的,每个结果都是模型返回的文件,按原样渲染。
需要注意什么
MiniMax M3 返回文件的速度最快,约为每秒 114 个令牌。MiMo V2.6 Pro 写入文件最长,平均约 1090 行,MiniMax M3 最紧凑,约 500 行。MiMo V2.6 Pro 使用了最多的输出令牌,每个任务约 42,000 个,包括推理。观察每个模型如何让场景栩栩如生:运动、细节以及它如何独立运行。我们不会宣布哪个是赢家。播放片段并根据你的使用场景判断输出。
对EmpirioLabs做同样的测试
curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “kimi-k3”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “在单个HTML文件中构建洗衣机的脱水周期。”}] }'
交换 模型 到 deepseek-v4-pro-0813, (中文), Minimax-M3 或 mimo-v2-6-pro 对其他请求执行相同请求,或在 操场。 。 。.
常见问题解答
结果被编辑或重试了吗?
不是。每个面板都是模型在该提示下返回的第一个文件,渲染时完全按返回的样子渲染。如果没有文件,请求会再次发送。
为什么选择最高推理设置?
公平的对比显示了每个型号的最佳状态,因此它们都以最高标准运行:Kimi K3和DeepSeek V4 Pro 0813是最大努力,MiniMax M3和MiMo V2.6 Pro则是最大努力。
我应该用哪个型号?
MiMo V2.6 Pro 在这四款中输出价格最低。在决定前,先对比一下你的工作负载:同一个请求适用于四款,只是型号名称不同。



