首页 博客

Kimi K3 vs DeepSeek V4 Pro 0813 vs MiniMax M3 vs MiMo V2.6 Pro:三项编程测试

Kimi K3 vs DeepSeek V4 Pro 0813 vs MiniMax M3 vs MiMo V2.6 Pro:三项编程测试

Oct 7, 2026

EmpirioLabs AI

我们放下了 Kimi K3, (中文), DeepSeek V4 Pro 0813, (中文), MiniMax M3 以及 MiMo V2.6 Pro 在三次一次性编程测试中相互竞争,全部运行在EmpirioLabs上。每个提示词相同,一次性,无编辑,且所有结果均在真实浏览器中实时渲染。

观看四向对比

规格一览

Kimi K3DeepSeek V4 Pro 0813MiniMax M3MiMo V2.6 Pro
制造者登月计划 AI深搜迷你极限小米
上下文窗口1,000,000 代币1,000,000 代币1,000,000 代币1,000,000 代币
输入文本、图片与视频正文文本、图片与视频文本、图像、视频和音频
推理努力达到最大努力达到最大思考是否关机思考是否关机
结构化输出严格 JSON 模式严格 JSON 模式JSON 模式严格 JSON 模式
投入价格每100万个代币$3.00每100万个代币$1.32$0.225每100万个代币最多可达51.2万的上下文,$0.45如上所述每100万个代币$0.435
产出价格每100万个代币$15.00每100万个代币$3.96$0.90每100万个代币最多可达51.2万的上下文,$1.80如上所述每100万个代币$0.87

我们的运行方式

每个模型都收到相同的三个任务提示:在单个 HTML 文件中构建一台旋转洗衣机;在单个 HTML 文件中制作植物生长延时摄影;在单个 HTML 文件中制作爆米花。每个任务要求一个独立且无外部库、独立动画的 HTML 文件。Kimi K3 和 DeepSeek V4 Pro 0813 运行于 reasoning_effort:“max”;MiniMax M3 和 MiMo V2.6 Pro 没有工作设置,运行时还能思考。每个模型的代币输出预算为 65,536,每个任务只能拍摄一次。每个面板的行数和 tokens-per-second 读数是基于真实的 API 调用来测量的,每个结果都是模型返回的文件,按原样渲染。

需要注意什么

MiniMax M3 返回文件的速度最快,约为每秒 114 个令牌。MiMo V2.6 Pro 写入文件最长,平均约 1090 行,MiniMax M3 最紧凑,约 500 行。MiMo V2.6 Pro 使用了最多的输出令牌,每个任务约 42,000 个,包括推理。观察每个模型如何让场景栩栩如生:运动、细节以及它如何独立运行。我们不会宣布哪个是赢家。播放片段并根据你的使用场景判断输出。

对EmpirioLabs做同样的测试

curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “kimi-k3”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “在单个HTML文件中构建洗衣机的脱水周期。”}] }'

交换 模型 到 deepseek-v4-pro-0813, (中文), Minimax-M3 或 mimo-v2-6-pro 对其他请求执行相同请求,或在 操场。 。 。.

常见问题解答

结果被编辑或重试了吗?

不是。每个面板都是模型在该提示下返回的第一个文件,渲染时完全按返回的样子渲染。如果没有文件,请求会再次发送。

为什么选择最高推理设置?

公平的对比显示了每个型号的最佳状态,因此它们都以最高标准运行:Kimi K3和DeepSeek V4 Pro 0813是最大努力,MiniMax M3和MiMo V2.6 Pro则是最大努力。

我应该用哪个型号?

MiMo V2.6 Pro 在这四款中输出价格最低。在决定前,先对比一下你的工作负载:同一个请求适用于四款,只是型号名称不同。

试试看吧

游戏场 | 所有型号 | 定价

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。