首页 博客

Kimi K3 vs GLM 5.3 vs Qwen 3.8 Max vs DeepSeek V4 Pro:自玩 Flappy Bird 和 Missile Command(导弹指挥官)

Kimi K3 vs GLM 5.3 vs Qwen 3.8 Max vs DeepSeek V4 Pro:自玩 Flappy Bird 和 Missile Command(导弹指挥官)

Oct 6, 2026

EmpirioLabs AI

我们放下了 Kimi K3, (中文), GLM 5.3, (中文), Qwen3.8 Max 0902 以及 DeepSeek V4 Pro 0813 通过两次一次性编程测试相互竞争,全部运行在EmpirioLabs上。每次都用相同的提示,一次尝试,没有编辑或重试,所有结果都实时在真实浏览器中渲染。

观看四向对比

规格一览

Kimi K3GLM 5.3Qwen3.8 Max 0902DeepSeek V4 Pro 0813
制造者登月计划 AIZ.ai阿里巴巴深搜
上下文窗口1,000,000 代币1,000,000 代币1,000,000 代币1,000,000 代币
输入文本、图片与视频正文文本、图片与视频正文
作出合理努力最高最高最高最高
结构化输出严格 JSON 模式JSON 模式严格 JSON 模式严格 JSON 模式
投入价格每100万个代币$3.00每100万个代币$1.40每100万个代币$2.00每100万个代币$1.32
产出价格每100万个代币$15.00每100万个代币$4.40每100万个代币$6.00每100万个代币$3.96

我们的运行方式

每个模型都收到两个任务的相同提示:构建一个在单个HTML文件中自动运行的Flappy Bird游戏;构建一个在单个HTML文件中自行运行的Missile Command游戏。每个任务都要求一个独立且无外部库且能独立动画的HTML文件。四个模型均运行于 reasoning_effort:“max” 以65,536个令牌输出预算,一次性完成,不重试。每个面板的行数和读数tokens-per-second是基于真实API调用测量的,每个结果都是模型返回的文件,按原样渲染。

需要注意什么

DeepSeek V4 Pro 0813 返回文件的速度最快,约为每秒 115 个令牌。DeepSeek V4 Pro 0813 写入文件最长,平均约 920 行,Kimi K3 最紧凑,约 490 行。GLM 5.3 使用最多输出令牌,每个任务约 59,000 个,包括其推理。观察每个模型如何赋予场景生命:运动、细节以及它如何独立运行。我们不是在宣布赢家。运行该片段,根据你的实际使用情况判断输出。

对EmpirioLabs做同样的测试

curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “kimi-k3”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “构建一个在单个HTML文件中自动运行的Flappy Bird游戏。”}] }'

交换 模型 到 glm-5-3, (中文), qwen3-8-max-0902 或 deepseek-v4-pro-0813 对其他请求执行相同请求,或在 操场。 。 。.

常见问题解答

结果被编辑或重试了吗?

不。每个模型每个任务都有一次尝试,提示完全相同,渲染出来的结果就是它返回的文件。

为什么要用最大推理?

公平的对比显示了每个模型的最佳状态。四个模型在EmpirioLabs都暴露出reasoning_effort控制,因此四个都运行在最高档位。

我应该用哪个型号?

DeepSeek V4 Pro 0813 在这里的输出价格是四款中最低的。在决定之前,先对比一下你的工作负载:同样的要求适用于四款,只是型号名称不同。

试试看吧

游戏场 | 所有型号 | 定价

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。