首页 博客

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro:一个水族箱、一架纸飞机和一个小行星

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro:一个水族箱、一架纸飞机和一个小行星

Oct 5, 2026

EmpirioLabs AI

我们放下了 Kimi K3, (中文), GLM 5.3, (中文), Qwen3.8 Max 0902 以及 DeepSeek V4 Pro 0813 在三次一次性编程测试中相互竞争,全部运行在EmpirioLabs上。每个提示词相同,一次尝试,不进行编辑或重试,所有结果都实时在真实浏览器中渲染。

观看四向对比

规格一览

Kimi K3GLM 5.3Qwen3.8 Max 0902DeepSeek V4 Pro 0813
制造者登月计划 AIZ.ai阿里巴巴深搜
上下文窗口1,000,000 代币1,000,000 代币1,000,000 代币1,000,000 代币
输入文本、图片与视频正文文本、图片与视频正文
作出合理努力最高最高最高最高
结构化输出严格 JSON 模式JSON 模式严格 JSON 模式严格 JSON 模式
投入价格每100万个代币$3.00每100万个代币$1.40每100万个代币$2.00每100万个代币$1.32
产出价格每100万个代币$15.00每100万个代币$4.40每100万个代币$6.00每100万个代币$3.96

我们的运行方式

每个模型都收到相同的三个任务提示:在单个HTML文件中建造一个活生生的水族箱;在一个HTML文件中制作一架穿越云层的纸飞机;在一个HTML文件中建造一个有汽车绕行的小行星。每个任务都要求一个独立且无外部库、能独立动画的HTML文件。四个模型均运行于 reasoning_effort:“max” 以65,536个令牌输出预算,一次性完成,不重试。每个面板的行数和读数tokens-per-second是基于真实API调用测量的,每个结果都是模型返回的文件,按原样渲染。

需要注意什么

DeepSeek V4 Pro 0813 返回文件的速度最快,约为每秒 114 个令牌。GLM 5.3 写入文件最长,平均约 710 行,Kimi K3 最紧凑,约 450 行。GLM 5.3 使用最多输出令牌,每个任务约 54,000 个,包括推理。观察每个模型如何赋予场景生命:运动、细节以及它如何独立运行。我们不会宣布哪个是赢家。播放该片段,根据你的使用场景判断输出。

对EmpirioLabs做同样的测试

curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “kimi-k3”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “在单一HTML文件中构建一个活水族箱。”}}'

交换 模型 到 glm-5-3, (中文), qwen3-8-max-0902 或 deepseek-v4-pro-0813 对其他请求执行相同请求,或在 操场。 。 。.

常见问题解答

结果被编辑或重试了吗?

不。每个模型每个任务都有一次尝试,提示完全相同,渲染出来的结果就是它返回的文件。

为什么要用最大推理?

公平的对比显示了每个模型的最佳状态。四个模型在EmpirioLabs都暴露出reasoning_effort控制,因此四个都运行在最高档位。

我应该用哪个型号?

DeepSeek V4 Pro 0813 在这里的输出价格是四款中最低的。在决定之前,先对比一下你的工作负载:同样的要求适用于四款,只是型号名称不同。

试试看吧

游戏场 | 所有型号 | 定价

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。