我们放下了 Kimi K3, (中文), GLM 5.3, (中文), Qwen3.8 Max 0902 以及 DeepSeek V4 Pro 0813 在三次一次性编程测试中相互竞争,全部运行在EmpirioLabs上。每个提示词相同,一次尝试,不进行编辑或重试,所有结果都实时在真实浏览器中渲染。
观看四向对比
规格一览
| Kimi K3 | GLM 5.3 | Qwen3.8 Max 0902 | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| 制造者 | 登月计划 AI | Z.ai | 阿里巴巴 | 深搜 |
| 上下文窗口 | 1,000,000 代币 | 1,000,000 代币 | 1,000,000 代币 | 1,000,000 代币 |
| 输入 | 文本、图片与视频 | 正文 | 文本、图片与视频 | 正文 |
| 作出合理努力 | 最高 | 最高 | 最高 | 最高 |
| 结构化输出 | 严格 JSON 模式 | JSON 模式 | 严格 JSON 模式 | 严格 JSON 模式 |
| 投入价格 | 每100万个代币$3.00 | 每100万个代币$1.40 | 每100万个代币$2.00 | 每100万个代币$1.32 |
| 产出价格 | 每100万个代币$15.00 | 每100万个代币$4.40 | 每100万个代币$6.00 | 每100万个代币$3.96 |
我们的运行方式
每个模型都收到相同的三个任务提示:在单个HTML文件中建造一个活生生的水族箱;在一个HTML文件中制作一架穿越云层的纸飞机;在一个HTML文件中建造一个有汽车绕行的小行星。每个任务都要求一个独立且无外部库、能独立动画的HTML文件。四个模型均运行于 reasoning_effort:“max” 以65,536个令牌输出预算,一次性完成,不重试。每个面板的行数和读数tokens-per-second是基于真实API调用测量的,每个结果都是模型返回的文件,按原样渲染。
需要注意什么
DeepSeek V4 Pro 0813 返回文件的速度最快,约为每秒 114 个令牌。GLM 5.3 写入文件最长,平均约 710 行,Kimi K3 最紧凑,约 450 行。GLM 5.3 使用最多输出令牌,每个任务约 54,000 个,包括推理。观察每个模型如何赋予场景生命:运动、细节以及它如何独立运行。我们不会宣布哪个是赢家。播放该片段,根据你的使用场景判断输出。
对EmpirioLabs做同样的测试
curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “kimi-k3”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “在单一HTML文件中构建一个活水族箱。”}}'
交换 模型 到 glm-5-3, (中文), qwen3-8-max-0902 或 deepseek-v4-pro-0813 对其他请求执行相同请求,或在 操场。 。 。.
常见问题解答
结果被编辑或重试了吗?
不。每个模型每个任务都有一次尝试,提示完全相同,渲染出来的结果就是它返回的文件。
为什么要用最大推理?
公平的对比显示了每个模型的最佳状态。四个模型在EmpirioLabs都暴露出reasoning_effort控制,因此四个都运行在最高档位。
我应该用哪个型号?
DeepSeek V4 Pro 0813 在这里的输出价格是四款中最低的。在决定之前,先对比一下你的工作负载:同样的要求适用于四款,只是型号名称不同。



