我们放下了 Kimi K3, (中文), GLM 5.3, (中文), Qwen 3.8 Max 以及 DeepSeek V4 Pro 0813 在四个一次性编程测试中相互竞争,全部在EmpirioLabs上运行。每个测试都用相同的提示,一次尝试,没有编辑或重试,所有结果都在真实浏览器中实时渲染。
观看四向对比
规格一览
| Kimi K3 | GLM 5.3 | Qwen 3.8 Max | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| 制造者 | 登月计划 AI | Z.ai | 阿里巴巴 | 深搜 |
| 上下文窗口 | 1,000,000 代币 | 1,000,000 代币 | 1,000,000 代币 | 1,000,000 代币 |
| 输入 | 文本、图片与视频 | 正文 | 文本、图片与视频 | 正文 |
| 推理控制 | reasoning_effort,从低到最大 | reasoning_effort,从低到最大 | reasoning_effort,最高值为零 | reasoning_effort,最高值为零 |
| 结构化输出 | 严格 JSON 模式 | JSON 模式 | 严格 JSON 模式 | 严格 JSON 模式 |
| 投入价格 | 每100万个代币$3.00 | 每100万个代币$1.40 | 每100万个代币$2.00 | 每100万个代币$1.32 |
| 产出价格 | 每100万个代币$15.00 | 每100万个代币$4.40 | 每100万个代币$6.00 | 每100万个代币$3.96 |
我们的运行方式
每个模型都收到了四个任务的相同提示:一个生成并通过动画A*搜索自我求解的迷宫、一个落沙模拟、一个带帆船乘风而下的海洋日落,以及夜晚窗户流下的雨水。每个任务都要求一个独立的HTML文件,没有外部库。四个模型均运行于 reasoning_effort:“max” 以65,536个令牌输出预算,一次性完成,不重试。每个面板的行数和读数tokens-per-second是基于真实API调用测量的,每个结果都是模型返回的文件,按原样渲染。
需要注意什么
DeepSeek V4 Pro 0813 返回文件的速度最快,约为每秒 100 个令牌。Qwen3.8 Max 写入文件最长,平均约 540 行,Kimi K3 最紧凑,约 360 行。GLM 5.3 使用最多输出令牌,每个任务约 47,000 个,包括推理。观察每个模型如何动画迷宫搜索、堆沙、移动波浪和合并雨滴。我们不是在宣布赢家。播放片段并根据你的实际使用情况判断输出。
对EmpirioLabs做同样的测试
curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “kimi-k3”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “构建一个在单个HTML文件中生成并自我解决的迷宫。”}] }'
交换 模型 到 glm-5-3, (中文), qwen3-8-max 或 deepseek-v4-pro-0813 对其他请求执行相同请求,或在 操场。 。 。.
常见问题解答
结果被编辑或重试了吗?
不。每个模型每个任务都有一次尝试,提示完全相同,渲染出来的结果就是它返回的文件。
为什么要用最大推理?
公平的对比显示了每个模型的最佳状态。四个模型在EmpirioLabs都暴露出reasoning_effort控制,因此四个都运行在最高档位。
我应该用哪个型号?
DeepSeek V4 Pro 0813 在四个中单代币价格最低,这里回答得也最快。Kimi K3 和 Qwen3.8 Max 支持图片和视频以及文本。GLM 5.3 的价格接近 DeepSeek。在决定前,先比较一下各自的工作负载。



