首页 博客

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro:四次一次性编程测试

Kimi K3 vs GLM 5.3 vs Qwen3.8 Max vs DeepSeek V4 Pro:四次一次性编程测试

Oct 4, 2026

EmpirioLabs AI

我们放下了 Kimi K3, (中文), GLM 5.3, (中文), Qwen 3.8 Max 以及 DeepSeek V4 Pro 0813 在四个一次性编程测试中相互竞争,全部在EmpirioLabs上运行。每个测试都用相同的提示,一次尝试,没有编辑或重试,所有结果都在真实浏览器中实时渲染。

观看四向对比

规格一览

Kimi K3GLM 5.3Qwen 3.8 MaxDeepSeek V4 Pro 0813
制造者登月计划 AIZ.ai阿里巴巴深搜
上下文窗口1,000,000 代币1,000,000 代币1,000,000 代币1,000,000 代币
输入文本、图片与视频正文文本、图片与视频正文
推理控制reasoning_effort,从低到最大reasoning_effort,从低到最大reasoning_effort,最高值为零reasoning_effort,最高值为零
结构化输出严格 JSON 模式JSON 模式严格 JSON 模式严格 JSON 模式
投入价格每100万个代币$3.00每100万个代币$1.40每100万个代币$2.00每100万个代币$1.32
产出价格每100万个代币$15.00每100万个代币$4.40每100万个代币$6.00每100万个代币$3.96

我们的运行方式

每个模型都收到了四个任务的相同提示:一个生成并通过动画A*搜索自我求解的迷宫、一个落沙模拟、一个带帆船乘风而下的海洋日落,以及夜晚窗户流下的雨水。每个任务都要求一个独立的HTML文件,没有外部库。四个模型均运行于 reasoning_effort:“max” 以65,536个令牌输出预算,一次性完成,不重试。每个面板的行数和读数tokens-per-second是基于真实API调用测量的,每个结果都是模型返回的文件,按原样渲染。

需要注意什么

DeepSeek V4 Pro 0813 返回文件的速度最快,约为每秒 100 个令牌。Qwen3.8 Max 写入文件最长,平均约 540 行,Kimi K3 最紧凑,约 360 行。GLM 5.3 使用最多输出令牌,每个任务约 47,000 个,包括推理。观察每个模型如何动画迷宫搜索、堆沙、移动波浪和合并雨滴。我们不是在宣布赢家。播放片段并根据你的实际使用情况判断输出。

对EmpirioLabs做同样的测试

curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “kimi-k3”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “构建一个在单个HTML文件中生成并自我解决的迷宫。”}] }'

交换 模型 到 glm-5-3, (中文), qwen3-8-max 或 deepseek-v4-pro-0813 对其他请求执行相同请求,或在 操场。 。 。.

常见问题解答

结果被编辑或重试了吗?

不。每个模型每个任务都有一次尝试,提示完全相同,渲染出来的结果就是它返回的文件。

为什么要用最大推理?

公平的对比显示了每个模型的最佳状态。四个模型在EmpirioLabs都暴露出reasoning_effort控制,因此四个都运行在最高档位。

我应该用哪个型号?

DeepSeek V4 Pro 0813 在四个中单代币价格最低,这里回答得也最快。Kimi K3 和 Qwen3.8 Max 支持图片和视频以及文本。GLM 5.3 的价格接近 DeepSeek。在决定前,先比较一下各自的工作负载。

试试看吧

游戏场 | 所有型号 | 定价

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。