我们放下了 缪斯·格利默30B 反对 Qwen3.6 27B 通过五次一次性编码测试,所有测试都通过一个API在EmpirioLabs上运行。每次都是相同的提示,一次尝试,没有编辑或重试,所有结果都实时在真实浏览器中渲染。
看一对一比赛
规格一览
| 缪斯·格利默30B | Qwen3.6 27B | |
|---|---|---|
| 制造者 | 元文化 | 阿里巴巴 |
| 上下文窗口 | 131,072枚代币 | 256,000代币 |
| 投入 | 文本与图片 | 文本、图片与视频 |
| 推理控制 | reasoning_effort,最高值为零 | reasoning_effort,最高值为零 |
| 结构化产出 | 严格 JSON 模式 | JSON 模式 |
| 投入价格 | 每100万个代币$0.20 | 每100万个代币$0.41 |
| 产出价格 | 每100万个代币$0.80 | 每100万个代币$2.48 |
| 服务 | EmpirioLabs 本土推断 | 托管API |
我们的运行方式
每个模型都收到了相同的五个任务提示:山脊上的极光、深海水母群、夜间雷暴伴有分叉闪电、俯瞰锦鲤池和喷发火山。每个任务都要求一个独立的 HTML 文件,没有外部库。两款型号的运行速度均为 reasoning_effort:“max” 32,000代币的输出预算,一次性,不重试。每个面板的行数和读数tokens-per-second是基于真实的API调用测量的,每个结果都是模型返回的文件,按原样渲染。
需要注意什么
Muse Glimmer 倾向于编写紧凑的文件并保持稳定的世代节奏,而 Qwen3.6 27B 通常编写更长、更复杂的场景。观察每个模型如何处理粒子运动、层叠光影,以及提示中要求的细节,如涟漪、余晖和漂浮的余烬。我们不是在宣布赢家。播放剪辑,根据你的实际情况判断输出。
对EmpirioLabs做同样的测试
curl https://api.empiriolabs.ai/v1/chat/completions \ -h '授权:承载者 $EMPIRIOLABS_API_KEY' \ -h '内容类型:application/json' \ -d '{ “model”: “muse-glimmer-30b”, “reasoning_effort”: “max”, “messages”: [{“role”: “user”, “content”: “在单个HTML文件中构建动画极光。”}] }'
交换 模型 到 qwen3-6-27b 对另一个模型运行相同请求,或者在 操场。 。 。.
常见问题解答
结果被编辑或重试了吗?
不。每个模型每个任务都有一次尝试,提示完全相同,渲染出来的结果就是它返回的文件。
为什么要用最大推理?
公平的正面对决展示了每个模型的最佳状态。两款机型在EmpirioLabs上都暴露出reasoning_effort控制,因此都运行在最高档位。
我应该用哪个型号?
Muse Glimmer 30B 价格较低,基于EmpirioLabs原生推理和严格的 JSON 模式输出,适合代理支架和高流量工作负载。Qwen3.6 27B 可携带更大的上下文窗口和视频输入。在决定之前,先把自己的工作量和两者都做比较。



