私たちは置いた キミK3, GLM 5.3, Qwen3.8 Max 0902 および DeepSeek V4 Pro 0813 3回のワンショットコーディングテストで互いに競い合い、すべてEmpirioLabs上で実行されます。同じプロンプトで、1回の試み、編集ややり直しはなく、すべての結果が実際のブラウザでリアルタイムでレンダリングされます。
4人比較を見てください
仕様の概要
| キミK3 | GLM 5.3 | Qwen3.8 Max 0902 | DeepSeek V4 Pro 0813 | |
|---|---|---|---|---|
| メイカー | ムーンショットAI | Z.ai | アリババ | ディープシーク |
| コンテキストウィンドウ | 1,000,000トークン | 1,000,000トークン | 1,000,000トークン | 1,000,000トークン |
| 入力 | テキスト、画像、ビデオ | 本文 | テキスト、画像、ビデオ | 本文 |
| 働き方改革 | 最大まで | 最大まで | 最大まで | 最大まで |
| 構造化出力 | 厳密なJSONスキーマ | JSONモード | 厳密なJSONスキーマ | 厳密なJSONスキーマ |
| 投入価格 | 100万トークンあたり$3.00 | 100万トークンあたり$1.40 | 100万トークンあたり$2.00 | 100万トークンあたり$1.32 |
| 出力価格 | 100万トークンあたり$15.00 | 100万トークンあたり$4.40 | 100万トークンあたり$6.00 | 100万トークンあたり$3.96 |
運営方法
各モデルは3つのタスクに対して同じプロンプトを受け取りました:単一のHTMLファイルで生きた水族館を作ること;1つのHTMLファイルで雲の中を飛ぶ紙飛行機を作ること;1つのHTMLファイルで車が周りを走る小さな惑星を作ること。すべてのタスクは、外部ライブラリを持たず、単独でアニメーションする単一の自己完結型HTMLファイルを求めました。4つのモデルすべてが reasoning_effort:「マックス」 65,536トークン出力予算、ワンショット、リトライなし。各パネルのライン数とtokens-per-second読み取り値は実際のAPI呼び出しから測定され、各結果はモデルが返したファイルで、そのままレンダリングされます。
注意すべき点
DeepSeek V4 Pro 0813はファイルが最も速く、約114トークン/秒で返事を行いました。GLM 5.3は最も長いファイルを書き込み、平均約710行、Kimi K3が最もコンパクトで約450本でした。GLM 5.3は最も多くの出力トークンを使用し、作業ごとに約54,000トークン(推論を含む)を使いました。各モデルがどのようにシーンに命を吹き込むか、動き、細部、そして自ら動作し続ける様子をご覧ください。私たちは勝者を決めるつもりはありません。クリップを実行し、自分のユースケースに合わせて出力を判断してください。
同じテストをEmpirioLabsで行ってください
curl https://api.empiriolabs.ai/v1/chat/completions \ -h 「認証:ベアラー $EMPIRIOLABS_API_KEY」 \ -h 「コンテンツタイプ:application/json」 \ -d '{ 「model」: "kimi-k3", "reasoning_effort": "max", "messages": [{"role": "user", "content": "Building a living aquarium in one HTML file."}'
スワップ モデル から glm-5-3, qwen3-8-max-0902 または deepseek-v4-pro-0813 同じリクエストを他のものに対して実行したり、インタラクティブに試したりするために プレイグラウンドお問い合わせ.
よくある質問
結果は編集されたり再試されたりしましたか?
いいえ。各モデルは同じプロンプトで1回の試行があり、レンダリングされた結果は返されたファイルとまったく同じです。
なぜマックス・リザンズなのか?
公平な一騎打ちでは、各モデルのベストパフォーマンスが見られます。4台すべてEmpirioLabsreasoning_effortコントロールが露出しているため、4台とも最高設定で動作しました。
どのモデルを使うべきでしょうか?
DeepSeek V4 Pro 0813は、ここで4つの中で最も出力価格が低いです。それぞれの作業負荷を比較して判断してください:同じリクエストはモデル名を変えるだけで4つすべてで動作します。



