私たちは置いた Qwen3.8 フラッシュ, DeepSeek V4.1 フラッシュ, MiMo V2.6 フラッシュ および ステップ3.7 フラッシュ 4つのワンショットコーディングテストで互いに競い合い、すべてEmpirioLabs上で実行されます。同じプロンプトで、ワンショット、編集なし、すべての結果が実際のブラウザでリアルタイムでレンダリングされます。
4人比較を見てください
仕様の概要
| Qwen3.8 フラッシュ | DeepSeek V4.1 フラッシュ | MiMo V2.6 フラッシュ | ステップ3.7 フラッシュ | |
|---|---|---|---|---|
| メイカー | アリババ | ディープシーク | Xiaomi | ステップファン |
| コンテキストウィンドウ | 1,000,000トークン | 1,000,000トークン | 1,000,000トークン | 256,000トークン |
| 入力 | テキスト、画像、ビデオ | テキストと画像 | テキスト、画像、映像、音声 | テキスト、画像、ビデオ |
| 理由 | 最大限の努力を | 最大限の努力を | 考えるかどうか | 最大限の努力を |
| 構造化出力 | 厳密なJSONスキーマ | JSONモード | 厳密なJSONスキーマ | JSONモード |
| 投入価格 | 100万トークンあたり$0.16 | 100万トークンあたり$0.30 | 100万トークンあたり$0.14 | 100万トークンあたり$0.20 |
| 出力価格 | 100万トークンあたり$0.47 | 100万トークンあたり$1.20 | 100万トークンあたり$0.28 | 100万トークンあたり$1.15 |
運営方法
各モデルは4つのタスクに対して同じプロンプトを受け取りました:1つのHTMLファイルで夜間観覧車を作る;薪窯でピザを焼く1つのHTMLファイル;1つのHTMLファイルでおもちゃの列車セットを作る;1つのHTMLファイルでビーチを飛ぶ凧を作ること。すべてのタスクは、外部ライブラリを持たず、単独でアニメーションする単一の自己完結型HTMLファイルを求めました。Qwen3.8 Flash、DeepSeek V4.1 Flash、Step 3.7 Flashは reasoning_effort:「マックス」;MiMo V2.6 Flashは、エフォート設定なしで、思考オンで動作しました。各モデルは65,536トークンの出力予算を持ち、タスクごとに1ショットが割り当てられていました。各パネルのライン数とtokens-per-second表示は実際のAPI呼び出しから測定され、各結果はモデルが返したファイルであり、そのままレンダリングされています。
注意すべき点
DeepSeek V4.1 Flashは約191トークン/秒で最速のファイルを返しました。MiMo V2.6 Flashは平均約930行のファイルが最も長く、Step 3.7 Flashは約490行で最もコンパクトでした。Qwen3.8 Flashは最も多くの出力トークンを使用し、1タスクあたり約48,000トークン(推論を含む)を扱いました。各モデルがどのようにシーンに命を吹き込むかを見てください:動き、細部、そして自ら動作し続ける様子。勝者を決めるわけではありません。クリップを実行し、自分のユースケースに合わせて出力を判断してください。
同じテストをEmpirioLabsで行ってください
curl https://api.empiriolabs.ai/v1/chat/completions \ -H 「認証:ベアラー $EMPIRIOLABS_API_KEY」\ -H 「Content-Type: application/json」 \ -d '{ "model": "qwen3-8-flash", "reasoning_effort": "max", "messages": [{"role": "user", "content": "Building a Night a Ferris wheel in one one HTML file."}}'
スワップ モデル から deepseek-v4-1-flash, mimo-v2-6-flash または step-3-7-flash 同じリクエストを他のものに対して実行したり、インタラクティブに試したりするために プレイグラウンドお問い合わせ.
よくある質問
結果は編集されたり再試されたりしましたか?
いいえ。各パネルは、そのプロンプトに対してモデルが最初に返したファイルであり、返された通りにレンダリングされます。ファイルなしで返ってきたリクエストは再度送信されました。
なぜ最高の論理設定なのでしょうか?
公平な一頭比べでは各モデルが最良の状態を示し、それぞれが最高設定で動作しました:Qwen3.8フラッシュは最大努力、DeepSeek V4.1フラッシュ、Step 3.7フラッシュはMiMo V2.6フラッシュを考えています。
どのモデルを使うべきでしょうか?
MiMo V2.6 Flashはここで4つの中で最も出力価格が低いです。判断前にそれぞれのワークロードを比較してみてください:同じリクエストで4つすべてで動作し、モデル名だけが変わるだけです。



