ホーム ブログ

Qwen3.8 フラッシュ vs DeepSeek V4.1 フラッシュ vs MiMo V2.6 フラッシュ vs Step 3.7 フラッシュ:4つのコーディングテスト

Qwen3.8 フラッシュ vs DeepSeek V4.1 フラッシュ vs MiMo V2.6 フラッシュ vs Step 3.7 フラッシュ:4つのコーディングテスト

Oct 7, 2026

EmpirioLabs AI

私たちは置いた Qwen3.8 フラッシュ, DeepSeek V4.1 フラッシュ, MiMo V2.6 フラッシュ および ステップ3.7 フラッシュ 4つのワンショットコーディングテストで互いに競い合い、すべてEmpirioLabs上で実行されます。同じプロンプトで、ワンショット、編集なし、すべての結果が実際のブラウザでリアルタイムでレンダリングされます。

4人比較を見てください

仕様の概要

Qwen3.8 フラッシュDeepSeek V4.1 フラッシュMiMo V2.6 フラッシュステップ3.7 フラッシュ
メイカーアリババディープシークXiaomiステップファン
コンテキストウィンドウ1,000,000トークン1,000,000トークン1,000,000トークン256,000トークン
入力テキスト、画像、ビデオテキストと画像テキスト、画像、映像、音声テキスト、画像、ビデオ
理由最大限の努力を最大限の努力を考えるかどうか最大限の努力を
構造化出力厳密なJSONスキーマJSONモード厳密なJSONスキーマJSONモード
投入価格100万トークンあたり$0.16100万トークンあたり$0.30100万トークンあたり$0.14100万トークンあたり$0.20
出力価格100万トークンあたり$0.47100万トークンあたり$1.20100万トークンあたり$0.28100万トークンあたり$1.15

運営方法

各モデルは4つのタスクに対して同じプロンプトを受け取りました:1つのHTMLファイルで夜間観覧車を作る;薪窯でピザを焼く1つのHTMLファイル;1つのHTMLファイルでおもちゃの列車セットを作る;1つのHTMLファイルでビーチを飛ぶ凧を作ること。すべてのタスクは、外部ライブラリを持たず、単独でアニメーションする単一の自己完結型HTMLファイルを求めました。Qwen3.8 Flash、DeepSeek V4.1 Flash、Step 3.7 Flashは reasoning_effort:「マックス」;MiMo V2.6 Flashは、エフォート設定なしで、思考オンで動作しました。各モデルは65,536トークンの出力予算を持ち、タスクごとに1ショットが割り当てられていました。各パネルのライン数とtokens-per-second表示は実際のAPI呼び出しから測定され、各結果はモデルが返したファイルであり、そのままレンダリングされています。

注意すべき点

DeepSeek V4.1 Flashは約191トークン/秒で最速のファイルを返しました。MiMo V2.6 Flashは平均約930行のファイルが最も長く、Step 3.7 Flashは約490行で最もコンパクトでした。Qwen3.8 Flashは最も多くの出力トークンを使用し、1タスクあたり約48,000トークン(推論を含む)を扱いました。各モデルがどのようにシーンに命を吹き込むかを見てください:動き、細部、そして自ら動作し続ける様子。勝者を決めるわけではありません。クリップを実行し、自分のユースケースに合わせて出力を判断してください。

同じテストをEmpirioLabsで行ってください

curl https://api.empiriolabs.ai/v1/chat/completions \ -H 「認証:ベアラー $EMPIRIOLABS_API_KEY」\ -H 「Content-Type: application/json」 \ -d '{ "model": "qwen3-8-flash", "reasoning_effort": "max", "messages": [{"role": "user", "content": "Building a Night a Ferris wheel in one one HTML file."}}'

スワップ モデル から deepseek-v4-1-flash, mimo-v2-6-flash または step-3-7-flash 同じリクエストを他のものに対して実行したり、インタラクティブに試したりするために プレイグラウンドお問い合わせ.

よくある質問

結果は編集されたり再試されたりしましたか?

いいえ。各パネルは、そのプロンプトに対してモデルが最初に返したファイルであり、返された通りにレンダリングされます。ファイルなしで返ってきたリクエストは再度送信されました。

なぜ最高の論理設定なのでしょうか?

公平な一頭比べでは各モデルが最良の状態を示し、それぞれが最高設定で動作しました:Qwen3.8フラッシュは最大努力、DeepSeek V4.1フラッシュ、Step 3.7フラッシュはMiMo V2.6フラッシュを考えています。

どのモデルを使うべきでしょうか?

MiMo V2.6 Flashはここで4つの中で最も出力価格が低いです。判断前にそれぞれのワークロードを比較してみてください:同じリクエストで4つすべてで動作し、モデル名だけが変わるだけです。

試してみて

プレイグラウンド お問い合わせ 全モデル お問い合わせ 料金について

より良いエンドポイントを使う準備はできていますか?

当社のモデルをご覧いただくか、ビジネスの問い合わせ、カスタム展開、その他何でもご連絡ください。