
Qwen3.6 35B A3Bは、128Kのコンテキスト、関数ツール、厳格構造化JSON出力を持つ256人のエキスパートmixture-of-experts推論モデルです。
Qwen3.6 35B A3Bは、128Kのコンテキスト、関数ツール、厳格構造化JSON出力を持つ256人のエキスパートmixture-of-experts推論モデルです。
テキストのみ。このビルドは、ベースのQwen3.6 35B A3Bとは異なり、画像や映像入力を受け付けていません。Weights Escha Labs(eschalabs.com)がApache-2.0の下でHugging Face上でEschaLabs/Qwen3.6-35B-A3B-Escha-W2として公開した2ビットのeschamoe W2ビルドから提供されています。エキスパートは2ビットに量子化され、各投影ごとに混gate_up_proj(2ビット、down_proj 3ビット)、密度の高い層はint8、KVキャッシュはFP16です。Escha Labsは同じモデルのFP8ベースラインとの品質比較を公開しています。数学、大学院科学、ツール使用、長期コンテキストで同等以上、広範な知識では約2%、長期的コード生成では約7%低く、これが唯一の明確なギャップです。ベンチマーク表とプロトコルの詳細はモデルカードをご覧ください。Behavior ストリーミング、関数ツール、厳密スキーマを含む構造化JSON出力、そしてデフォルトで思考モードをサポート。直接回答にはenable_thinking=falseを設定してください。考えを続けると、理由はreasoning_contentに、答えは内容に現れるので、両方を読んでください。思考を続けた低いmax_tokensは完全に推論に費やせるので、答えの余地を残してください。**キャッシュ* 自動プレフィックスキャッシュの読み取りは、報告時にキャッシュ入力レートで請求されます。明示的なキャッシュ制御はサポートされていません。ストリーミングリクエストを発生発生中にキャンセルすると、それまでに生成されたトークンのみが請求されます。
別名 EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B
qwen3-6-35b-a3b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContentqwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2EmpirioLabs カタログのライブ従量課金料金です。使った分だけの支払いで、月額最低料金はありません。
Qwen3.6 35B A3B は OpenAI 互換の Chat Completions API を提供します。任意の OpenAI SDK を EmpirioLabs API キーで https://api.empiriolabs.ai/v1 に向け、モデル ID qwen3-6-35b-a3b を使ってください。 EmpirioLabs ダッシュボードで API キーを取得してください。
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-6-35b-a3b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)EmpirioLabs 上の Qwen3.6 35B A3B API が対応するリクエストパラメーターです。フィールドを省略した場合はデフォルト値が適用されます。
| パラメータ | タイプ | デフォルト | 範囲 / 値 | 説明 |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 から 2 | サンプリング温度。0は決定的で、2は最大のランダム性です。 |
| top_p | number | 0.95 | 0 から 1 | 原子核サンプリング確率質量。値が低いほど出力がより集中します。 |
| max_tokens | number | 4096 | 1 から 16384 | 最大出力トークン。 |
| stop | string | - | - | 最大4つの文字列で、モデルはこれ以上のトークン生成を停止します。 |
| enable_thinking | boolean | true | - | 答える前に論理を可能にしましょう。 |
| reasoning_effort | enum | medium | none, low, medium, high, max | 推論の努力レベル。誰も思考を妨げるものではありません。低、中、高、最大は選択したモデルに合わせて限定された思考予算を設定します。 |
| top_k | number | 20 | 1 から 200 | 対応する場合は、上位K個候補トークンにサンプリングを制限してください。 |
| min_p | number | 0 | 0 から 1 | トークンサンプリングの最小確率閾値。 |
| frequency_penalty | number | 0 | -2 から 2 | トークンが既に出現した回数に基づくペナルティです。 |
| presence_penalty | number | 0 | -2 から 2 | 生成されたテキストに既に表示されたトークンに対するペナルティ。 |
| seed | number | - | 0 から 2147483647 | 再現可能なサンプリングのためのオプションランダムシード。 |
| response_format | enum | - | text, json_object, json_schema | 出力を有効なJSONに制限します。任意のJSONオブジェクトにJSONモードを使うか、正確なレスポンス形状を強制するためのJSONスキーマを提供してください。 |
| web_search_linkup | boolean | false | - | Linkupによるオプションのウェブ検索機能。有効化すると、最新のウェブソースが最新のユーザーメッセージをクエリとして取得し、モデルに追加のコンテキストとして提供されます。モデルの通常のトークンコストに加えて、呼び出しごとに$0.013が加算されます。デフォルトで無効化されています。 |
| disable_formatting | boolean | false | - | 有効化されると、Linkupウェブ検索を使用したアシスタント応答に「ソース」フッターを付け加えません。モデル出力が装飾を期待しない別のシステムに送られる場合に有用です。 |
テキストのみ。このビルドは、ベースのQwen3.6 35B A3Bとは異なり、画像や映像入力を受け付けていません。Weights Escha Labs(eschalabs.com)がApache-2.0の下でHugging Face上でEschaLabs/Qwen3.6-35B-A3B-Escha-W2として公開した2ビットのeschamoe W2ビルドから提供されています。エキスパートは2ビットに量子化され、各投影ごとに混gate_up_proj(2ビット、down_proj 3ビット)、密度の高い層はint8、KVキャッシュはFP16です。Escha Labsは同じモデルのFP8ベースラインとの品質比較を公開しています。数学、大学院科学、ツール使用、長期コンテキストで同等以上、広範な知識では約2%、長期的コード生成では約7%低く、これが唯一の明確なギャップです。ベンチマーク表とプロトコルの詳細はモデルカードをご覧ください。Behavior ストリーミング、関数ツール、厳密スキーマを含む構造化JSON出力、そしてデフォルトで思考モードをサポート。直接回答にはenable_thinking=falseを設定してください。考えを続けると、理由はreasoning_contentに、答えは内容に現れるので、両方を読んでください。思考を続けた低いmax_tokensは完全に推論に費やせるので、答えの余地を残してください。**キャッシュ* 自動プレフィックスキャッシュの読み取りは、報告時にキャッシュ入力レートで請求されます。明示的なキャッシュ制御はサポートされていません。ストリーミングリクエストを発生発生中にキャンセルすると、それまでに生成されたトークンのみが請求されます。
EmpirioLabs では Qwen3.6 35B A3B は従量課金です。このページのライブ料金表は常に API の請求額と一致します。
Qwen3.6 35B A3B は 128K トークンのコンテキストウィンドウに対応しています(1回の応答あたり最大 16,384 出力トークン)。
はい。Qwen3.6 35B A3B は OpenAI 互換の Chat Completions API を提供しているため、既存の OpenAI SDK は base_url を https://api.empiriolabs.ai/v1 に向けてモデル ID を qwen3-6-35b-a3b に設定するだけで動作します。
はい。EmpirioLabs プレイグラウンドでは API と同じパラメーターで Qwen3.6 35B A3B をブラウザ上で実行できるので、コードを書く前にプロンプトを試せます。
EmpirioLabs アカウントを作成し、ダッシュボードの API Keysでキーを生成してください。課金は従量制クレジットなので、実行したリクエストの分だけ支払います。