
Qwen3.6 35B A3B 是一个包含256个专家mixture-of-experts推理模型,拥有128K上下文、函数工具和严格结构化的JSON输出。
Qwen3.6 35B A3B 是一个包含256个专家mixture-of-experts推理模型,拥有128K上下文、函数工具和严格结构化的JSON输出。
仅支持文本。该构建不接受图像或视频输入,不同于基础版Qwen3.6 35B A3B。权重 由Escha Labs(eschalabs.com)发布的2位eschamoe W2构建提供,作为EschaLabs/Qwen3.6-35B-A3B-Escha-W2在Apache-2.0下的Hugging Face上发布。专家被量化为2位,每个投影混合(gate_up_proj为2位,down_proj为3位),密集层为int8,KV缓存为FP16。Escha Labs发布了与同一模型FP8基线的质量对比:数学、研究生科学、工具使用和长上下文均有均衡或更好,广泛知识约低2%,长视野代码生成约低7%,这是唯一明显的差距。完整基准表和协议请参见模型卡。行为 支持流式流、函数工具、结构化JSON输出(包括严格模式),默认开启思考模式。将enable_thinking=false设置为直接回答。开启思考时,推理出现在reasoning_content,答案出现在内容中,因此两者都读。开启思考时,低max_tokens可以完全用于推理,因此请留出空间给答案。缓存 自动前缀缓存读取按缓存输入速率计费。不支持显式缓存控制。在生成过程中取消流式请求只计费到该时产生的令牌。
也称为 EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B
qwen3-6-35b-a3b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContentqwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。
Qwen3.6 35B A3B 提供 OpenAI 兼容的 Chat Completions API。用你的 EmpirioLabs API 密钥把任意 OpenAI SDK 指向 https://api.empiriolabs.ai/v1,并使用模型 ID qwen3-6-35b-a3b。 在EmpirioLabs 控制台获取 API 密钥。
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-6-35b-a3b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)EmpirioLabs 上 Qwen3.6 35B A3B API 支持的请求参数。省略字段时使用默认值。
| 参数 | 类型 | 默认值 | 范围 / 值 | 描述 |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 到 2 | 采样温度。0是确定性的,2是最大随机性。 |
| top_p | number | 0.95 | 0 到 1 | 核抽样概率质量。较低的数值使输出更集中。 |
| max_tokens | number | 4096 | 1 到 16384 | 最大输出令牌。 |
| stop | string | - | - | 最多有4串字符串,模型会停止生成更多代币。 |
| enable_thinking | boolean | true | - | 在回答之前先启用推理。 |
| reasoning_effort | enum | medium | none, low, medium, high, max | 推理努力程度。没有人能让思考失效。低、中、高和最大设定了根据所选模型大小的有界思维预算。 |
| top_k | number | 20 | 1 到 200 | 支持时,限制抽样仅限于顶K候选代币。 |
| min_p | number | 0 | 0 到 1 | 代币抽样的最小概率阈值。 |
| frequency_penalty | number | 0 | -2 到 2 | 惩罚基于代币出现的频率。 |
| presence_penalty | number | 0 | -2 到 2 | 对已出现在生成文本中的代币进行惩罚。 |
| seed | number | - | 0 到 2147483647 | 可选的随机种子用于可复现抽样。 |
| response_format | enum | - | text, json_object, json_schema | 将输出限制为有效的 JSON。对任意 JSON 对象使用 JSON 模式,或者提供 JSON 模式强制执行精确的响应形态。 |
| web_search_linkup | boolean | false | - | 可选的网页搜索由Linkup提供。启用后,最近的网页源会通过最新的用户消息作为查询检索,并作为额外上下文提供给模型。每次调用时,在模型正常的令牌成本基础上额外增加$0.013。默认为禁用。 |
| disable_formatting | boolean | false | - | 启用后,网关不会在使用Linkup网页搜索的助理响应中附加“来源”脚部。当模型输出被传输到另一个不需要装饰的系统时,这很有用。 |
仅支持文本。该构建不接受图像或视频输入,不同于基础版Qwen3.6 35B A3B。权重 由Escha Labs(eschalabs.com)发布的2位eschamoe W2构建提供,作为EschaLabs/Qwen3.6-35B-A3B-Escha-W2在Apache-2.0下的Hugging Face上发布。专家被量化为2位,每个投影混合(gate_up_proj为2位,down_proj为3位),密集层为int8,KV缓存为FP16。Escha Labs发布了与同一模型FP8基线的质量对比:数学、研究生科学、工具使用和长上下文均有均衡或更好,广泛知识约低2%,长视野代码生成约低7%,这是唯一明显的差距。完整基准表和协议请参见模型卡。行为 支持流式流、函数工具、结构化JSON输出(包括严格模式),默认开启思考模式。将enable_thinking=false设置为直接回答。开启思考时,推理出现在reasoning_content,答案出现在内容中,因此两者都读。开启思考时,低max_tokens可以完全用于推理,因此请留出空间给答案。缓存 自动前缀缓存读取按缓存输入速率计费。不支持显式缓存控制。在生成过程中取消流式请求只计费到该时产生的令牌。
在 EmpirioLabs,Qwen3.6 35B A3B 按量计费。本页的实时价格表始终与 API 的实际计费一致。
Qwen3.6 35B A3B 支持 128K token 的上下文窗口,每次响应最多 16,384 个输出 token。
兼容。Qwen3.6 35B A3B 提供 OpenAI 兼容的 Chat Completions API,现有 OpenAI SDK 只需把 base_url 指向 https://api.empiriolabs.ai/v1 并把模型 ID 设为 qwen3-6-35b-a3b 即可使用。
可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Qwen3.6 35B A3B,你可以在写代码之前先测试提示词。
创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。