Qwen3.6 35B A3B API

Qwen3.6 35B A3B 是一个包含256个专家mixture-of-experts推理模型,拥有128K上下文、函数工具和严格结构化的JSON输出。

Alibaba Cloud文本生成128K 上下文发布日期 2026年4月16日原生推理

关于 Qwen3.6 35B A3B

Qwen3.6 35B A3B 是一个包含256个专家mixture-of-experts推理模型,拥有128K上下文、函数工具和严格结构化的JSON输出。

仅支持文本。该构建不接受图像或视频输入,不同于基础版Qwen3.6 35B A3B。权重 由Escha Labs(eschalabs.com)发布的2位eschamoe W2构建提供,作为EschaLabs/Qwen3.6-35B-A3B-Escha-W2在Apache-2.0下的Hugging Face上发布。专家被量化为2位,每个投影混合(gate_up_proj为2位,down_proj为3位),密集层为int8,KV缓存为FP16。Escha Labs发布了与同一模型FP8基线的质量对比:数学、研究生科学、工具使用和长上下文均有均衡或更好,广泛知识约低2%,长视野代码生成约低7%,这是唯一明显的差距。完整基准表和协议请参见模型卡。行为 支持流式流、函数工具、结构化JSON输出(包括严格模式),默认开启思考模式。将enable_thinking=false设置为直接回答。开启思考时,推理出现在reasoning_content,答案出现在内容中,因此两者都读。开启思考时,低max_tokens可以完全用于推理,因此请留出空间给答案。缓存 自动前缀缓存读取按缓存输入速率计费。不支持显式缓存控制。在生成过程中取消流式请求只计费到该时产生的令牌。

也称为 EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B

reasoningfunction callingjson modecache

Qwen3.6 35B A3B 规格

模型 ID
qwen3-6-35b-a3b
开发方
Alibaba Cloud
类别
文本生成
发布日期
2026年4月16日
上下文窗口
128K 个 token
最大输出
16,384 个 token
输入
文本
输出
文本
结构化输出
JSON Schema
端点
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContent
备用模型 ID
qwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2

Qwen3.6 35B A3B API 价格最高省 72%

来自 EmpirioLabs 目录的实时按量计费价格。只为实际用量付费,没有月度最低消费。

类型
规格
价格
输入
每100万个提示词标记
$0.248$0.07
产出
每100万个生成代币
$1.485$0.42
隐式缓存读取
每 1M 缓存输入标记
$0.035
网络搜索(链接)
每次调用时
$0.013
在完整价格页比较

如何调用 Qwen3.6 35B A3B API

Qwen3.6 35B A3B 提供 OpenAI 兼容的 Chat Completions API。用你的 EmpirioLabs API 密钥把任意 OpenAI SDK 指向 https://api.empiriolabs.ai/v1,并使用模型 ID qwen3-6-35b-a3b。 在EmpirioLabs 控制台获取 API 密钥。

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-6-35b-a3b",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-6-35b-a3b",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Qwen3.6 35B A3B API 完整参考

Qwen3.6 35B A3B API 参数

EmpirioLabs 上 Qwen3.6 35B A3B API 支持的请求参数。省略字段时使用默认值。

参数类型默认值范围 / 值描述
temperaturenumber0.70 到 2采样温度。0是确定性的,2是最大随机性。
top_pnumber0.950 到 1核抽样概率质量。较低的数值使输出更集中。
max_tokensnumber40961 到 16384最大输出令牌。
stopstring--最多有4串字符串,模型会停止生成更多代币。
enable_thinkingbooleantrue-在回答之前先启用推理。
reasoning_effortenummediumnone, low, medium, high, max推理努力程度。没有人能让思考失效。低、中、高和最大设定了根据所选模型大小的有界思维预算。
top_knumber201 到 200支持时,限制抽样仅限于顶K候选代币。
min_pnumber00 到 1代币抽样的最小概率阈值。
frequency_penaltynumber0-2 到 2惩罚基于代币出现的频率。
presence_penaltynumber0-2 到 2对已出现在生成文本中的代币进行惩罚。
seednumber-0 到 2147483647可选的随机种子用于可复现抽样。
response_formatenum-text, json_object, json_schema将输出限制为有效的 JSON。对任意 JSON 对象使用 JSON 模式,或者提供 JSON 模式强制执行精确的响应形态。
web_search_linkupbooleanfalse-可选的网页搜索由Linkup提供。启用后,最近的网页源会通过最新的用户消息作为查询检索,并作为额外上下文提供给模型。每次调用时,在模型正常的令牌成本基础上额外增加$0.013。默认为禁用。
disable_formattingbooleanfalse-启用后,网关不会在使用Linkup网页搜索的助理响应中附加“来源”脚部。当模型输出被传输到另一个不需要装饰的系统时,这很有用。

须知

仅支持文本。该构建不接受图像或视频输入,不同于基础版Qwen3.6 35B A3B。权重 由Escha Labs(eschalabs.com)发布的2位eschamoe W2构建提供,作为EschaLabs/Qwen3.6-35B-A3B-Escha-W2在Apache-2.0下的Hugging Face上发布。专家被量化为2位,每个投影混合(gate_up_proj为2位,down_proj为3位),密集层为int8,KV缓存为FP16。Escha Labs发布了与同一模型FP8基线的质量对比:数学、研究生科学、工具使用和长上下文均有均衡或更好,广泛知识约低2%,长视野代码生成约低7%,这是唯一明显的差距。完整基准表和协议请参见模型卡。行为 支持流式流、函数工具、结构化JSON输出(包括严格模式),默认开启思考模式。将enable_thinking=false设置为直接回答。开启思考时,推理出现在reasoning_content,答案出现在内容中,因此两者都读。开启思考时,低max_tokens可以完全用于推理,因此请留出空间给答案。缓存 自动前缀缓存读取按缓存输入速率计费。不支持显式缓存控制。在生成过程中取消流式请求只计费到该时产生的令牌。

Qwen3.6 35B A3B API:常见问题

Qwen3.6 35B A3B API 收费多少?

在 EmpirioLabs,Qwen3.6 35B A3B 按量计费。本页的实时价格表始终与 API 的实际计费一致。

Qwen3.6 35B A3B 的上下文窗口有多大?

Qwen3.6 35B A3B 支持 128K token 的上下文窗口,每次响应最多 16,384 个输出 token。

Qwen3.6 35B A3B API 兼容 OpenAI 吗?

兼容。Qwen3.6 35B A3B 提供 OpenAI 兼容的 Chat Completions API,现有 OpenAI SDK 只需把 base_url 指向 https://api.empiriolabs.ai/v1 并把模型 ID 设为 qwen3-6-35b-a3b 即可使用。

集成之前可以在浏览器里试用 Qwen3.6 35B A3B 吗?

可以。EmpirioLabs Playground在浏览器中以与 API 相同的参数运行 Qwen3.6 35B A3B,你可以在写代码之前先测试提示词。

如何获取 Qwen3.6 35B A3B API 密钥?

创建 EmpirioLabs 账户,然后在控制台的 API Keys生成密钥。计费使用按量付费的额度,只为实际发出的请求付费。

准备好使用更好的终端了吗?

查看我们的定价,或者如果你想将自己的模型部署到我们的堆栈中,请联系我们。