
Qwen3.6 35B A3B é um modelo de raciocínio mixture-of-experts com 256 especialistas em raciocínio, com contexto de 128K, ferramentas funcionais e saída JSON estruturada e estritamente estruturada.
Qwen3.6 35B A3B é um modelo de raciocínio mixture-of-experts com 256 especialistas em raciocínio, com contexto de 128K, ferramentas funcionais e saída JSON estruturada e estritamente estruturada.
Só por mensagem. Esta versão não aceita entrada de imagem ou vídeo, ao contrário do Qwen3.6 35B A3B base. Pesos Servido a partir da versão eschamoe 2-bit W2 publicada pela Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 no Hugging Face, sob Apache-2.0. Os especialistas são quantizados para 2 bits, misturados por projeção (gate_up_proj em 2 bits e down_proj em 3 bits), as camadas densas são int8, e o cache KV é FP16. A Escha Labs publica a comparação de qualidade com base FP8 do mesmo modelo: paridade ou melhor em matemática, ciência de pós-graduação, uso de ferramentas e contexto longo, cerca de 2% menor em conhecimento amplo e cerca de 7% menor na geração de código a longo prazo, que é a única lacuna clara. Veja o cartão de modelos para a tabela completa de benchmark e protocolo. Comportamento Suporta streaming, ferramentas funcionais, saída JSON estruturada incluindo esquemas rígidos, e modo de pensamento ativado por padrão. Defina enable_thinking=false para respostas diretas. Pensando bem, o raciocínio vem em reasoning_content e a resposta no conteúdo, então leia ambos. Um max_tokens baixo de pensamento pode ser gasto inteiramente em raciocínio, então deixe espaço para a resposta. Cache Leituras automáticas de cache com prefixo são cobradas na taxa de entrada em cache quando reportadas. Controles de cache explícitos não são suportados. Cancelar um pedido de streaming no meio da geração cobre apenas os tokens produzidos até aquele momento.
Também conhecido como EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B
qwen3-6-35b-a3b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContentqwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Qwen3.6 35B A3B atende a API Chat Completions compatível com OpenAI. Aponte qualquer SDK OpenAI para https://api.empiriolabs.ai/v1 com sua chave de API EmpirioLabs e use o id de modelo qwen3-6-35b-a3b. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-6-35b-a3b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parâmetros de requisição suportados pela API Qwen3.6 35B A3B na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 a 2 | Temperatura de amostragem. 0 é determinístico e 2 é a aleatoriedade máxima. |
| top_p | number | 0.95 | 0 a 1 | Amostragem do núcleo com a probabilidade de massa. Valores mais baixos tornam as saídas mais focadas. |
| max_tokens | number | 4096 | 1 a 16384 | Tokens de saída máximos. |
| stop | string | - | - | Até 4 strings em que o modelo para de gerar mais tokens. |
| enable_thinking | boolean | true | - | Ative o raciocínio antes de responder. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Nível de esforço de raciocínio. Nenhum impede o pensamento. orçamentos limitados de pensamento de conjuntos baixos, médios, altos e máximos, dimensionados para o... |
| top_k | number | 20 | 1 a 200 | Limite a amostragem aos principais K tokens candidatos quando suportados. |
| min_p | number | 0 | 0 a 1 | Limiar mínimo de probabilidade para amostragem de tokens. |
| frequency_penalty | number | 0 | -2 a 2 | Penalidade baseada na frequência com que um token já apareceu. |
| presence_penalty | number | 0 | -2 a 2 | Penalidade para tokens que já apareceram no texto gerado. |
| seed | number | - | 0 a 2147483647 | Semente aleatória opcional para amostragem reproduzível. |
| response_format | enum | - | text, json_object, json_schema | Restringa a saída a JSON válido. Use o modo JSON para qualquer objeto JSON, ou forneça um Esquema JSON para forçar uma forma exata de resposta. |
| web_search_linkup | boolean | false | - | Busca opcional na web alimentada pelo Linkup. Quando ativadas, fontes web recentes são recuperadas usando sua última mensagem de usuário como consulta e fornecidas ao modelo como contexto adicional. Adiciona $0.013 por chamada quando invocada, além do custo normal do token do modelo. Desativado por padrão. |
| disable_formatting | boolean | false | - | Quando ativado, o gateway não adiciona o rodapé "Fontes" às respostas assistentes que usaram busca web do Linkup. Útil quando a saída do modelo é canalizada para... |
Só por mensagem. Esta versão não aceita entrada de imagem ou vídeo, ao contrário do Qwen3.6 35B A3B base. Pesos Servido a partir da versão eschamoe 2-bit W2 publicada pela Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 no Hugging Face, sob Apache-2.0. Os especialistas são quantizados para 2 bits, misturados por projeção (gate_up_proj em 2 bits e down_proj em 3 bits), as camadas densas são int8, e o cache KV é FP16. A Escha Labs publica a comparação de qualidade com base FP8 do mesmo modelo: paridade ou melhor em matemática, ciência de pós-graduação, uso de ferramentas e contexto longo, cerca de 2% menor em conhecimento amplo e cerca de 7% menor na geração de código a longo prazo, que é a única lacuna clara. Veja o cartão de modelos para a tabela completa de benchmark e protocolo. Comportamento Suporta streaming, ferramentas funcionais, saída JSON estruturada incluindo esquemas rígidos, e modo de pensamento ativado por padrão. Defina enable_thinking=false para respostas diretas. Pensando bem, o raciocínio vem em reasoning_content e a resposta no conteúdo, então leia ambos. Um max_tokens baixo de pensamento pode ser gasto inteiramente em raciocínio, então deixe espaço para a resposta. Cache Leituras automáticas de cache com prefixo são cobradas na taxa de entrada em cache quando reportadas. Controles de cache explícitos não são suportados. Cancelar um pedido de streaming no meio da geração cobre apenas os tokens produzidos até aquele momento.
Na EmpirioLabs, Qwen3.6 35B A3B é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Qwen3.6 35B A3B suporta uma janela de contexto de 128K tokens com até 16.384 tokens de saída por resposta.
Sim. Qwen3.6 35B A3B atende a API Chat Completions compatível com OpenAI, então SDKs OpenAI existentes funcionam apontando base_url para https://api.empiriolabs.ai/v1 e definindo o id de modelo qwen3-6-35b-a3b.
Sim. O playground da EmpirioLabs executa Qwen3.6 35B A3B no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.