Qwen3.6 35B A3B API

Qwen3.6 35B A3B é um modelo de raciocínio mixture-of-experts com 256 especialistas em raciocínio, com contexto de 128K, ferramentas funcionais e saída JSON estruturada e estritamente estruturada.

Alibaba CloudGeração de Texto128K contextoLançado 16 de abr. de 2026Inferência nativaNovo

Sobre Qwen3.6 35B A3B

Qwen3.6 35B A3B é um modelo de raciocínio mixture-of-experts com 256 especialistas em raciocínio, com contexto de 128K, ferramentas funcionais e saída JSON estruturada e estritamente estruturada.

Só por mensagem. Esta versão não aceita entrada de imagem ou vídeo, ao contrário do Qwen3.6 35B A3B base. Pesos Servido a partir da versão eschamoe 2-bit W2 publicada pela Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 no Hugging Face, sob Apache-2.0. Os especialistas são quantizados para 2 bits, misturados por projeção (gate_up_proj em 2 bits e down_proj em 3 bits), as camadas densas são int8, e o cache KV é FP16. A Escha Labs publica a comparação de qualidade com base FP8 do mesmo modelo: paridade ou melhor em matemática, ciência de pós-graduação, uso de ferramentas e contexto longo, cerca de 2% menor em conhecimento amplo e cerca de 7% menor na geração de código a longo prazo, que é a única lacuna clara. Veja o cartão de modelos para a tabela completa de benchmark e protocolo. Comportamento Suporta streaming, ferramentas funcionais, saída JSON estruturada incluindo esquemas rígidos, e modo de pensamento ativado por padrão. Defina enable_thinking=false para respostas diretas. Pensando bem, o raciocínio vem em reasoning_content e a resposta no conteúdo, então leia ambos. Um max_tokens baixo de pensamento pode ser gasto inteiramente em raciocínio, então deixe espaço para a resposta. Cache Leituras automáticas de cache com prefixo são cobradas na taxa de entrada em cache quando reportadas. Controles de cache explícitos não são suportados. Cancelar um pedido de streaming no meio da geração cobre apenas os tokens produzidos até aquele momento.

Também conhecido como EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B

reasoningfunction callingjson modecache

Especificações de Qwen3.6 35B A3B

ID do modelo
qwen3-6-35b-a3b
Autor
Alibaba Cloud
Categoria
Geração de Texto
Lançado
16 de abr. de 2026
Janela de contexto
128K tokens
Saída máxima
16.384 tokens
Entrada
Texto
Saída
Texto
Saída estruturada
JSON Schema
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContent
IDs de modelo alternativos
qwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2

Preços da API Qwen3.6 35B A3BEconomize até 72%

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Entrada
por 1M de tokens de prompt
$0.248$0.07
Saída
por 1M de tokens gerados
$1.485$0.42
Leitura implícita do cache
por 1M de tokens de entrada cacheados
$0.035
Busca na Web (Linkup)
por chamada quando invocada
$0.013
Comparar na página completa de preços

Como chamar a API Qwen3.6 35B A3B

Qwen3.6 35B A3B atende a API Chat Completions compatível com OpenAI. Aponte qualquer SDK OpenAI para https://api.empiriolabs.ai/v1 com sua chave de API EmpirioLabs e use o id de modelo qwen3-6-35b-a3b. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-6-35b-a3b",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-6-35b-a3b",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Referência completa da API Qwen3.6 35B A3B

Parâmetros da API Qwen3.6 35B A3B

Parâmetros de requisição suportados pela API Qwen3.6 35B A3B na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
temperaturenumber0.70 a 2Temperatura de amostragem. 0 é determinístico e 2 é a aleatoriedade máxima.
top_pnumber0.950 a 1Amostragem do núcleo com a probabilidade de massa. Valores mais baixos tornam as saídas mais focadas.
max_tokensnumber40961 a 16384Tokens de saída máximos.
stopstring--Até 4 strings em que o modelo para de gerar mais tokens.
enable_thinkingbooleantrue-Ative o raciocínio antes de responder.
reasoning_effortenummediumnone, low, medium, high, maxNível de esforço de raciocínio. Nenhum impede o pensamento. orçamentos limitados de pensamento de conjuntos baixos, médios, altos e máximos, dimensionados para o...
top_knumber201 a 200Limite a amostragem aos principais K tokens candidatos quando suportados.
min_pnumber00 a 1Limiar mínimo de probabilidade para amostragem de tokens.
frequency_penaltynumber0-2 a 2Penalidade baseada na frequência com que um token já apareceu.
presence_penaltynumber0-2 a 2Penalidade para tokens que já apareceram no texto gerado.
seednumber-0 a 2147483647Semente aleatória opcional para amostragem reproduzível.
response_formatenum-text, json_object, json_schemaRestringa a saída a JSON válido. Use o modo JSON para qualquer objeto JSON, ou forneça um Esquema JSON para forçar uma forma exata de resposta.
web_search_linkupbooleanfalse-Busca opcional na web alimentada pelo Linkup. Quando ativadas, fontes web recentes são recuperadas usando sua última mensagem de usuário como consulta e fornecidas ao modelo como contexto adicional. Adiciona $0.013 por chamada quando invocada, além do custo normal do token do modelo. Desativado por padrão.
disable_formattingbooleanfalse-Quando ativado, o gateway não adiciona o rodapé "Fontes" às respostas assistentes que usaram busca web do Linkup. Útil quando a saída do modelo é canalizada para...

Bom saber

Só por mensagem. Esta versão não aceita entrada de imagem ou vídeo, ao contrário do Qwen3.6 35B A3B base. Pesos Servido a partir da versão eschamoe 2-bit W2 publicada pela Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 no Hugging Face, sob Apache-2.0. Os especialistas são quantizados para 2 bits, misturados por projeção (gate_up_proj em 2 bits e down_proj em 3 bits), as camadas densas são int8, e o cache KV é FP16. A Escha Labs publica a comparação de qualidade com base FP8 do mesmo modelo: paridade ou melhor em matemática, ciência de pós-graduação, uso de ferramentas e contexto longo, cerca de 2% menor em conhecimento amplo e cerca de 7% menor na geração de código a longo prazo, que é a única lacuna clara. Veja o cartão de modelos para a tabela completa de benchmark e protocolo. Comportamento Suporta streaming, ferramentas funcionais, saída JSON estruturada incluindo esquemas rígidos, e modo de pensamento ativado por padrão. Defina enable_thinking=false para respostas diretas. Pensando bem, o raciocínio vem em reasoning_content e a resposta no conteúdo, então leia ambos. Um max_tokens baixo de pensamento pode ser gasto inteiramente em raciocínio, então deixe espaço para a resposta. Cache Leituras automáticas de cache com prefixo são cobradas na taxa de entrada em cache quando reportadas. Controles de cache explícitos não são suportados. Cancelar um pedido de streaming no meio da geração cobre apenas os tokens produzidos até aquele momento.

API Qwen3.6 35B A3B: perguntas frequentes

Quanto custa a API Qwen3.6 35B A3B?

Na EmpirioLabs, Qwen3.6 35B A3B é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual é a janela de contexto de Qwen3.6 35B A3B?

Qwen3.6 35B A3B suporta uma janela de contexto de 128K tokens com até 16.384 tokens de saída por resposta.

A API Qwen3.6 35B A3B é compatível com OpenAI?

Sim. Qwen3.6 35B A3B atende a API Chat Completions compatível com OpenAI, então SDKs OpenAI existentes funcionam apontando base_url para https://api.empiriolabs.ai/v1 e definindo o id de modelo qwen3-6-35b-a3b.

Posso testar Qwen3.6 35B A3B no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa Qwen3.6 35B A3B no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API Qwen3.6 35B A3B?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.