
Qwen3.6 35B A3B es un modelo de razonamiento mixture-of-experts experto en 256 con 128K de contexto, herramientas funcionales y salida JSON estrictamente estructurada.
Qwen3.6 35B A3B es un modelo de razonamiento mixture-of-experts experto en 256 con 128K de contexto, herramientas funcionales y salida JSON estrictamente estructurada.
Solo texto. Esta versión no acepta entrada de imagen ni vídeo, a diferencia del Qwen3.6 35B A3B base. Pesos Servidos desde la versión eschamoe W2 de 2 bits publicada por Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 en Hugging Face, bajo Apache-2.0. Los expertos están cuantizados a 2 bits, mezclados por proyección (gate_up_proj a 2 bits y down_proj a 3 bits), las capas densas son int8 y la caché KV es FP16. Escha Labs publica la comparación de calidad con una línea base FP8 del mismo modelo: paridad o mejor en matemáticas, ciencias de posgrado, uso de herramientas y contexto largo, aproximadamente un 2 por ciento menos en conocimiento amplio y aproximadamente un 7 por ciento menos en generación de código a largo plazo, que es la única brecha clara. Consulta la tarjeta de modelos para la tabla de benchmark completa y el protocolo. Comportamiento Soporta streaming, herramientas de funciones, salida JSON estructurada incluyendo esquemas estrictos y modo de pensamiento activado por defecto. Establece enable_thinking=falso para respuestas directas. Al reflexionar, el razonamiento llega en reasoning_content y la respuesta en el contenido, así que lee ambos. Un max_tokens bajo con pensar en ello puede dedicarse enteramente al razonamiento, así que deja espacio para la respuesta. **Caché* Las lecturas automáticas de la caché con prefijo se facturan a la tasa de entrada en caché cuando se reportan. No se admiten controles explícitos de caché. Cancelar una solicitud de streaming a mitad de generación solo factura los tokens producidos hasta ese momento.
También conocido como EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B
qwen3-6-35b-a3b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContentqwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Qwen3.6 35B A3B sirve la API de Chat Completions compatible con OpenAI. Apunta cualquier SDK de OpenAI a https://api.empiriolabs.ai/v1 con tu clave de API de EmpirioLabs y usa el id de modelo qwen3-6-35b-a3b. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-6-35b-a3b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-6-35b-a3b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parámetros de solicitud compatibles con la API de Qwen3.6 35B A3B en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 a 2 | Temperatura de muestreo. 0 es determinista y 2 es la aleatoriedad máxima. |
| top_p | number | 0.95 | 0 a 1 | Masa de probabilidad de muestreo del núcleo. Valores bajos hacen que las salidas sean más enfocadas. |
| max_tokens | number | 4096 | 1 a 16384 | Tokens de salida máximos. |
| stop | string | - | - | Hasta 4 cadenas donde el modelo dejará de generar más tokens. |
| enable_thinking | boolean | true | - | Habilita el razonamiento antes de responder. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Nivel de esfuerzo de razonamiento. Ninguno impide pensar. Presupuestos limitados de pensamiento de conjunto bajos, medios, altos y máximos, adaptados al modelo... |
| top_k | number | 20 | 1 a 200 | Limita el muestreo a los K principales tokens candidatos cuando estén soportados. |
| min_p | number | 0 | 0 a 1 | Umbral mínimo de probabilidad para el muestreo de tokens. |
| frequency_penalty | number | 0 | -2 a 2 | Penalización basada en la frecuencia con la que ya ha aparecido un token. |
| presence_penalty | number | 0 | -2 a 2 | Penalización por tokens que ya aparecieron en el texto generado. |
| seed | number | - | 0 a 2147483647 | Semilla aleatoria opcional para muestreo reproducible. |
| response_format | enum | - | text, json_object, json_schema | Limita la salida a JSON válido. Utiliza el modo JSON para cualquier objeto JSON, o proporciona un esquema JSON para forzar una forma de respuesta exacta. |
| web_search_linkup | boolean | false | - | Búsqueda web opcional impulsada por Linkup. Cuando están habilitadas, las fuentes web recientes se recuperan usando tu último mensaje de usuario como consulta y se proporcionan al modelo como contexto adicional. Añade $0.013 por llamada cuando se invoca además del coste normal del token del modelo. Desactivado por defecto. |
| disable_formatting | boolean | false | - | Cuando está habilitada, la pasarela no añadirá el pie de página "Fuentes" a las respuestas de los asistentes que utilizaron la búsqueda web de Linkup. Útil cuando la... |
Solo texto. Esta versión no acepta entrada de imagen ni vídeo, a diferencia del Qwen3.6 35B A3B base. Pesos Servidos desde la versión eschamoe W2 de 2 bits publicada por Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 en Hugging Face, bajo Apache-2.0. Los expertos están cuantizados a 2 bits, mezclados por proyección (gate_up_proj a 2 bits y down_proj a 3 bits), las capas densas son int8 y la caché KV es FP16. Escha Labs publica la comparación de calidad con una línea base FP8 del mismo modelo: paridad o mejor en matemáticas, ciencias de posgrado, uso de herramientas y contexto largo, aproximadamente un 2 por ciento menos en conocimiento amplio y aproximadamente un 7 por ciento menos en generación de código a largo plazo, que es la única brecha clara. Consulta la tarjeta de modelos para la tabla de benchmark completa y el protocolo. Comportamiento Soporta streaming, herramientas de funciones, salida JSON estructurada incluyendo esquemas estrictos y modo de pensamiento activado por defecto. Establece enable_thinking=falso para respuestas directas. Al reflexionar, el razonamiento llega en reasoning_content y la respuesta en el contenido, así que lee ambos. Un max_tokens bajo con pensar en ello puede dedicarse enteramente al razonamiento, así que deja espacio para la respuesta. **Caché* Las lecturas automáticas de la caché con prefijo se facturan a la tasa de entrada en caché cuando se reportan. No se admiten controles explícitos de caché. Cancelar una solicitud de streaming a mitad de generación solo factura los tokens producidos hasta ese momento.
En EmpirioLabs, Qwen3.6 35B A3B se factura por uso. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Qwen3.6 35B A3B admite una ventana de contexto de 128K tokens con hasta 16.384 tokens de salida por respuesta.
Sí. Qwen3.6 35B A3B sirve la API de Chat Completions compatible con OpenAI, así que los SDKs de OpenAI existentes funcionan apuntando base_url a https://api.empiriolabs.ai/v1 y usando el id de modelo qwen3-6-35b-a3b.
Sí. El playground de EmpirioLabs ejecuta Qwen3.6 35B A3B en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.