Qwen3.6 35B A3B API

Qwen3.6 35B A3B es un modelo de razonamiento mixture-of-experts experto en 256 con 128K de contexto, herramientas funcionales y salida JSON estrictamente estructurada.

Alibaba CloudGeneracion de texto128K contextoLanzado 16 abr 2026Inferencia nativaNuevo

Acerca de Qwen3.6 35B A3B

Qwen3.6 35B A3B es un modelo de razonamiento mixture-of-experts experto en 256 con 128K de contexto, herramientas funcionales y salida JSON estrictamente estructurada.

Solo texto. Esta versión no acepta entrada de imagen ni vídeo, a diferencia del Qwen3.6 35B A3B base. Pesos Servidos desde la versión eschamoe W2 de 2 bits publicada por Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 en Hugging Face, bajo Apache-2.0. Los expertos están cuantizados a 2 bits, mezclados por proyección (gate_up_proj a 2 bits y down_proj a 3 bits), las capas densas son int8 y la caché KV es FP16. Escha Labs publica la comparación de calidad con una línea base FP8 del mismo modelo: paridad o mejor en matemáticas, ciencias de posgrado, uso de herramientas y contexto largo, aproximadamente un 2 por ciento menos en conocimiento amplio y aproximadamente un 7 por ciento menos en generación de código a largo plazo, que es la única brecha clara. Consulta la tarjeta de modelos para la tabla de benchmark completa y el protocolo. Comportamiento Soporta streaming, herramientas de funciones, salida JSON estructurada incluyendo esquemas estrictos y modo de pensamiento activado por defecto. Establece enable_thinking=falso para respuestas directas. Al reflexionar, el razonamiento llega en reasoning_content y la respuesta en el contenido, así que lee ambos. Un max_tokens bajo con pensar en ello puede dedicarse enteramente al razonamiento, así que deja espacio para la respuesta. **Caché* Las lecturas automáticas de la caché con prefijo se facturan a la tasa de entrada en caché cuando se reportan. No se admiten controles explícitos de caché. Cancelar una solicitud de streaming a mitad de generación solo factura los tokens producidos hasta ese momento.

También conocido como EschaLabs/Qwen3.6-35B-A3B-Escha-W2, Alibaba Cloud Qwen3.6 35B A3B

reasoningfunction callingjson modecache

Especificaciones de Qwen3.6 35B A3B

ID del modelo
qwen3-6-35b-a3b
Autor
Alibaba Cloud
Categoría
Generacion de texto
Lanzado
16 abr 2026
Ventana de contexto
128K tokens
Salida máxima
16.384 tokens
Entrada
Texto
Salida
Texto
Salida estructurada
JSON Schema
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-6-35b-a3b:generateContent
IDs de modelo alternativos
qwen3.6-35b-a3bqwen/qwen3.6-35b-a3bEschaLabs/Qwen3.6-35B-A3B-Escha-W2

Precios de la API de Qwen3.6 35B A3BAhorra hasta 72%

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Entrada
por 1M de tokens de prompt
$0.248$0.07
Producto
por 1M de tokens generados
$1.485$0.42
Caché implícita
por fichas de entrada en caché de 1M
$0.035
Búsqueda web (Linkup)
por llamada cuando se invoca
$0.013
Comparar en la página completa de precios

Cómo llamar a la API de Qwen3.6 35B A3B

Qwen3.6 35B A3B sirve la API de Chat Completions compatible con OpenAI. Apunta cualquier SDK de OpenAI a https://api.empiriolabs.ai/v1 con tu clave de API de EmpirioLabs y usa el id de modelo qwen3-6-35b-a3b. Consigue una clave de API en el panel de EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-6-35b-a3b",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="qwen3-6-35b-a3b",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Referencia completa de la API de Qwen3.6 35B A3B

Parámetros de la API de Qwen3.6 35B A3B

Parámetros de solicitud compatibles con la API de Qwen3.6 35B A3B en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
temperaturenumber0.70 a 2Temperatura de muestreo. 0 es determinista y 2 es la aleatoriedad máxima.
top_pnumber0.950 a 1Masa de probabilidad de muestreo del núcleo. Valores bajos hacen que las salidas sean más enfocadas.
max_tokensnumber40961 a 16384Tokens de salida máximos.
stopstring--Hasta 4 cadenas donde el modelo dejará de generar más tokens.
enable_thinkingbooleantrue-Habilita el razonamiento antes de responder.
reasoning_effortenummediumnone, low, medium, high, maxNivel de esfuerzo de razonamiento. Ninguno impide pensar. Presupuestos limitados de pensamiento de conjunto bajos, medios, altos y máximos, adaptados al modelo...
top_knumber201 a 200Limita el muestreo a los K principales tokens candidatos cuando estén soportados.
min_pnumber00 a 1Umbral mínimo de probabilidad para el muestreo de tokens.
frequency_penaltynumber0-2 a 2Penalización basada en la frecuencia con la que ya ha aparecido un token.
presence_penaltynumber0-2 a 2Penalización por tokens que ya aparecieron en el texto generado.
seednumber-0 a 2147483647Semilla aleatoria opcional para muestreo reproducible.
response_formatenum-text, json_object, json_schemaLimita la salida a JSON válido. Utiliza el modo JSON para cualquier objeto JSON, o proporciona un esquema JSON para forzar una forma de respuesta exacta.
web_search_linkupbooleanfalse-Búsqueda web opcional impulsada por Linkup. Cuando están habilitadas, las fuentes web recientes se recuperan usando tu último mensaje de usuario como consulta y se proporcionan al modelo como contexto adicional. Añade $0.013 por llamada cuando se invoca además del coste normal del token del modelo. Desactivado por defecto.
disable_formattingbooleanfalse-Cuando está habilitada, la pasarela no añadirá el pie de página "Fuentes" a las respuestas de los asistentes que utilizaron la búsqueda web de Linkup. Útil cuando la...

Información útil

Solo texto. Esta versión no acepta entrada de imagen ni vídeo, a diferencia del Qwen3.6 35B A3B base. Pesos Servidos desde la versión eschamoe W2 de 2 bits publicada por Escha Labs (eschalabs.com) como EschaLabs/Qwen3.6-35B-A3B-Escha-W2 en Hugging Face, bajo Apache-2.0. Los expertos están cuantizados a 2 bits, mezclados por proyección (gate_up_proj a 2 bits y down_proj a 3 bits), las capas densas son int8 y la caché KV es FP16. Escha Labs publica la comparación de calidad con una línea base FP8 del mismo modelo: paridad o mejor en matemáticas, ciencias de posgrado, uso de herramientas y contexto largo, aproximadamente un 2 por ciento menos en conocimiento amplio y aproximadamente un 7 por ciento menos en generación de código a largo plazo, que es la única brecha clara. Consulta la tarjeta de modelos para la tabla de benchmark completa y el protocolo. Comportamiento Soporta streaming, herramientas de funciones, salida JSON estructurada incluyendo esquemas estrictos y modo de pensamiento activado por defecto. Establece enable_thinking=falso para respuestas directas. Al reflexionar, el razonamiento llega en reasoning_content y la respuesta en el contenido, así que lee ambos. Un max_tokens bajo con pensar en ello puede dedicarse enteramente al razonamiento, así que deja espacio para la respuesta. **Caché* Las lecturas automáticas de la caché con prefijo se facturan a la tasa de entrada en caché cuando se reportan. No se admiten controles explícitos de caché. Cancelar una solicitud de streaming a mitad de generación solo factura los tokens producidos hasta ese momento.

API de Qwen3.6 35B A3B: preguntas frecuentes

¿Cuánto cuesta la API de Qwen3.6 35B A3B?

En EmpirioLabs, Qwen3.6 35B A3B se factura por uso. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Cuál es la ventana de contexto de Qwen3.6 35B A3B?

Qwen3.6 35B A3B admite una ventana de contexto de 128K tokens con hasta 16.384 tokens de salida por respuesta.

¿La API de Qwen3.6 35B A3B es compatible con OpenAI?

Sí. Qwen3.6 35B A3B sirve la API de Chat Completions compatible con OpenAI, así que los SDKs de OpenAI existentes funcionan apuntando base_url a https://api.empiriolabs.ai/v1 y usando el id de modelo qwen3-6-35b-a3b.

¿Puedo probar Qwen3.6 35B A3B en el navegador antes de integrar?

Sí. El playground de EmpirioLabs ejecuta Qwen3.6 35B A3B en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.

¿Cómo consigo una clave de API de Qwen3.6 35B A3B?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.