
Qwen3.5 4B es un modelo de razonamiento multimodal de bajo coste con 256K de contexto, entrada de imagen y vídeo, herramientas funcionales y salida estructurada.
Qwen3.5 4B es un modelo de razonamiento multimodal de bajo coste con 256K de contexto, entrada de imagen y vídeo, herramientas funcionales y salida estructurada.
Soporta entrada de texto, imagen y vídeo, streaming, herramientas funcionales, salida JSON estructurada, control semilla y modo de pensamiento activado por defecto. Usa reasoning_effort o thinking_budget para el pensamiento acotado, o enable_thinking=falso para respuestas directas. Las lecturas automáticas de caché se facturan a la tasa de entrada en caché cuando se reportan por el servicio modelo. No se admiten controles explícitos de caché.
También conocido como Alibaba Cloud Qwen3.5 4B
qwen3-5-4b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-5-4b:generateContentqwen3.5-4bTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Qwen3.5 4B sirve la API de Chat Completions compatible con OpenAI. Apunta cualquier SDK de OpenAI a https://api.empiriolabs.ai/v1 con tu clave de API de EmpirioLabs y usa el id de modelo qwen3-5-4b. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-5-4b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-5-4b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parámetros de solicitud compatibles con la API de Qwen3.5 4B en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 a 2 | Temperatura de muestreo. 0 es determinista y 2 es la aleatoriedad máxima. |
| top_p | number | 0.95 | 0 a 1 | Masa de probabilidad de muestreo del núcleo. Valores bajos hacen que las salidas sean más enfocadas. |
| max_tokens | integer | 4096 | 1 a 32768 | Tokens de salida máximos. |
| stop | string | - | - | Hasta 4 cadenas donde el modelo dejará de generar más tokens. |
| enable_thinking | boolean | true | - | Habilita el razonamiento antes de responder. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Nivel de esfuerzo de razonamiento. Ninguno impide pensar. Presupuestos limitados de pensamiento de conjunto bajos, medios, altos y máximos, adaptados al modelo... |
| thinking_budget | integer | 4096 | 1024 a 32768 | Se permiten tokens máximos reservados para razonar cuando se habilita el pensamiento. |
| top_k | integer | 20 | 1 a 200 | Limita el muestreo a los K principales tokens candidatos cuando estén soportados. |
| min_p | number | 0 | 0 a 1 | Umbral mínimo de probabilidad para el muestreo de tokens. |
| frequency_penalty | number | 0 | -2 a 2 | Penalización basada en la frecuencia con la que ya ha aparecido un token. |
| presence_penalty | number | 0 | -2 a 2 | Penalización por tokens que ya aparecieron en el texto generado. |
| repetition_penalty | number | 1 | 0.1 a 2 | Penalización utilizada por SGLang para reducir el texto repetido. |
| seed | integer | - | 0 a 2147483647 | Semilla aleatoria opcional para muestreo reproducible. |
| logprobs | boolean | false | - | Devuelve las probabilidades de registro de tokens cuando estén soportadas. |
Soporta entrada de texto, imagen y vídeo, streaming, herramientas funcionales, salida JSON estructurada, control semilla y modo de pensamiento activado por defecto. Usa reasoning_effort o thinking_budget para el pensamiento acotado, o enable_thinking=falso para respuestas directas. Las lecturas automáticas de caché se facturan a la tasa de entrada en caché cuando se reportan por el servicio modelo. No se admiten controles explícitos de caché.
En EmpirioLabs, Qwen3.5 4B se factura por uso: Entrada $0.04 por 1M de tokens de prompt; Producto $0.07 por 1M de tokens generados; Caché implícita $0.02 por fichas de entrada en caché de 1M. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Qwen3.5 4B admite una ventana de contexto de 256K tokens con hasta 32.768 tokens de salida por respuesta.
Sí. Qwen3.5 4B sirve la API de Chat Completions compatible con OpenAI, así que los SDKs de OpenAI existentes funcionan apuntando base_url a https://api.empiriolabs.ai/v1 y usando el id de modelo qwen3-5-4b.
Sí. El playground de EmpirioLabs ejecuta Qwen3.5 4B en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.