
Qwen3.5 4B é um modelo multimodal de raciocínio de baixo custo com 256K de contexto, entrada de imagem e vídeo, ferramentas funcionais e saída estruturada.
Qwen3.5 4B é um modelo multimodal de raciocínio de baixo custo com 256K de contexto, entrada de imagem e vídeo, ferramentas funcionais e saída estruturada.
Suporta entrada de texto, imagem e vídeo, streaming, ferramentas de função, saída JSON estruturada, controle seed e modo de pensamento ativado por padrão. Use reasoning_effort ou thinking_budget para pensamento limitado, ou enable_thinking=falso para respostas diretas. Leituras automáticas de cache são cobradas na taxa de entrada em cache quando reportadas pelo serviço modelo. Controles de cache explícitos não são suportados.
Também conhecido como Alibaba Cloud Qwen3.5 4B
qwen3-5-4b/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1/completionsPOST/v1beta/models/qwen3-5-4b:generateContentqwen3.5-4bTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Qwen3.5 4B atende a API Chat Completions compatível com OpenAI. Aponte qualquer SDK OpenAI para https://api.empiriolabs.ai/v1 com sua chave de API EmpirioLabs e use o id de modelo qwen3-5-4b. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-5-4b",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-5-4b",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parâmetros de requisição suportados pela API Qwen3.5 4B na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 a 2 | Temperatura de amostragem. 0 é determinístico e 2 é a aleatoriedade máxima. |
| top_p | number | 0.95 | 0 a 1 | Amostragem do núcleo com a probabilidade de massa. Valores mais baixos tornam as saídas mais focadas. |
| max_tokens | integer | 4096 | 1 a 32768 | Tokens de saída máximos. |
| stop | string | - | - | Até 4 strings em que o modelo para de gerar mais tokens. |
| enable_thinking | boolean | true | - | Ative o raciocínio antes de responder. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Nível de esforço de raciocínio. Nenhum impede o pensamento. orçamentos limitados de pensamento de conjuntos baixos, médios, altos e máximos, dimensionados para o... |
| thinking_budget | integer | 4096 | 1024 a 32768 | Tokens máximos reservados para raciocínio quando o pensamento está ativado. |
| top_k | integer | 20 | 1 a 200 | Limite a amostragem aos principais K tokens candidatos quando suportados. |
| min_p | number | 0 | 0 a 1 | Limiar mínimo de probabilidade para amostragem de tokens. |
| frequency_penalty | number | 0 | -2 a 2 | Penalidade baseada na frequência com que um token já apareceu. |
| presence_penalty | number | 0 | -2 a 2 | Penalidade para tokens que já apareceram no texto gerado. |
| repetition_penalty | number | 1 | 0.1 a 2 | Penalidade usada pelo SGLang para reduzir o texto repetido. |
| seed | integer | - | 0 a 2147483647 | Semente aleatória opcional para amostragem reproduzível. |
| logprobs | boolean | false | - | Devolva as probabilidades de logarista dos tokens quando suportado. |
Suporta entrada de texto, imagem e vídeo, streaming, ferramentas de função, saída JSON estruturada, controle seed e modo de pensamento ativado por padrão. Use reasoning_effort ou thinking_budget para pensamento limitado, ou enable_thinking=falso para respostas diretas. Leituras automáticas de cache são cobradas na taxa de entrada em cache quando reportadas pelo serviço modelo. Controles de cache explícitos não são suportados.
Na EmpirioLabs, Qwen3.5 4B é cobrado por uso: Entrada $0.04 por 1M de tokens de prompt; Saída $0.07 por 1M de tokens gerados; Leitura implícita do cache $0.02 por 1M de tokens de entrada cacheados. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Qwen3.5 4B suporta uma janela de contexto de 256K tokens com até 32.768 tokens de saída por resposta.
Sim. Qwen3.5 4B atende a API Chat Completions compatível com OpenAI, então SDKs OpenAI existentes funcionam apontando base_url para https://api.empiriolabs.ai/v1 e definindo o id de modelo qwen3-5-4b.
Sim. O playground da EmpirioLabs executa Qwen3.5 4B no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.