
Modelo de linguagem visual Fast Qwen3.8 para codificação, agentes e compreensão visual, com entrada de imagem e vídeo, cinco ferramentas integradas e um contexto de token de 1M.
Modelo de linguagem visual Fast Qwen3.8 para codificação, agentes e compreensão visual, com entrada de imagem e vídeo, cinco ferramentas integradas e um contexto de token de 1M.
Suporta entrada de texto, imagem e vídeo, modo de pensamento com enable_thinking e thinking_budget até 262144 tokens, chamada de funções, saída estruturada incluindo estrito esquema JSON e cinco ferramentas integradas: tool_web_search, tool_web_extractor, tool_code_interpreter, tool_web_search_image e tool_image_search. Tokens de pensamento são anunciados como tokens de saída.
Também conhecido como Alibaba Cloud Qwen3.8 Flash
qwen3-8-flash/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/qwen3-8-flash:generateContentqwen3.8-flashTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Qwen3.8 Flash atende a API Chat Completions compatível com OpenAI. Aponte qualquer SDK OpenAI para https://api.empiriolabs.ai/v1 com sua chave de API EmpirioLabs e use o id de modelo qwen3-8-flash. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-8-flash",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-8-flash",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parâmetros de requisição suportados pela API Qwen3.8 Flash na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 a 2 | Temperatura de amostragem. 0 é determinístico e 2 é a aleatoriedade máxima. |
| top_p | number | 0.9 | 0 a 1 | Amostragem do núcleo com a probabilidade de massa. Valores mais baixos tornam as saídas mais focadas. |
| max_tokens | number | 4096 | 1 a 131072 | Tokens de saída máximos. |
| stop | string | - | - | Até 4 strings em que o modelo para de gerar mais tokens. |
| enable_thinking | boolean | true | - | Ative o raciocínio antes de responder. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Nível de esforço de raciocínio. Nenhum impede o pensamento. orçamentos limitados de pensamento de conjuntos baixos, médios, altos e máximos, dimensionados para o... |
| thinking_budget | number | 32768 | 1 a 262144 | Tokens máximos reservados para raciocínio quando o pensamento está ativado. |
| vl_high_resolution_images | boolean | true | - | Use processamento de resolução mais alta para entradas de imagem. |
| max_pixels | number | 2621440 | 4096 a 16777216 | Contagem máxima de pixels por imagem quando o processamento de alta resolução está desativado. |
| video_fps | number | 2 | 0.1 a 10 | Frames por segundo para amostrar a partir das entradas de vídeo. |
| treat_images_as_video | boolean | false | - | Trate uma sequência de imagens como quadros de vídeo. |
| tool_web_search | boolean | false | - | Pesquise na internet por informações em tempo real. Adiciona $0.02 ao custo da solicitação para cada chamada invocada. |
| tool_web_extractor | boolean | false | - | Extraia e leia conteúdo de URLs. Exige busca na web e reflexão. |
| tool_code_interpreter | boolean | false | - | Rodar código Python em um sandbox. Exige Pensar. |
Entrada de texto, imagem e vídeo são suportados. Busca web, extrator web, interpretador de código, busca text-to-image e busca image-to-image são ferramentas opcionais incorporadas expostas por parâmetros tool_*. Busca na Web, text-to-image busca e image-to-image busca adicionam $0.02 para cada chamada invocada; Web Extractor e Interpreter de Código rodam sem custo adicional. Web extractor exige busca na web, e tanto web extractor quanto interpretador de código exigem pensamento. Uma única solicitação pode invocar uma ferramenta mais de uma vez, e cada chamada invocada é cobrada. Tokens de pensamento são anunciados como tokens de saída.
When this model invokes built-in tools inside a single request, the response carries a normalized usage.tool_usage map alongside the token counts:
"usage": {
"prompt_tokens": 123,
"completion_tokens": 456,
"cost_usd": 0.0042,
"tool_usage": {"web_search": 3, "code_interpreter": 1}
}Tool counts are already factored into cost_usd and are surfaced for transparency so you can audit per-tool billing. The field is omitted when no tools were invoked.
Na EmpirioLabs, Qwen3.8 Flash é cobrado por uso: Entrada $0.16 por 1M de tokens de prompt; Saída $0.47 por 1M de tokens gerados; Pesquisa Web $0.02 por chamada quando invocada. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Qwen3.8 Flash suporta uma janela de contexto de 1M tokens com até 131.072 tokens de saída por resposta.
Sim. Qwen3.8 Flash atende a API Chat Completions compatível com OpenAI, então SDKs OpenAI existentes funcionam apontando base_url para https://api.empiriolabs.ai/v1 e definindo o id de modelo qwen3-8-flash.
Sim. O playground da EmpirioLabs executa Qwen3.8 Flash no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.