Casa Blog

Como Usar a API Flash do Qwen3.8

Como Usar a API Flash do Qwen3.8

Aug 26, 2026

EmpirioLabs AI

Qwen3.8 Flash é o modelo multimodal mais novo da família Qwen3.8 do Alibaba, lançado em 26 de agosto de 2026, desenvolvido para trabalhos rápidos e de baixo custo em codificação, agentes e visão. Ele combina um contexto de token de 1M com entendimento de texto, imagem e vídeo, pensamento profundo ativado por padrão, e as mesmas cinco ferramentas integradas do Qwen3.8 Max.

O Qwen3.8 Flash está disponível no EmpirioLabs hoje por meio de uma API compatível com OpenAI, com chamada de funções, saída estruturada rigorosa do Esquema JSON, streaming e até 128K tokens de saída. Tente no playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo Flash Qwen3.8 e o Documentos de API.

Preços

A cobrança é baseada no uso, com uma taxa fixa de entrada e uma taxa fixa de saída em cada tamanho de prompt, e não há um nível de cache separado. A busca na web, text-to-image busca e image-to-image busca adicionam uma pequena taxa por chamada que se aplica apenas quando uma chamada realmente é executada; O Web Extractor e o Interpretador de Código rodam sem custo adicional. As taxas atuais sempre vivem no página do modelo e o página de preços, que permanecem em sincronia com o que você é cobrado.

Início rápido

Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe qwen3-8-flash como modelo:

from openai import OpenAI client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "O que está acontecendo neste gráfico?"}, {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)

O mesmo modelo id funciona /v1/responses, a Antrópica /v1/messages, e o compatível com o Google /v1beta/models/qwen3-8-flash:gerar conteúdo rota. O id alternativo qwen3.8-flash resolve para o mesmo modelo.

Pensamento

O pensamento profundo está ativado por padrão e retorna como raciocinar conteúdo junto com a resposta. Controle-o com activar pensar e thinking_budget (até 262.144 tokens), ou enviar raciocinação esforço e a plataforma mapeia para um orçamento adequado ao modelo. Tokens de pensamento faturam como tokens de saída, então desative o pensamento ou defina um orçamento pequeno para turnos curtos e sensíveis à latência.

Ferramentas integradas

Cinco ferramentas embutidas acompanham atrás tool_* Alternâncias: tool_web_search, tool_web_extractor, tool_code_interpreter, tool_web_search_image, e tool_image_search. O extrator web requer busca na web, e tanto o extrator quanto o interpretador de código rodam apenas enquanto o pensamento está ativado. Quando as ferramentas rodam, a resposta é usage.tool_usage O MAP informa exatamente quantas chamadas foram feitas, para que você possa auditar a faturação por ferramenta.

Saída estruturada

Para uma forma de resposta exata, passe response_format com {"tipo": "json_schema",...} e "rígido": verdade: o modelo retorna exatamente as chaves do esquema sem extras. Modo JSON simples com {"tipo": "json_object"} também é suportado.

Coisas que valem a pena saber antes da primeira ligação

  • Todas as cinco ferramentas integradas têm como padrão ligado e pesquisam na fatura por chamada invocada. Uma única solicitação pode executar uma busca na web várias vezes, e cada invocação é cobrada. Para um chat simples sem taxas de ferramenta, defina tool_web_search, tool_web_search_image, e tool_image_search para falso.
  • tool_choice: "obrigatório" não funciona enquanto o pensamento está ativo. O pedido é rejeitado com um erro claro. Fique tool_choice: "auto" com o pensamento ativado, ou definido enable_thinking: falso Quando você precisa forçar uma chamada de função.
  • O modo JSON precisa da palavra "json" nas suas mensagens. A {"tipo": "json_object"} O pedido é rejeitado, a menos que a palavra apareça em algum momento da conversa. Solicitações de esquema JSON não possuem tal requisito.

O Flash Qwen3.8 já está disponível no playground e através do EmpirioLabs API.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.