O Flash Qwen3.7 está disponível no EmpirioLabs. É o nível rápido da série Qwen3.7 de linguagem de visão do Alibaba, construída para compreensão multimodal, uso de ferramentas agenticas e trabalho de longo contexto, com uma janela de contexto de token de 1M, pensamento comutável e entrada de texto, imagem e vídeo. Ele roda em uma API compatível com OpenAI, então você pode mudar para ela mudando um campo.
O que o Qwen3.7 Flash faz bem
Flash é a faixa de velocidade e custo da família Qwen3.7, então ela se adequa a trabalhos de alto volume onde você ainda quer raciocínio real disponível: compreensão de documentos e capturas de tela, resposta em vídeo, pipelines de extração e loops de agentes que chamam ferramentas. Ele lê imagens e vídeos, chama ferramentas com chamadas padrão de função, retorna JSON sob demanda e pode pesquisar na web, executar código e ler URLs por meio de ferramentas integradas. Tanto uma implantação em Singapura quanto uma na China estão disponíveis, então você pode escolher a que atender às suas necessidades de latência e preço.
Como chamar isso
Envie uma conclusão padrão do chat:
curl https://api.empiriolabs.ai/v1/chat/completions \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "qwen3-7-flash", "mensagens": [ {"Função": "usuário", "conteúdo": "Resume o relatório deste trimestre em cinco tópicos."} ] }'
A resposta final volta para Conteúdo, e quando o pensamento está em, o raciocínio do modelo está em raciocinar conteúdo.
Controle o pensamento
O pensamento está ativado por padrão. Desligue-o para chamadas curtas e sensíveis à latência, ou defina um orçamento para quantos tokens o modelo pode gastar em raciocínio. Você também pode usar raciocinação esforço com nenhum, baixo, médio, alto ou máximo, que corresponde a um orçamento para este modelo:
{ "model": "qwen3-7-flash", "messages": [{"role": "user", "content": "Planeje uma migração e justifique a ordem."}], "enable_thinking": true, "thinking_budget": 32768 }
Tokens de raciocínio são anunciados como tokens de saída.
Imagens e vídeo
Passe imagens e vídeos como partes de conteúdo em uma mensagem de usuário junto com seu texto, depois faça uma pergunta sobre o que eles mostram. Você pode anexar mais de uma entrada em uma única solicitação:
{ "modelo": "qwen3-7-flash", "mensagens": [{"papel": "usuário", "conteúdo": [ {"tipo": "texto", "texto": "O que mudou entre essas duas capturas de tela?"}, {"tipo": "image_url", "image_url": {"URL": "https://example.com/before.png"}}, {"tipo": "image_url", "image_url": {"URL": "https://example.com/after.png"}} ]}] }
Ferramentas integradas
O Qwen3.7 Flash vem com busca na web, um extrator web para leitura de URLs, um interpretador de código e text-to-image e image-to-image busca. Cada um é um toggle, e eles são cobrados apenas quando o modelo realmente os invoca. Web Extractor e Code Interpreter precisam de pensamento habilitado:
{ "modelo": "qwen3-7-flash", "mensagens": [{"papel": "usuário", "conteúdo": "O que veio na última versão?"}], "tool_web_search": verdadeiro }
Quando as ferramentas são executadas, a resposta carrega um usage.tool_usage Mapeie ao lado das contagens de tokens para poder auditar exatamente o que foi invocado.
Saída estruturada e chamada de função
Uso response_format com {"tipo": "json_object"} forçar um objeto JSON válido e passar Ferramentas Para chamadas de função padrão quando você quer que o modelo chame no seu próprio código.
Cache de prompts
Prefixos repetidos de prompt são armazenados em cache automaticamente, e tokens de entrada em cache faturam a uma taxa muito menor do que a entrada nova. Se você enviar um prompt de sistema compartilhado longo ou cabeçalho de documento para várias solicitações, você recebe esse desconto sem alterar nada no seu código.
Regiões
O padrão qwen3-7-flash é a missão de Singapura. qwen3-7-flash:variant1 é a implantação do mesmo modelo na China em taxas mais baixas. Ambos usam os mesmos parâmetros, então você pode alternar entre eles apenas com o campo do modelo.
Preços
O Flash Qwen3.7 é pay as you go, cobrado por token. As taxas de entrada e saída diminuem para prompts mais curtos e aumentam para os muito longos, as contas de entrada armazenadas em cache a uma taxa reduzida, e as ferramentas integradas custam uma pequena taxa por chamada apenas quando rodam. Veja as taxas ao vivo no Página do modelo Flash Qwen3.7 e o página de preços, e tente no playground.



