
Raciocínio omni-modal que lê texto, imagens, áudio e vídeo e responde em texto, com um contexto de token de 1M, pensamento e busca nativa na web.
Raciocínio omni-modal que lê texto, imagens, áudio e vídeo e responde em texto, com um contexto de token de 1M, pensamento e busca nativa na web.
Suporta entrada de texto, imagem, áudio e vídeo, modo de pensamento com enable_thinking e thinking_budget até 262144 tokens, chamada de funções, saída estruturada incluindo estrito esquema JSON e a ferramenta tool_web_search embutida. Tokens de pensamento são anunciados como tokens de saída.
Também conhecido como Alibaba Cloud Qwen3.8 Omni Flash
qwen3-8-omni-flash/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/qwen3-8-omni-flash:generateContentqwen3.8-omni-flashTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Qwen3.8 Omni Flash atende a API Chat Completions compatível com OpenAI. Aponte qualquer SDK OpenAI para https://api.empiriolabs.ai/v1 com sua chave de API EmpirioLabs e use o id de modelo qwen3-8-omni-flash. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-8-omni-flash",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="qwen3-8-omni-flash",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parâmetros de requisição suportados pela API Qwen3.8 Omni Flash na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| temperature | number | 0.7 | 0 a 2 | Temperatura de amostragem. 0 é determinístico e 2 é a aleatoriedade máxima. |
| top_p | number | 0.9 | 0 a 1 | Amostragem do núcleo com a probabilidade de massa. Valores mais baixos tornam as saídas mais focadas. |
| max_tokens | number | 4096 | 1 a 131072 | Tokens de saída máximos. |
| stop | string | - | - | Até 4 strings em que o modelo para de gerar mais tokens. |
| enable_thinking | boolean | true | - | Ative o raciocínio antes de responder. |
| reasoning_effort | enum | medium | none, low, medium, high, max | Nível de esforço de raciocínio. Nenhum impede o pensamento. orçamentos limitados de pensamento de conjuntos baixos, médios, altos e máximos, dimensionados para o... |
| thinking_budget | number | 32768 | 1 a 262144 | Tokens máximos reservados para raciocínio quando o pensamento está ativado. |
| vl_high_resolution_images | boolean | true | - | Use processamento de resolução mais alta para entradas de imagem. |
| max_pixels | number | 2621440 | 4096 a 16777216 | Contagem máxima de pixels por imagem quando o processamento de alta resolução está desativado. |
| video_fps | number | 2 | 0.1 a 10 | Frames por segundo para amostrar a partir das entradas de vídeo. |
| treat_images_as_video | boolean | false | - | Trate uma sequência de imagens como quadros de vídeo. |
| tool_web_search | boolean | false | - | Pesquise na internet por informações em tempo real. Adiciona $0.02 ao custo da solicitação para cada chamada invocada. |
| disable_formatting | boolean | false | - | Devolver a saída bruta no estilo provedor sem EmpirioLabs formatação de fonte quando suportado. |
| response_format | enum | - | - | Restringa a saída a JSON válido. Use o modo JSON para qualquer objeto JSON, ou forneça um Esquema JSON para forçar uma forma exata de resposta. |
Entrada de texto, imagem, áudio e vídeo são suportados, e o modelo responde em texto. O pensamento está ativado por padrão; use enable_thinking para desligar e thinking_budget para limitar a até 262144 tokens. Tokens de pensamento são anunciados como tokens de saída. A busca na web é uma ferramenta opcional embutida exposta por meio de tool_web_search e adiciona $0.02 para cada chamada invocada; uma única solicitação pode invocá-la mais de uma vez, e cada chamada invocada é cobrada. Para entrada de áudio, passe o arquivo como uma URL ou um URI de dados base64. A trilha sonora de um vídeo é anunciada como tokens de áudio junto com seus tokens de vídeo.
When this model invokes built-in tools inside a single request, the response carries a normalized usage.tool_usage map alongside the token counts:
"usage": {
"prompt_tokens": 123,
"completion_tokens": 456,
"cost_usd": 0.0042,
"tool_usage": {"web_search": 3}
}Tool counts are already factored into cost_usd and are surfaced for transparency so you can audit per-tool billing. The field is omitted when no tools were invoked.
Na EmpirioLabs, Qwen3.8 Omni Flash é cobrado por uso: Entrada $0.30 por 1M de tokens de prompt; Saída $0.94 por 1M de tokens gerados; Pesquisa Web $0.02 por chamada quando invocada. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Qwen3.8 Omni Flash suporta uma janela de contexto de 1M tokens com até 131.072 tokens de saída por resposta.
Sim. Qwen3.8 Omni Flash atende a API Chat Completions compatível com OpenAI, então SDKs OpenAI existentes funcionam apontando base_url para https://api.empiriolabs.ai/v1 e definindo o id de modelo qwen3-8-omni-flash.
Sim. O playground da EmpirioLabs executa Qwen3.8 Omni Flash no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.