O GLM 5.3 Flash é o primeiro modelo nativamente multimodal da família GLM-5 da Z.ai, lançado em 26 de agosto de 2026 sob a licença do MIT após uma prévia anterior como Ox Alpha. É um 320B-A18B mixture-of-experts treinado em um corpus multimodal, e Z.ai reporta que supera o GLM 5.2 em benchmarks de codificação e agentes por uma fração do preço, com resultados que se aproximam de modelos de codificação de fronteira muito maiores.
O Flash GLM 5.3 está disponível em EmpirioLabs hoje por meio de uma API compatível com OpenAI, com entrada de texto, imagem, vídeo e arquivo, contexto de token de 1M, até 128K tokens de saída, chamada de funções, saída estruturada em modo JSON, busca web integrada e streaming. Tente no playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo Flash GLM 5.3 e o Documentos de API.
Preços
A cobrança é baseada no uso: os tokens de entrada e saída são medidos por token, e cada busca web embutida adiciona uma pequena taxa por chamada que se aplica apenas quando a busca realmente é executada. Não existe um nível de cache separado. As taxas atuais por token sempre estão disponíveis no página do modelo e o página de preços, que permanecem em sincronia com o que você é cobrado.
Início rápido
Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe glm-5-3-flash como modelo:
from openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "O que está falhando nesta captura de tela do log de build?"}, {"type": "image_url", "image_url": {"url": "https://example.com/build-log.png"}}, ]}, ], reasoning_effort="low",) print(resp.choices[0].message.content)
O mesmo modelo id funciona /v1/responses, a Antrópica /v1/messages, e o compatível com o Google /v1beta/models/glm-5-3-flash:gerar conteúdo rota. IDs alternativos glm-5.3-flash, zai/glm-5.3-flash, e zhipu/glm-5.3-flash Resolve para o mesmo modelo.
Entrada multimodal
Imagens, vídeos e arquivos são usados no array padrão de partes de conteúdo: image_url para imagens, video_url para vídeo, e file_url Para documentos. Passe uma URL https pública (recomendada) ou uma URL de dados base64. Z.ai posiciona o modelo para trabalho de visão agente: ele pode ler interfaces, resultados renderizados e feedback de interação, o que fecha o ciclo entre código, navegadores e interfaces gráficas.
Esforço de fundamentação
O Flash GLM 5.3 expõe um nativo raciocinação esforço Controle com três níveis: baixo para raciocínio leve, alto para raciocínio aprimorado, e max por raciocínios profundos. O padrão é max, que é o que Z.ai recomenda para codificação complexa e trabalho com agentes de longo prazo. Descer para baixo para curvas curtas, sensíveis à latência.
Busca na web e ferramentas
Definir tool_web_search para Verdade deixar o modelo pesquisar na web antes de responder, e restringir os resultados com search_recency_filter, search_domain_filter, e Conde. A chamada de função utiliza o padrão OpenAI Ferramentas arranje, e tool_stream Streams argumentos de chamada de ferramenta à medida que são produzidos.
Coisas que valem a pena saber antes da primeira ligação
- O raciocínio não pode ser desligado, então ele sempre faz parte da sua conta de saída.
raciocinação esforçoaceita apenasbaixo,alto, emax. Uma solicitação que pede um nível diferente, ou que o pensamento seja desativado, é servida no nível suportado mais próximo em vez de falhar, então o código escrito para outros modelos GLM continua funcionando. Tokens de raciocínio faturam como tokens de saída, e emmaxMesmo uma resposta de uma palavra pode gastar a maior parte do orçamento de produção pensando, então enviebaixoExplicitamente para chamadas triviais. - A saída estruturada é em modo JSON, não aplicação de esquema. Uso
response_formatcom{"tipo": "json_object"}E descreva os campos que você quer no prompt. Fornecer um esquema JSON é aceito, mas não aplicado, então valide o resultado do seu lado em vez de assumir a forma. - As partes de mídia devem ser URLs que o serviço pode buscar. O modelo busca
image_url,video_url, efile_urlse auto-direciona, então uma URL atrás de um login ou uma rede privada falhará na solicitação. Quando a mídia não for acessível publicamente, inscreva-a como uma URL de dados base64.
Para onde ir a seguir
Abra o playground para tentar o Flash GLM 5.3 sem escrever código, leia o Referência de API para a lista completa de parâmetros, ou navegue pelo Catálogo de modelos para comparar com o restante da formação.



