Casa Blog

Como Usar a API Flash GLM 5.3

Como Usar a API Flash GLM 5.3

Aug 26, 2026

EmpirioLabs AI

O GLM 5.3 Flash é o primeiro modelo nativamente multimodal da família GLM-5 da Z.ai, lançado em 26 de agosto de 2026 sob a licença do MIT após uma prévia anterior como Ox Alpha. É um 320B-A18B mixture-of-experts treinado em um corpus multimodal, e Z.ai reporta que supera o GLM 5.2 em benchmarks de codificação e agentes por uma fração do preço, com resultados que se aproximam de modelos de codificação de fronteira muito maiores.

O Flash GLM 5.3 está disponível em EmpirioLabs hoje por meio de uma API compatível com OpenAI, com entrada de texto, imagem, vídeo e arquivo, contexto de token de 1M, até 128K tokens de saída, chamada de funções, saída estruturada em modo JSON, busca web integrada e streaming. Tente no playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo Flash GLM 5.3 e o Documentos de API.

Preços

A cobrança é baseada no uso: os tokens de entrada e saída são medidos por token, e cada busca web embutida adiciona uma pequena taxa por chamada que se aplica apenas quando a busca realmente é executada. Não existe um nível de cache separado. As taxas atuais por token sempre estão disponíveis no página do modelo e o página de preços, que permanecem em sincronia com o que você é cobrado.

Início rápido

Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe glm-5-3-flash como modelo:

from openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "O que está falhando nesta captura de tela do log de build?"}, {"type": "image_url", "image_url": {"url": "https://example.com/build-log.png"}}, ]}, ], reasoning_effort="low",) print(resp.choices[0].message.content)

O mesmo modelo id funciona /v1/responses, a Antrópica /v1/messages, e o compatível com o Google /v1beta/models/glm-5-3-flash:gerar conteúdo rota. IDs alternativos glm-5.3-flash, zai/glm-5.3-flash, e zhipu/glm-5.3-flash Resolve para o mesmo modelo.

Entrada multimodal

Imagens, vídeos e arquivos são usados no array padrão de partes de conteúdo: image_url para imagens, video_url para vídeo, e file_url Para documentos. Passe uma URL https pública (recomendada) ou uma URL de dados base64. Z.ai posiciona o modelo para trabalho de visão agente: ele pode ler interfaces, resultados renderizados e feedback de interação, o que fecha o ciclo entre código, navegadores e interfaces gráficas.

Esforço de fundamentação

O Flash GLM 5.3 expõe um nativo raciocinação esforço Controle com três níveis: baixo para raciocínio leve, alto para raciocínio aprimorado, e max por raciocínios profundos. O padrão é max, que é o que Z.ai recomenda para codificação complexa e trabalho com agentes de longo prazo. Descer para baixo para curvas curtas, sensíveis à latência.

Busca na web e ferramentas

Definir tool_web_search para Verdade deixar o modelo pesquisar na web antes de responder, e restringir os resultados com search_recency_filter, search_domain_filter, e Conde. A chamada de função utiliza o padrão OpenAI Ferramentas arranje, e tool_stream Streams argumentos de chamada de ferramenta à medida que são produzidos.

Coisas que valem a pena saber antes da primeira ligação

  • O raciocínio não pode ser desligado, então ele sempre faz parte da sua conta de saída. raciocinação esforço aceita apenas baixo, alto, e max. Uma solicitação que pede um nível diferente, ou que o pensamento seja desativado, é servida no nível suportado mais próximo em vez de falhar, então o código escrito para outros modelos GLM continua funcionando. Tokens de raciocínio faturam como tokens de saída, e em max Mesmo uma resposta de uma palavra pode gastar a maior parte do orçamento de produção pensando, então envie baixo Explicitamente para chamadas triviais.
  • A saída estruturada é em modo JSON, não aplicação de esquema. Uso response_format com {"tipo": "json_object"} E descreva os campos que você quer no prompt. Fornecer um esquema JSON é aceito, mas não aplicado, então valide o resultado do seu lado em vez de assumir a forma.
  • As partes de mídia devem ser URLs que o serviço pode buscar. O modelo busca image_url, video_url, e file_url se auto-direciona, então uma URL atrás de um login ou uma rede privada falhará na solicitação. Quando a mídia não for acessível publicamente, inscreva-a como uma URL de dados base64.

Para onde ir a seguir

Abra o playground para tentar o Flash GLM 5.3 sem escrever código, leia o Referência de API para a lista completa de parâmetros, ou navegue pelo Catálogo de modelos para comparar com o restante da formação.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.