GLM 5.3 é o modelo principal de codificação e agente da Z.ai, lançado em 14 de agosto de 2026. Ele roda no mesmo modelo base do GLM 5.2, com os ganhos vindos do pós-treinamento estendido em vez de uma nova execução pré-treinamento: Z.ai relata uma melhora de 50% na codificação em relação ao GLM 5.2 em seu próprio Code Bench, além de resultados state-of-the-art entre modelos open-source no Terminal Bench 3.0 e no Agents' Last Exam.
O GLM 5.3 está disponível no EmpirioLabs hoje por meio de uma API compatível com OpenAI, com entrada e saída de texto, contexto de token de 1M, até 128K tokens de saída, chamada de funções, saída estruturada em modo JSON, busca web integrada e streaming. Tente no playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo GLM 5.3 e o Documentos de API.
Preços
A cobrança é baseada no uso: os tokens de entrada e saída são medidos por token, e cada busca web embutida adiciona uma pequena taxa por chamada que se aplica apenas quando a busca realmente é executada. Não existe um nível de cache separado. As taxas atuais por token sempre estão disponíveis no página do modelo e o página de preços, que permanecem em sincronia com o que você é cobrado.
Início rápido
Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe glm-5-3 como modelo:
from openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3", messages=[ {"role": "user", "content": "Encontre a condição de corrida neste pool de trabalhadores e proponha uma correção."}, ], reasoning_effort="max",) print(resp.choices[0].message.content)
O mesmo modelo id funciona /v1/responses, a Antrópica /v1/messages, e o compatível com o Google /v1beta/models/glm-5-3:gerar conteúdo rota. IDs alternativos GLM-5.3, zai/glm-5.3, e zhipu/glm-5.3 Resolve para o mesmo modelo.
Esforço de fundamentação
O GLM 5.3 expõe um nativo raciocinação esforço Controle com três níveis: baixo para raciocínio leve, alto para raciocínio aprimorado, e max por raciocínios profundos. O padrão é max, que é o que Z.ai recomenda para codificação complexa e trabalho com agentes de longo prazo. Descer para baixo para curvas curtas, sensíveis à latência.
Busca na web e ferramentas
Definir tool_web_search para Verdade deixar o modelo pesquisar na web antes de responder, e restringir os resultados com search_recency_filter, search_domain_filter, e Conde. A chamada de função utiliza o padrão OpenAI Ferramentas arranje, e tool_stream Streams argumentos de chamada de ferramenta à medida que são produzidos.
Coisas que valem a pena saber antes da primeira ligação
- O raciocínio não pode ser desligado, então ele sempre faz parte da sua conta de saída. Diferente do GLM 5.2, este modelo não possui modo de desconexão, e
raciocinação esforçoaceita apenasbaixo,alto, emax. Uma solicitação que pede um nível diferente, ou que o pensamento seja desativado, é servida no nível suportado mais próximo em vez de falhar, então o código escrito para GLM 5.2 continua funcionando. Tokens de raciocínio faturam como tokens de saída, e emmaxMesmo uma resposta de uma palavra pode gastar a maior parte do orçamento de produção pensando, então enviebaixoExplicitamente para chamadas triviais. - A saída estruturada é em modo JSON, não aplicação de esquema. Uso
response_formatcom{"tipo": "json_object"}E descreva os campos que você quer no prompt. Fornecer um esquema JSON é aceito, mas não aplicado, então valide o resultado do seu lado em vez de assumir a forma. - É apenas texto. Imagens, vídeos e partes de arquivos são rejeitadas. Use um modelo de visão como o GLM 5.3 Flash para entrada multimodal.
Para onde ir a seguir
Abra o playground para tentar o GLM 5.3 sem escrever código, leia o Referência de API para a lista completa de parâmetros, ou navegue pelo Catálogo de modelos para comparar com o restante da formação.



