Casa Blog

Como Usar a API GLM 5.3

GLM 5.3 via API cover

Aug 19, 2026

EmpirioLabs AI

GLM 5.3 é o modelo principal de codificação e agente da Z.ai, lançado em 14 de agosto de 2026. Ele roda no mesmo modelo base do GLM 5.2, com os ganhos vindos do pós-treinamento estendido em vez de uma nova execução pré-treinamento: Z.ai relata uma melhora de 50% na codificação em relação ao GLM 5.2 em seu próprio Code Bench, além de resultados state-of-the-art entre modelos open-source no Terminal Bench 3.0 e no Agents' Last Exam.

O GLM 5.3 está disponível no EmpirioLabs hoje por meio de uma API compatível com OpenAI, com entrada e saída de texto, contexto de token de 1M, até 128K tokens de saída, chamada de funções, saída estruturada em modo JSON, busca web integrada e streaming. Tente no playground ou chamá-lo de qualquer cliente compatível com o OpenAI. A especificação completa e as taxas atuais vivem no Página do modelo GLM 5.3 e o Documentos de API.

Preços

A cobrança é baseada no uso: os tokens de entrada e saída são medidos por token, e cada busca web embutida adiciona uma pequena taxa por chamada que se aplica apenas quando a busca realmente é executada. Não existe um nível de cache separado. As taxas atuais por token sempre estão disponíveis no página do modelo e o página de preços, que permanecem em sincronia com o que você é cobrado.

Início rápido

Aponte qualquer SDK OpenAI na URL base EmpirioLabs e passe glm-5-3 como modelo:

from openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3", messages=[ {"role": "user", "content": "Encontre a condição de corrida neste pool de trabalhadores e proponha uma correção."}, ], reasoning_effort="max",) print(resp.choices[0].message.content)

O mesmo modelo id funciona /v1/responses, a Antrópica /v1/messages, e o compatível com o Google /v1beta/models/glm-5-3:gerar conteúdo rota. IDs alternativos GLM-5.3, zai/glm-5.3, e zhipu/glm-5.3 Resolve para o mesmo modelo.

Esforço de fundamentação

O GLM 5.3 expõe um nativo raciocinação esforço Controle com três níveis: baixo para raciocínio leve, alto para raciocínio aprimorado, e max por raciocínios profundos. O padrão é max, que é o que Z.ai recomenda para codificação complexa e trabalho com agentes de longo prazo. Descer para baixo para curvas curtas, sensíveis à latência.

Busca na web e ferramentas

Definir tool_web_search para Verdade deixar o modelo pesquisar na web antes de responder, e restringir os resultados com search_recency_filter, search_domain_filter, e Conde. A chamada de função utiliza o padrão OpenAI Ferramentas arranje, e tool_stream Streams argumentos de chamada de ferramenta à medida que são produzidos.

Coisas que valem a pena saber antes da primeira ligação

  • O raciocínio não pode ser desligado, então ele sempre faz parte da sua conta de saída. Diferente do GLM 5.2, este modelo não possui modo de desconexão, e raciocinação esforço aceita apenas baixo, alto, e max. Uma solicitação que pede um nível diferente, ou que o pensamento seja desativado, é servida no nível suportado mais próximo em vez de falhar, então o código escrito para GLM 5.2 continua funcionando. Tokens de raciocínio faturam como tokens de saída, e em max Mesmo uma resposta de uma palavra pode gastar a maior parte do orçamento de produção pensando, então envie baixo Explicitamente para chamadas triviais.
  • A saída estruturada é em modo JSON, não aplicação de esquema. Uso response_format com {"tipo": "json_object"} E descreva os campos que você quer no prompt. Fornecer um esquema JSON é aceito, mas não aplicado, então valide o resultado do seu lado em vez de assumir a forma.
  • É apenas texto. Imagens, vídeos e partes de arquivos são rejeitadas. Use um modelo de visão como o GLM 5.3 Flash para entrada multimodal.

Para onde ir a seguir

Abra o playground para tentar o GLM 5.3 sem escrever código, leia o Referência de API para a lista completa de parâmetros, ou navegue pelo Catálogo de modelos para comparar com o restante da formação.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.