GLM-5.2 es el principal modelo de razonamiento y codificación de Z.ai, lanzado el 13 de junio de 2026. Se combina con una ventana de contexto one-million-token con un esfuerzo de razonamiento ajustable, por lo que puede marcar lo duro que el modelo piensa antes de que responda, y se envía con búsqueda web integrada y llamada de herramienta. Z.ai lo posiciona como un modelo de codificación que mantiene un fuerte razonamiento general, y recomienda el máximo esfuerzo de razonamiento para trabajos de ingeniería complejos y multi-pasos.
GLM-5.2 está en vivo en EmpirioLabs hoy a través de una API compatible con OpenAI, con entrada y salida de texto, un contexto de token de 1M, hasta 128K tokens de salida, llamada de funciones, salida estructurada del modo JSON y streaming. Pruébalo en el parque infantil o llamarlo de cualquier cliente compatible con OpenAI. La especificaciones completas y las tasas actuales viven en Página modelo GLM-5.2 y el API docs.
Precios
La facturación se basa en el uso: los tokens de entrada y salida se miden por token, y cada búsqueda web integrada añade una pequeña tarifa por llamada que solo se aplica cuando la búsqueda realmente se ejecuta. No hay un nivel de caché separado. Las tasas actuales por token siempre están en la página modelo y el página de precios, que se mantienen en sincronía con lo que se cobra.
Quickstart
Indique cualquier SDK OpenAI en la URL base EmpirioLabs y pase glm-5-2 como modelo:
desde openai import OpenAI client = OpenAI(base url=" https://api.empiriolabs.ai/v1", api key="YOUR EMPIRIOLABS API KEY",) resp = client.chat.completions.create(model=" EL TOKEN, messages=[ {"role": "user"
Reasoning effort
GLM-5.2 expone a un nativo reasoning effort control con niveles desde mínimo hasta max, más ninguno para apagar el pensamiento por completo. El predeterminado es max, que Z.ai recomienda para la codificación compleja. Bajar el esfuerzo para respuestas más rápidas y baratas en simples turnos, o establecer habilitar pensar a falso para el camino de baja latencia. Cuando el modelo piensa, el razonamiento es devuelto junto a la respuesta para que puedas mostrarlo o ocultarlo.
Búsqueda web
Set tool_web_search para permitir que GLM-5.2 tire resultados en vivo en su respuesta. El modelo decide cuándo buscar, cita lo que usó, y la tarifa por llamada sólo se aplica cuando se ejecuta una búsqueda. Déjalo fuera por un razonamiento completamente fuera de línea.
Es bueno saberlo
Para una producción estructurada estricta, corre con el pensamiento discapacitado para que el modelo regrese limpio JSON sin un rastro de razonamiento entrelazado. GLM-5.2 es texto y texto: para la comprensión de imagen o video, elija un modelo multimodal del catálogo. El contexto one-million-token posee cómodamente grandes bases de código, largas transcripciones y refactores de varios ficheros en una sola solicitud.



