Inicio Blog

Cómo usar la API Flash de GLM 5.3

Cómo usar la API Flash de GLM 5.3

Aug 26, 2026

EmpirioLabs AI

GLM 5.3 Flash es el primer modelo multimodal nativo de la familia GLM-5 de Z.ai, lanzado el 26 de agosto de 2026 bajo la licencia MIT tras una previa previa como Ox Alpha. Es un 320B-A18B mixture-of-experts entrenado con un corpus multimodal, y Z.ai informa que supera a GLM 5.2 en benchmarks de codificación y agentes a una fracción del precio, con resultados que se acercan a modelos de codificación frontera mucho mayores.

GLM 5.3 Flash está disponible en EmpirioLabs hoy a través de una API compatible con OpenAI, con entrada de texto, imagen, vídeo y archivos, un contexto de token de 1M, hasta 128K tokens de salida, llamada a funciones, salida estructurada en modo JSON, búsqueda web integrada y streaming. Pruébalo en el parque infantil o llamarlo de cualquier cliente compatible con OpenAI. La especificaciones completas y las tasas actuales viven en Página del modelo Flash GLM 5.3 y el API docs.

Precios

La facturación se basa en el uso: los tokens de entrada y salida se miden por token, y cada búsqueda web integrada añade una pequeña tarifa por llamada que solo se aplica cuando la búsqueda realmente se ejecuta. No hay un nivel de caché separado. Las tasas actuales por token siempre están en la página modelo y el página de precios, que se mantienen en sincronía con lo que se cobra.

Quickstart

Indique cualquier SDK OpenAI en la URL base EmpirioLabs y pase glm-5-3-flash como modelo:

desde openai import cliente OpenAI = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="glm-5-3-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "What falla in this build log screenshot?"}, {"type": "image_url", "image_url": {"url": "https://example.com/build-log.png"}}, ]}, ], reasoning_effort="low",) print(resp.choices[0].message.content)

El mismo id de modelo funciona /v1/responses, el de forma antrópica /v1/messages, y el compatible con Google /v1beta/models/glm-5-3-flash:generateContent Ruta. Identificadores alternativos glm-5.3-flash, zai/glm-5.3-flash, y zhipu/glm-5.3-flash resuelve al mismo modelo.

Entrada multimodal

Las imágenes, vídeos y archivos se utilizan en la matriz estándar de partes de contenido: image_url para imágenes, video_url para vídeo, y file_url Para documentos. Transmite una URL https pública (recomendada) o una URL de datos base64. Z.ai posiciona el modelo para el trabajo de visión agente: puede leer interfaces, resultados renderizados y retroalimentación de interacción, lo que cierra el ciclo entre código, navegadores y interfaces gráficas.

Reasoning effort

El flash GLM 5.3 expone un nativo reasoning effort Control con tres niveles: Grave para razonamiento ligero, Alto para razonamiento mejorado, y max por razones profundas. El valor por defecto es max, que es lo que Z.ai recomienda para codificación compleja y trabajo de agentes a largo plazo. Descender a Grave para giros cortos, sensibles a la latencia.

Búsqueda web y herramientas

Set tool_web_search a Cierto dejar que el modelo busque en la web antes de responder, y acotar los resultados con search_recency_filter, search_domain_filter, y Conde. La llamada a funciones utiliza el estándar OpenAI Herramientas y tool_stream Flujos llaman a los argumentos de llamada de herramientas a medida que se producen.

Cosas que merece la pena saber antes de tu primera llamada

  • El razonamiento no se puede desactivar, así que siempre forma parte de tu factura de producción. reasoning effort solo acepta Grave, Alto, y max. Una solicitud que pide un nivel diferente, o que el pensamiento sea desactivado, se atiende en el nivel soportado más cercano en lugar de fallar, por lo que el código escrito para otros modelos GLM sigue funcionando. Los tokens de razonamiento facturan como tokens de salida, y en max Incluso una respuesta de una sola palabra puede gastar la mayor parte de su presupuesto de producción pensando, así que enviar Grave Explícitamente para llamadas triviales.
  • La salida estructurada es en modo JSON, no en aplicación de esquemas. Uso response_format con {"tipo": "json_object"} Y describe los campos que quieres en el prompt. Suministrar un esquema JSON es aceptado pero no se impone, así que valida el resultado de tu lado en lugar de asumir la forma.
  • Las partes de medios deberían ser URLs que el servicio pueda obtener. El modelo obtiene image_url, video_url, y file_url Se apunta a sí mismo, así que una URL detrás de un inicio de sesión o una red privada fallará la solicitud. Cuando el medio no sea accesible públicamente, indícalo como una URL de datos base64.

¿A dónde ir ahora

Abre el parque infantil para probar el Flash GLM 5.3 sin escribir código, lee el Referencia de API para la lista completa de parámetros, o navega por la Catálogo de modelos para compararlo con el resto de la formación.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.