GLM 5.3 Flash est le premier modèle multimodal natif de la famille GLM-5 de Z.ai, sorti le 26 août 2026 sous licence MIT après une précédente présentation sous le nom Ox Alpha. Il s’agit d’un 320B-A18B mixture-of-experts entraîné sur un corpus multimodal, et Z.ai rapporte qu’il surpasse GLM 5.2 sur les benchmarks de codage et d’agents à une fraction du prix, avec des résultats approchant des modèles de codage frontière beaucoup plus vastes.
GLM 5.3 Flash est disponible aujourd’hui sur EmpirioLabs via une API compatible OpenAI, avec texte d’entrée, image, vidéo et fichiers, un contexte de jetons de 1M, jusqu’à 128K de jetons de sortie, appel de fonctions, sortie structurée en mode JSON, recherche web intégrée et streaming. Essaie-le dans le aire de jeux ou appelez-le d'un client compatible OpenAI. L'ensemble de la spec et les taux actuels vivent sur le Page modèle Flash GLM 5.3 et les Docs API.
Prix
La facturation est basée sur l’utilisation: les jetons d’entrée et de sortie sont mesurés par jeton, et chaque recherche web intégrée ajoute un petit frais par appel qui ne s’applique que lorsqu’une recherche est effectivement effectuée. Il n’y a pas de niveau de cache séparé. Les taux actuels par jeton sont toujours présents sur le page modèle et les page de prix, qui restent en phase avec ce qui vous est facturé.
Démarrer rapidement
Pointez n'importe quel SDK OpenAI à l'URL de base d'EmpirioLabs et passez glm-5-3-flash comme modèle:
depuis openai import OpenAI client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY »,) resp = client.chat.completions.create(model="glm-5-3-flash », messages=[ {"role »: « user », « content »: [ {"type »: « text », « text »: « Qu’est-ce qui échoue dans cette capture d’écran du journal de compilation ?"}, {"type »: « image_url », « image_url »: {"url »: « https://example.com/build-log.png"}}, ]}, ], reasoning_effort="low »,) print(resp.choices[0].message.content)
Le même modèle d’ID fonctionne /v1/responses, la forme anthropique /v1/messages, et le modèle compatible Google /v1beta/models/glm-5-3-flash:générer du contenu Route. Identifiants alternatifs glm-5.3-flash, zai/glm-5.3-flash, et zhipu/glm-5.3-flash Résous selon le même modèle.
Entrée multimodale
Les images, vidéos et fichiers sont utilisés dans la liste standard de parties de contenu: image_url pour les images, video_url pour la vidéo, et file_url Pour les documents. Passez une URL https publique (recommandée) ou une URL de données base64. Z.ai positionne le modèle pour le travail de vision agentique: il peut lire les interfaces, les résultats rendus et le retour d’interaction, ce qui ferme la boucle entre le code, les navigateurs et les interfaces graphiques.
Efforts de motivation
Le flash GLM 5.3 expose une mémoire native raisonnement effort Contrôle avec trois niveaux: Low pour raisonnement léger, haut pour un raisonnement amélioré, et max pour des raisons profondes. Le défaut est max, ce que Z.ai recommande pour le codage complexe et le travail sur les agents à long terme. Descendre à Low pour les virages courts et sensibles à la latence.
Recherche web et outils
Jeu tool_web_search à Vrai laisser le modèle rechercher sur le web avant de répondre, et restreindre les résultats avec search_recency_filter, search_domain_filter, et Comte. L’appel de fonction utilise le standard OpenAI Outils et tool_stream Des flux d’arguments d’appel d’outils au fur et à mesure qu’ils sont produits.
Des choses qui valent la peine d’être connues avant votre premier appel
- Le raisonnement ne peut pas être désactivé, donc cela fait toujours partie de votre facture de sortie.
raisonnement effortaccepte seulementLow,haut, etmax. Une requête qui demande un niveau différent, ou que la pensée soit désactivée, est servie au niveau supporté le plus proche plutôt que d’échouer, donc le code écrit pour d’autres modèles GLM continue de fonctionner. Les jetons de raisonnement facturent en tant que jetons de sortie, et enmaxMême une réponse d’un mot peut dépenser la majeure partie de son budget de production à réfléchir, alors envoyezLowexplicitement pour des appels triviaux. - La sortie structurée est en mode JSON, pas en application du schéma. Utilisation
response_formatavec{"type »: « json_object"}Et décrivez les champs que vous souhaitez dans la consigne. Fournir un schéma JSON est accepté mais pas appliqué, donc validez le résultat de votre côté plutôt que de supposer la forme. - Les parties médias doivent être des URL que le service peut récupérer. Le modèle obtient
image_url,video_url, etfile_urlse cible lui-même, donc une URL derrière une connexion ou un réseau privé échouera à la requête. Lorsque le média n’est pas accessible publiquement, il faut l’intégrer en base 64 à la place.
Où aller ensuite
Ouvrir la aire de jeux pour essayer la Flash GLM 5.3 sans écrire de code, lisez le Référence API pour la liste complète des paramètres, ou parcourez la liste Catalogue de modèles pour le comparer avec le reste de la formation.



