GLM 4.6V Flash API

Modèle multimodal GLM-4.6V gratuit pour la compréhension d’images, vidéos, fichiers et texte avec appel de fonction natif.

Z.aiGénération de texte128K contextePublié 8 déc. 2025SingaporeEndpoint propriétaire

À propos de GLM 4.6V Flash

Modèle multimodal GLM-4.6V gratuit pour la compréhension d’images, vidéos, fichiers et texte avec appel de fonction natif.

L’utilisation de base des jetons est gratuite. La recherche web intégrée est optionnelle via tool_web_search et ajoute $0.033 par requête lorsqu’elle est activée. Prend en charge les outils de saisie de texte, d’images, de vidéos et de fichiers ainsi que des outils fonctionnels, tool_choice auto, JSON response_format, contrôles de réflexion, tool_stream, température, top_p, do_sample, max_tokens, stop et streaming.

Aussi connu sous le nom Z.ai GLM 4.6V Flash, GLM-4.6V-Flash, glm-4-6v-flash

visionvideo understandingdocument understandingfunction callingweb searchreasoning

Caractéristiques de GLM 4.6V Flash

ID du modèle
glm-4-6v-flash
Fournisseur
Z.ai
Catégorie
Génération de texte
Publié
8 déc. 2025
Fenêtre de contexte
128K tokens
Sortie max
32 768 tokens
Entrée
TexteImageVidéoFichier
Sortie
Texte
Sortie structurée
Mode JSON
Région
Singapore
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-4-6v-flash:generateContent
Identifiants de modèle alternatifs
glm-4.6v-flashzai/glm-4.6v-flashzhipu/glm-4.6v-flash

Tarifs de l'API GLM 4.6V Flash

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Entrée
par jetons 1M
Gratuit
Produit
par jeton généré 1M
Gratuit
cache implicite lu
par jetons d'entrée en cache 1M
Gratuit
Recherche Web
par demande lorsqu'elle est activée
$0.033
Comparer sur la page complète des tarifs

Comment appeler l'API GLM 4.6V Flash

GLM 4.6V Flash sert l'API Chat Completions compatible OpenAI. Pointez n'importe quel SDK OpenAI vers https://api.empiriolabs.ai/v1 avec votre clé API EmpirioLabs et utilisez l'id de modèle glm-4-6v-flash. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-4-6v-flash",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="glm-4-6v-flash",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Référence complète de l'API GLM 4.6V Flash

Paramètres de l'API GLM 4.6V Flash

Paramètres de requête pris en charge par l'API GLM 4.6V Flash sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
temperaturenumber10 à 1Température d’échantillonnage. Les valeurs plus basses sont plus déterministes. GLM-4.7-Flash et GLM-4.6V-Flash par défaut à 1.0; GLM-4.5-Flash est par défaut à 0,6.
top_pnumber0.950.01 à 1Probabilité d’échantillonnage du noyau, masse. Z.AI documente un taux par défaut de 0,95 pour les séries GLM-4.7, GLM-4.6 et GLM-4.5.
max_tokensnumber40961 à 32768Jetons de sortie maximaux pour GLM-4.6V-Flash: 32768.
stoparray--Liste de mots stop. Z.AI prend actuellement en charge une chaîne de stop sous forme de tableau.
do_samplebooleantrue-Activez l’échantillonnage. Lorsqu’ils sont faux, la température et top_p n’affectent pas la génération.
enable_thinkingbooleantrue-Les contrôles Z.AI mode réflexion. Activé est la valeur par défaut; GLM-4.6V-Flash décide automatiquement s’il faut réfléchir lorsqu’il est activé.
thinkingobject--Objet de pensée avancée. Utilisez {"type »:"enabled"} ou {"type »:"disabled"}. GLM-4.6V-Flash décide automatiquement s’il faut réfléchir lorsqu’il est activé.
toolsarray--Les outils fonctionnels et l’outil de web_search intégré sont pris en charge.
tool_choiceenumautoautoContrôle si le modèle peut utiliser des outils. Z.AI documents la sélection automatique des outils; Omettez les outils pour désactiver l’utilisation des outils.
tool_streambooleanfalse-Sortie de l’outil d’appel de fonction du flux lorsque le flux est vrai. Z.AI documents tool_stream pour le GLM-4.6 et les modèles plus récents.
tool_web_searchbooleanfalse-Activez la recherche web intégrée. Ajoute $0.033 par requête lorsqu’il est activé.
search_resultbooleantrue-Retournez les métadonnées structurées des résultats de recherche web lorsque la recherche web est activée.
search_promptstring--Instruction optionnelle pour résumer les résultats de recherche web récupérés.
countnumber101 à 50Nombre de résultats de recherche web à récupérer.
3 paramètres de plus dans la doc

Bon à savoir

L’utilisation de base des jetons est gratuite. La recherche web intégrée est optionnelle via tool_web_search et ajoute $0.033 par requête lorsqu’elle est activée.

API GLM 4.6V Flash : questions fréquentes

Combien coûte l'API GLM 4.6V Flash ?

Sur EmpirioLabs, GLM 4.6V Flash est facturé à l'usage. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quelle est la fenêtre de contexte de GLM 4.6V Flash ?

GLM 4.6V Flash prend en charge une fenêtre de contexte de 128K tokens avec jusqu'à 32 768 tokens de sortie par réponse.

L'API GLM 4.6V Flash est-elle compatible OpenAI ?

Oui. GLM 4.6V Flash sert l'API Chat Completions compatible OpenAI : les SDKs OpenAI existants fonctionnent en pointant base_url vers https://api.empiriolabs.ai/v1 et en utilisant l'id de modèle glm-4-6v-flash.

Puis-je essayer GLM 4.6V Flash dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute GLM 4.6V Flash dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API GLM 4.6V Flash ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.