GLM 4.7 Flash API

Modelo de texto GLM-4.7 gratuito y ligero para codificación, razonamiento, escritura en contexto largo y chat general.

Z.aiGeneracion de texto200K contextoLanzado 19 ene 2026SingaporeEndpoint propietario

Acerca de GLM 4.7 Flash

Modelo de texto GLM-4.7 gratuito y ligero para codificación, razonamiento, escritura en contexto largo y chat general.

El uso base de fichas es gratuito. La búsqueda web integrada es opcional a través de tool_web_search y añade $0.033 por solicitud cuando está activada. Soporta herramientas funcionales, tool_choice auto, JSON response_format, controles de pensamiento, tool_stream, temperatura, top_p, do_sample, max_tokens, stop y streaming.

También conocido como GLM Flash, Z.ai GLM 4.7 Flash, GLM-4.7-Flash, glm-4-7-flash

reasoningfunction callingweb search

Especificaciones de GLM 4.7 Flash

ID del modelo
glm-4-7-flash
Proveedor
Z.ai
Categoría
Generacion de texto
Lanzado
19 ene 2026
Ventana de contexto
200K tokens
Salida máxima
131.072 tokens
Entrada
Texto
Salida
Texto
Salida estructurada
Modo JSON
Región
Singapore
Endpoints
POST/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-4-7-flash:generateContent
IDs de modelo alternativos
glm-4.7-flashzai/glm-4.7-flashzhipu/glm-4.7-flash

Precios de la API de GLM 4.7 Flash

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Entrada
por 1M de tokens de prompt
Gratis
Producto
por 1M de tokens generados
Gratis
Caché implícita
por fichas de entrada en caché de 1M
Gratis
Búsqueda web
por solicitud cuando esté habilitada
$0.033
Comparar en la página completa de precios

Cómo llamar a la API de GLM 4.7 Flash

GLM 4.7 Flash sirve la API de Chat Completions compatible con OpenAI. Apunta cualquier SDK de OpenAI a https://api.empiriolabs.ai/v1 con tu clave de API de EmpirioLabs y usa el id de modelo glm-4-7-flash. Consigue una clave de API en el panel de EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/chat/completions \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-4-7-flash",
    "messages": [
      {"role": "user", "content": "Write a haiku about the ocean."}
    ]
  }'
Python (OpenAI SDK)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.empiriolabs.ai/v1",
    api_key="YOUR_EMPIRIOLABS_API_KEY",
)

response = client.chat.completions.create(
    model="glm-4-7-flash",
    messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)
Referencia completa de la API de GLM 4.7 Flash

Parámetros de la API de GLM 4.7 Flash

Parámetros de solicitud compatibles con la API de GLM 4.7 Flash en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
temperaturenumber10 a 1Temperatura de muestreo. Los valores más bajos son más deterministas. GLM-4.7-Flash y GLM-4.6V-Flash por defecto en 1.0; GLM-4.5-Flash por defecto es 0.6.
top_pnumber0.950.01 a 1Masa de probabilidad de muestreo del núcleo. Z.AI documenta un valor predeterminado de 0,95 para las series GLM-4.7, GLM-4.6 y GLM-4.5.
max_tokensnumber40961 a 131072Tokens máximos de salida para GLM-4.7-Flash: 131072.
stoparray--Lista de palabras de parada. Z.AI actualmente soporta cadena de un solo paso en forma de array.
do_samplebooleantrue-Habilitar el muestreo. Cuando es falso, la temperatura y la top_p no afectan a la generación.
enable_thinkingbooleantrue-Los controles Z.AI modo pensamiento. Activado es el valor predeterminado y hace que GLM-4.7-Flash piense; Desactivala para giros sencillos de baja latencia.
thinkingobject--Objeto de pensamiento avanzado. Usa {"type":"enabled"} o {"type":"disabled"}. GLM-4.7-Flash piensa cuando está habilitado.
toolsarray--Se soportan herramientas funcionales y la herramienta web_search integrada.
tool_choiceenumautoautoControla si el modelo puede usar herramientas. Z.AI documentos de selección automática de herramientas; Omite herramientas para desactivar el uso de herramientas.
tool_streambooleanfalse-Salida de la herramienta de llamada de función de flujo cuando el flujo es verdadero. Z.AI documentos tool_stream para GLM-4.6 y modelos más recientes.
tool_web_searchbooleanfalse-Activa la búsqueda web integrada. Añade $0.033 por petición cuando está activado.
search_resultbooleantrue-Devuelve los metadatos estructurados de los resultados de búsqueda web cuando la búsqueda web esté habilitada.
search_promptstring--Instrucción opcional para resumir los resultados de búsqueda web recuperados.
countnumber101 a 50Número de resultados de búsqueda web por recuperar.
3 parámetros más en la documentación

Información útil

El uso base de fichas es gratuito. La búsqueda web integrada es opcional a través de tool_web_search y añade $0.033 por solicitud cuando está activada.

API de GLM 4.7 Flash: preguntas frecuentes

¿Cuánto cuesta la API de GLM 4.7 Flash?

En EmpirioLabs, GLM 4.7 Flash se factura por uso. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Cuál es la ventana de contexto de GLM 4.7 Flash?

GLM 4.7 Flash admite una ventana de contexto de 200K tokens con hasta 131.072 tokens de salida por respuesta.

¿La API de GLM 4.7 Flash es compatible con OpenAI?

Sí. GLM 4.7 Flash sirve la API de Chat Completions compatible con OpenAI, así que los SDKs de OpenAI existentes funcionan apuntando base_url a https://api.empiriolabs.ai/v1 y usando el id de modelo glm-4-7-flash.

¿Puedo probar GLM 4.7 Flash en el navegador antes de integrar?

Sí. El playground de EmpirioLabs ejecuta GLM 4.7 Flash en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.

¿Cómo consigo una clave de API de GLM 4.7 Flash?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.