
Modelo de texto GLM-4.7 leve gratuito para codificação, raciocínio, escrita de longo contexto e chat geral.
Modelo de texto GLM-4.7 leve gratuito para codificação, raciocínio, escrita de longo contexto e chat geral.
O uso do token base é gratuito. Built-in busca web é opcional através de tool_web_search e adiciona $0.033 por solicitação quando habilitado. Suporta ferramentas de função, tool choice auto, JSON response format, thinking controles, tool stream, temperatura, top p, do sample, max tokens, stop, and streaming.
Também conhecido como GLM Flash, Z.ai GLM 4.7 Flash, GLM-4.7-Flash, glm-4-7-flash
glm-4-7-flash/v1/chat/completionsPOST/v1/responsesPOST/v1/messagesPOST/v1beta/models/glm-4-7-flash:generateContentglm-4.7-flashzai/glm-4.7-flashzhipu/glm-4.7-flashTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
GLM 4.7 Flash atende a API Chat Completions compatível com OpenAI. Aponte qualquer SDK OpenAI para https://api.empiriolabs.ai/v1 com sua chave de API EmpirioLabs e use o id de modelo glm-4-7-flash. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/chat/completions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-4-7-flash",
"messages": [
{"role": "user", "content": "Write a haiku about the ocean."}
]
}'from openai import OpenAI
client = OpenAI(
base_url="https://api.empiriolabs.ai/v1",
api_key="YOUR_EMPIRIOLABS_API_KEY",
)
response = client.chat.completions.create(
model="glm-4-7-flash",
messages=[{"role": "user", "content": "Write a haiku about the ocean."}],
)
print(response.choices[0].message.content)Parâmetros de requisição suportados pela API GLM 4.7 Flash na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| temperature | number | 1 | 0 a 1 | Temperatura de amostragem. Valores mais baixos são mais determinísticos. GLM-4.7-Flash e GLM-4.6V-Flash como padrão para 1.0; GLM-4.5-Flash tem como padrão 0.6. |
| top_p | number | 0.95 | 0.01 a 1 | Amostragem do núcleo com a probabilidade de massa. Z.AI documenta um padrão de 0,95 para as séries GLM-4.7, GLM-4.6 e GLM-4.5. |
| max_tokens | number | 4096 | 1 a 131072 | Tokens máximos de saída para GLM-4.7-Flash: 131072. |
| stop | array | - | - | Lista de palavras de parada. Z.AI atualmente suporta uma cadeia de um stop em formato de array. |
| do_sample | boolean | true | - | Ative a amostragem. Quando falso, temperatura e top_p não afetam a geração. |
| enable_thinking | boolean | true | - | Controles Z.AI modo pensamento. Ativado é o padrão e faz o GLM-4.7-Flash pensar; Desative para turnos simples de baixa latência. |
| thinking | object | - | - | Objeto de pensamento avançado. Use {"type":"enabled"} ou {"type":"disabled"}. O GLM-4.7-Flash pensa quando ativado. |
| tools | array | - | - | Ferramentas funcionais e a ferramenta web_search embutida são suportadas. |
| tool_choice | enum | auto | auto | Determina se o modelo pode usar ferramentas. Z.AI documentos de seleção automática de ferramentas; Omita ferramentas para desabilitar o uso de ferramentas. |
| tool_stream | boolean | false | - | A ferramenta de chamada de função do fluxo é saída quando o fluxo é verdadeiro. Z.AI documentos tool_stream para o GLM-4.6 e modelos mais recentes. |
| tool_web_search | boolean | false | - | Ative a busca web embutida. Adiciona $0.033 por requisição quando ativado. |
| search_result | boolean | true | - | Retorne metadados estruturados dos resultados da busca web quando a busca na web estiver habilitada. |
| search_prompt | string | - | - | Instrução opcional para resumir resultados de busca web recuperados. |
| count | number | 10 | 1 a 50 | Número de resultados de busca na web para recuperar. |
O uso do token base é gratuito. Built-in busca web é opcional através de tool_web_search e adiciona $0.033 por solicitação quando habilitado.
Na EmpirioLabs, GLM 4.7 Flash é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
GLM 4.7 Flash suporta uma janela de contexto de 200K tokens com até 131.072 tokens de saída por resposta.
Sim. GLM 4.7 Flash atende a API Chat Completions compatível com OpenAI, então SDKs OpenAI existentes funcionam apontando base_url para https://api.empiriolabs.ai/v1 e definindo o id de modelo glm-4-7-flash.
Sim. O playground da EmpirioLabs executa GLM 4.7 Flash no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.