Kimi K2.7 Código é o novo modelo de codificação agente da Moonshot IA, lançado em 12 de junho de 2026. É um modelo Mixture-of-Experts de trilhões de parâmetros que ativa aproximadamente 32B parâmetros por token, sintonizado especificamente para geração de código, depuração, uso de ferramentas e longos fluxos de trabalho de engenharia multi-step. No benchmark de codificação próprio de Moonshot ele salta de 50,9 (K2.6) para 62,0, e ele marca 81,1 por cento no MCPMark Verificado, à frente de vários modelos de fronteira fechados no uso de ferramenta agente.
O modelo está ao vivo no EmpirioLabs hoje com uma janela de contexto 262.144-token, sempre em raciocínio, chamada de função, saída estruturada modo JSON, e entradas de texto, imagem e vídeo. Você pode tentar no playground ou chamá-lo através da API compatível com OpenAI. A especificação completa vive no Kimi K2.7 Página do modelo de código e o Documentos de API.
Preços
A cobrança é baseada no uso: os tokens de entrada e saída são medidos por token, e cada busca web invocada adiciona uma pequena taxa por chamada que se aplica apenas quando a busca realmente é executada. As taxas atuais por token sempre estão disponíveis no página do modelo. Raciocínio está sempre ligado para este modelo, e tokens de raciocínio são faturados como tokens de saída, então orçamento seus tokens max com isso em mente.
Início rápido
Kimi K2.7 Código é compatível com OpenAI, então os SDKs oficiais funcionam apontando a URL base para EmpirioLabs:
do openai import OpenAI client = OpenAI(api key="YOUR EMPIRIOLABS API KEY", base url=" https://api.empiriolabs.ai/v1",) response = client.chat.completions.create(model=" kimi-k2-7-code ", messages=[ {"role": "user", "content": "Write a Python function that merges sobreponding intervales."} ],) print(resposta. choices[0].message.raking content) # the model's raciocine print(resposta. choices[0].mesage.content) # the final responseTransmissão, chamada de funções, modo JSON, estilo Antrópico /v1/messages ed /v1/responses endpoint todo o trabalho fora da caixa.
Coisas para saber antes de construir
Alguns detalhes operacionais que confirmamos ao trazer o modelo para cima:
- Pensar está sempre de pé. Cada resposta inclui
raciocinar conteúdoantes da resposta final, não pode ser desactivada. Raciocínio conta para tokens de saída e para o limite máximo de tokens, então deixe o headroom: a API é padrão para um orçamento de saída generoso e aceita até 131.072 tokens de saída por solicitação. - A amostragem é fixa. O serviço do modelo executa configurações de amostragem fixas, então
temperatura,topo p, e anulações de pena são aceitas, mas ignoradas em vez de rejeitadas. O seu código OpenAI existente funciona inalterado. - A pesquisa na web está integrada. Definir
" tool_web_search ": trueem qualquer solicitação de bate-papo e o modelo executa sua própria ferramenta de busca hospedada na web: decide quando pesquisar, lê resultados ao vivo e cita fontes na resposta. Cada pesquisa invocada adiciona uma pequena taxa por pesquisa, cobrada apenas quando uma pesquisa realmente é executada e reportada emuse. tool_usage.web_search. - Chamadas de ferramentas carregam raciocínio. Quando você executar seus próprios loops de chamadas de função, replay a mensagem assistente com sua
raciocinar conteúdocampo intacto; o serviço do modelo requer o raciocínio do turn atual para permanecer no contexto durante a chamada de ferramentas multi-step. - É genuinamente multimodal. Entradas de imagem e vídeo funcionam através de arrays de conteúdo padrão do OpenAI, o que torna prático depurar imagens ou gravações de tela.
Resumo
Kimi K2.7 O código traz codificação agentic de nível de fronteira para uma API de uso, per-token. Iniciar na playground, ler dogs, ou pegue uma chave API e aponte o seu OpenAI SDK para https://api.empiriolabs.ai/v1.
Divulgação: Este artigo foi escrito com assistência de IA e revisado por EmpirioLabs IA.



