Kimi K2.7 Code ist das neue agentische Codierungsmodell von Moonshot AI, das am 12. Juni 2026 veröffentlicht wurde. Es ist ein Trillion-Parameter-Mixture-of-Experts-Modell, das ungefähr 32B-Parameter pro Token aktiviert, speziell für die Codegenerierung, das Debugging, die Werkzeugnutzung und lange mehrstufige Engineering-Workflows. Auf Moonshots eigenem Codierungs-Benchmark springt es von 50,9 (K2.6) auf 62,0 und erzielt 81,1 Prozent auf MCPMark Verified, vor mehreren Frontier-Closed-Modellen bei der Verwendung von Agentic-Tools.
Das Modell ist live auf EmpirioLabs heute mit einem 262.144-Token-Kontextfenster, immer-on Argumentation, Funktionsaufruf, JSON-Modus strukturierte Ausgabe und Text, Bild und Video-Eingänge. Sie können es in der spielplatz oder rufen Sie es über die OpenAI-kompatible API auf. Die volle Spec lebt auf der Kimi K2.7 Codemodellseite und die API-Doku.
Preisgestaltung
Die Abrechnung basiert auf der Verwendung: Ein- und Ausgabetoken werden pro Token gemessen, und jede gestartete Websuche erhebt eine kleine Gebühr pro Anruf, die nur gilt, wenn eine Suche tatsächlich läuft. Die aktuellen Pro-Token-Raten gelten immer auf dem modellblatt. Reasoning ist für dieses Modell immer an, und Reasoning-Tokens werden als Output-Tokens in Rechnung gestellt, also budgetieren Sie Ihre maximalen Tokens in diesem Sinne.
Quickstart
Kimi K2.7 Code ist OpenAI-kompatibel, daher arbeiten die offiziellen SDKs, indem sie die Basis-URL auf EmpirioLabs zeigen:
aus openai import OpenAI client = OpenAI(api key="YOUR EMPIRIOLABS API KEY", base url=" https://api.empiriolabs.ai/v1",) response = client.chat.completions.create(model=" kimi-k2-7-code ", messages=[{"role": "user", "content": "Write a Python function that merges overlapping intervals."} ],) print(response.choices[0].message.reasoning content) # the model's reasoning print(response.choices[0].message.content) # the final answerStreaming, Funktionsaufruf, JSON-Modus, der anthropische Stil /v1/messages endpunkt und der /v1/responses endpoint all work out of the box.
Dinge zu wissen, bevor Sie bauen
Ein paar operative Details, die wir während der Heranführung des Modells bestätigt haben:
- Denken ist immer an. Jede Antwort beinhaltet
reasoning contentvor der endgültigen Antwort, und es kann nicht deaktiviert werden. Die Argumentation zählt in Richtung Output-Token und in Richtung Ihres maximalen Token-Limits, also lassen Sie den Headroom: Die API verfügt standardmäßig über ein großzügiges Output-Budget und akzeptiert bis zu 131.072 Output-Token pro Anfrage. - Die Probenahme ist festgelegt. Der Modelldienst führt gepinnte Sampling-Einstellungen aus, so
temperatur,top pUnd Strafüberschreitungen werden akzeptiert, aber ignoriert und nicht abgelehnt. Ihr vorhandener OpenAI-Code funktioniert unverändert. - Die Websuche ist eingebaut. Setz
" tool_web_search ": wahrauf jede chat-anfrage und das modell läuft sein gehostetes web-such-tool selbst: es entscheidet, wann gesucht wird, liest live-ergebnisse und zitiert quellen in der antwort. Jede aufgerufene Suche fügt eine kleine Gebühr pro Suche hinzu, die nur in Rechnung gestellt wird, wenn eine Suche tatsächlich ausgeführt und innutzung. tool_usage.web_search. - Tool Calls tragen Argumentation. Wenn sie ihre eigenen funktionsaufrufschleifen ausführen, wiederholen sie die assistenznachricht mit ihren
reasoning contentfeld intakt; der modelldienst erfordert, dass die argumentation des aktuellen zuges während des mehrstufigen werkzeugaufrufs im kontext bleibt. - Es ist wirklich multimodal. Bild- und Videoeingaben funktionieren über Standard-OpenAI-Content-Arrays, was es praktisch macht, von Screenshots oder Bildschirmaufnahmen zu debuggen.
Zusammenfassung
Kimi K2.7 Code bringt Agentic Codierung auf Frontier-Level in eine nutzungsbasierte Per-Token-API. Beginnen Sie in der spielplatzlesen sie die docsoder greifen Sie einen API-Schlüssel und richten Sie Ihr OpenAI SDK auf https://api.empiriolabs.ai/v1.
Offenlegung: Dieser Artikel wurde mit KI-Unterstützung geschrieben und von EmpirioLabs AI überprüft.



