Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.
- Erstellt:
- Aktualisiert:
- Autor:
- Roland Golla
Was ist Kimi? Moonshots KI Modellreihe 2026
Kimi ist die KI Modellreihe und der gleichnamige Assistent des chinesischen Unternehmens Moonshot AI aus Peking. Die Modelle setzen auf eine Mixture of Experts Architektur und erscheinen mit offenen Gewichten auf Hugging Face. Bekannt wurde Kimi vor allem durch den Agent Swarm, bei dem ein Orchestrator viele Sub Agenten parallel steuert.
Stand Oktober 2026 umfasst die Reihe vier wichtige Modelle:
- Kimi K3 (Juli 2026): Flaggschiff mit 2,8 Billionen Parametern, davon 104 Milliarden aktiv, und 1 Million Token Kontext
- Kimi K2.7 Code (Juni 2026): spezialisiertes Coding Modell auf K2 Basis
- Kimi K2.6 (April 2026): Agent Swarm mit bis zu 300 Sub Agenten
- Kimi K2.5 (Januar 2026): erstes nativ multimodales Kimi Modell mit Agent Swarm
Für Entwickler zählen vor allem Preis pro Leistung und die Option auf Self Hosting. Für europäische Teams kommt die Frage dazu, wo Daten landen. Beides ordnen wir auf dieser Seite ein, von K2.5 bis K3.
Kimi mit NCA: Schnelle Hilfe vom Experten
Wir arbeiten täglich mit Claude Code, OpenCode und Modellen über Ollama, lokal und in Ollama Cloud. Kimi Modelle testen wir genau in diesen Agent Setups, nicht nur im Chat. Dazu kommt unser Fokus auf DSGVO und eigene Server in Deutschland. So bewerten wir offene chinesische Modelle nach Leistung, Kosten und Datenfluss.
Bei Kimi helfen wir mit Vibe Coding Consulting für die Tool und Modellauswahl, mit unserem Überblick zu Vibe Coding Modellen für den Vergleich, mit Self Hosted KI für Unternehmen für den Betrieb offener Gewichte und mit Datenschutz und DSGVO Beratung für die rechtliche Einordnung.
Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.
Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.
Die Kimi Modellreihe 2026 im Überblick
Moonshot veröffentlicht in hohem Tempo. Zwischen Januar und Juli 2026 kamen vier große Modelle heraus. Die Tabelle zeigt die Eckdaten. Alle Werte stammen von Moonshot selbst.
Kimi K3: Das Flaggschiff seit Juli 2026
Mit Kimi K3 hat Moonshot am 16. Juli 2026 das bislang größte Modell mit offenen Gewichten vorgestellt, die Gewichte folgten Ende Juli. K3 kommt auf 2,8 Billionen Parameter, davon 104 Milliarden aktiv pro Token, und verarbeitet bis zu 1 Million Token Kontext. Ein Vision Encoder verarbeitet Bilder und Videos direkt.
Zum Start gibt es zwei Varianten:
- K3 Max für Chat und agentische Aufgaben
- K3 Swarm Max für viele parallele Agenten und hohen Durchsatz
Anders als die K2 Reihe steht K3 unter einer eigenen Lizenz. Interne Nutzung ist frei, große kommerzielle Anbieter brauchen ab bestimmten Umsatzgrenzen eine eigene Vereinbarung mit Moonshot.
K3 ist kein Schnäppchen mehr: Die API Preise liegen deutlich über denen der K2 Modelle, und für Self Hosting braucht ihr sehr viel GPU Speicher. Die ausführliche Einordnung steht auf unserer Seite zu Kimi K3.
Kimi K2.7 Code: Das Coding Modell seit Juni 2026
Kimi K2.7 Code erschien am 12. Juni 2026. Es nutzt die bewährte K2 Architektur mit 1 Billion Parametern, 32 Milliarden aktiven Parametern und 256K Kontext, ist aber gezielt auf Coding trainiert. Laut Moonshot braucht es rund 30 Prozent weniger Reasoning Token als K2.6. Der Thinking Modus ist dabei immer aktiv.
Die Gewichte stehen unter modifizierter MIT Lizenz auf Hugging Face. Nutzen lässt sich das Modell über Kimi Code CLI, die Kimi API oder per Self Hosting mit vLLM, SGLang oder KTransformers. Die Details stehen in unserem Eintrag zu Kimi K2.7 Code.
Kimi K2.6: Was war neu im April 2026?
Am 20. April 2026 erschien Kimi K2.6. Das Modell behält die MoE Architektur mit 1 Billion Parametern und 32 Milliarden aktiven Parametern pro Token. Der große Fortschritt liegt in der Stabilität über lange autonome Sessions.
Die wichtigsten Neuerungen gegenüber K2.5:
- Agent Swarm mit 300 Sub Agenten und bis zu 4000 koordinierten Schritten, statt 100 Agenten und 1500 Schritten bei K2.5
- Long Horizon Coding: autonome Coding Sessions laut Moonshot über mehr als 12 Stunden
- Native Multimodalität: der MoonViT Vision Encoder mit 400 Millionen Parametern verarbeitet Bilder und Videos direkt
- Claw Groups: offene Zusammenarbeit von Menschen und Agenten in einem gemeinsamen Schwarm
- Ollama Cloud: ab Tag 1 verfügbar, dazu bei Cloudflare Workers AI, OpenRouter und Baseten
Die Gewichte stehen unter einer modifizierten MIT Lizenz auf Hugging Face. Für Self Hosting empfiehlt Moonshot vLLM, SGLang oder KTransformers. Quantisierte Varianten wie INT4 oder GGUF laufen auf kleinerer Hardware, kosten aber Qualität. Mehr zu GGUF steht im Eintrag GGUF Quantisierung.
Kimi K2.6 in Ollama nutzen
Kimi K2.6 läuft als Cloud Modell in Ollama. Ihr braucht keine lokale GPU, Ollama stellt das Modell über die eigene Cloud bereit. Das Kontextfenster umfasst 256K Token, Eingaben dürfen Text und Bilder sein.
ollama run kimi-k2.6:cloud
In eigenen Anwendungen nutzt ihr die normale Ollama API. Ein Beispiel mit Python:
from ollama import chat
response = chat(
model='kimi-k2.6:cloud',
messages=[{'role': 'user', 'content': 'Hello!'}],
)
print(response.message.content)
K2.6 arbeitet auch mit Coding Agents wie OpenClaw, OpenCode und Hermes Agent zusammen. Die Ollama CLI startet sie direkt:
ollama launch openclaw --model kimi-k2.6:cloud
ollama launch opencode --model kimi-k2.6:cloud
Wichtig für DSGVO: Ollama Cloud verarbeitet Anfragen auf fremder Infrastruktur. Wer personenbezogene Daten verarbeitet, setzt besser auf Self Hosting der offenen Gewichte mit vLLM oder SGLang auf eigenen Servern.
Benchmarks: Kimi K2.6 im Vergleich
Kimi K2.6 trat im April 2026 direkt gegen die stärksten geschlossenen Modelle an. Die Werte stammen aus der offiziellen Evaluation von Moonshot und aus Tests von Partnern. Wie bei allen Herstellern gilt: Selbst gemessene Benchmarks kritisch lesen.
- SWE Bench Verified: 80,2 % (K2.5: 76,8 %)
- SWE Bench Pro: 58,6 % (K2.5: 50,7 %)
- HLE Full mit Tools: 54,0 % (damals GPT 5.4: 52,1 %, Claude Opus 4.6: 53,0 %)
- BrowseComp mit Agent Swarm: 86,3 % (K2.5: 78,4 %)
- Terminal Bench 2.0: 66,7 % (K2.5: 50,8 %)
- AIME 2026: 96,4 %
- GPQA Diamond: 90,5 %
Auffällig ist der Sprung bei Terminal Bench 2.0 um fast 16 Prozentpunkte. Der Benchmark misst, wie gut ein Modell Aufgaben im Terminal selbstständig löst. Das passt direkt zu Vibe Coding Workflows mit Agents wie Claude Code oder OpenCode.
Inzwischen hat Moonshot nachgelegt: K2.7 Code verbessert die Coding Werte laut Moonshot weiter, K3 spielt in einer neuen Größenklasse. Einen direkten Vergleich mit Alibabas Modell bietet unser Artikel Kimi K2.6 vs Qwen3.6 Plus.
Kimi K2.6 Preise: Frontier Coding zu einem Bruchteil der Kosten
Der eigentliche Aufreger bei Kimi K2.6 war nicht ein einzelner Benchmark, sondern Leistung pro Euro. K2.6 erreichte auf SWE Bench Pro das Niveau von GPT 5.4 und lag bei Humanity's Last Exam mit Tools sogar knapp vor den damaligen Top Modellen von OpenAI und Anthropic. Ein offenes Modell zog damit bei agentischem Coding mit der geschlossenen Spitze gleich.
Über die Moonshot API kostet K2.6 0,95 USD pro Million Input Token und 4,00 USD pro Million Output Token, Cache Treffer deutlich weniger. Das ist ein Bruchteil der Preise geschlossener Top Modelle. Wer die offenen Gewichte selbst hostet, zahlt nur die Infrastruktur. Laut Cursor baut auch das hauseigene Modell Composer 2 auf Kimi K2.5 auf, was die Bedeutung der Reihe zeigt.
Der Grund liegt in der Architektur. K2.6 nutzt Mixture of Experts mit 1 Billion Parametern, aber nur 32 Milliarden aktiven Parametern pro Token. Die Inferenzkosten verhalten sich wie bei einem 32B Modell, die Fähigkeiten liegen auf Frontier Niveau. Native INT4 Quantisierung, komprimierte KV Caches und Routing über 384 Experten senken die Hardwarekosten weiter.
Aber: Billig pro Token heißt nicht billig pro Aufgabe. Bei Reasoning lastigen Workloads verbraucht K2.6 laut Artificial Analysis deutlich mehr Reasoning Token als GPT 5.4. Die Ersparnis schrumpft dann spürbar. Bei Vibe Coding Projekten mit hohem Token Volumen lohnt die Prüfung trotzdem. Offene Gewichte machen lokale Ollama Setups oder Self Hosting auf eigenen Servern in Deutschland realistisch, bei uns mit Infrastruktur von unserem Netzwerkpartner Conversis. Wir helfen Teams bei der Modellauswahl für den eigenen Workload.
Was ist Kimi K2.5?
Kimi K2.5 ist ein nativ multimodales Open Source KI Modell von Moonshot AI. Es basiert auf einer Mixture of Experts Architektur mit 1 Billion Parametern, von denen pro Anfrage 32 Milliarden aktiv sind. Moonshot hat K2.5 im Januar 2026 unter einer modifizierten MIT Lizenz veröffentlicht. Es war das erste Kimi Modell mit Agent Swarm und gilt heute als Basis der K2.6 und K2.7 Generation.
Mixture of Experts: So funktioniert die Architektur von Kimi K2.5
Die MoE Architektur ist das Rückgrat von Kimi K2.5. Statt bei jeder Anfrage alle Parameter zu nutzen, leitet das Modell jede Eingabe an spezialisierte Experten weiter. Das hält den Rechenaufwand niedrig und die Qualität hoch:
- 1 Billion Parameter verteilt auf 384 Experten
- 32 Milliarden aktive Parameter pro Anfrage
- 61 Layer mit 64 Attention Heads
- 256K Token Kontextfenster für lange Eingaben
Ein wichtiger Baustein ist der Muon Optimizer (MomentUm Orthogonalized by Newton Schulz). Er löst ein Grundproblem beim Training großer Modelle: Klassische Optimizer wie AdamW bleiben oft in dominanten Richtungen hängen. Muon nutzt Matrix Orthogonalisierung und erkundet so einen breiteren Lösungsraum.
Die Weiterentwicklung MuonClip verhindert zusätzlich Instabilitäten beim Training mit Billionen Parametern. Laut Moonshot verdoppelt Muon die Recheneffizienz gegenüber AdamW. Erst das macht das Training so großer Modelle wirtschaftlich.
Agent Swarm: Bis zu 100 parallele KI Agenten koordinieren
Das bekannteste Feature von Kimi K2.5 ist der Agent Swarm. Statt eine Aufgabe Schritt für Schritt abzuarbeiten, startet das Modell bis zu 100 Sub Agenten gleichzeitig und koordiniert sie über bis zu 1500 Arbeitsschritte. K2.6 hat diese Grenzen später auf 300 Agenten und 4000 Schritte angehoben.
Im Zentrum steht ein trainierbarer Orchestrator Agent. Er zerlegt komplexe Aufgaben in parallele Teilaufgaben und verteilt sie an spezialisierte Sub Agenten. Moonshot nutzt dafür ein eigenes Verfahren, das Parallel Agent Reinforcement Learning:
- Phase 1: frühe Belohnung für parallele Ausführung, damit der Orchestrator nicht in sequenzielles Verhalten zurückfällt
- Phase 2: Fokus auf Qualität, 80 % Gewicht auf das Ergebnis, 20 % auf den kritischen Pfad
- Metrik: Critical Steps statt Total Steps, gemessen wird die langsamste Abhängigkeitskette
Bei breiten Rechercheaufgaben überzeugt das Konzept: Im BrowseComp Benchmark erreicht Agent Swarm 78,4 % statt 60,6 % mit dem Standard Agenten. Bei Wide Search steht es 79,0 % zu 72,7 %. Moonshot nennt eine 4,5 fache Beschleunigung gegenüber sequenziellen Agent Pipelines. Wer Multi Agent Systeme lieber selbst baut, findet Alternativen in CrewAI, LangGraph und AutoGen.
Kimi Code CLI: Open Source Alternative zu Claude Code
Parallel zum Modell hat Moonshot mit Kimi Code ein Open Source Coding Tool veröffentlicht. Es konkurriert mit Claude Code und Codex. Kimi Code läuft im Terminal und lässt sich in Editoren wie VS Code, Cursor und Zed einbinden. Heute laufen dort auch K2.7 Code und K3.
Die Besonderheit: Neben Text akzeptiert Kimi Code auch Bilder und Videos als Input. Das ermöglicht Workflows wie:
- Design zu Code: Screenshot eines Figma Entwurfs hochladen und Frontend Code erhalten
- Video zu Code: Bildschirmaufnahme eines Ablaufs zeigen, Kimi baut die Interaktion nach
- Visuelles Debugging: Screenshot eines Bugs teilen, Kimi analysiert und schlägt Fixes vor
Moonshot positioniert Kimi Code ausdrücklich als Frontend Spezialist. Auf dem internen Kimi Code Bench, der typische Aufgaben wie Build, Debug, Refactoring und Testing abdeckt, meldet das Unternehmen klare Fortschritte gegenüber K2. Wer Websites direkt mit Kimi bauen will, findet mehr im Eintrag Kimi Websites.
Vier Betriebsmodi: Von Instant bis Agent Swarm
Kimi K2.5 kennt vier Modi, je nach Aufgabe und Aufwand:
- Instant: schnelle Antworten ohne Reasoning. Empfohlene Temperatur 0,6. Ideal für einfache Fragen, Zusammenfassungen und kurze Code Snippets.
- Thinking: erweitertes Reasoning mit Chain of Thought. Temperatur 1,0. Für Mathematik, komplexes Coding und Analysen.
- Agent: einzelner Agent mit Tools wie Suche, Code Interpreter und Browser. Für Recherche und Automatisierung.
- Agent Swarm: parallele Ausführung mit vielen Agenten. Für große Aufgaben mit vielen unabhängigen Teilschritten.
Zugang gibt es über kimi.com im Web, die Kimi App, die Moonshot API auf platform.moonshot.ai und Kimi Code CLI im Terminal. Die API ist mit OpenAI und Anthropic kompatibel. Bestehende Integrationen lassen sich mit wenigen Änderungen umstellen.
Benchmark Vergleich: Kimi K2.5 vs. GPT 5.2 und Claude Opus 4.5
Die Ergebnisse vom Januar 2026 stammen überwiegend aus der eigenen Evaluation von Moonshot. Wie immer gilt: Selbst gemessene Benchmarks kritisch lesen. Einige GPT 5.2 Werte konnten laut Moonshot wegen Stabilitätsproblemen des Dienstes nicht vollständig getestet werden.
- HLE Text mit Tools: 51,8 %, deutlich über GPT 5 mit offiziell 35,2 %
- SWE Bench Multilingual: vor GPT 5.2 und Gemini 3 Pro
- VideoMMMU: führend vor GPT 5.2 und Claude Opus 4.5 beim Video Reasoning
- BrowseComp mit Agent Swarm: 78,4 % statt 60,6 % mit Standard Agent
- BrowseComp Standard: 74,9 % gegenüber 59,2 % bei GPT 5.2 laut Codecademy
Wichtiger Kontext: Moonshot misst teils unter eigenen Bedingungen und markiert nachgemessene Werte mit Sternchen. Der HLE Wert mit Tools hängt stark vom Kontextmanagement ab: Ab einer Schwelle behält das Modell nur die neuesten Tool Nachrichten. Das schränkt die Vergleichbarkeit ein.
Kimi K2.5 für Entwickler: API, Self Hosting und Deployment
Moonshot bietet mehrere Wege, Kimi in eigene Projekte zu bringen:
- Offizielle API über platform.moonshot.ai, kompatibel mit den SDKs von OpenAI und Anthropic
- Self Hosting mit vLLM oder SGLang als empfohlenen Inference Engines
- Hugging Face mit den Gewichten im Block FP8 Format, Überblick im Eintrag Hugging Face
- NVIDIA NIM für optimierte Inferenz auf NVIDIA Hardware
Für Self Hosting von K2.5 braucht ihr transformers ab Version 4.57.1. Video als Input lief zum Release nur über die offizielle API. Bei eigenen Deployments mit vLLM oder SGLang war das Feature als experimentell markiert.
Die API Kosten für K2.5 lagen laut Codecademy bei 0,60 USD pro Million Input Token und 2,50 USD pro Million Output Token. Die Nachfolger K2.6 und K2.7 Code kosten bei Moonshot 0,95 USD und 4,00 USD, K3 liegt deutlich darüber. Preise ändern sich schnell, prüft vor Projektstart immer die aktuelle Preisliste.
Moonshot AI: Das Unternehmen hinter Kimi
Moonshot AI wurde im März 2023 in Peking von drei Absolventen der Tsinghua Universität gegründet: Yang Zhilin (CEO), Zhou Xinyu und Wu Yuxin. Der Name ist eine Hommage an das Pink Floyd Album The Dark Side of the Moon. Yang Zhilin nennt AGI als erklärtes Ziel. Seine Meilensteine dorthin: verlustfreie Verarbeitung langer Kontexte, multimodale Weltmodelle und eine Architektur, die sich selbst weiter verbessert.
Die Entwicklung im Zeitraffer:
- Oktober 2023: Start des Kimi Chatbots mit 128K Token Kontext
- Februar 2024: Finanzierungsrunde über 1 Milliarde US Dollar, angeführt von Alibaba
- Juli 2025: Kimi K2 als offenes MoE Modell
- November 2025: Kimi K2 Thinking mit erweitertem Reasoning
- Januar 2026: Kimi K2.5 mit nativer Multimodalität und Agent Swarm
- April 2026: Kimi K2.6 mit Swarm für 300 Sub Agenten
- Juni 2026: Kimi K2.7 Code
- Juli 2026: Kimi K3 mit 2,8 Billionen Parametern und Finanzierungsrunde bei einer Bewertung von 35 Milliarden US Dollar
Moonshot gehört damit zu den wertvollsten KI Unternehmen Chinas. Einen Überblick über die Konkurrenz aus China gibt unser Artikel zu chinesischen KI Modellen für AI Coding.
Kimi für europäische Teams: DSGVO, Lizenz und Self Hosting
Kimi ist technisch beeindruckend: Native Multimodalität, Agent Swarm und offene Gewichte machen die Reihe zu einer der spannendsten im Jahr 2026. Für Teams, die mit Multi Agent Systemen arbeiten oder günstige Alternativen zu proprietären Modellen suchen, lohnt ein genauer Blick.
Aber: Moonshot AI ist ein chinesisches Unternehmen. Wer die offizielle API oder die Kimi App nutzt, schickt Daten an Moonshot. Für europäische Unternehmen stellen sich damit Fragen zu DSGVO, Datenstandort und rechtlicher Absicherung. Auch die Lizenzen unterscheiden sich:
- K2 Reihe: modifizierte MIT Lizenz, Attribution erst ab 100 Millionen monatlichen Nutzern oder 20 Millionen US Dollar Monatsumsatz
- K3: eigene Lizenz, interne Nutzung frei, große kommerzielle Anbieter brauchen eine eigene Vereinbarung
Self Hosting entschärft viele Bedenken. Wer das Modell auf eigener Infrastruktur betreibt, behält die Kontrolle über die Daten. Wie das rechtlich und technisch aussieht, zeigen unsere Seiten zu lokaler KI für Compliance und Self Hosted KI für Unternehmen. Den größeren Rahmen liefert unser Beitrag zur digitalen Souveränität.
Kimi K2.6 raises the bar for open-source models.
Kimi K3 ist Moonshots offenes 2,8 Billionen Parameter Modell mit 1 Million Token Kontext. NCA ordnet das KI Modell für Vibe Coding Teams 2026 ein.
Mehr erfahrenKimi in der NCA Beratung
Kimi taucht in unserer Beratung vor allem bei Teams auf, die hohe Token Mengen für Coding Agents haben und Kosten senken wollen. Wir vergleichen Kimi dann mit anderen offenen Modellen wie Qwen und DeepSeek und mit europäischen Optionen wie Mistral AI. Entscheidend ist der echte Workload, nicht die Benchmark Tabelle.
Unser Vorgehen ist immer gleich: Aufgaben aus eurem Alltag sammeln, mit zwei oder drei Modellen in Claude Code oder OpenCode testen, Kosten pro Aufgabe messen. Danach klären wir, ob die API reicht oder ob Self Hosting nötig ist. Wer die neueste Generation prüfen will, startet mit unserem Eintrag zu Kimi K2.7 Code. Für Entwickler, die den Umgang mit Agents lernen wollen, gibt es unser 1:1 Vibe Coding Mentoring.
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Häufige Fragen zu Kimi
Die wichtigsten Fragen und Antworten zur Kimi Modellreihe von Moonshot AI, von K2.5 über K2.6 und K2.7 Code bis K3, von der Architektur über Agent Swarm bis zum Einsatz in der Praxis.
Kimi ist die KI Modellreihe und der Assistent von Moonshot AI aus Peking. Die Modelle nutzen Mixture of Experts und erscheinen mit offenen Gewichten. Stand Oktober 2026 ist Kimi K3 das Flaggschiff, daneben gibt es K2.7 Code für Coding sowie K2.6 und K2.5. Bekannt ist die Reihe für den Agent Swarm mit vielen parallelen Sub Agenten.
Kimi K3 erschien am 16. Juli 2026, die Gewichte folgten Ende Juli. Das Modell hat 2,8 Billionen Parameter, davon 104 Milliarden aktiv, und verarbeitet 1 Million Token Kontext. Es gibt die Varianten K3 Max und K3 Swarm Max. K3 steht unter einer eigenen Lizenz und kostet über die API deutlich mehr als die K2 Modelle.
Kimi K2.7 Code ist ein auf Coding spezialisiertes Modell, erschienen am 12. Juni 2026. Es nutzt die K2 Architektur mit 1 Billion Parametern und 32 Milliarden aktiven Parametern sowie 256K Kontext. Laut Moonshot braucht es rund 30 Prozent weniger Reasoning Token als K2.6. Die Gewichte stehen unter modifizierter MIT Lizenz bereit.
Kimi K2.6 skaliert den Agent Swarm von 100 auf 300 parallele Sub Agenten mit bis zu 4000 koordinierten Schritten. Autonome Coding Sessions hält das Modell laut Moonshot über mehr als 12 Stunden stabil. Neu waren außerdem Claw Groups für offene Zusammenarbeit von Menschen und Agenten sowie die Verfügbarkeit in Ollama Cloud ab dem ersten Tag.
Ein trainierbarer Orchestrator zerlegt eine Aufgabe in parallele Teilschritte und verteilt sie an spezialisierte Sub Agenten. Bei K2.5 waren es bis zu 100 Agenten, bei K2.6 bis zu 300. Moonshot trainiert das mit Parallel Agent Reinforcement Learning, das frühe Parallelisierung belohnt. K3 führt das Konzept mit der Variante K3 Swarm Max fort.
Die K2 Reihe mit K2.5, K2.6 und K2.7 Code steht unter einer modifizierten MIT Lizenz. Sie erlaubt weitgehende Nutzung und verlangt erst bei sehr großen Produkten eine Attribution. Kimi K3 nutzt eine eigene Lizenz: Interne Nutzung ist frei, große kommerzielle Anbieter brauchen eine eigene Vereinbarung mit Moonshot. Die Gewichte liegen jeweils auf Hugging Face.
Kimi K2.6 läuft als Cloud Modell in Ollama, eine lokale GPU braucht ihr nicht. Der Aufruf lautet ollama run kimi-k2.6:cloud. Das Modell akzeptiert Text und Bilder bei 256K Token Kontext. Für Coding Agents wie OpenClaw oder OpenCode gibt es direkte Integrationen über ollama launch. Für personenbezogene Daten ist Self Hosting die sicherere Wahl.
Kimi K2.6 und K2.7 Code kosten über die Moonshot API 0,95 USD pro Million Input Token und 4,00 USD pro Million Output Token, Cache Treffer deutlich weniger. Kimi K3 liegt preislich klar darüber. Wer die offenen Gewichte selbst hostet, zahlt nur Hardware und Betrieb. Prüft vor Projektstart immer die aktuelle Preisliste von Moonshot.
Mit Self Hosting auf eigener europäischer Infrastruktur ist das möglich, denn dann verlassen keine Daten euer Netz. Empfohlene Inference Engines sind vLLM, SGLang und KTransformers. Für den vollen Betrieb braucht ihr Multi GPU Hardware, quantisierte Varianten laufen kleiner. Bei der offiziellen API gehen Daten an Moonshot, dort ist Vorsicht geboten.
Moonshot AI wurde im März 2023 in Peking von Yang Zhilin, Zhou Xinyu und Wu Yuxin gegründet, alle drei Absolventen der Tsinghua Universität. Yang Zhilin ist CEO. Im Juli 2026 schloss Moonshot eine Finanzierungsrunde bei einer Bewertung von 35 Milliarden US Dollar ab und gehört damit zu den wertvollsten KI Unternehmen Chinas.
Kimi Code ist das Open Source Coding Tool von Moonshot für Terminal und Editoren wie VS Code, Cursor und Zed. Es akzeptiert neben Text auch Bilder und Videos, etwa für Design zu Code oder visuelles Debugging. Inzwischen laufen dort auch K2.7 Code und K3. Kimi Code ist besonders stark bei Frontend Aufgaben.
Claw Groups ist ein Research Preview Feature von K2.6 für offene Multi Agent Zusammenarbeit. Menschen und Agenten arbeiten von beliebigen Geräten und mit beliebigen Modellen in einem gemeinsamen Schwarm. K2.6 übernimmt die Koordination und verteilt Aufgaben dynamisch. Das Konzept zeigt, wohin sich Agent Workflows entwickeln.
Kimi K2.6 erzielt laut Moonshot 80,2 Prozent auf SWE Bench Verified, 58,6 Prozent auf SWE Bench Pro und 54,0 Prozent auf HLE Full mit Tools. Beim Terminal Bench 2.0 stieg der Wert von 50,8 auf 66,7 Prozent. Die Werte stammen teils aus eigener Evaluation von Moonshot und sollten entsprechend kritisch gelesen werden.
Kimi K2 war ein reines Sprachmodell. Kimi K2.5 ergänzt native Multimodalität mit Bild und Videoverarbeitung über den MoonViT Vision Encoder mit 400 Millionen Parametern. Dazu kamen Agent Swarm für parallele Multi Agent Ausführung und Kimi Code CLI als Open Source Coding Tool. Die Architektur mit 1 Billion Parametern blieb gleich.
Offene Alternativen sind DeepSeek V4, Qwen von Alibaba und GLM von Z.AI, aus Europa kommt Mistral mit offenen Modellen. Geschlossene Alternativen sind Claude von Anthropic, die GPT Modelle von OpenAI und Gemini von Google. Für eigene Multi Agent Systeme eignen sich Frameworks wie CrewAI, LangGraph oder AutoGen als Ergänzung.