Dies ist eine umfassende, von A bis Z gehende Aufschlüsselung dessen, was Kimi K3 tatsächlich ist, was es kann und warum es sich im Stillen zum wichtigsten Coding-Modell entwickelt, über das noch niemand spricht.
Setze ein Lesezeichen für diese Seite, damit du diesen Artikel nicht verlierst.
2,8 Billionen Parameter. 1 Million Token Kontext.
Hier ist alles, was drin steckt.
Bevor wir über Benchmarks sprechen, reden wir darüber, was gerade passiert ist
Die letzten drei Jahre war die Geschichte immer dieselbe: Amerikanische Labore bauen die Spitze, chinesische Labore bauen die billige Kopie sechs Monate später.
Am 16. Juli veröffentlichte Moonshot AI Kimi K3.
https://x.com/Kimi_Moonshot/status/2077830229968683203
2,8 Billionen Gesamtparameter – etwa 75 % größer als DeepSeek's V4 Pro und fast 4x Zhipu's GLM 5 Serie. Das größte je veröffentlichte Open-Source-Modell.
Es übertrifft Claude Opus 4.8. Es übertrifft GPT-5.6 Sol. Und in Moonshots Benchmarks liegt es auf Augenhöhe mit Fable 5 – dem leistungsfähigsten Modell, das der Öffentlichkeit derzeit zur Verfügung steht.
Die Kopiergeschichte ist vorbei.
Die Zahlen

Diese letzte Zeile ist die, die die Leute falsch lesen. Gehen wir das richtig an.
Die Preisrealität – Lies das genau
Kimi K3 ist kein Discount-Modell. Mit 3/15 $ pro Million Tokens liegt der Preis etwa auf dem Niveau von Claude Sonnet – nicht bei den tiefen Rabatten, die Moonshots frühere Versionen boten.
Woher kommt also „5x günstiger als Fable 5"?
Kosten pro Aufgabe, nicht Preis pro Token.
K3 verwendet erheblich weniger Ausgabe-Tokens, um dieselbe Arbeit zu erledigen. Bei einer repräsentativen Programmieraufgabe kostet Fable 5 etwa 1,30 $. K3 kostet etwa 0,25 $.
Gleiche Ausgabeebene. Weniger Tokens. Niedrigere Gesamtrechnung.
Die ehrliche Einordnung: Sonnet-Preis, Fable-Niveau-Erfahrung. Du kaufst nicht die billigsten Tokens auf dem Markt. Du kaufst Spitzenleistung zu Mittelklasse-Preisen und erreichst sie in weniger Schritten.
Wenn du die reinen Token-Preise vergleichst, sieht K3 unspektakulär aus. Wenn du vergleichst, was es kostet, eine Aufgabe zu erledigen, ist das eine ganz andere Diskussion.
Wo Kimi K3 State of the Art ist
Laut Moonshots veröffentlichten Benchmarks setzt K3 SOTA in:
- HLE mit Tools – Humanity's Last Exam, toolunterstützt
- SWE-Bench Pro – reale Softwareentwicklung
- SWE-Bench Multilingual – Entwicklung über mehrere Sprachen
- BrowseComp – Webbrowsing und Recherche
- Toolathlon – Tool-Nutzung in großem Maßstab
- CharXiv mit Python – Diagramm- und Figurenlogik
- MathVision mit Python – visuelle Mathematik

Gegen die Konkurrenz: übertrifft Opus 4.8 und GPT-5.6 Sol, auf Augenhöhe mit Fable 5.
In Blindtests des KI-Evaluators Arena bevorzugten Entwickler Kimi gegenüber jedem führenden US-Modell.
Die zwei Architekturinnovationen, die wirklich zählen
Dies ist der Teil, den die meisten Berichterstattungen überspringen, und es ist das Interessanteste an der Veröffentlichung.

- Kimi Delta Attention (KDA)
Ein hybrider linearer Aufmerksamkeitsmechanismus. Das Ergebnis: bis zu 6,3x schnellere Dekodierung in Million-Token-Kontexten.
Ein 1M-Kontextfenster ist nur nützlich, wenn du tatsächlich darin arbeiten kannst, ohne ewig zu warten. KDA macht das Kontextfenster praktisch statt theoretisch.
- Attention Residuals (AttnRes)
Ein Drop-in-Ersatz für Residualverbindungen. Liefert etwa 25 % höhere Trainingseffizienz bei unter 2 % Mehrkosten.
Beide Techniken wurden vom Moonshot-Team als offene Forschung auf GitHub veröffentlicht, bevor das Modell ausgeliefert wurde. Das ist kein Marketing – es ist peer-inspizierbare Arbeit.
Und zusammen erklären sie die Token-Effizienz: K3 verwendet 21 % weniger Ausgabe-Tokens als K2.6 bei gleichwertigen Aufgaben.
Der Teil, der dich aufhorchen lassen sollte: K3 optimierte seine eigene Architektur
Moonshot gab K3 die Implementierung von Attention Residuals – seiner eigenen Architekturkomponente – und ein Ziel: mach es schneller auf H200-Hardware, ohne das numerische Verhalten zu ändern.
Dann ließen sie es in Ruhe.
20 Stunden Experimente. Null menschliche Eingriffe. 1,6x Beschleunigung.
In einem separaten Durchlauf verkürzte K3 die FLA Triton AttnRes Vorwärts-/Rückwärtszeit von 283,6 ms auf 114,4 ms – eine 2,48x Beschleunigung – wiederum ohne die Numerik zu ändern.

Und es iterierte schneller als Fable 5 bei derselben Aufgabe.
Lies das noch einmal. Das Modell verbesserte den Mechanismus, der das Modell zum Laufen bringt. Autonom. Über Nacht.
So sieht „rekursive Selbstverbesserung" in der Praxis aus – kein Science-Fiction-Szenario, sondern ein 20-Stunden-Job mit messbarem Ergebnis. Es ist dieselbe Fähigkeit, die Anthropic vor Wochen als Grund zur Vorsicht genannt hat, die in einem Open-Weight-Modell läuft, das jeder am 27. Juli herunterladen kann.
Langfristiges Coding ist der eigentliche Punkt
Moonshots eigene Einordnung: „K3 steht als Moonshot AI's leistungsstärkstes Open-Source-Coding-Modell dar. Es arbeitet mit minimaler menschlicher Aufsicht, kann lange Engineering-Sitzungen durchhalten, riesige Repositories navigieren und Terminal-Tools orchestrieren."
Die drei Dinge, die für echte Softwareentwicklung zählen:
- Dauerhafte Sitzungen – das 20-stündige autonome Experiment ist keine Demo. Es ist das Designziel.
- Massive Repositories – ein 1M-Kontextfenster mit 6,3x schnellerer Dekodierung bedeutet, dass du ein echtes Codebase in den Kontext legen und tatsächlich darin arbeiten kannst.
- Tool-Orchestrierung – SOTA bei Toolathlon und BrowseComp bedeutet, dass es Terminal, Browser und API-Aufrufe handhabt, ohne auseinanderzufallen.
Frontend-Coding liegt auf Fable-5-Niveau. AAA-Spieleszenen aus einem einzigen Prompt. WebGPU, Three.js, Shader, Physik – die Dinge, die früher ein Studio erforderten.
Vibe Coding mit Kimi K3
Hier hört das Modell auf, eine Benchmark-Zahl zu sein, und wird offensichtlich nützlich.
K3s Frontend-Coding liegt auf Fable-5-Niveau. In der Praxis bedeutet das, dass die Wand zwischen einer Beschreibung und einem funktionierenden 3D-Produkt jetzt ein Prompt ist.
Was die Leute tatsächlich aus einzelnen Prompts ausgeliefert haben:
Spiele – WebGPU-Kampfarenen mit VFX. Browser-basierte 3D-Stadterkundung mit Greifmechanik.
- Zombie-FPS.
- Multiplayer-Rennen.
- Ein funktionierender 3D-GBA-Emulator.
- Vollständiges MMORPG-Gerüst.
Nicht „eine spielähnliche Demo" – spielbare Szenen mit Trefferreaktionen, Impact-Feedback und Physik, die sich richtig verhält.

3D-Objekte mit echter Materialarbeit – Eine Rolex mit korrektem Glanz und Lichtverhalten. Eine CSGO-Waffe, die sich über 33 einzeln modellierte Teile zusammen- und auseinanderbaut. Eine Sony-Kamera-Zerlegung. Ein schwarzes Loch mit Gravitationslinseneffekt. Meeresimulation mit tatsächlichen Wellendynamiken.

Physikszenen – Stoffsimulation. Strukturversagen. Fahrzeugkollisionen mit Impulsübertragung, die richtig aussieht, statt inszeniert.
Das, was dies von früheren „KI baut eine Website"-Demos unterscheidet: K3 kümmert sich um die Details, die normalerweise kaputtgehen. Beleuchtung. Schatten. Materialglanz. Die 20 kleinen Dinge, die „eindeutig KI-generiert" von „das hat jemand gebaut" trennen.
Ein Prompt. Vier Millionen Tokens. Eine Szene, die früher ein Team brauchte.
4 Erprobte Prompts (Copy-Paste-bereit)
Diese sind so strukturiert, dass sie das ausnutzen, was K3 wirklich gut kann: langfristige Arbeit, Tool-Nutzung und das Halten eines großen Kontexts ohne abzudriften.
Prompt 1 – Der Physik-Stresstest
Dies ist der Prompt, der echte Fähigkeiten von Demo-Politur trennt. Wenn ein Modell alle drei Szenen in Qualität schafft, ist es echt.
1Baue drei eigenständige HTML5-Canvas-Szenen mit echter Physik.2Keine externen Bibliotheken. Alles in einer Datei pro Szene.34Szene 1: Ein Zug, der von einer kaputten Brücke ins Wasser stürzt.5Enthalte: Waggon-Impuls, Brückenstrukturversagen,6Wasserverdrängung beim Aufprall.78Szene 2: Zwei Autos, die von Rampen springen und in der Luft9über einer Schlucht kollidieren. Enthalte: korrekte Flugbahnen,10Kollisionsimpulsübertragung, Trümmer.1112Szene 3: Ein Monster Truck, der eine Reihe geparkter Autos zerquetscht.13Enthalte: Federungskompression, Blechverformung,14Gewichtsverteilung.1516Anforderungen für alle drei:17- Physik muss berechnet, nicht animiert sein18- 60fps-Ziel19- Einen Reset-Button enthalten20- Kommentiere die Physik-Mathematik, damit ich sie überprüfen kann2122Baue alle drei. Stelle keine klärenden Fragen.
Prompt 2 – Die langfristige Repository-Aufgabe
Hierfür wurde K3 eigentlich gebaut. Richte es auf ein echtes Codebase und gib ihm ein Ergebnis, keine Aufgabe.
1Lies das gesamte Codebase, bevor du etwas schreibst.23[füge dein Repo ein oder weise auf das Verzeichnis]45Ziel: [nenne ein messbares Ergebnis – z. B. „Reduziere die6p95-API-Antwortzeit um 30 %" oder „Beseitige alle N+1-7Abfragen in der Datenschicht"]89Regeln:10- Proifil zuerst. Zeige mir, wo die Zeit tatsächlich hinfließt,11 bevor du etwas änderst.12- Ändere keine öffentlichen Schnittstellen oder das numerische Verhalten.13- Führe die vorhandene Testsuite nach jeder Änderung aus.14- Wenn eine Änderung die Dinge verschlechtert, mache sie rückgängig15 und sage mir, warum.16- Arbeite, bis das Ziel erreicht ist oder du beweisen kannst, dass es17 ohne Regelverstoß nicht erreichbar ist.1819Berichte am Ende: was du geändert hast, was es gebracht hat,20was du versucht hast, was nicht funktioniert hat.
Die Zeile „was du versucht hast, was nicht funktioniert hat" ist wichtig. Sie verwandelt die Ausgabe von einem Diff in ein Engineering-Protokoll.
Prompt 3 – Der 3D-Produktbau
Für alle, die Frontend, Landing Pages oder Produktvisualisierung machen.
1Baue ein interaktives 3D-[Objekt] im Browser.2Single HTML-Datei. Three.js.34Das Objekt: [beschreibe es genau – Materialien,5Anzahl der Teile, was sich bewegt]67Muss enthalten:8- Korrekte Materialeigenschaften (Glanz, Rauheit,9 Metallizität wo relevant)10- Drei-Punkt-Beleuchtung mit echten Schatten11- Orbit Controls12- [Beliebige Interaktion – Zusammen-/Auseinanderbau, Animation,13 Hover-Zustände]1415Qualitätsanspruch: das sollte wie ein Produkt-Render aussehen,16nicht wie eine WebGL-Demo. Wenn ein Detail im echten Leben sichtbar17wäre, modelliere es.1819Baue das Ganze. Zeige mir die Datei.
Die Zeile „Qualitätsanspruch" leistet mehr Arbeit als alles andere im Prompt. K3 reagiert auf Standards, nicht nur auf Anweisungen.
Prompt 4 – Echtzeit-Feature mit einem beweglichen Teil
Full-Stack-CRUD ist eine Form von App. Echtzeit ist eine ganz andere Form – der Zustand muss über Clients hinweg synchron bleiben, nicht nur in einer Datenbank persistieren. Hier fallen viele Modelle leise auseinander.
1Füge einer bestehenden App ein Echtzeit-Feature hinzu: ein Live-Kollaborations-2Cursor- und Kommentarsystem, wie bei Figma.34ANFORDERUNGEN:5- WebSocket-Verbindung (verwende Socket.io oder natives ws)6- Zeige die Cursor-Positionen anderer verbundener Benutzer in Echtzeit an7- Klicke irgendwo, um einen Kommentar-Pin zu setzen8- Kommentare aktualisieren sich live für alle verbundenen Clients9- Behandle Trennung/Wiederverbindung elegant – keine Geister-Cursor10- Dämpfe Cursor-Updates, damit der Socket nicht überflutet wird1112BAUE:131. Richte den WebSocket-Server ein142. Baue die Client-seitige Verbindung mit automatischer Wiederverbindung153. Implementiere Cursor-Broadcasting mit Dämpfung164. Implementiere das Kommentar-Pin-System175. Füge einen einfachen Anwesenheitsindikator hinzu (wer ist online)186. Teste mit mindestens 2 simulierten Clients, um die Synchronisation zu bestätigen1920Zeige mir, wie du die Multi-Client-Synchronisation getestet hast, bevor du dies als erledigt bezeichnest.
Erwartetes Ergebnis: Eine funktionierende Echtzeitschicht in 15–30 Minuten, mit sichtbarem Nachweis, dass sie gegen mehr als einen Client getestet wurde.

Die letzte Zeile ist der wichtige Teil. Echtzeit-Bugs zeigen sich nicht mit einem geöffneten Browser-Tab – sie zeigen sich mit zwei. Ein Modell, das Multi-Client-Tests überspringt, wird dir Code liefern, der fertig aussieht, und es nicht ist.
Wenn K3 schiefgeht: Fehlerbehebungsleitfaden
Es ist ein neues Modell mit echten Kanten. Hier ist, was kaputtgeht und was zu tun ist.
- Problem: Es verbraucht Tokens für triviale Aufgaben
Dies ist das große Problem, und es ist strukturell.
K3 wird derzeit mit nur einer Reasoning-Anstrengungsstufe ausgeliefert – 'max'. Es gibt keinen „Antworte einfach schnell"-Modus. Unabhängige Tester maßen 13.241 Reasoning-Tokens für die Erstellung eines einfachen SVG – etwa 0,25 $ für etwas, das Bruchteile eines Cents kosten sollte.
Die Lösung:
Leite einfache Arbeiten nicht an K3 weiter. Es ist ein Spitzenmodell mit einem Gang, und dieser Gang ist „denk über alles gründlich nach." Verwende K2.7 oder ein kleineres Modell für Boilerplate, Formatierung und alles Mechanische. Hebe dir K3 für Arbeiten auf, die das Reasoning rechtfertigen.
Dies ist der mit Abstand größte Fehler, den Leute im ersten Monat machen werden: K3 zum Standard für alles zu machen und dann von der Rechnung überrascht zu sein.
- Problem: Das Kontextfenster füllt sich trotzdem
1M Tokens klingen unendlich, bis du ein echtes Repo hineinlegst und es nicht ist.
Die Lösung:
Wirf nicht alles hinein. Richte es auf die Verzeichnisse aus, die wichtig sind. K3s Stärke bei langfristiger Arbeit kommt von anhaltendem Fokus, nicht davon, jede Datei im Kontext zu haben. Ein straffes 200K des richtigen Codes schlägt ein aufgeblähtes 900K des gesamten Monorepos.
- Problem: Es driftet bei sehr langen autonomen Läufen
Das 20-stündige autonome Experiment ist echt, aber es funktionierte, weil das Ziel messbar war – „mach das auf H200 schneller, ohne die Numerik zu ändern." Gib ihm ein vages Ziel und eine lange Leine, und es wird wandern.
Die Lösung:
Jeder Langzeit-Prompt braucht eine verifizierbare Erfolgsbedingung. Nicht „verbessere den Code." Eine Zahl, ein Test, der bestanden wird, ein Benchmark, der sich bewegt. Wenn du nicht sagen kannst, wie du überprüfen würdest, ob es erfolgreich war, wird es driften.
- Problem: Du kannst das Benchmark-Ergebnis von jemandem nicht reproduzieren
Niemand außerhalb von Moonshot hat dieses Modell geprüft. Die Gewichte kommen erst am 27. Juli. Jede Zahl, die gerade kursiert – einschließlich in diesem Artikel – ist vom Anbieter gemeldet.
Die Lösung:
Warte auf den 27. Juli oder teste mit eigenen Aufgaben und vertraue darauf. Deine fünf echten Aufgaben sind mehr wert als jede Benchmark-Tabelle von irgendjemandem.
- Problem: Integrationsfehler nach Wechsel von OpenAI oder Anthropic
K3 ist mit dem OpenAI SDK kompatibel, was 90 % der Migration abdeckt. Die restlichen 10 % sind normalerweise das Reasoning-Verhalten – K3 denkt standardmäßig und gibt Reasoning-Tokens zurück, die du in deiner Antwortverarbeitung vielleicht nicht erwartest.
Die Lösung:
Überprüfe deine Token-Abrechnung und deine Antwort-Parsing, bevor du annimmst, dass das Modell kaputt ist. Die meisten Beschwerden über „K3 ist teuer" sind eigentlich „Ich habe vergessen, dass Reasoning-Tokens Ausgabe-Tokens sind."
Der Kontext, den niemand ignorieren sollte
Moonshot hat seinen Sitz in Peking, gegründet von Yang Zhilin, einem ehemaligen Google-Forscher, und wird von Alibaba unterstützt.
https://x.com/kirillk_web3/status/2057528102368977328
Sie bauten ein Spitzenmodell mit 2,8 Billionen Parametern unter drei Jahren eskalierender US-Exportkontrollen für fortschrittliche Chips.
Die Analysten der Bank of America brachten es direkt auf den Punkt: „Trotz anhaltender Hardware-/Rechenkapazitätsbeschränkungen in China zeigt K3, dass Pre-Training-Skalierung gepaart mit architektonischer Innovation immer noch schrittweise Verbesserungen für führende chinesische Modelle liefern kann."
Und das Timing ist kein Zufall: K3 landete Tage vor der World Artificial Intelligence Conference 2026 in Shanghai.
Die Frage zum 27. Juli
Die Gewichte kommen am 27. Juli. Dieses Datum ist wichtiger als das Veröffentlichungsdatum.
Bis dahin ist K3 ein Spitzenmodell, das du über eine API nutzen kannst – beeindruckend.
Am 27. Juli wird es etwas anderes: ein Spitzenklasse-Modell, das jeder herunterladen, inspizieren, modifizieren und auf eigener Hardware ausführen kann. Keine API. Keine Nutzungsbeschränkungen. Keine Allgemeinen Geschäftsbedingungen. Keine 30-Tage-Prompt-Aufbewahrung.
Das ist die eigentliche Geschichte. Nicht „China hat aufgeholt."
China hat aufgeholt und es verschenkt.

Erwähnenswert: Chinesische Regulierungsbehörden diskutieren über eigene KI-Exportkontrollen. Ob K3 die letzte Open-Weight-Spitzenveröffentlichung aus China ist oder die erste von vielen, ist derzeit wirklich unklar.
Wie du es ausprobieren kannst
Chat: kimi.com – K3 ist jetzt live
API: Kompatibel mit dem OpenAI SDK, wenn du also bereits auf OpenAI- oder Anthropic-Toolchains aufbaust, ist die Integration eine Konfigurationsänderung, kein Neuschreiben
Gewichte: 27. Juli
Die SDK-Kompatibilität ist wichtiger, als es klingt. Modelle zu tauschen bedeutet normalerweise, deine Integrationsschicht neu zu schreiben. Hier bedeutet es, eine Basis-URL und einen Modell-String zu ändern.
So installierst du Kimi Code (Der Terminal-Agent)
Wenn du K3 in deinem tatsächlichen Codebase laufen lassen möchtest, statt in einem Chat-Fenster, ist dies die Einrichtung.

Anforderungen:
- Ein Computer (Mac, Windows oder Linux)
- Terminal-Zugriff
- Kimi-Konto – kimi.com
Schritt 1 – Kimi Code installieren
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows (PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
Installiere unter Windows zuerst Git for Windows – die Kimi Code CLI verwendet dessen gebündeltes Git Bash als Shell-Umgebung.
Überprüfe die Installation:
1kimi --version
Aufgrund von macOS Gatekeeper kann der erste Start deutlich länger dauern. Füge deine Terminal-App unter Systemeinstellungen → Datenschutz & Sicherheit → Entwickler-Tools hinzu, um spätere Starts zu beschleunigen.
Wenn du bereits uv installiert hast, kannst du direkt installieren:
1uv tool install --python 3.13 kimi-cli
Kimi Code CLI unterstützt Python 3.12–3.14, wobei 3.13 für beste Kompatibilität empfohlen wird.
Schritt 2 – Navigiere zu deinem Projekt und starte
1cd your-project2kimi
Beim ersten Start führe /login innerhalb der Sitzung aus, um deine API-Quelle zu konfigurieren – es öffnet sich ein Browserfenster für OAuth.
Schritt 3 – Gib ihm eine Aufgabe
Kimi Code läuft jetzt in deinem Projekt, mit direktem Lese-/Schreibzugriff auf jede Datei. Beschreibe eine Aufgabe in einfachem Englisch – es plant die Schritte, bearbeitet den Code, führt Tests aus und berichtet, was es getan hat.
Was das wirklich bedeutet
Wenn du Produktions-Workloads betreibst:
Teste es, bevor du umstellst. Anbieter-Benchmarks und reale Leistung weichen ständig voneinander ab. Wähle fünf echte Aufgaben, führe K3 und dein aktuelles Modell nebeneinander aus, messe die Kosten pro erledigter Aufgabe – nicht die Kosten pro Token.

Die Mathematik pro Aufgabe ist das ganze Argument. Bei 3/15 $ ist K3 auf dem Papier nicht billig. Bei 21 % weniger Tokens und Fable-Niveau-Ausgabe ist es dort billig, wo es zählt.
Der 27. Juli ändert die Rechnung. Offene Gewichte bedeuten Self-Hosting, Feintuning und null Abhängigkeit davon, dass die API von jemandem online bleibt oder die Bedingungen von jemandem günstig bleiben. Für alles Sensible ist das keine Kleinigkeit.
Fazit
Die Spitze war früher ein Ort, den amerikanische Labore bauten und alle anderen sechs Monate später besuchten.
2,8 Billionen Parameter. 1M Kontext. Fable-5-Niveau-Coding zum Sonnet-Preis. Gebaut unter Exportkontrollen, vom am niedrigsten bewerteten Labor im Raum, und verschenkt am 27. Juli.
Die interessante Frage ist nicht, ob K3 Fable 5 in irgendeinem Benchmark schlägt. Es ist, was mit den Wirtschaftlichkeiten geschlossener Spitzenmodelle passiert, wenn ein Open-Weight-Modell sie erreicht.
Links
- Kimi K3: https://www.kimi.com
- Mein Telegram: https://t.me/kirillk_web3
- Mein Twitter/X: https://x.com/kirillk_web3
- Partner-Hosting: https://ishosting.com/affiliate/NzE0MiM2
Folge für weitere Vibe Coding Informationen. Danke fürs Lesen!





