Kimi K3 + Graph Engineering: 85 % niedrigere Token-Kosten und 18 % bessere Genauigkeit

@noisyb0y1
ENGLISCHvor 1 Tag · 22. Juli 2026
100K
160
20
12
330

TL;DR

Ein umfassender Leitfaden zum Aufbau von KI-Architekturen mit Kimi K3 und Graph Engineering, mit dem Sie im Vergleich zu herkömmlichem RAG 85 % niedrigere Token-Kosten und eine um 18 % höhere Genauigkeit erzielen.

Die meisten Menschen nutzen KI wie eine teure Suchmaschine. Chat öffnen, Frage stellen, Antwort bekommen, Tab schließen. Am nächsten Tag beginnen sie bei Null, weil die KI sich an nichts erinnert.

Aber es gibt Entwickler, die 10.000–20.000 $ im Monat verdienen, einfach weil ihr KI-System doppelt so schnell antwortet, präzisere Antworten liefert und 85 % weniger kostet als die Konkurrenz. Sie verwenden kein geheimes Modell. Sie haben die richtige Architektur um ein normales Modell herum gebaut.

Sie heißt Kimi K3 + Graph Engineering. Microsoft hat jahrelang bewiesen, dass es funktioniert – 85 % niedrigere Kosten, 18 % bessere Genauigkeit.

Hier erfährst du, wie du das selbst von Grund auf in einer Woche aufbaust.

Warum normales RAG irgendwann nicht mehr funktioniert

Die meisten Entwickler bauen KI-Systeme auf die gleiche Weise. Der Nutzer fragt etwas, das System durchsucht Dokumente, findet ähnliche Textfragmente, das Modell generiert eine Antwort. Funktioniert gut für einfache Fragen. Scheitert völlig bei komplexen.

Frag: "Warum sind unsere Verkäufe im März gefallen?" und normales RAG findet Dokumente mit den Wörtern "Verkäufe" und "März". Es findet Fragmente. Es findet nicht die Kette von Ursachen.

text
1Normale RAG-Antwort:
2Hier sind 5 Dokumente, die Verkäufe im März erwähnen.
3
4Graph-Engineering-Antwort:
5Umsatzrückgang aufgrund einer Verzögerung bei der Veröffentlichung,
6verursacht durch ein Lieferantenproblem,
7ausgelöst durch einen Lagerfehler,
8der negative Bewertungen hervorrief,
9was die Conversion um 23 % senkte.

Gleiches Modell. Gleiche Daten. Völlig anderes Ergebnis – weil ein System Text durchsucht und das andere Verbindungen zwischen echten Fakten.

Das haben Microsoft, Stanford und Anthropic unabhängig voneinander herausgefunden. Und deshalb sind die Entwickler, die das verstehen, schneller als alle anderen.

Was ein Wissensgraph eigentlich ist

Ein Wissensgraph speichert Informationen als Tripel:

text
1Subjekt → Relation → Objekt

Reale Beispiele:

text
1Kimi K3 → entwickelt von → Moonshot AI
2Kimi K3 → Kontextfenster → 1 Million Token
3Microsoft → baute → GraphRAG
4GraphRAG → senkt Kosten um → 85 %
5Anthropic → erstellte → Claude
6Claude → unterstützt → MCP

Jede Information ist eine explizite Verbindung zwischen zwei Entitäten. Kein Textabsatz, der diese Information irgendwo enthalten könnte – eine strukturierte Tatsache, die du direkt abfragen kannst.

text
1Normale Datenbank:
2Tabelle von Unternehmen
3Tabelle von Produkten
4Keine expliziten Verbindungen zwischen ihnen
5
6Wissensgraph:
7Unternehmen → erstellte → Produkt
8Produkt → konkurriert mit → Anderes Produkt
9Anderes Produkt → gehört zu → Anderes Unternehmen
10Unternehmen → investierte in → Anderes Unternehmen

Der Graph speichert nicht nur Fakten. Er speichert, wie Fakten miteinander verbunden sind. Das macht komplexe Schlussfolgerungen möglich – und das kann normales RAG niemals leisten, egal wie gut das Modell ist.

Das Stanford AI Lab definiert einen Wissensgraphen als eine strukturierte Datenbank, in der Informationen als Netzwerk von Entitäten und Beziehungen in Subjekt-Relation-Objekt-Tripeln dargestellt werden. Verwendet in Suche, Empfehlungen und Aufgaben, bei denen indirekte Verbindungen gefunden werden müssen.

ai.stanford.edu/blog/introduction-to-knowledge-graphs

Noisy - inline image

Warum Kimi K3 das richtige Modell für diese Architektur ist

Die meisten Modelle haben Kontextfenster von 128.000 bis 200.000 Token. Kimi K3 hat eine Million. Das ist nicht nur eine beeindruckende Zahl – es ist ein architektonischer Vorteil speziell für Graph Engineering.

Ein Graph gibt Subgraphen, Beweisketten, Listen verbundener Entitäten zurück. All das nimmt Platz im Kontextfenster ein. Mit einem kleinen Kontext musst du den Graphen beschneiden. Mit einer Million Token passt der gesamte relevante Teil des Graphen in eine Sitzung.

text
1Kimi K3 Architektur:
22,8 Billionen Gesamtparameter
3896 Experten in MoE, 16 aktiv pro Token
41.048.576 Token Kontextfenster
5Native Bildanalyse
6Kimi Delta Attention für lange Sequenzen
7Attention Residuals zur Signalerhaltung zwischen den Schichten

kimi.com/blog/kimi-k3

Noisy - inline image

Kimi Delta Attention ist ein hybrider Mechanismus, der die Kosten für die Arbeit mit langen Sequenzen reduziert. Für Graph Engineering bedeutet das, dass das System dem Modell große Subgraphen, lange Beweislisten, Dutzende von Dokumenten und die Repository-Struktur übergeben kann, ohne dass die Kosten katastrophal steigen.

Aber selbst eine Million Token sind temporärer Speicher. Nach der Sitzung verschwindet alles.

text
11M Token Kontext = große Arbeitsfläche pro Sitzung
2Wissensgraph = permanenter strukturierter Speicher zwischen Sitzungen

Kimi K3 bietet Skalierung und Schlussfolgerung. Graph Engineering bietet Gedächtnis und Struktur. Zusammen lösen sie gleichzeitig verschiedene Probleme.

Dokument 1 – Microsoft GraphRAG

github.com/microsoft/graphrag

arxiv.org/abs/2603.22528

Noisy - inline image

Microsoft hat GraphRAG entwickelt und als Open Source veröffentlicht. Die Zahlen aus ihrer Forschung sind der konkreteste Beweis dafür, was Graph Engineering im Vergleich zu normalem RAG tatsächlich leistet.

Die Architektur wandelt unstrukturierten Text in einen vollständigen Wissensgraphen um:

text
1Dokumente laden
2
3Dokumente chunken
4
5Entitäten und Beziehungen extrahieren
6
7Graph erstellen
8
9Communities erkennen
10
11Community-Berichte generieren
12
13Entitäten und Berichte einbetten
14
15Lokale Suche / Globale Suche

Wichtige Erkenntnis von Microsoft: Normales RAG beantwortet lokale Fragen gut – finde Informationen über diese spezifische Entität. Es versagt bei globalen Fragen – was sind die Hauptmuster in diesen 10.000 Dokumenten, was verbindet diese Ereignisse über den gesamten Datensatz.

Graph Engineering beantwortet beides.

text
1Lokale Suche | Was ist mit Lieferant X im März passiert?
2 | Findet spezifischen Knoten und seine Verbindungen
3
4Globale Suche | Was sind die wichtigsten Risikomuster
5 | in allen unseren Lieferantenbeziehungen
6 | Findet Muster im gesamten Graphen

Reale Zahlen aus der ChatP&ID-Forschung:

text
1Genauigkeitsverbesserung | 18 % höher als reiner Dokumentenansatz
2Token-Kostenreduktion | 85 % niedriger als direktes Laden strukturierter Dateien
3Kosten pro Aufgabe | ca. 0,004 $ in der getesteten Konfiguration

Dokument 2 – Drei Modi der Kombination von LLM und Wissensgraph

arxiv.org/abs/2306.08302

Eines der stärksten theoretischen Papiere zur Kombination von Sprachmodellen und Wissensgraphen beschreibt drei Modi:

text
1Modus 1 – KG-verbessertes LLM
2Der Graph liefert dem Modell Fakten und Struktur
3Das Modell generiert bessere Antworten
4
5Modus 2 – LLM-erweiterter KG
6Das Modell erstellt, bereinigt und erweitert den Graphen
7Der Graph verbessert sich im Laufe der Zeit
8
9Modus 3 – Synergisiertes LLM + KG
10Graph und Modell verbessern sich gegenseitig
11Der leistungsstärkste Modus

Für Kimi K3 + Graph Engineering funktioniert der dritte Modus am besten. Kimi K3 extrahiert neue Fakten und fügt sie dem Graphen hinzu. Der Graph gibt Kimi K3 strukturierten Kontext für Schlussfolgerungen. Der Zyklus wiederholt sich und das System wird mit jeder Iteration besser.

Dokument 3 – Relationales Gedächtnis für Sprachmodelle

direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476

MIT Press, Transactions of the Association for Computational Linguistics.

Die Forschung zeigt, was passiert, wenn man ein Sprachmodell mit relationalem Gedächtnis verbindet – einem Wissensgraphen von Beziehungen anstelle von Textfragmenten.

text
1Textkontext
2
3Relevante Beziehungen aus dem Graphen extrahieren
4
5Relationales Gedächtnis
6
7Sprachmodell
8
9Kohärentere und genauere Generierung

Wichtigste Erkenntnis: Modelle mit Zugriff auf explizite Beziehungsstrukturen produzieren kohärenteren Text und machen weniger logische Fehler als Modelle, die nur mit Text arbeiten.

Dies ist die wissenschaftliche Erklärung, warum Graph Engineering funktioniert. Das Modell muss Beziehungen nicht aus Text ableiten. Die Beziehungen sind im Graphen explizit. Das Modell verwendet sie direkt.

Veröffentlicht unter CC BY 4.0 – kann mit Quellenangabe frei verwendet werden.

Dokument 4 – Skalierungsgesetze für Knowledge Graph Engineering

arxiv.org/abs/2505.16276

Forschung, die 26 Open-Source-Modelle bei Aufgaben des Knowledge Graph Engineerings verglichen hat. Die Schlussfolgerung ist eine der wichtigsten Erkenntnisse auf diesem Gebiet:

text
1Größeres Modell + schlechter Graph | schlechtere Ergebnisse
2Kleineres Modell + guter Graph | bessere Ergebnisse

Der richtige Graph schlägt das größere Modell. Jedes Mal.

Die gleiche Schlussfolgerung, zu der Microsoft mit GraphRAG und Anthropic mit Claude Code kamen – das System um das Modell herum bestimmt die Ausgabe mehr als das Modell selbst. Graph Engineering ist die konkreteste Umsetzung dieses Prinzips.

Dokument 5 – Agent-as-a-Graph

arxiv.org/abs/2511.18194

Dieses Papier zeigt, wie man nicht nur Wissen, sondern auch Agenten und Werkzeuge als Knoten in einem Graphen darstellt.

text
1Benutzerfrage
2
3Graph der Fähigkeiten
4
5Recherche-Agent auswählen
6
7GitHub-Tool auswählen
8
9ArXiv-Tool auswählen
10
11Graphdatenbank-Tool auswählen
12
13Kimi K3 koordiniert die Ausführung

Die Autoren berichten eine Recall@5-Verbesserung von 14,9 % und eine nDCG@5-Verbesserung von 14,6 % im Vergleich zu vergleichbaren Retrievern auf dem LiveMCPBenchmark.

Für Kimi K3 bedeutet das, dass der Graph nicht nur das Wissen verwalten kann, sondern auch, welcher Agent und welches Tool für jede spezifische Aufgabe verwendet werden sollen.

Dokument 6 – Kimi Code und Agent SDK

github.com/MoonshotAI/kimi-code

github.com/MoonshotAI/kimi-agent-sdk

Kimi Code ist ein Terminal-Agent, der Folgendes kann:

text
1Code lesen und bearbeiten
2Shell-Befehle ausführen
3Dateien durchsuchen
4Webseiten abrufen
5Das Ergebnis jedes Schrittes analysieren
6Selbstständig die nächste Aktion wählen
7Unterstützt MCP
8Lifecycle-Hooks
9Genehmigungsmodi

Mit dem Kimi Agent SDK kannst du Kimi Code als Grundlage für deinen eigenen Agenten verwenden. Es verwendet die Tools, Fähigkeiten und die MCP-Server-Konfiguration von Kimi Code wieder.

Für Graph Engineering ist dies eine einsatzbereite Ausführungsebene. Der Graph liefert strukturiertes Wissen und Argumentationspfade. Kimi Code führt Aktionen in der realen Umgebung aus. Das SDK verbindet alles.

Die vollständige Systemarchitektur

text
1Schritt 1 – Erfassungsebene
2PDFs, Websites, Datenbanken, APIs, Slack, Notion
3
4
5Schritt 2 – Extraktionsebene
6Kimi K3 extrahiert Entitäten und Beziehungen
7
8{
9 "entity": "Kimi K3",
10 "type": "KI-Modell",
11 "relations": [
12 {
13 "predicate": "entwickelt_von",
14 "object": "Moonshot AI",
15 "confidence": 0.98
16 }
17 ]
18}
19
20
21
22Schritt 3 – Auflösungsebene
23System ermittelt, ob es sich um dieselbe Entität handelt:
24Moonshot AI / Moonshot / Beijing Moonshot / 月之暗面
25
26
27
28Schritt 4 – Graph-Speicher
29Neo4j / Memgraph / Amazon Neptune / PostgreSQL
30
31
32
33Schritt 5 – Abrufebene
34Vektorsuche + Entitätssuche + Pfadsuche
35Community-Suche + Zeitfilterung
36
37
38
39Schritt 6 – Agentenebene
40Kimi K3:
41Plant das Vorgehen
42Wählt das richtige Werkzeug
43Generiert Cypher- oder SPARQL-Abfragen
44Analysiert Subgraphen
45Führt Internetrecherchen durch
46Zieht Schlussfolgerungen
47Identifiziert die nächste Wissenslücke
48
49
50
51Schritt 7 – Verifikationsebene
52Prüft die Abdeckung der Beweise
53Findet Widersprüche
54Bewertet die Konfidenz
55Überprüft Quellen
56
57
58
59Schritt 8 – Graph-Aktualisierung
60Neue Fakten werden dem Graphen hinzugefügt
61Widersprüche werden markiert
62Alte Informationen erhalten einen Zeitstempel

Dies ist eine geschlossene Wissens-Aktions-Schleife. Kimi K3 liest nicht nur den Graphen. Es identifiziert, was fehlt, bildet Unterfragen, wählt einen Knoten oder Subgraphen aus, führt eine Suche durch, überprüft das Ergebnis, fügt eine neue Tatsache hinzu und bewertet die Hypothese neu.

Fünf Prompts, die die gesamte Pipeline betreiben

Graph Engineering ersetzt keine Prompts. Es verwendet sie in jeder spezifischen Phase.

Prompt 1 – Extraktion

text
1Extrahiere alle Organisationen, Personen, Produkte und Ereignisse.
2
3Gib für jede Entität zurück:
4- canonical_name
5- type
6- description
7- source
8
9Gib für jede Beziehung zurück:
10- source_entity
11- relation_type
12- target_entity
13- evidence
14- confidence_score

Prompt 2 – Normalisierung

text
1Vergleiche die folgenden Entitäten.
2Bestimme, ob sie sich beziehen auf:
3- dieselbe Entität
4- verwandte, aber unterschiedliche Entitäten
5- nicht verwandte Entitäten
6
7Gib den kanonischen Namen und eine Erklärung zurück.
8Führe keine Entitäten ohne klare Beweise zusammen.

Prompt 3 – Graph-Abfrage

text
1Übersetze die Benutzerfrage in eine Cypher-Abfrage.
2Verwende nur Beziehungen, die im Schema vorhanden sind.
3Erfinde keine Labels oder Eigenschaften.
4Gib die Abfrage und eine Erklärung der Logik zurück.

Prompt 4 – Fundierte Antwort

text
1Antworte nur unter Verwendung der abgerufenen Graphenpfade.
2Für jede Schlussfolgerung:
3- identifiziere die unterstützenden Knoten
4- identifiziere den Beziehungspfad
5- gib die Unsicherheit klar an
6- leite keine Kausalität aus Korrelation ab

Prompt 5 – Graph-Wartung

text
1Vergleiche neue Fakten mit dem bestehenden Graphen.
2Klassifiziere jeden Fakt als:
3- neu
4- Duplikat
5- Widerspruch
6- Aktualisierung
7- unsicher
8
9Überschreibe keine bestehenden Fakten ohne Beweise.

Fünf Geschäftsmodelle, die du auf diesem System aufbauen kannst

1 – Investment-Recherche

text
1Unternehmen
2├── Gründer und ihre vorherigen Projekte
3├── Investoren und ihr Portfolio
4├── Wettbewerber und ihre Strategien
5├── rechtliche Risiken
6├── Patente
7├── Stellenausschreibungen als Strategieindikator
8└── Finanzkennzahlen im Zeitverlauf

Kimi K3 liest Berichte und Nachrichten. Der Graph zeigt versteckte Verbindungen zwischen Unternehmen, gemeinsame Investoren, Lieferantenabhängigkeiten und Personalsignale. Kunden: Investmentfonds, Anwaltskanzleien, M&A-Berater. 2.000–10.000 $ pro Kunde und Monat.

2 – Engineering Intelligence

text
1GitHub-Commits + Jira-Tickets + Linear-Aufgaben
2
3Graph der Engineering-Arbeit
4
55x schnellere Incident-Erkennung
650 % weniger Besprechungszeit
7Automatische Release-Notes

anthropic.com/customers/graph

LaunchNotes verkauft dies bereits. Der Markt ist jedes Engineering-Team, das mehr als ein Projektmanagement-Tool verwendet.

3 – Wissenschaftliche Forschungsmaschine

text
1Paper → Autor → Institution → Methode → Datensatz → Ergebnis
2
3Welche GraphRAG-Methoden verwenden Community-Erkennung,
4auf welchen Datensätzen sie getestet wurden
5und welche Paper sich gegenseitig widersprechen

Normale Suche liefert eine Liste von Dokumenten. Ein Graphsystem erstellt eine Karte von Beweisen und Widersprüchen.

4 – Cybersicherheits-Bedrohungsgraph

text
1IP → Domain → Zertifikat → Malware → Kampagne → Akteur
2
3Kimi K3 analysiert Bedrohungsberichte
4Ordnet Indikatoren über Quellen hinweg zu
5Erklärt Angriffspfade
6Aktualisiert den Bedrohungsgraphen automatisch

5 – Persönliches Wissens-Betriebssystem

text
1Personen ↔ Meetings ↔ Projekte ↔ Dokumente ↔ Entscheidungen ↔ Zusagen
2
3Fragen, die Kimi K3 beantworten kann:
4Wer blockiert diese Aufgabe?
5Welche Entscheidung haben wir getroffen und worauf basierte sie?
6Was habe ich diesen Monat versprochen?
7Welche alten Annahmen sind nicht mehr gültig?

Wo du diese Woche anfängst

text
1Tag 1 | Installiere Neo4j lokal
2 | Lies das DSPy-README
3 | github.com/stanfordnlp/dspy
4 | Verstehe den Unterschied zwischen Prompting
5 | und dem Programmieren eines Systems
6
7Tag 2 | Nimm einen Satz von Dokumenten
8 | Führe Kimi K3 über die API aus
9 | Extrahiere erste Entitäten und Beziehungen
10 | Speichere sie in Neo4j
11
12Tag 3 | Baue die erste Abrufebene
13 | Kombiniere Vektorsuche und Graphensuche
14 | Teste mit einer komplexen Frage, die RAG nicht beantworten kann
15
16Tag 4 | Verbinde Kimi Code über MCP
17 | github.com/MoonshotAI/kimi-code
18 | Lass den Agenten den Graphen lesen und neue Fakten hinzufügen
19 | Führe die erste Wissens-Aktions-Schleife aus
20
21Tag 5 | Messe das Ergebnis
22 | Vergleiche die Genauigkeit mit normalem RAG
23 | Vergleiche die Token-Kosten
24 | Finde den ersten echten Kunden-Anwendungsfall

Was Microsoft, Stanford und Anthropic gemeinsam herausgefunden haben

text
1Microsoft GraphRAG | Graph senkt Kosten um 85 %, verbessert Genauigkeit um 18 %
2Stanford DSPy | Modell ist ein Knoten in einem Graphen, nicht das Zentrum
3Stanford Skalierungsgesetze | Kleineres Modell + guter Graph schlägt größeres Modell
4MIT Press Forschung | Explizite Beziehungen verbessern Kohärenz und Genauigkeit
5Anthropic LaunchNotes | 5x schnellere Incident-Erkennung, 50 % weniger Besprechungszeit

Kimi K3 ist der Motor. Graph Engineering ist die Karte, das Gedächtnis und das Koordinatensystem. Ohne den Motor handelt der Graph nicht. Ohne den Graphen bewegt sich der Motor sehr schnell, weiß aber nicht immer, wohin er geht.

Die meisten Entwickler werden weiterhin normales RAG bauen und sich wundern, warum komplexe Fragen schlechte Antworten liefern. Einige wenige werden eine Woche damit verbringen, ein Graphsystem aufzubauen und niemals zur Textsuche zurückkehren.

Du baust dein eigenes Leben – also wähle den richtigen Weg.

/ Wenn das nützlich war – folge mir /

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken