Kimi K3 + Graph Engineering: 85% di costi in meno per i token e 18% di precisione in più

@noisyb0y1
INGLESE1 giorno fa · 22 lug 2026
100K
160
20
12
330

TL;DR

Una guida completa alla creazione di architetture AI utilizzando Kimi K3 e la Graph Engineering, per ottenere una riduzione dell'85% dei costi dei token e un miglioramento del 18% della precisione rispetto al RAG tradizionale.

La maggior parte delle persone usa l'AI come un costoso motore di ricerca. Apri una chat, fai una domanda, ottieni una risposta, chiudi la scheda. Il giorno dopo ricominci da zero perché l'AI non ricorda nulla.

Ma ci sono sviluppatori che guadagnano 10.000-20.000 dollari al mese semplicemente perché il loro sistema AI risponde il doppio più velocemente, dà risposte più accurate e costa l'85% in meno rispetto ai loro concorrenti. Non stanno usando un modello segreto. Hanno costruito l'architettura giusta attorno a un modello normale.

Si chiama Kimi K3 + Graph Engineering. Microsoft ha passato anni a dimostrare che funziona: costi inferiori dell'85%, precisione migliorata del 18%.

Ecco come costruirlo da zero in una settimana.

Perché la RAG normale smette di funzionare a un certo punto

La maggior parte degli sviluppatori costruisce sistemi AI allo stesso modo. L'utente chiede qualcosa, il sistema cerca nei documenti, trova frammenti di testo simili, il modello genera una risposta. Funziona bene per domande semplici. Crolla completamente per quelle complesse.

Chiedi "perché le nostre vendite sono calate a marzo?" e la RAG normale trova documenti con le parole "vendite" e "marzo." Trova frammenti. Non trova la catena di cause.

text
1Risposta RAG normale:
2Ecco 5 documenti che menzionano le vendite a marzo.
3
4Risposta Graph Engineering:
5Le vendite sono calate a causa di un ritardo nel rilascio
6causato da un problema del fornitore
7innescato da un guasto al magazzino
8che ha generato recensioni negative
9che hanno ridotto la conversione del 23%.

Stesso modello. Stessi dati. Risultato completamente diverso - perché un sistema cerca testo e l'altro cerca connessioni tra fatti reali.

Questo è ciò che Microsoft, Stanford e Anthropic hanno scoperto indipendentemente. Ed è il motivo per cui gli sviluppatori che lo capiscono si stanno muovendo più velocemente di tutti gli altri.

Cos'è realmente un grafo di conoscenza

Un grafo di conoscenza memorizza le informazioni come triple:

text
1Soggetto → Relazione → Oggetto

Esempi reali:

text
1Kimi K3 → sviluppato da → Moonshot AI
2Kimi K3 → finestra di contesto → 1 milione di token
3Microsoft → ha costruito → GraphRAG
4GraphRAG → riduce i costi del → 85%
5Anthropic → ha creato → Claude
6Claude → supporta → MCP

Ogni informazione è una connessione esplicita tra due entità. Non un paragrafo di testo che potrebbe contenere queste informazioni da qualche parte - un fatto strutturato che puoi interrogare direttamente.

text
1Database normale:
2Tabella delle aziende
3Tabella dei prodotti
4Nessuna connessione esplicita tra loro
5
6Grafo di conoscenza:
7Azienda → ha creato → Prodotto
8Prodotto → compete con → Altro Prodotto
9Altro Prodotto → posseduto da → Altra Azienda
10Azienda → ha investito in → Altra Azienda

Il grafo non memorizza solo fatti. Memorizza come i fatti si connettono tra loro. Questo è ciò che rende possibile il ragionamento complesso - e ciò che la RAG normale non potrà mai fare, indipendentemente da quanto sia buono il modello.

Lo Stanford AI Lab definisce un grafo di conoscenza come un database strutturato in cui le informazioni sono rappresentate come una rete di entità e relazioni in triple soggetto-relazione-oggetto. Utilizzato nella ricerca, nei consigli e in attività in cui è necessario trovare connessioni indirette.

ai.stanford.edu/blog/introduction-to-knowledge-graphs

Noisy - inline image

Perché Kimi K3 è il modello giusto per questa architettura

La maggior parte dei modelli ha finestre di contesto da 128.000 a 200.000 token. Kimi K3 ne ha un milione. Non è solo un numero impressionante - è un vantaggio architetturale specifico per il Graph Engineering.

Un grafo restituisce sottografi, catene di prove, elenchi di entità connesse. Tutto questo occupa spazio nella finestra di contesto. Con un contesto piccolo devi tagliare il grafo. Con un milione di token, l'intera parte rilevante del grafo entra in una singola sessione.

text
1Architettura di Kimi K3:
22,8 trilioni di parametri totali
3896 esperti in MoE, 16 attivi per token
4Finestra di contesto di 1.048.576 token
5Analisi nativa delle immagini
6Kimi Delta Attention per sequenze lunghe
7Attention Residuals per preservare i segnali tra i livelli

kimi.com/blog/kimi-k3

Noisy - inline image

Kimi Delta Attention è un meccanismo ibrido che riduce il costo di lavorare con sequenze lunghe. Per il Graph Engineering, questo significa che il sistema può passare al modello grandi sottografi, lunghi elenchi di prove, dozzine di documenti e la struttura del repository senza aumenti di costo catastrofici.

Ma anche un milione di token è memoria temporanea. Dopo la sessione, tutto scompare.

text
1Contesto da 1M token = ampia superficie di lavoro per sessione
2Grafo di conoscenza = memoria strutturata permanente tra le sessioni

Kimi K3 fornisce scala e ragionamento. Graph Engineering fornisce memoria e struttura. Insieme risolvono problemi diversi contemporaneamente.

Documento 1 - Microsoft GraphRAG

github.com/microsoft/graphrag

arxiv.org/abs/2603.22528

Noisy - inline image

Microsoft ha costruito GraphRAG e lo ha reso open source. I numeri della loro ricerca sono la prova più concreta disponibile di ciò che Graph Engineering offre realmente rispetto alla RAG normale.

L'architettura converte il testo non strutturato in un grafo di conoscenza completo:

text
1Carica documenti
2
3Dividi in chunk
4
5Estrai entità e relazioni
6
7Costruisci grafo
8
9Rileva comunità
10
11Genera report di comunità
12
13Embed entità e report
14
15Ricerca Locale / Ricerca Globale

Intuizione chiave di Microsoft: la RAG normale risponde bene a domande locali - trova informazioni su questa specifica entità. Fallisce sulle domande globali - quali sono i modelli principali in questi 10.000 documenti, cosa collega questi eventi nell'intero dataset.

Graph Engineering risponde a entrambe.

text
1Ricerca Locale | cosa è successo con il fornitore X a marzo
2 | trova il nodo specifico e le sue connessioni
3
4Ricerca Globale | quali sono i principali modelli di rischio
5 | in tutte le nostre relazioni con i fornitori
6 | trova modelli nell'intero grafo

Numeri reali dalla ricerca ChatP&ID:

text
1Miglioramento della precisione | 18% superiore rispetto all'approccio a documenti grezzi
2Riduzione del costo dei token | 85% inferiore rispetto al caricamento diretto di file strutturati
3Costo per attività | circa $0,004 nella configurazione testata

Documento 2 - Tre modalità di combinazione tra LLM e Grafo di Conoscenza

arxiv.org/abs/2306.08302

Uno dei documenti teorici più solidi sulla combinazione di modelli linguistici e grafi di conoscenza descrive tre modalità:

text
1Modalità 1 - LLM potenziato da KG
2Il grafo fornisce fatti e struttura al modello
3Il modello genera risposte migliori
4
5Modalità 2 - KG potenziato da LLM
6Il modello crea, pulisce ed espande il grafo
7Il grafo migliora nel tempo
8
9Modalità 3 - LLM + KG sinergizzati
10Grafo e modello si migliorano a vicenda
11Modalità più potente

Per Kimi K3 + Graph Engineering, la terza modalità funziona meglio. Kimi K3 estrae nuovi fatti e li aggiunge al grafo. Il grafo fornisce a Kimi K3 un contesto strutturato per il ragionamento. Il ciclo si ripete e il sistema migliora a ogni iterazione.

Documento 3 - Memoria Relazionale per modelli linguistici

direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476

MIT Press, Transactions of the Association for Computational Linguistics.

La ricerca mostra cosa succede quando colleghi un modello linguistico a una memoria relazionale - un grafo di conoscenza di relazioni invece di frammenti di testo.

text
1Contesto testuale
2
3Estrai relazioni rilevanti dal grafo
4
5Memoria Relazionale
6
7Modello linguistico
8
9Generazione più coerente e accurata

Risultato chiave: i modelli con accesso a strutture relazionali esplicite producono testo più coerente e commettono meno errori logici rispetto ai modelli che lavorano solo con il testo.

Questa è la spiegazione scientifica del perché Graph Engineering funziona. Il modello non deve dedurre le relazioni dal testo. Le relazioni sono esplicite nel grafo. Il modello le usa direttamente.

Pubblicato sotto CC BY 4.0 - può essere utilizzato liberamente con attribuzione.

Documento 4 - Leggi di Scala per l'Ingegneria dei Grafi di Conoscenza

arxiv.org/abs/2505.16276

Ricerca che ha confrontato 26 modelli open-source su compiti di ingegneria dei grafi di conoscenza. La conclusione è una delle scoperte più importanti del settore:

text
1Modello più grande + grafo scadente | risultati peggiori
2Modello più piccolo + grafo buono | risultati migliori

Il grafo giusto batte il modello più grande. Ogni volta.

Stessa conclusione a cui sono giunti Microsoft con GraphRAG e Anthropic con Claude Code: il sistema attorno al modello determina l'output più del modello stesso. Graph Engineering è l'implementazione più concreta di questo principio.

Documento 5 - Agente come Grafo

arxiv.org/abs/2511.18194

Questo documento mostra come rappresentare non solo la conoscenza, ma anche agenti e strumenti come nodi in un grafo.

text
1Domanda dell'utente
2
3Grafo delle capacità
4
5Seleziona agente di ricerca
6
7Seleziona strumento GitHub
8
9Seleziona strumento ArXiv
10
11Seleziona strumento database grafo
12
13Kimi K3 coordina l'esecuzione

Gli autori riportano un miglioramento Recall@5 del 14,9% e nDCG@5 del 14,6% rispetto a recuperatori comparabili su LiveMCPBenchmark.

Per Kimi K3, ciò significa che il grafo può gestire non solo la conoscenza, ma anche quale agente e quale strumento utilizzare per ogni attività specifica.

Documento 6 - Kimi Code e Agent SDK

github.com/MoonshotAI/kimi-code

github.com/MoonshotAI/kimi-agent-sdk

Kimi Code è un agente terminale che può:

text
1Leggere e modificare codice
2Eseguire comandi shell
3Cercare file
4Recuperare pagine web
5Analizzare il risultato di ogni passaggio
6Scegliere autonomamente l'azione successiva
7Supporta MCP
8Hook del ciclo di vita
9Modalità di approvazione

Kimi Agent SDK ti permette di usare Kimi Code come base per il tuo agente. Riutilizza gli strumenti, le competenze e la configurazione del server MCP di Kimi Code.

Per il Graph Engineering, questo è un livello di esecuzione già pronto. Il grafo fornisce conoscenza strutturata e percorsi di ragionamento. Kimi Code agisce nell'ambiente reale. L'SDK tiene tutto insieme.

L'architettura completa del sistema

text
1Passaggio 1 - Livello di Ingestione
2PDF, siti web, database, API, Slack, Notion
3
4
5Passaggio 2 - Livello di Estrazione
6Kimi K3 estrae entità e relazioni
7
8{
9 "entity": "Kimi K3",
10 "type": "Modello AI",
11 "relations": [
12 {
13 "predicate": "sviluppato_da",
14 "object": "Moonshot AI",
15 "confidence": 0.98
16 }
17 ]
18}
19
20
21
22Passaggio 3 - Livello di Risoluzione
23Il sistema risolve se si tratta della stessa entità:
24Moonshot AI / Moonshot / Beijing Moonshot / 月之暗面
25
26
27
28Passaggio 4 - Archiviazione del Grafo
29Neo4j / Memgraph / Amazon Neptune / PostgreSQL
30
31
32
33Passaggio 5 - Livello di Recupero
34Ricerca vettoriale + Ricerca entità + Ricerca percorsi
35Ricerca comunità + Filtraggio temporale
36
37
38
39Passaggio 6 - Livello Agente
40Kimi K3:
41Pianifica l'approccio
42Sceglie lo strumento giusto
43Genera query Cypher o SPARQL
44Analizza il sottografo
45Esegue ricerche web
46Trae conclusioni
47Identifica il prossimo gap di conoscenza
48
49
50
51Passaggio 7 - Livello di Verifica
52Controlla la copertura delle prove
53Trova contraddizioni
54Valuta la confidenza
55Verifica le fonti
56
57
58
59Passaggio 8 - Aggiornamento del Grafo
60Nuovi fatti aggiunti al grafo
61Contraddizioni segnalate
62Informazioni vecchie ottengono un timestamp

Questo è un ciclo chiuso conoscenza-azione. Kimi K3 non si limita a leggere il grafo. Identifica cosa manca, formula sotto-domande, seleziona un nodo o sottografo, esegue una ricerca, controlla il risultato, aggiunge un nuovo fatto e rivaluta l'ipotesi.

Cinque prompt che gestiscono l'intera pipeline

Graph Engineering non sostituisce i prompt. Li utilizza in ogni fase specifica.

Prompt 1 - Estrazione

text
1Estrai tutte le organizzazioni, persone, prodotti ed eventi.
2
3Per ogni entità restituisci:
4- nome_canonico
5- tipo
6- descrizione
7- fonte
8
9Per ogni relazione restituisci:
10- entità_fonte
11- tipo_relazione
12- entità_destinazione
13- prova
14- punteggio_confidenza

Prompt 2 - Normalizzazione

text
1Confronta le seguenti entità.
2Determina se si riferiscono a:
3- la stessa entità
4- entità correlate ma diverse
5- entità non correlate
6
7Restituisci il nome canonico e la spiegazione.
8Non unire entità senza prove chiare.

Prompt 3 - Query del Grafo

text
1Traduci la domanda dell'utente in una query Cypher.
2Usa solo le relazioni presenti nello schema.
3Non inventare etichette o proprietà.
4Restituisci la query e la spiegazione della logica.

Prompt 4 - Risposta Fondata

text
1Rispondi usando solo i percorsi del grafo recuperati.
2Per ogni conclusione:
3- identifica i nodi di supporto
4- identifica il percorso di relazione
5- dichiara chiaramente l'incertezza
6- non inferire causalità dalla correlazione

Prompt 5 - Manutenzione del Grafo

text
1Confronta i nuovi fatti con il grafo esistente.
2Classifica ogni fatto come:
3- nuovo
4- duplicato
5- contraddizione
6- aggiornamento
7- incerto
8
9Non sovrascrivere i fatti esistenti senza prove.

Cinque attività che puoi costruire su questo sistema

1 - Ricerca per Investimenti

text
1Azienda
2├── fondatori e i loro progetti precedenti
3├── investitori e il loro portafoglio
4├── concorrenti e le loro strategie
5├── rischi legali
6├── brevetti
7├── offerte di lavoro come segnale strategico
8└── metriche finanziarie nel tempo

Kimi K3 legge report e notizie. Il grafo mostra connessioni nascoste tra aziende, investitori condivisi, dipendenze dai fornitori e segnali del personale. Clienti: fondi di investimento, studi legali, consulenti M&A. $2.000-10.000 per cliente al mese.

2 - Intelligenza Ingegneristica

text
1Commit GitHub + Ticket Jira + Attività Linear
2
3Grafo del Lavoro Ingegneristico
4
5Rilevamento incidenti 5x più veloce
650% in meno di tempo in riunioni
7Note di rilascio automatiche

anthropic.com/customers/graph

LaunchNotes vende già questo. Il mercato è ogni team di ingegneria che utilizza più di uno strumento di project management.

3 - Motore di Ricerca Scientifica

text
1Articolo → autore → istituzione → metodo → dataset → risultato
2
3Quali metodi GraphRAG usano il rilevamento di comunità,
4su quali dataset sono stati testati
5e quali articoli si contraddicono a vicenda

La ricerca normale dà un elenco di documenti. Un sistema a grafo costruisce una mappa di prove e contraddizioni.

4 - Grafo delle Minacce Informatiche

text
1IP → dominio → certificato → malware → campagna → attore
2
3Kimi K3 analizza i report sulle minacce
4Mappa gli indicatori tra le fonti
5Spiega i percorsi di attacco
6Aggiorna automaticamente il grafo delle minacce

5 - Sistema Operativo di Conoscenza Personale

text
1Persone ↔ Riunioni ↔ Progetti ↔ Documenti ↔ Decisioni ↔ Promesse
2
3Domande a cui Kimi K3 può rispondere:
4Chi sta bloccando questa attività?
5Che decisione abbiamo preso e su cosa si basava?
6Cosa ho promesso di fare questo mese?
7Quali vecchie ipotesi non sono più valide?

Da dove iniziare questa settimana

text
1Giorno 1 | installa Neo4j localmente
2 | leggi il README di DSPy
3 | github.com/stanfordnlp/dspy
4 | capisci la differenza tra prompting
5 | e programmare un sistema
6
7Giorno 2 | prendi una serie di documenti
8 | esegui Kimi K3 tramite API
9 | estrai le prime entità e relazioni
10 | salva in Neo4j
11
12Giorno 3 | costruisci il primo livello di recupero
13 | combina ricerca vettoriale e ricerca sul grafo
14 | testa su una domanda complessa a cui la RAG non sa rispondere
15
16Giorno 4 | collega Kimi Code tramite MCP
17 | github.com/MoonshotAI/kimi-code
18 | lascia che l'agente legga il grafo e aggiunga nuovi fatti
19 | esegui il primo ciclo conoscenza-azione
20
21Giorno 5 | misura il risultato
22 | confronta la precisione rispetto alla RAG normale
23 | confronta i costi dei token
24 | trova il primo caso d'uso reale per un cliente

Cosa hanno scoperto insieme Microsoft, Stanford e Anthropic

text
1Microsoft GraphRAG | il grafo taglia i costi dell'85%, migliora la precisione del 18%
2Stanford DSPy | il modello è un nodo in un grafo, non il centro
3Stanford Scaling Laws | modello più piccolo + grafo buono batte modello più grande
4MIT Press Research | le relazioni esplicite migliorano coerenza e precisione
5Anthropic LaunchNotes | rilevamento incidenti 5x più veloce, 50% meno tempo in riunioni

Kimi K3 è il motore. Graph Engineering è la mappa, la memoria e il sistema di coordinate. Senza il motore, il grafo non agisce. Senza il grafo, il motore si muove molto velocemente ma non sempre sa dove sta andando.

La maggior parte degli sviluppatori continuerà a costruire RAG normale e si chiederà perché le domande complesse diano risposte scadenti. Alcuni passeranno una settimana a costruire un sistema a grafo e non torneranno mai più a cercare testo.

Costruisci la tua vita - quindi scegli la strada giusta.

/ Se questo è stato utile - seguimi /

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali