Kimi K3: Guida completa dalla A alla Z al modello open che ha battuto Fable 5

@kirillk_web3
INGLESE2 giorni fa · 19 lug 2026
235K
78
16
13
156

TL;DR

Kimi K3 è un modello open-source da 2,8 trilioni di parametri di Moonshot AI che rivaleggia con i principali modelli proprietari come Fable 5. Presenta un'architettura innovativa per una programmazione ad alta velocità, con contesto esteso e auto-miglioramento autonomo.

Ecco una suddivisione completa A–Z di cosa è realmente Kimi K3, cosa può fare e perché sta silenziosamente diventando il modello di coding più importante di cui nessuno parla ancora.

Segna questa pagina per non perdere questo articolo.

2,8 trilioni di parametri. 1 milione di token di contesto.

Ecco tutto ciò che contiene.

Prima di parlare dei benchmark, parliamo di ciò che è appena successo

Per gli ultimi tre anni la storia è stata sempre la stessa: i laboratori americani costruiscono la frontiera, i laboratori cinesi costruiscono la copia economica sei mesi dopo.

Il 16 luglio, Moonshot AI ha rilasciato Kimi K3.

https://x.com/Kimi_Moonshot/status/2077830229968683203

2,8 trilioni di parametri totali — circa il 75% in più rispetto a DeepSeek V4 Pro e quasi 4 volte la serie GLM 5 di Zhipu. Il modello open-source più grande mai rilasciato.

Supera Claude Opus 4.8. Supera GPT-5.6 Sol. E nei benchmark di Moonshot, è alla pari con Fable 5 — il modello più capace attualmente disponibile al pubblico.

La storia della copia è finita.

I numeri

Kirill - inline image

Quell'ultima riga è quella che le persone fraintendono. Affrontiamola correttamente.

La realtà dei prezzi — leggila attentamente

Kimi K3 non è un modello economico. A $3/$15 per milione di token, ha un prezzo simile a Claude Sonnet — non ai profondi sconti delle precedenti versioni di Moonshot.

Quindi da dove viene "5 volte più economico di Fable 5"?

Costo per attività, non prezzo per token.

K3 utilizza sostanzialmente meno token di output per completare lo stesso lavoro. In un'attività di coding rappresentativa: Fable 5 costa circa $1,30. K3 costa circa $0,25.

Stesso livello di output. Meno token. Conto totale più basso.

L'inquadramento onesto: prezzo Sonnet, esperienza Fable. Non stai comprando i token più economici sul mercato. Stai comprando capacità di frontiera a un prezzo medio, e ci arrivi in meno passaggi.

Se confronti i prezzi grezzi dei token, K3 sembra insignificante. Se confronti quanto costa portare a termine un lavoro, è un discorso completamente diverso.

Dove Kimi K3 è all'avanguardia

Secondo i benchmark pubblicati da Moonshot, K3 stabilisce lo stato dell'arte su:

  • HLE con strumenti — L'Esame Finale dell'Umanità, con supporto di strumenti
  • SWE-Bench Pro — ingegneria del software nel mondo reale
  • SWE-Bench Multilingue — ingegneria in più linguaggi
  • BrowseComp — navigazione web e ricerca
  • Toolathlon — uso di strumenti su larga scala
  • CharXiv con Python — ragionamento su grafici e figure
  • MathVision con Python — matematica visiva
Kirill - inline image

Rispetto alla concorrenza: supera Opus 4.8 e GPT-5.6 Sol, alla pari con Fable 5.

Nei test alla cieca dell'AI evaluator Arena, gli sviluppatori hanno preferito Kimi rispetto a ogni modello americano leader.

Le due innovazioni architetturali che contano davvero

Questa è la parte che la maggior parte delle coperture sta saltando, ed è la cosa più interessante del rilascio.

Kirill - inline image
  • Kimi Delta Attention (KDA)

Un meccanismo di attenzione lineare ibrido. Il risultato: fino a 6,3x più veloce nella decodifica in contesti di milioni di token.

Una finestra di contesto da 1M è utile solo se puoi effettivamente lavorarci senza aspettare per sempre. KDA è ciò che rende la finestra di contesto pratica invece che teorica.

  • Residui di Attenzione (AttnRes)

Un sostituto drop-in per le connessioni residue. Offre circa il 25% in più di efficienza di addestramento a un costo aggiuntivo inferiore al 2%.

Entrambe le tecniche sono state pubblicate come ricerca aperta dal team di Moonshot su GitHub prima che il modello fosse rilasciato. Non è marketing — è un lavoro verificabile dai pari.

E combinate, spiegano l'efficienza dei token: K3 utilizza il 21% in meno di token di output rispetto a K2.6 su attività equivalenti.

La parte che dovrebbe farti sobbalzare: K3 ha ottimizzato la propria architettura

Moonshot ha dato a K3 l'implementazione dei Residui di Attenzione — il suo stesso componente architetturale — e un obiettivo: renderlo più veloce sull'hardware H200 senza cambiare il comportamento numerico.

Poi lo hanno lasciato fare.

20 ore di esperimenti. Zero intervento umano. 1,6x di accelerazione.

In un'esecuzione separata, K3 ha ridotto il tempo forward/backward di FLA Triton AttnRes da 283,6ms a 114,4ms — un'accelerazione di 2,48x — ancora una volta senza cambiare i numeri.

Kirill - inline image

E ha iterato più velocemente di Fable 5 nello stesso compito.

Leggilo di nuovo. Il modello ha migliorato il meccanismo che fa funzionare il modello. Autonomamente. Durante la notte.

Questo è ciò che "auto-miglioramento ricorsivo" significa in pratica — non uno scenario fantascientifico, un lavoro di 20 ore con un risultato misurabile. È la stessa capacità che Anthropic ha segnalato come motivo di cautela settimane fa, in esecuzione in un modello open-weight che chiunque può scaricare il 27 luglio.

Il coding a lungo orizzonte è il punto centrale

L'inquadramento di Moonshot: "K3 è il modello di coding open-source più potente di Moonshot AI fino ad oggi. Operando con una supervisione umana minima, può sostenere lunghe sessioni di ingegneria, navigare in repository massicci e orchestrare strumenti da terminale."

Le tre cose che contano per il lavoro di ingegneria reale:

  1. Sessioni sostenute — l'esperimento autonomo di 20 ore non è una demo. È il target di progettazione.
  2. Repository massicci — una finestra di contesto da 1M con decodifica 6,3x più veloce significa che puoi mettere un vero codebase nel contesto e lavorarci effettivamente.
  3. Orchestrazione di strumenti — SOTA su Toolathlon e BrowseComp significa che gestisce il terminale, il browser e le chiamate API senza crollare.

Il coding frontend raggiunge il livello di Fable 5. Scene di gioco di qualità AAA da un singolo prompt. WebGPU, Three.js, shader, fisica — cose che prima richiedevano uno studio.

Vibe Coding con Kimi K3

Qui è dove il modello smette di essere un numero di benchmark e inizia a essere chiaramente utile.

Il coding frontend di K3 è al livello di Fable 5. In pratica, ciò significa che il muro tra una descrizione e un prodotto 3D funzionante è ora un solo prompt.

Cosa le persone hanno effettivamente pubblicato da singoli prompt:

Giochi — Arene di combattimento WebGPU con effetti visivi. Esplorazione di città 3D basata su browser con meccaniche di rampino.

  1. Zombie FPS.
  2. Corsa multiplayer.
  3. Un emulatore GBA 3D funzionante.
  4. Impalcatura completa di MMORPG.

Non "una demo simile a un gioco" — scene giocabili con reazioni ai colpi, feedback d'impatto e fisica che si comporta correttamente.

Kirill - inline image

Oggetti 3D con un vero lavoro sui materiali — Un Rolex con corretta lucentezza e comportamento della luce. Un'arma CSGO che si assembla e si smonta in 33 parti modellate singolarmente. Uno smontaggio di una fotocamera Sony. Un buco nero con lente gravitazionale. Simulazione oceanica con dinamiche delle onde reali.

Kirill - inline image

Scene fisiche — Simulazione di tessuti. Collasso strutturale. Collisioni veicolari con trasferimento di quantità di moto che sembra giusto invece di sembrare scriptato.

La cosa che rende questo diverso dalle precedenti demo "AI costruisce un sito web": K3 gestisce i dettagli che di solito si rompono. Illuminazione. Ombre. Lucentezza dei materiali. Le 20 piccole cose che separano "chiaramente generato dall'AI" da "qualcuno lo ha costruito."

Un prompt. Quattro milioni di token. Una scena che prima richiedeva un team.

4 Prompt Collaudati (Pronti per Copia-Incolla)

Sono strutturati per sfruttare ciò in cui K3 è davvero bravo: lavoro a lungo orizzonte, uso di strumenti e mantenimento di un grande contesto senza deviare.

Prompt 1 — Il Test di Stress Fisico

Questo è il prompt che separa le capacità reali dalla lucidatura da demo. Se un modello riesce a fare tutte e tre le scene con qualità, è reale.

text
1Costruisci tre scene canvas HTML5 autonome con fisica reale.
2Niente librerie esterne. Tutto in un file per scena.
3
4Scena 1: Un treno che deraglia da un ponte rotto nell'acqua.
5Includi: quantità di moto dei vagoni, cedimento strutturale del ponte,
6spostamento d'acqua all'impatto.
7
8Scena 2: Due auto che saltano da rampe e si scontrano a mezz'aria
9su un canyon. Includi: traiettorie ad arco corrette,
10trasferimento di quantità di moto alla collisione, detriti.
11
12Scena 3: Un monster truck che schiaccia una fila di auto parcheggiate.
13Includi: compressione delle sospensioni, deformazione della lamiera,
14distribuzione del peso.
15
16Requisiti per tutte e tre:
17- La fisica deve essere calcolata, non animata
18- Target 60fps
19- Includi un pulsante di reset
20- Commenta la matematica della fisica così posso verificarla
21
22Costruisci tutte e tre. Non fare domande di chiarimento.

Prompt 2 — Il Compito su Repository a Lungo Orizzonte

Questo è ciò per cui K3 è stato effettivamente costruito. Puntalo su un vero codebase e dagli un risultato, non un compito.

text
1Leggi tutto questo codebase prima di scrivere qualsiasi cosa.
2
3[incolla il tuo repo, o puntalo sulla directory]
4
5Obiettivo: [dichiara un risultato misurabile — es. "riduci
6il tempo di risposta API p95 del 30%" o "elimina tutte le
7query N+1 nel livello dati"]
8
9Regole:
10- Profila prima. Mostrami dove va effettivamente il tempo
11 prima di cambiare qualsiasi cosa.
12- Non cambiare interfacce pubbliche o comportamento numerico.
13- Esegui la suite di test esistente dopo ogni modifica.
14- Se una modifica peggiora le cose, annullala e dimmi perché.
15- Lavora fino a quando l'obiettivo non viene raggiunto o puoi dimostrare
16 che non è realizzabile senza infrangere le regole.
17
18Riporta alla fine: cosa hai cambiato, cosa hai ottenuto,
19cosa hai provato che non ha funzionato.

La riga "cosa hai provato che non ha funzionato" è importante. È ciò che trasforma l'output da un diff a un registro di ingegneria.

Prompt 3 — La Costruzione di un Prodotto 3D

Per chiunque faccia frontend, pagine di atterraggio o visualizzazione di prodotti.

text
1Costruisci un [oggetto] 3D interattivo nel browser.
2Un singolo file HTML. Three.js.
3
4L'oggetto: [descrivilo precisamente — materiali,
5numero di parti, cosa si muove]
6
7Deve includere:
8- Proprietà dei materiali corrette (lucentezza, rugosità,
9 metallicità dove rilevante)
10- Illuminazione a tre punti con ombre reali
11- Controlli orbitali
12- [Qualsiasi interazione — assemblaggio/smontaggio, animazione,
13 stati hover]
14
15Livello di qualità: questo dovrebbe assomigliare a un render di prodotto,
16non a una demo WebGL. Se un dettaglio sarebbe visibile nella vita reale,
17modellalo.
18
19Costruisci tutto. Mostrami il file.

La riga "livello di qualità" fa più lavoro di qualsiasi altra cosa nel prompt. K3 risponde agli standard, non solo alle istruzioni.

Prompt 4 — Funzionalità in Tempo Reale con una Parte Mobile

Il CRUD full-stack è una forma di app. Il tempo reale è una forma completamente diversa — lo stato deve rimanere sincronizzato tra i client, non solo persistere in un database. Qui è dove molti modelli crollano silenziosamente.

text
1Aggiungi una funzionalità in tempo reale a un'app esistente: un sistema
2di cursore collaborativo live + commenti, come quello di Figma.
3
4REQUISITI:
5- Connessione WebSocket (usa Socket.io o ws nativo)
6- Mostra le posizioni del cursore degli altri utenti connessi in tempo reale
7- Clicca ovunque per lasciare un pin di commento
8- I commenti si aggiornano in tempo reale per tutti i client connessi
9- Gestisci disconnessione/riconnessione con grazia — niente cursori fantasma
10- Debounce degli aggiornamenti del cursore per non sovraccaricare il socket
11
12COSTRUISCI:
131. Configura il server WebSocket
142. Costruisci la connessione lato client con auto-riconnessione
153. Implementa la trasmissione del cursore con debouncing
164. Implementa il sistema di pin dei commenti
175. Aggiungi un semplice indicatore di presenza (chi è online)
186. Testa con almeno 2 client simulati per confermare la sincronizzazione
19
20Mostrami come hai testato la sincronizzazione multi-client prima di dichiararlo finito.

Risultato atteso: Un livello in tempo reale funzionante in 15-30 minuti, con prova visibile che è stato testato contro più di un client.

Kirill - inline image

L'ultima riga è la parte importante. I bug in tempo reale non si mostrano con una scheda del browser aperta — si mostrano con due. Un modello che salta i test multi-client ti darà codice che sembra finito ma non lo è.

Quando K3 sbaglia: Guida alla risoluzione dei problemi

È un modello nuovo con veri spigoli. Ecco cosa si rompe e cosa fare.

  • Problema: Brucia token su compiti banali

Questo è il più grosso, ed è strutturale.

K3 attualmente viene fornito con un solo livello di sforzo di ragionamento — 'max'. Non esiste una modalità "rispondi e basta velocemente." I tester indipendenti hanno cronometrato 13.241 token di ragionamento per generare un semplice SVG — circa $0,25 per qualcosa che dovrebbe costare frazioni di centesimo.

La soluzione:

non instradare lavori semplici a K3. È un modello di frontiera con una sola marcia, e quella marcia è "pensa a fondo su tutto." Usa K2.7 o un modello più piccolo per boilerplate, formattazione e tutto ciò che è meccanico. Riserva K3 per lavori che giustifichino il ragionamento.

Questo è l'errore più grande che la gente farà nel primo mese: rendere K3 il predefinito per tutto e poi essere sorpresi dal conto.

  • Problema: La finestra di contesto si riempie comunque

1M di token sembra infinito finché non ci metti un vero repo e non lo è.

La soluzione:

non scaricare tutto. Puntalo sulle directory che contano. La forza di K3 nel lavoro a lungo orizzonte viene dalla concentrazione sostenuta, non dall'avere ogni file nel contesto. Un contenuto di 200K ben mirato batte un intero monorepo gonfiato di 900K.

  • Problema: Deriva in esecuzioni autonome molto lunghe

L'esperimento autonomo di 20 ore è reale, ma ha funzionato perché l'obiettivo era misurabile — "rendi questo più veloce su H200 senza cambiare i numeri." Dagli un obiettivo vago e una lunga libertà e si perderà.

La soluzione:

ogni prompt a lungo orizzonte ha bisogno di una condizione di successo verificabile. Non "migliora il codice." Un numero, un test che passa, un benchmark che si muove. Se non puoi dire come verificheresti se ha avuto successo, deriverà.

  • Problema: Non riesci a riprodurre il risultato del benchmark di qualcuno

Nessuno al di fuori di Moonshot ha verificato questo modello. I pesi non vengono rilasciati fino al 27 luglio. Ogni numero che circola ora — incluso in questo articolo — è riportato dal fornitore.

La soluzione:

aspetta il 27 luglio, oppure testa sui tuoi compiti e fidati di quello invece. I tuoi cinque compiti reali valgono più della tabella dei benchmark di chiunque.

  • Problema: Errori di integrazione dopo il passaggio da OpenAI o Anthropic

K3 è compatibile con l'SDK di OpenAI, il che gestisce il 90% della migrazione. Il restante 10% è di solito il comportamento di ragionamento — K3 pensa per impostazione predefinita e restituisce token di ragionamento che potresti non aspettarti nella gestione delle risposte.

La soluzione:

controlla la tua contabilità dei token e il parsing delle risposte prima di presumere che il modello sia rotto. La maggior parte delle lamentele "K3 è costoso" sono in realtà "ho dimenticato che i token di ragionamento sono token di output."

Il contesto che nessuno dovrebbe ignorare

Moonshot ha sede a Pechino, fondata da Yang Zhilin, ex ricercatore di Google, e supportata da Alibaba.

https://x.com/kirillk_web3/status/2057528102368977328

Hanno costruito un modello di frontiera da 2,8 trilioni di parametri sotto tre anni di crescenti controlli all'esportazione degli Stati Uniti sui chip avanzati.

Gli analisti di Bank of America lo hanno detto direttamente: "Nonostante i persistenti vincoli di capacità hardware/computazionale in Cina, K3 dimostra che lo scaling pre-addestrativo, abbinato all'innovazione architetturale, può ancora fornire miglioramenti radicali per i modelli cinesi di punta."

E il tempismo non è casuale: K3 è arrivato giorni prima della Conferenza Mondiale sull'Intelligenza Artificiale 2026 a Shanghai.

La domanda del 27 luglio

I pesi vengono rilasciati il 27 luglio. Quella data conta più della data di lancio.

Fino ad allora, K3 è un modello di frontiera che puoi usare tramite API — impressionante.

Il 27 luglio, diventa qualcos'altro: un modello di classe frontiera che chiunque può scaricare, ispezionare, modificare ed eseguire sul proprio hardware. Nessuna API. Nessun limite di utilizzo. Nessun termine di servizio. Nessuna conservazione dei prompt per 30 giorni.

Questa è la vera storia. Non "La Cina ha raggiunto."

La Cina ha raggiunto e lo ha regalato.

Kirill - inline image

Vale la pena notare: i regolatori cinesi hanno discusso di propri controlli all'esportazione dell'AI. Se K3 sia l'ultimo rilascio open-weight di frontiera dalla Cina o il primo di molti è genuinamente poco chiaro in questo momento.

Come provarlo

Chat: kimi.com — K3 è live ora

API: Compatibile con l'SDK di OpenAI, quindi se stai già costruendo su toolchain OpenAI o Anthropic, l'integrazione è un cambio di configurazione, non una riscrittura

Pesi: 27 luglio

La compatibilità con l'SDK è più importante di quanto sembri. Cambiare modello di solito significa riscrivere il livello di integrazione. Qui significa cambiare un URL di base e una stringa del modello.

Come installare Kimi Code (L'Agente Terminale)

Se vuoi K3 in esecuzione all'interno del tuo codebase effettivo invece di una finestra di chat, questa è la configurazione.

Kirill - inline image

Requisiti:

  • Un computer (Mac, Windows o Linux)
  • Accesso al terminale
  • Account Kimi — kimi.com

Passo 1 — Installa Kimi Code

Mac/Linux:

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell):

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

Su Windows, installa prima Git per Windows — la CLI di Kimi Code usa il suo Git Bash integrato come ambiente shell.

Verifica l'installazione:

bash
1kimi --version

A causa di macOS Gatekeeper, il primo avvio potrebbe richiedere molto più tempo. Aggiungi la tua app terminale in Impostazioni di Sistema → Privacy e Sicurezza → Strumenti per sviluppatori per velocizzare gli avvii successivi.

Se hai già uv installato, puoi installare direttamente:

bash
1uv tool install --python 3.13 kimi-cli

La CLI di Kimi Code supporta Python 3.12–3.14, con 3.13 raccomandato per la migliore compatibilità.

Passo 2 — Naviga nel tuo progetto e avvia

bash
1cd tuo-progetto
2kimi

Al primo avvio, esegui /login all'interno della sessione per configurare la tua fonte API — si apre una finestra del browser per l'OAuth.

Passo 3 — Dagli un compito

Kimi Code è ora in esecuzione all'interno del tuo progetto, con accesso diretto in lettura/scrittura a ogni file. Descrivi un compito in inglese semplice — pianifica i passaggi, modifica il codice, esegue i test e riporta cosa ha fatto.

Cosa significa realmente

Se stai eseguendo carichi di lavoro di produzione:

Testalo prima di cambiare. I benchmark dei fornitori e le prestazioni nel mondo reale divergono costantemente. Scegli cinque compiti reali, esegui K3 e il tuo modello attuale fianco a fianco, misura il costo per lavoro completato — non il costo per token.

Kirill - inline image

Il calcolo per attività è l'intero argomento. A $3/$15 K3 non è economico sulla carta. Con il 21% in meno di token e output di livello Fable, è economico dove conta.

Il 27 luglio cambia le carte in tavola. I pesi aperti significano self-hosting, fine-tuning e zero dipendenza dall'API di qualcuno che rimanga online o dai termini di qualcuno che rimangano favorevoli. Per qualsiasi cosa sensibile, non è una cosa da poco.

Conclusione

La frontiera era un posto che i laboratori americani costruivano e tutti gli altri visitavano sei mesi dopo.

2,8 trilioni di parametri. 1M di contesto. Coding di livello Fable 5 al prezzo di Sonnet. Costruito sotto controlli all'esportazione, dal laboratorio con la valutazione più bassa nella stanza, e regalato il 27 luglio.

La domanda interessante non è se K3 batta Fable 5 su qualche benchmark. È cosa succede all'economia dei modelli di frontiera chiusi quando uno open-weight li eguaglia.

Link

Segui per altre informazioni su Vibe Coding. Grazie per aver letto!

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali