Kimi K3 è stato rilasciato il 16 luglio 2026. 2,8 trilioni di parametri. Contesto di 1 milione di token. Il modello open-weight più grande mai pubblicato.
La funzionalità principale è K3 Swarm Max: fino a 300 sub-agenti in esecuzione in parallelo, che coordinano fino a 4.000 passaggi, producendo file reali invece di risposte testuali. Due varianti condividono lo stesso cervello. K3 Max gestisce le attività quotidiane. K3 Swarm Max punta un'intera flotta sul problema.

La maggior parte delle persone apre Kimi, scrive una domanda, ottiene una risposta e chiude la scheda. Questo è circa il 10% di ciò che il prodotto fa. Questa guida copre l'altro 90%.

Lo sciame non è un componente aggiuntivo. L'orchestratore è una policy appresa tramite Parallel-Agent Reinforcement Learning. Descrivi l'obiettivo. Lo sciame decide come suddividerlo, quanti agenti generare e come ricombinare i risultati. Gli sciami eccellono in lavori ampi e parallelizzabili: ricerca su più di 50 fonti, analisi batch, monitoraggio competitivo, creazione di dataset. Hanno difficoltà con compiti sequenziali profondi in cui il passaggio 3 dipende dal passaggio 2.

- Scrivi un capitolato, non un prompt
"Analizza il mercato delle app per il fitness" è il modo per bruciare crediti e ottenere risultati scadenti. Un prompt di una riga dà allo sciame il permesso di decidere tutto. Deciderà male.

Tratta lo sciame come un appaltatore. Un capitolato definisce cosa raccogliere, cosa conta come valido, quali fonti sono consentite, il formato esatto dell'output e cosa fare in caso di conflitto. Il capitolato è l'elemento singolo a più alta leva in tutto il flusso di lavoro, perché nel Livello 2 diventa il seme della tua Skill riutilizzabile.
1# PROGETTO: [nome]2OBIETTIVO: [una frase, il risultato finale, non l'argomento]3AMBITO: [cosa è incluso, cosa è esplicitamente escluso]4REGOLE: [validazione, cosa conta come risultato verificato]5FONTI: [post ufficiali, articoli scientifici, solo fonti primarie, niente aggregatori]6OUTPUT: [tipo di file / quantità / nome / dettagli sul formato]7IN CASO DI CONFLITTO: contrassegna la riga, mai risolvere silenziosamente8CONDIZIONE DI ARRESTO: [quando fermarsi e segnalare invece di indovinare]
- Leggi il piano di scomposizione prima di spendere
Dopo aver inviato il capitolato, Kimi ti mostra il piano di esecuzione prima di eseguirlo: quanti sub-agenti, cosa gestisce ciascuno, l'ordine delle dipendenze, il budget di passaggi. Questo è il passaggio che i principianti saltano, ed è il più costoso da saltare.

Uno sciame di 200 agenti scomposto in modo errato costa soldi veri. Controllare il piano non costa nulla. Devi cercare tre cose: se ha capito l'ambito, se il numero di agenti è adeguato al compito e se il piano di output corrisponde a ciò di cui hai effettivamente bisogno.
1Mostrami la scomposizione proposta prima di eseguire:2- quanti sub-agenti e cosa gestisce ciascuno3- l'ordine delle dipendenze (cosa blocca cosa)4- budget di passaggi stimato5- dove si trova il rischio maggiore di calo di qualità6NON eseguire ancora. Aspetta la mia conferma.
Un dettaglio che vale la pena conoscere: i 4.000 passaggi sono un budget coordinato totale per l'intero sciame, non 4.000 per agente. Un'esecuzione con 300 agenti ha una media di circa 13 passaggi ciascuno. Questo ti dice se il tuo compito è adatto a questa forma.
- Esegui
Ora esegui. Fino a 300 sub-agenti si attivano in ondate parallele, ciascuno nel proprio contesto delimitato. Solo l'output strutturato torna al coordinatore.
1Esegui il capitolato dall'inizio alla fine.2Parallelizza ovunque il piano lo consenta.3Segnala immediatamente qualsiasi blocco, non aggirarlo silenziosamente.4Unisci tutto nell'OUTPUT definito nel capitolato.
Cosa ottieni dopo il Livello 1
Un singolo output dello sciame costruito dal tuo capitolato. Grezzo, non verificato, ma strutturato. La maggior parte delle persone si ferma qui. Il valore inizia nel Livello 2.

- Richiedi file veri, non una risposta testuale
"Un report completo" dà agli agenti il permesso di fermarsi presto. "Un PDF di 40 pagine + un CSV con 20.000 righe + 14 grafici PNG pronti per l'esportazione" dà loro un obiettivo di qualità.
Inizia sempre il capitolato con l'output. La specificità a livello di output è la differenza tra un team di ricerca e una costosa cassetta dei suggerimenti.
1# esempi di output forti:2OUTPUT: 1 .xlsx, una riga per modello, + brief di 200 parole3OUTPUT: 30 file HTML, uno per negozio, nominati per attività4OUTPUT: PDF di 40 pagine + CSV di 20.000 righe + 14 grafici PNG
- Richiedi file veri, non una risposta testuale
"Un report completo" dà agli agenti il permesso di fermarsi presto. "Un PDF di 40 pagine + un CSV con 20.000 righe + 14 grafici PNG pronti per l'esportazione" dà loro un obiettivo di qualità. Inizia sempre il capitolato con l'output. La specificità a livello di output è la differenza tra un team di ricerca e una costosa cassetta dei suggerimenti.
1# esempi di output forti:2OUTPUT: 1 .xlsx, una riga per modello, + brief di 200 parole3OUTPUT: 30 file HTML, uno per negozio, nominati per attività4OUTPUT: PDF di 40 pagine + CSV di 20.000 righe + 14 grafici PNG
- Punta un modello separato sull'output
Il difetto noto dello sciame: a meno che tu non richieda esplicitamente la verifica, produce affermazioni sicure ma poco citate, e i sub-agenti indipendenti a volte si contraddicono a vicenda. "Sembra finito" ed "è corretto" sono pianeti diversi.
Usa un secondo modello come gate di verifica. Il suo unico compito: confutare, non lodare. Non stai pagando token premium per generare. Li stai pagando per cogliere il difetto silenzioso prima che il passaggio successivo salvi il flusso di lavoro come Skill riutilizzabile.

1Sei il VERIFICATORE. Uno sciame di agenti ha prodotto l'output allegato.2Il tuo unico compito è trovare cosa non va.34Controlla:5- Ogni cifra dichiarata risale a una fonte nominata?6- Due sezioni qualsiasi si contraddicono a vicenda?7- Qualcosa è presentato come fatto che in realtà è un'inferenza?8- L'output corrisponde ai requisiti di formato del capitolato?910Per ogni problema: cita la posizione esatta e la correzione.11Se tutto è a posto: APPROVATO.12Se qualcosa fallisce: RIFIUTATO + la singola correzione più critica per prima.
- Salva l'intero flusso di lavoro come Skill
Dopo un'esecuzione verificata, chiedi a Kimi di catturare l'intero flusso di lavoro: formato di input, passaggi degli agenti, formato di output, regole di validazione. La prima esecuzione richiede 20 minuti. Ogni esecuzione successiva richiede 30 secondi. La Skill è il motivo per cui il sistema si accumula invece di ricominciare ogni volta.
1Salva l'intero flusso di lavoro come Skill riutilizzabile: "[nome]"2Cattura:3- formato di input (che tipo di file / forma di capitolato si aspetta)4- i passaggi degli agenti che hanno funzionato5- il formato di output e la convenzione di denominazione6- le regole di validazione dal capitolato7La prossima volta che lo eseguo, allego nuovi file e ottengo la stessa forma.
Cosa ottieni dopo il Livello 2
Un output verificato di cui ti puoi fidare e una Skill salvata che puoi riprodurre senza ricostruire il capitolato. È qui che il ciclo inizia ad accumularsi.

- Inserisci i tuoi documenti come conoscenza dello sciame
Le Skill catturano il processo. Il Document-to-Skill cattura il dominio. Carica il tuo lavoro migliore e Kimi ne cattura l'impronta strutturale come una skill che ogni futuro sciame applicherà.

Ogni PDF, trascrizione o foglio di calcolo che inserisci diventa un contesto su cui tutti i 300 agenti si basano, invece di ripiegare sui dati di addestramento. Più gliene dai, più l'output assomiglierà al tuo lavoro invece che a un'IA generica.
1Cattura questo documento come una skill riutilizzabile. Identifica cosa lo rende efficace:2- struttura e ordine delle sezioni3- tono e registro vocale4- profondità di analisi per sezione5Salvalo come "[nome]". Poi produci un nuovo documento su [argomento diverso]6usando la skill catturata. Raggiungi lo stesso livello di qualità, non lo stesso contenuto.
- Trasforma ogni rifiuto in una regola permanente
Il passaggio di verifica coglie un difetto una volta. Questo passaggio fa sì che lo sciame non lo ripeta mai più. Distilla il feedback in regole rigide e scrivile in un file di vincoli che lo sciame legge prima di fare qualsiasi cosa.
1# VINCOLI.md, caricato automaticamente2- ogni cifra dichiarata deve risalire a una fonte primaria o essere contrassegnata3- nessuna risoluzione silenziosa dei conflitti: rendi palesi le contraddizioni4- [regola distillata dal feedback del verificatore dell'ultima esecuzione]5- [l'errore che non vuoi che si ripeta mai]6Blocco ambito: non toccare nulla al di fuori del blocco AMBITO del capitolato.
- Riproduci la skill su nuovi input
È qui che "accumulazione" smette di essere una parola d'ordine e si manifesta in fattura. La seconda esecuzione non parte da zero. Parte dalla skill, dalla conoscenza dello sciame e dal file di vincoli che hai costruito sopra. Stesso flusso di lavoro, nuovi file, una frazione della configurazione.
L'economia cambia drasticamente con la riproduzione. Il prezzo del cache-hit di K3 scende a $0,30 per milione di token per il contesto ripetuto, 10 volte più economico del prezzo di input della prima esecuzione. La skill, i vincoli e il capitolato sono tutto contesto ripetuto. Solo i tuoi nuovi file di input costano la tariffa intera. La prima esecuzione è un investimento. Ogni esecuzione successiva raccoglie il ritorno.

Anche l'output migliora strutturalmente. La Skill impone il formato. I vincoli bloccano ogni errore che il verificatore ha già colto. La conoscenza dello sciame basa ogni agente sui tuoi documenti reali invece che sui dati di addestramento. La quarta esecuzione non solo costa meno della prima. Produce risultati migliori, perché il sistema ha imparato da tre cicli di feedback reali.

1Esegui la skill salvata "[nome]" su questi nuovi input.2Applica VINCOLI.md. Usa il formato di output catturato.3[allega nuovi file]45Confronta l'output di questa esecuzione con l'ultima.6Segnala:7- nuovi risultati non presenti l'ultima volta8- risultati che sono cambiati dall'ultima esecuzione9- qualsiasi cosa che è scomparsa (segnala come potenziale lacuna)10- deviazioni dalla forma prevista della skill
Cosa ottieni dopo il Livello 3
Una pipeline di ricerca auto-migliorante. Ogni esecuzione è più economica, più veloce e più precisa della precedente perché la libreria di skill, la base di conoscenza e il file di vincoli continuano a crescere.

- Promuovi la skill a un agente programmato
Una volta che il ciclo è stabile e basato su skill, smetti di lanciarlo manualmente. Punta Kimi a un trigger: una pianificazione, un nuovo file in arrivo, un URL monitorato. Lascia che esegua l'intero sciame in modo proattivo, mostrando solo il risultato finale e le deviazioni che meritano la tua attenzione.

Il monitoraggio competitivo è l'esempio perfetto. Prima esecuzione: costruisci e verifica manualmente. Quando diventa un agente in background, sta controllando ogni concorrente in parallelo ogni settimana e lasciando un brief nella tua casella di posta a costo marginale zero. L'unico essere umano rimasto nel ciclo sei tu, con la domanda che hai posto e la decisione che prendi sulla risposta.
1Esegui la skill "[nome]" con cadenza settimanale.2Trigger: [pianificazione / nuovo file / URL monitorato]3Ad ogni esecuzione: esegui lo sciame, applica VINCOLI.md,4verifica, poi consegna l'OUTPUT + un diff rispetto all'ultima esecuzione.5Avvisami solo se una deviazione supera [soglia].
Cosa 2,8T di parametri non risolvono

L'allucinazione scala con il parallelismo. Più agenti cercano significa più risposte errate ma sicure di sé, a meno che non esegui un passaggio di verifica. Lo sciame non verifica i fatti da solo.
K3 costa 3-4 volte più di K2.6. Input: $3,00/M contro $0,95/M. Output: $15,00/M contro $4,00/M. La cache aiuta nelle riproduzioni, ma la prima esecuzione è costosa. Per la pura ottimizzazione dei costi, K2.6 è ancora la scelta economica.
I pesi aperti non sono ancora stati rilasciati. Moonshot li ha promessi per il 27 luglio 2026. Fino ad allora, K3 è disponibile solo tramite API e l'app Kimi.
Gli sciami amplificano i capitolati scadenti. Un prompt vago attraverso un agente spreca una finestra di contesto. Attraverso 300 agenti ne spreca 300 in parallelo.
L'elenco rapido
- Prompt di una riga. Lo sciame decide tutto. Decide male.
- Saltare la revisione della scomposizione. Il passaggio più costoso da saltare.
- Nessun passaggio di verifica. "Sembra finito" non è "è corretto."
- Salvare un output non verificato come skill. L'errore si accumula in ogni esecuzione futura.
- 300 agenti per un compito sequenziale. Uno sciame non può parallelizzare una catena di pensiero.
- Usare K3 dove K2.6 è sufficiente. Non tutti i compiti hanno bisogno di 2,8T parametri.
Conclusione
La maggior parte delle persone aprirà Kimi, scriverà una domanda, chiuderà la scheda. Questa è la chatbox. È circa il 10% di ciò che K3 fa.
L'altro 90% è un team di ricerca che costruisci una volta e riproduci per sempre. Ogni livello sblocca più leva: prima esecuzione, poi fiducia, poi accumulazione, poi autonomia. Non hai bisogno di tutti e quattro il primo giorno. Inizia al Livello 1 con un capitolato. Se l'output è utile, passa al Livello 2 e verificalo. Se hai intenzione di eseguirlo di nuovo, salva la Skill. Il sistema diventerà più affilato da lì in poi da solo.
Scrivi il capitolato, non il prompt. Verifica prima di salvare. Poi guarda ogni esecuzione diventare più economica e più precisa della precedente.

![[Memo] I capi stanno tagliando i ponti con i subordinati meno performanti](/cdn-cgi/image/width=1920,quality=90,format=auto,metadata=none/https%3A%2F%2Fcms-assets.youmind.com%2Fmedia%2F1784827522698_408j7z_HN3Kb76awAAvvjF.jpg)



