Kimi K3 Swarm Max: come eseguire 300 agenti di ricerca da un singolo prompt

@choopyplug1
INGLESE1 giorno fa · 22 lug 2026
105K
46
5
7
74

TL;DR

Questa guida spiega come sfruttare la funzionalità Swarm Max di Kimi K3 per eseguire 300 agenti in parallelo per ricerche complesse, ponendo l'accento su specifiche strutturate e gate di verifica.

Kimi K3 è stato rilasciato il 16 luglio 2026. 2,8 trilioni di parametri. Contesto di 1 milione di token. Il modello open-weight più grande mai pubblicato.

La funzionalità principale è K3 Swarm Max: fino a 300 sub-agenti in esecuzione in parallelo, che coordinano fino a 4.000 passaggi, producendo file reali invece di risposte testuali. Due varianti condividono lo stesso cervello. K3 Max gestisce le attività quotidiane. K3 Swarm Max punta un'intera flotta sul problema.

chuplung - inline image

La maggior parte delle persone apre Kimi, scrive una domanda, ottiene una risposta e chiude la scheda. Questo è circa il 10% di ciò che il prodotto fa. Questa guida copre l'altro 90%.

chuplung - inline image

Lo sciame non è un componente aggiuntivo. L'orchestratore è una policy appresa tramite Parallel-Agent Reinforcement Learning. Descrivi l'obiettivo. Lo sciame decide come suddividerlo, quanti agenti generare e come ricombinare i risultati. Gli sciami eccellono in lavori ampi e parallelizzabili: ricerca su più di 50 fonti, analisi batch, monitoraggio competitivo, creazione di dataset. Hanno difficoltà con compiti sequenziali profondi in cui il passaggio 3 dipende dal passaggio 2.

chuplung - inline image
  • Scrivi un capitolato, non un prompt

"Analizza il mercato delle app per il fitness" è il modo per bruciare crediti e ottenere risultati scadenti. Un prompt di una riga dà allo sciame il permesso di decidere tutto. Deciderà male.

chuplung - inline image

Tratta lo sciame come un appaltatore. Un capitolato definisce cosa raccogliere, cosa conta come valido, quali fonti sono consentite, il formato esatto dell'output e cosa fare in caso di conflitto. Il capitolato è l'elemento singolo a più alta leva in tutto il flusso di lavoro, perché nel Livello 2 diventa il seme della tua Skill riutilizzabile.

text
1# PROGETTO: [nome]
2OBIETTIVO: [una frase, il risultato finale, non l'argomento]
3AMBITO: [cosa è incluso, cosa è esplicitamente escluso]
4REGOLE: [validazione, cosa conta come risultato verificato]
5FONTI: [post ufficiali, articoli scientifici, solo fonti primarie, niente aggregatori]
6OUTPUT: [tipo di file / quantità / nome / dettagli sul formato]
7IN CASO DI CONFLITTO: contrassegna la riga, mai risolvere silenziosamente
8CONDIZIONE DI ARRESTO: [quando fermarsi e segnalare invece di indovinare]
  • Leggi il piano di scomposizione prima di spendere

Dopo aver inviato il capitolato, Kimi ti mostra il piano di esecuzione prima di eseguirlo: quanti sub-agenti, cosa gestisce ciascuno, l'ordine delle dipendenze, il budget di passaggi. Questo è il passaggio che i principianti saltano, ed è il più costoso da saltare.

chuplung - inline image

Uno sciame di 200 agenti scomposto in modo errato costa soldi veri. Controllare il piano non costa nulla. Devi cercare tre cose: se ha capito l'ambito, se il numero di agenti è adeguato al compito e se il piano di output corrisponde a ciò di cui hai effettivamente bisogno.

text
1Mostrami la scomposizione proposta prima di eseguire:
2- quanti sub-agenti e cosa gestisce ciascuno
3- l'ordine delle dipendenze (cosa blocca cosa)
4- budget di passaggi stimato
5- dove si trova il rischio maggiore di calo di qualità
6NON eseguire ancora. Aspetta la mia conferma.

Un dettaglio che vale la pena conoscere: i 4.000 passaggi sono un budget coordinato totale per l'intero sciame, non 4.000 per agente. Un'esecuzione con 300 agenti ha una media di circa 13 passaggi ciascuno. Questo ti dice se il tuo compito è adatto a questa forma.

  • Esegui

Ora esegui. Fino a 300 sub-agenti si attivano in ondate parallele, ciascuno nel proprio contesto delimitato. Solo l'output strutturato torna al coordinatore.

text
1Esegui il capitolato dall'inizio alla fine.
2Parallelizza ovunque il piano lo consenta.
3Segnala immediatamente qualsiasi blocco, non aggirarlo silenziosamente.
4Unisci tutto nell'OUTPUT definito nel capitolato.

Cosa ottieni dopo il Livello 1

Un singolo output dello sciame costruito dal tuo capitolato. Grezzo, non verificato, ma strutturato. La maggior parte delle persone si ferma qui. Il valore inizia nel Livello 2.

chuplung - inline image
  • Richiedi file veri, non una risposta testuale

"Un report completo" dà agli agenti il permesso di fermarsi presto. "Un PDF di 40 pagine + un CSV con 20.000 righe + 14 grafici PNG pronti per l'esportazione" dà loro un obiettivo di qualità.

Inizia sempre il capitolato con l'output. La specificità a livello di output è la differenza tra un team di ricerca e una costosa cassetta dei suggerimenti.

text
1# esempi di output forti:
2OUTPUT: 1 .xlsx, una riga per modello, + brief di 200 parole
3OUTPUT: 30 file HTML, uno per negozio, nominati per attività
4OUTPUT: PDF di 40 pagine + CSV di 20.000 righe + 14 grafici PNG
  • Richiedi file veri, non una risposta testuale

"Un report completo" dà agli agenti il permesso di fermarsi presto. "Un PDF di 40 pagine + un CSV con 20.000 righe + 14 grafici PNG pronti per l'esportazione" dà loro un obiettivo di qualità. Inizia sempre il capitolato con l'output. La specificità a livello di output è la differenza tra un team di ricerca e una costosa cassetta dei suggerimenti.

text
1# esempi di output forti:
2OUTPUT: 1 .xlsx, una riga per modello, + brief di 200 parole
3OUTPUT: 30 file HTML, uno per negozio, nominati per attività
4OUTPUT: PDF di 40 pagine + CSV di 20.000 righe + 14 grafici PNG
  • Punta un modello separato sull'output

Il difetto noto dello sciame: a meno che tu non richieda esplicitamente la verifica, produce affermazioni sicure ma poco citate, e i sub-agenti indipendenti a volte si contraddicono a vicenda. "Sembra finito" ed "è corretto" sono pianeti diversi.

Usa un secondo modello come gate di verifica. Il suo unico compito: confutare, non lodare. Non stai pagando token premium per generare. Li stai pagando per cogliere il difetto silenzioso prima che il passaggio successivo salvi il flusso di lavoro come Skill riutilizzabile.

chuplung - inline image
text
1Sei il VERIFICATORE. Uno sciame di agenti ha prodotto l'output allegato.
2Il tuo unico compito è trovare cosa non va.
3
4Controlla:
5- Ogni cifra dichiarata risale a una fonte nominata?
6- Due sezioni qualsiasi si contraddicono a vicenda?
7- Qualcosa è presentato come fatto che in realtà è un'inferenza?
8- L'output corrisponde ai requisiti di formato del capitolato?
9
10Per ogni problema: cita la posizione esatta e la correzione.
11Se tutto è a posto: APPROVATO.
12Se qualcosa fallisce: RIFIUTATO + la singola correzione più critica per prima.
  • Salva l'intero flusso di lavoro come Skill

Dopo un'esecuzione verificata, chiedi a Kimi di catturare l'intero flusso di lavoro: formato di input, passaggi degli agenti, formato di output, regole di validazione. La prima esecuzione richiede 20 minuti. Ogni esecuzione successiva richiede 30 secondi. La Skill è il motivo per cui il sistema si accumula invece di ricominciare ogni volta.

text
1Salva l'intero flusso di lavoro come Skill riutilizzabile: "[nome]"
2Cattura:
3- formato di input (che tipo di file / forma di capitolato si aspetta)
4- i passaggi degli agenti che hanno funzionato
5- il formato di output e la convenzione di denominazione
6- le regole di validazione dal capitolato
7La prossima volta che lo eseguo, allego nuovi file e ottengo la stessa forma.

Cosa ottieni dopo il Livello 2

Un output verificato di cui ti puoi fidare e una Skill salvata che puoi riprodurre senza ricostruire il capitolato. È qui che il ciclo inizia ad accumularsi.

chuplung - inline image
  • Inserisci i tuoi documenti come conoscenza dello sciame

Le Skill catturano il processo. Il Document-to-Skill cattura il dominio. Carica il tuo lavoro migliore e Kimi ne cattura l'impronta strutturale come una skill che ogni futuro sciame applicherà.

chuplung - inline image

Ogni PDF, trascrizione o foglio di calcolo che inserisci diventa un contesto su cui tutti i 300 agenti si basano, invece di ripiegare sui dati di addestramento. Più gliene dai, più l'output assomiglierà al tuo lavoro invece che a un'IA generica.

text
1Cattura questo documento come una skill riutilizzabile. Identifica cosa lo rende efficace:
2- struttura e ordine delle sezioni
3- tono e registro vocale
4- profondità di analisi per sezione
5Salvalo come "[nome]". Poi produci un nuovo documento su [argomento diverso]
6usando la skill catturata. Raggiungi lo stesso livello di qualità, non lo stesso contenuto.
  • Trasforma ogni rifiuto in una regola permanente

Il passaggio di verifica coglie un difetto una volta. Questo passaggio fa sì che lo sciame non lo ripeta mai più. Distilla il feedback in regole rigide e scrivile in un file di vincoli che lo sciame legge prima di fare qualsiasi cosa.

text
1# VINCOLI.md, caricato automaticamente
2- ogni cifra dichiarata deve risalire a una fonte primaria o essere contrassegnata
3- nessuna risoluzione silenziosa dei conflitti: rendi palesi le contraddizioni
4- [regola distillata dal feedback del verificatore dell'ultima esecuzione]
5- [l'errore che non vuoi che si ripeta mai]
6Blocco ambito: non toccare nulla al di fuori del blocco AMBITO del capitolato.
  • Riproduci la skill su nuovi input

È qui che "accumulazione" smette di essere una parola d'ordine e si manifesta in fattura. La seconda esecuzione non parte da zero. Parte dalla skill, dalla conoscenza dello sciame e dal file di vincoli che hai costruito sopra. Stesso flusso di lavoro, nuovi file, una frazione della configurazione.

L'economia cambia drasticamente con la riproduzione. Il prezzo del cache-hit di K3 scende a $0,30 per milione di token per il contesto ripetuto, 10 volte più economico del prezzo di input della prima esecuzione. La skill, i vincoli e il capitolato sono tutto contesto ripetuto. Solo i tuoi nuovi file di input costano la tariffa intera. La prima esecuzione è un investimento. Ogni esecuzione successiva raccoglie il ritorno.

chuplung - inline image

Anche l'output migliora strutturalmente. La Skill impone il formato. I vincoli bloccano ogni errore che il verificatore ha già colto. La conoscenza dello sciame basa ogni agente sui tuoi documenti reali invece che sui dati di addestramento. La quarta esecuzione non solo costa meno della prima. Produce risultati migliori, perché il sistema ha imparato da tre cicli di feedback reali.

chuplung - inline image
text
1Esegui la skill salvata "[nome]" su questi nuovi input.
2Applica VINCOLI.md. Usa il formato di output catturato.
3[allega nuovi file]
4
5Confronta l'output di questa esecuzione con l'ultima.
6Segnala:
7- nuovi risultati non presenti l'ultima volta
8- risultati che sono cambiati dall'ultima esecuzione
9- qualsiasi cosa che è scomparsa (segnala come potenziale lacuna)
10- deviazioni dalla forma prevista della skill

Cosa ottieni dopo il Livello 3

Una pipeline di ricerca auto-migliorante. Ogni esecuzione è più economica, più veloce e più precisa della precedente perché la libreria di skill, la base di conoscenza e il file di vincoli continuano a crescere.

chuplung - inline image
  • Promuovi la skill a un agente programmato

Una volta che il ciclo è stabile e basato su skill, smetti di lanciarlo manualmente. Punta Kimi a un trigger: una pianificazione, un nuovo file in arrivo, un URL monitorato. Lascia che esegua l'intero sciame in modo proattivo, mostrando solo il risultato finale e le deviazioni che meritano la tua attenzione.

chuplung - inline image

Il monitoraggio competitivo è l'esempio perfetto. Prima esecuzione: costruisci e verifica manualmente. Quando diventa un agente in background, sta controllando ogni concorrente in parallelo ogni settimana e lasciando un brief nella tua casella di posta a costo marginale zero. L'unico essere umano rimasto nel ciclo sei tu, con la domanda che hai posto e la decisione che prendi sulla risposta.

text
1Esegui la skill "[nome]" con cadenza settimanale.
2Trigger: [pianificazione / nuovo file / URL monitorato]
3Ad ogni esecuzione: esegui lo sciame, applica VINCOLI.md,
4verifica, poi consegna l'OUTPUT + un diff rispetto all'ultima esecuzione.
5Avvisami solo se una deviazione supera [soglia].

Cosa 2,8T di parametri non risolvono

chuplung - inline image

L'allucinazione scala con il parallelismo. Più agenti cercano significa più risposte errate ma sicure di sé, a meno che non esegui un passaggio di verifica. Lo sciame non verifica i fatti da solo.

K3 costa 3-4 volte più di K2.6. Input: $3,00/M contro $0,95/M. Output: $15,00/M contro $4,00/M. La cache aiuta nelle riproduzioni, ma la prima esecuzione è costosa. Per la pura ottimizzazione dei costi, K2.6 è ancora la scelta economica.

I pesi aperti non sono ancora stati rilasciati. Moonshot li ha promessi per il 27 luglio 2026. Fino ad allora, K3 è disponibile solo tramite API e l'app Kimi.

Gli sciami amplificano i capitolati scadenti. Un prompt vago attraverso un agente spreca una finestra di contesto. Attraverso 300 agenti ne spreca 300 in parallelo.

L'elenco rapido

  • Prompt di una riga. Lo sciame decide tutto. Decide male.
  • Saltare la revisione della scomposizione. Il passaggio più costoso da saltare.
  • Nessun passaggio di verifica. "Sembra finito" non è "è corretto."
  • Salvare un output non verificato come skill. L'errore si accumula in ogni esecuzione futura.
  • 300 agenti per un compito sequenziale. Uno sciame non può parallelizzare una catena di pensiero.
  • Usare K3 dove K2.6 è sufficiente. Non tutti i compiti hanno bisogno di 2,8T parametri.

Conclusione

La maggior parte delle persone aprirà Kimi, scriverà una domanda, chiuderà la scheda. Questa è la chatbox. È circa il 10% di ciò che K3 fa.

L'altro 90% è un team di ricerca che costruisci una volta e riproduci per sempre. Ogni livello sblocca più leva: prima esecuzione, poi fiducia, poi accumulazione, poi autonomia. Non hai bisogno di tutti e quattro il primo giorno. Inizia al Livello 1 con un capitolato. Se l'output è utile, passa al Livello 2 e verificalo. Se hai intenzione di eseguirlo di nuovo, salva la Skill. Il sistema diventerà più affilato da lì in poi da solo.

Scrivi il capitolato, non il prompt. Verifica prima di salvare. Poi guarda ogni esecuzione diventare più economica e più precisa della precedente.

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali