Il metodo a manovella
Ogni grande laboratorio ha silenziosamente ricostruito se stesso attorno alla stessa idea: un ciclo che continua a funzionare anche dopo che smetti di digitare. Questa è la guida pratica su come funzionano realmente i cicli al 25 luglio 2026, su Claude, GPT, Gemini, Grok, Muse Spark di Meta, Mira e l'ondata open-weight, con ogni affermazione documentata.
Guarda qualcuno usare l'AI al lavoro e vedrai solitamente lo stesso rituale. Scrivi una richiesta. Aspetta. Leggi la risposta. Trova i problemi. Spiega i problemi. Aspetta di nuovo. Incolla il risultato da qualche altra parte. Torna il giorno dopo e ricomincia tutto da capo.
Ecco la parte scomoda: quel rituale È un ciclo. Chiedi, controlla, correggi, ripeti. L'unica differenza tra quello e ciò che ora i laboratori forniscono è chi gira la manovella. Quando lo fai a mano, tu sei il grilletto, la memoria, il verificatore e la condizione di arresto, e sei costoso.
Nell'ultimo anno, ogni laboratorio AI serio è converguto sulla stessa soluzione: spostare la manovella dentro la macchina. Anthropic pubblica una tassonomia ufficiale dei cicli per Claude. OpenAI ha ricostruito ChatGPT attorno a una modalità di lavoro che esegue compiti multi-step in autonomia. Google vende cicli di ricerca che noleggi a compito. Meta ha addestrato il suo modello Muse Spark specificamente per orchestrare flotte di sotto-agenti. Anche il più piccolo attore in questa storia, una startup di due persone con un bot Telegram chiamato Mira, sta in realtà vendendo cicli a persone che non apriranno mai un terminale.
E il terreno si sta ancora muovendo mentre scrivo. Solo nei sette giorni precedenti questo aggiornamento: Anthropic ha rilasciato un nuovo Opus costruito per il lavoro agentico quotidiano, Alibaba ha presentato in anteprima un Qwen da 2,4 trilioni di parametri, e il più grande modello open-weight mai rilasciato sta per pubblicare i suoi pesi tra circa 48 ore.
Il risultato è il più grande cambiamento silenzioso nel modo in cui questa tecnologia viene utilizzata da quando sono apparse le interfacce chat: l'unità di lavoro non è più il prompt. È il ciclo, un ciclo di lavoro che continua finché una condizione che hai definito non viene soddisfatta.
Questo pezzo è la versione lunga di quella storia. Cosa sia realmente un ciclo, spogliato dall'hype. Che aspetto ha lo stack di cicli di ogni laboratorio in questo momento, inclusi i modelli che non esistevano un mese fa. Cosa funziona davvero, che si rivela sorprendentemente coerente tra tutti i fornitori. E le modalità di fallimento e i costi che i post di lancio non menzionano.
Una nota sul metodo, perché il discorso sull'AI sta annegando in sciocchezze sicure di sé: tutto ciò che segue è basato sulla documentazione e gli annunci dei laboratori stessi, o su valutazioni indipendenti nominate, verificate dal vivo nella settimana conclusasi il 25 luglio 2026. Dove un numero è auto-dichiarato da un fornitore, lo dico. Dove qualcosa non è verificato o è ancora in anteprima, lo dico anch'io. Elenco completo delle fonti in fondo.
Parte 1: Cosa sia realmente un ciclo
Spogliato del gergo, un ciclo è quattro battiti più un motivo per fermarsi.
Il team di Claude Code di Anthropic, che ha pubblicato la cosa più vicina a una definizione canonica in questo campo, lo riassume in una riga: i cicli sono "agenti che ripetono cicli di lavoro fino a quando una condizione di arresto viene soddisfatta". La guida agli agenti di OpenAI dice la stessa cosa in linguaggio da ingegnere: "Ogni approccio di orchestrazione ha bisogno del concetto di 'esecuzione', tipicamente implementato come un ciclo che permette agli agenti di operare finché non viene raggiunta una condizione di uscita", dove le condizioni di uscita includono un output finale, un errore o un numero massimo di turni.
I quattro battiti, in parole semplici:
- Innesco. Qualcosa avvia l'esecuzione. Tu, un programma, un avviso, una nuova pull request, un'email in arrivo.
- Lavoro. Il modello raccoglie il contesto e compie un'azione con gli strumenti: legge i file, esegue la query, abbozza il messaggio, modifica il codice.
- Controllo. Il risultato viene verificato rispetto a qualcosa di reale. I test superano o falliscono. Il numero corrisponde alla fonte. Un secondo modello valuta la bozza rispetto ai tuoi criteri.
- Ripeti o fermati. Se il controllo fallisce, il ciclo riparte con ciò che ha imparato. Se il controllo supera, o viene raggiunto un limite massimo, si ferma.
Questo è tutto il trucco. Un prompt è un singolo passaggio attraverso i battiti due e tre, con te che fai il battito tre nella tua testa. Un ciclo è la stessa cosa con il controllo e la ripetizione affidati alla macchina, più due binari di sicurezza: una condizione di arresto così non può funzionare per sempre, e un budget così non può spendere per sempre.
Il cast di supporto
Attorno a quei quattro battiti, ogni stack di cicli serio fornisce gli stessi cinque elementi di supporto, qualunque sia il nome che il fornitore gli dà:
- Memoria. Note che sopravvivono tra le esecuzioni, così l'esecuzione quaranta sa cosa ha imparato l'esecuzione uno.
- Stato. Dove si trova attualmente il ciclo: cosa è stato fatto, cosa è fallito, cosa c'è dopo.
- Verificatore. La cosa che decide "abbastanza buono". La singola scelta progettuale più importante che farai.
- Condizione di arresto. "Test superati", "coda vuota", "fermati dopo cinque tentativi", "sono le 9:00 e il digest è stato inviato".
- Contatore dei costi. Token e dollari per ciclo, perché i cicli moltiplicano tutto ciò che toccano, inclusa la tua bolletta.
I quattro tipi di ciclo
La tassonomia di Anthropic vale la pena di essere imparata perché si mappa chiaramente sui prodotti di ogni altro fornitore, anche se i nomi differiscono. Il loro team classifica i cicli in base a cosa deleghe:
- Cicli a turni. Fai un prompt, l'agente fa un ciclo (raccogli, agisci, controlla, rispondi), tu rivedi, fai un altro prompt. Sei ancora la condizione di arresto. È da qui che tutti iniziano, e Anthropic nota che ogni prompt esegue già questo micro-ciclo internamente.
- Cicli basati su obiettivi. Deleghi la condizione di arresto. Definisci come appare il "fatto", e l'agente itera finché non ci arriva o raggiunge un limite di turni. In Claude Code questo è letteralmente un comando /goal, e ogni volta che il modello cerca di fermarsi, "un modello valutatore controlla la tua condizione e lo rimanda al lavoro finché l'obiettivo non viene raggiunto". I criteri deterministici funzionano meglio: test superati, punteggio raggiunto, checklist completata.
- Cicli basati sul tempo. Deleghi l'innesco. Il ciclo viene eseguito a intervalli o su un programma e reagisce a ciò che è cambiato: riassumi Slack ogni mattina, controlla la pull request finché la CI non passa.
- Cicli proattivi. Deleghi il prompt stesso. Un evento o un programma avvia l'esecuzione senza un umano in tempo reale: le nuove segnalazioni di bug vengono triate appena arrivano, le dipendenze vengono aggiornate settimanalmente, e ogni compito termina quando il suo obiettivo viene raggiunto.
Tieni a mente questa scala (delega il controllo, poi la condizione di arresto, poi l'innesco, poi il prompt) e il resto di questo articolo è semplicemente guardare sette fornitori scalarne i gradini da direzioni diverse.
Parte 2: Lo stato dell'arte, in un'istantanea
Prima del tour laboratorio per laboratorio, un orientamento, perché la frontiera si è mossa incredibilmente veloce nelle cinque settimane precedenti questo articolo: Grok 4.5 è uscito l'8 luglio, Muse Spark 1.1 di Meta e GPT-5.6 di OpenAI sono usciti entrambi il 9 luglio, Thinking Machines ha rilasciato il suo primo modello il 15 luglio, Kimi K3 di Moonshot è arrivato il 16 luglio, Alibaba ha presentato in anteprima Qwen3.8-Max il 19 luglio, e Anthropic ha rilasciato Claude Opus 5 il 24 luglio, il giorno prima di questo aggiornamento.
Per un metro di giudizio neutrale, il valutatore indipendente Artificial Analysis valuta la capacità generale nel suo Intelligence Index. Al momento dell'istantanea di questa settimana (v4.1), la parte alta della classifica recita:
- Claude Fable 5 (Anthropic): 59,9
- GPT-5.6 Sol Max (OpenAI): 58,9
- Kimi K3 (Moonshot, pesi aperti imminenti): 57,1, quarto in assoluto
- Con Claude Opus 4.8, Grok 4.5, Muse Spark 1.1, GLM-5.2 e il resto del campo più in basso
Due avvertenze che meritano spazio. Claude Opus 5 ha un giorno di vita al momento in cui scrivo e non è ancora stato indicizzato. E un singolo indice composito non può catturare il lavoro agentico a lungo orizzonte, che è ciò che i cicli fanno realmente, quindi dove un laboratorio ha pubblicato risultati specifici per gli agenti, li cito nella sezione di quel laboratorio, segnalati come auto-dichiarati quando lo sono.
Due cose da notare comunque. La parte alta della classifica è ora una forbice di meno di tre punti, il che significa: ai fini della costruzione di cicli, la scelta del modello all'interno di quella fascia conta meno del ciclo che lo circonda. E un modello open-weight si trova ora all'interno di quella fascia per la prima volta.
Claude: il ciclo come primitiva di prima classe
I modelli. Claude Fable 5, rilasciato il 9 giugno 2026, è il modello più capace di Anthropic e quello più esplicitamente costruito per questo stile di lavoro. La stessa definizione di Anthropic è che, eseguito all'interno di un'imbracatura come Claude Code, può "lavorare per giorni interi: pianificare tra le fasi, delegare a sotto-agenti e controllare il proprio lavoro". Il suo pensiero è adattivo e sempre attivo, regolato da un'impostazione di sforzo, con una finestra di contesto di un milione di token. È ancora in cima all'indice indipendente di cui sopra. Il suo fratello Mythos 5, rilasciato insieme, è lo specialista che Anthropic valuta più forte nei compiti di cybersecurity.
La novità di questa settimana è Claude Opus 5, rilasciato il 24 luglio: Anthropic lo descrive come vicino all'intelligenza di frontiera di Fable 5 a metà prezzo ($5 per milione di token in input e $25 in output), il nuovo stato dell'arte nelle valutazioni di knowledge work come GDPval-AA secondo l'annuncio, e il modello predefinito sul piano Max di Claude. Per i costruttori di cicli, il messaggio è diretto: cicli quasi di frontiera a metà costo cambia cosa puoi permetterti di eseguire tutto il giorno.
Lo stack di cicli. Ciò che rende Anthropic distintivo è che i cicli non sono una caratteristica sepolta in un'app. Sono primitive nominate che puoi digitare:
- /goal definisce "fatto" e permette a un modello valutatore di rimbalzare l'agente al lavoro finché la condizione non viene soddisfatta o viene raggiunto un limite di turni. Questo è il ciclo basato su obiettivi, letteralmente prodotto.
- /loop riesegue un prompt a intervalli sulla tua macchina; /schedule sposta quel ciclo nel cloud di Anthropic come routine, dove continua a funzionare con il tuo portatile chiuso, innescato da programmi, chiamate API o eventi GitHub.
- I flussi di lavoro dinamici gestiscono l'estremo: Claude scrive un vero e proprio script di orchestrazione che può coordinare fino a 1.000 sotto-agenti in una singola esecuzione. L'aneddoto principale è uno sviluppatore che ha portato il runtime Bun, circa 750.000 righe, da Zig a Rust in circa undici giorni con centinaia di agenti paralleli.
- Competenze, hook e sotto-agenti completano il cast di supporto: le competenze codificano come verificare il lavoro, un secondo agente a contesto fresco fa la revisione del codice, e la memoria persiste nei file tra le sessioni.
La filosofia. La guida di Anthropic è insolitamente esplicita sulla moderazione: non tutti i compiti necessitano di un ciclo complesso, inizia con la primitiva più semplice, imposta criteri di arresto deterministici, sperimenta su una piccola fetta prima di una grande esecuzione e monitora l'utilizzo con comandi integrati. La loro linea che l'intero campo riscopre continuamente: gli agenti che possono controllare e migliorare il proprio output sono fondamentalmente più affidabili.
Leggilo come: il laboratorio di cicli per sviluppatori. La versione più leggibile e più componibile di ogni tipo di ciclo, e ora con un motore quasi di frontiera più economico da eseguire al suo interno.
OpenAI: tre modalità e un approvatore separato
I modelli. La generazione GPT-5.6 di OpenAI è diventata GA il 9 luglio 2026 in tre livelli: Sol (ammiraglia, $5 in / $30 out per milione di token), Terra (il mezzo equilibrato) e Luna (veloce ed economico), tutti con una finestra di contesto di circa un milione di token. Sol è al secondo posto nell'indice indipendente, sostanzialmente in parità con Fable 5. La sua caratteristica principale per i cicli è una modalità ultra che coordina quattro agenti in parallelo di default sui problemi difficili.
Lo stack di cicli consumer. La storia di OpenAI qui è una ricostruzione. L' "agente ChatGPT" autonomo del 2025 è stato interrotto; al suo posto, ChatGPT ora ha tre modalità: Chat per la conversazione, Work per compiti multi-step lunghi che producono risultati finali, e Codex per il software. Work esegue lavori nel cloud, può mettere in pausa ai checkpoint di approvazione e, cosa cruciale, può essere eseguito su trigger: le Attività Pianificate ora includono attività di monitoraggio che controllano qualcosa a intervalli e ti avvisano solo quando c'è qualcosa da segnalare. Questo è un ciclo basato sul tempo venduto ai consumatori, senza codice coinvolto. Una modalità agente vive anche all'interno del browser Atlas per compiti di azione sul web.
Lo stack di cicli per sviluppatori. La linea di divisione è dichiarata chiaramente nei documenti di OpenAI: "Usa l'API Responses quando vuoi possedere tu il ciclo. Usa l'Agents SDK quando vuoi che sia l'SDK a eseguirlo." L'API Responses è agentica di default, permettendo al modello di chiamare la ricerca web, la ricerca di file, l'uso del computer, l'esecuzione di codice e le tue funzioni all'interno di una singola richiesta. Due aggiunte dell'era GPT-5.6 sono importanti specificamente per i cicli: Programmatic Tool Calling, dove il modello scrive un piccolo programma JavaScript in una sandbox per coordinare le proprie chiamate agli strumenti, e una beta multi-agente dove un agente radice genera e gestisce un albero di sotto-agenti.
L'idea distintiva: separare l'esecutore dall'approvatore. Il contributo più interessante di OpenAI ai cicli è Auto-review(30 aprile 2026): quando un agente Codex vuole fare qualcosa al di fuori della sua sandbox, un modello revisore separato, non l'agente stesso, decide se l'azione è coerente con ciò che l'utente ha chiesto. Il loro ragionamento è diretto: l'agente principale è ottimizzato per completare il compito, il che crea la pressione di trattare un confine di approvazione come un semplice ostacolo. Tenere la decisione di approvazione in una diversa chiamata al modello la rende verificabile. Risultato, secondo OpenAI: le sessioni si fermano per chiedere a un umano circa 200 volte meno spesso, e il revisore approva circa il 99% di ciò che viene ancora escalated. Questi numeri sono auto-dichiarati, ma il principio progettuale è valido: non permettere mai che il modello che vuole finire sia anche il modello che decide che è finito.
Leggilo come: la rampa di accesso ai cicli per i consumatori, più uno stack serio per sviluppatori. E un monito per i costruttori di piattaforme: OpenAI ha deprecato il suo visual Agent Builder entro un anno dal lancio, con una chiusura definitiva fissata al 30 novembre 2026.
Google: cicli di ricerca che noleggi a compito
Il modello. L'ammiraglia attuale di Google è Gemini 3.1 Pro (aprile 2026), ma la parte interessante per questa storia non è il modello chat. È che Google ha trasformato un intero ciclo in un prodotto.
Lo stack di cicli. Gli agenti Deep Research, lanciati il 21 aprile 2026 in due varianti (standard, per la velocità, e Max, per l'esaustività), sono cicli di ricerca basati su obiettivi che chiami con una singola richiesta API. I documenti descrivono il ciclo apertamente: pianifica, cerca, leggi, itera, output, eseguito per minuti o un'ora in background, con citazioni nel report finale. I dettagli progettuali sono una piccola masterclass in ingegneria dei cicli:
- L'esecuzione in background è obbligatoria. Un ciclo di ricerca sopravvive a un timeout HTTP, quindi interroghi per il risultato. Il ciclo, non la richiesta, è l'unità di lavoro.
- La pianificazione collaborativa è un cancello umano all'inizio: l'agente propone il suo piano di ricerca, tu lo modifichi o lo approvi, poi viene eseguito. Guida prima del ciclo invece di babysitting durante il ciclo.
- Una condizione di arresto rigida è integrata: tempo massimo di ricerca di 60 minuti, la maggior parte dei compiti termina in circa 20.
- Gli strumenti sono limitati per esecuzione: Google Search, lettura di URL, esecuzione di codice di default, i tuoi server MCP e archivi di file opzionalmente, e puoi disattivare completamente il web aperto per ricercare solo i tuoi dati privati.
- Il costo è prezzato per ciclo, onestamente.Google stime proprie: un compito standard tipico consuma circa 80 ricerche e circa un quarto di milione di token in input, arrivando a uno o tre dollari; un'esecuzione Max può raggiungere 160 ricerche e circa $3 a $7. Un ciclo non è un messaggio chat, e Google fattura di conseguenza.
Leggilo come: la prova commerciale più chiara che il ciclo, non la chiamata al modello, sta diventando il prodotto. Non compri token; compri un'indagine completata.
Un'avvertenza onesta: al momento in cui scrivo, gli agenti Deep Research sono in anteprima tramite l'Interactions API, quindi aspettati che l'interfaccia cambi.
Muse Spark 1.1: il nuovo arrivato addestrato a orchestrare
Il modello. Muse Spark 1.1 è il modello di ragionamento multimodale di Meta Superintelligence Labs', rilasciato il 9 luglio 2026 come aggiornamento del Muse Spark 1.0 di aprile, ed è uno dei nuovi arrivati più consequenziali in questo riepilogo per tre motivi.
Primo, la strategia: è la prima API a pagamento per modelli di Meta, a $1,25 per milione di token in input e $4,25 in output, ed è a pesi chiusi, una netta rottura con l'era open di Llama. I campioni della linea Llama sono di fatto ceduti all'ondata open-weight coperta più avanti; Meta ha detto solo che spera di aprire le future versioni di Muse.
Secondo, l'obiettivo di addestramento. Mentre la maggior parte dei modelli impara il comportamento agentico come sottoprodotto, Meta dice che questo è stato addestrato direttamente per l'organigramma: "Come agente principale, può raccogliere il contesto, fare un piano e delegare l'esecuzione a sotto-agenti paralleli. Come sotto-agente, aderisce al suo compito, capisce gli strumenti disponibili e sa quando escalare di nuovo all'agente principale." Acquisisce zero-shot nuovi strumenti, server MCP e competenze personalizzate, gestisce attivamente il suo contesto di un milione di token (ricordando, recuperando e compattando mentre lavora) e gestisce flussi di lavoro di uso del computer attraverso più applicazioni.
Terzo, la posizione prezzo-prestazioni. Nell'indice indipendente è balzato di otto punti dalla versione 1.0 in tre mesi, il che lo colloca sotto il trio di frontiera ma a una frazione del loro costo per compito, e attualmente guida il benchmark MCP Atlas per l'uso di strumenti con 88,1 (numeri adiacenti al fornitore; da prendere con le pinze).
La nota per il costruttore di cicli che ti dice dove sta andando tutto questo. Gli stessi documenti per sviluppatori di Meta avvertono che se costruisci un agente multi-turno sulla vecchia API Chat Completions, il ragionamento del modello viene buttato via tra un turno e l'altro, quindi i cicli derivano e ripetono il lavoro; ti indirizzano verso un'API in stile Responses che trasporta il ragionamento crittografato tra i turni. L'infrastruttura del settore viene ricostruita attorno ai cicli, un'API deprecata alla volta.
Leggilo come: il motore che noleggi per cicli pesanti di orchestrazione quando il trio di frontiera è eccessivo in termini di costo. Ancora giovane; la pendenza da 1.0 a 1.1 è il motivo per prestare attenzione.
Grok 4.5: cicli economici e veloci, addestrati sul lavoro
Il modello. Grok 4.5 è uscito l'8 luglio 2026 da xAI di Musk (ora operante sotto l'ombrello pubblico SpaceXAI), presentato come il suo modello più intelligente per la programmazione, i compiti agentici e il knowledge work. Il posizionamento dello stesso Musk è stato insolitamente diretto: un modello di classe Opus, grossomodo paragonabile a Claude Opus 4.7, ma più veloce ed economico. Il punteggio indipendente è coerente con il tenore: sopra la precedente generazione Opus, sotto il trio di frontiera.
Perché è importante specificamente per i cicli. Due affermazioni, entrambe da xAI ed entrambe rilevanti per i cicli anche dopo aver scontato il marketing:
- È stato addestrato nei cicli. xAI dice che l'apprendimento per rinforzo ha coperto centinaia di migliaia di compiti ingegneristici multi-step con valutazione automatica, su infrastruttura dove i rollout agentici vengono eseguiti per ore mentre l'addestramento continua. Qualunque cosa dicano i benchmark, la dieta di addestramento era il lavoro stesso.
- L'economia dei cicli è il punto di forza. A $2 in / $6 out per milione di token, circa 80 token al secondo, e una presunta efficienza di token doppia (risolvendo compiti in meno della metà dei passaggi dei modelli comparabili), l'argomentazione non è "ciclo più intelligente", è "più cicli per dollaro". Per i cicli, dove il costo è uguale a costo-per-ciclo per il numero di cicli, quell'aritmetica è l'intero gioco. I documenti lo rafforzano con una poco affascinante infrastruttura di ciclo: caching di prompt appuntato per la conversazione in modo che i cicli lunghi non paghino i prezzi di cache fredda, e guida alla compattazione del contesto per esecuzioni pesanti di strumenti.
Il ciclo prodotto vive in Grok Build, il suo agente di programmazione (addestrato insieme a Cursor, dove è disponibile su tutti i piani), che si estende in territorio insolitamente pratico: modelli Excel multi-foglio con ricerca web, diagrammi PowerPoint nativi, documenti Word.
Leggilo come: il cavallo di battaglia economico per cicli ad alto volume, con la solita avvertenza che la maggior parte dei numeri di efficienza sono del fornitore stesso.
Mira: cicli per persone che non apriranno mai un terminale
Ecco la voce che sembra un errore in un elenco di modelli di frontiera, ed è in realtà una delle più istruttive.
Cosa sia realmente Mira. Mira non è un modello. È un agente AI consumer che vive interamente all'interno di Telegram, costruito da una startup così piccola che si arrotonda a due persone, guidata da Daria Yakovleva e incubata da The Open Platform, un'azienda di software dell'ecosistema Telegram. È stato lanciato silenziosamente nel febbraio 2026 e ha riportato il superamento di un milione di utenti mensili all'inizio di giugno (auto-dichiarato, circa 1,17 milioni). Sotto il cofano è agnostico rispetto al modello: instrada ogni compito a modelli di terze parti (GPT, Claude e altri) invece di eseguirne uno proprio.
Perché appartiene a questo articolo. Perché il prodotto di Mira sono i cicli, e nient'altro che i cicli, venduti a persone che non sentiranno mai quella parola. Le sue automazioni pacchettizzate, chiamate Skills, raggruppano ciascuna l'esatta anatomia della Parte 1: un innesco (un programma, una nota vocale, un evento di chat di gruppo), un'azione attraverso app connesse (calendario, email, tracker di progetti, strumenti di contenuti) e la consegna autonoma di nuovo nella chat. Monitora il prezzo di un volo e avvisami. Trasforma il mio promemoria vocale in post per tre piattaforme. Riassumi cosa ha deciso questo gruppo oggi e archivia le azioni da intraprendere. La frase di posizionamento nei suoi stessi materiali è il riassunto più pulito dell'intera era dei cicli: ChatGPT risponde, Mira agisce.
Le avvertenze oneste. I conteggi degli utenti e dei connettori (che i suoi materiali collocano variamente tra 200 e oltre 1.000 servizi) sono auto-dichiarati e incoerenti tra le pagine, l'azienda non pubblica alcuna guida ingegneristica su come i suoi cicli verifichino qualcosa, e chiamare le Skills "cicli" è un'interpretazione esterna, non il vocabolario di Mira. Un team minuscolo che avvolge i modelli di altri laboratori è anche una base fragile rispetto a tutto il resto in questo elenco.
Leggilo come: il segnale della domanda. Quando un bot Telegram di due persone raggiunge un milione di utenti impacchettando trigger, azioni e consegna autonoma per persone comuni, il ciclo ha smesso di essere un concetto per sviluppatori. Distribuzione e zero configurazione battono la capacità per un'enorme fetta di lavoro reale.
L'ondata open-weight: porta il tuo ciclo
La storia più rumorosa della metà del 2026 è che il mondo open-weight ha smesso di essere in ritardo di anni e ha iniziato a essere in ritardo di mesi, e nelle ultime due settimane, di punti. Per i costruttori di cicli, questo cambia completamente i calcoli, perché un modello aperto è l'unico motore di ciclo che nessuno può deprecare da sotto di te.
Il breve tour, date e licenze verificate:
- Kimi K3 di Moonshot è ora il protagonista. Lanciato il 16 luglio 2026 con 2,8 trilioni di parametri, è diventato il primo modello open-track a superare la fascia frontier dell'indice indipendente: 57,1 su Artificial Analysis (v4.1), quarto in assoluto, dietro solo a Fable 5 e GPT-5.6 Sol Max tra i punteggi pubblicati. Ha anche conquistato il primo posto nell'Arena Frontend Code di Arena.ai a votazione cieca, superando Fable 5. I pesi completi sono previsti per la pubblicazione su HuggingFace il 27 luglio 2026 con una licenza MIT modificata, il che lo renderebbe il primo modello scaricabile nella sua classe; al 24 luglio i pesi non erano ancora stati rilasciati, quindi considera questa affermazione come programmata piuttosto che realizzata. La demo di punta di Moonshot è puro teatro loop: 48 ore di funzionamento autonomo continuo per progettare un piccolo chip funzionale, eseguito come un singolo agente su un contesto di un milione di token. Un altro numero che conta, dalla stessa valutazione indipendente: il tasso di allucinazione misurato di K3 è salito a circa il 51% su compiti sensibili ai fatti, rispetto al 39 del suo predecessore, anche se l'accuratezza fattuale è migliorata. Migliore nelle risposte corrette, peggiore nel sapere quando si sbaglia. Ricordatelo per la Parte 3.
- Qwen3.8-Max di Alibaba, presentato in anteprima il 19 luglio 2026 durante la World AI Conference: un modello multimodale dichiarato da 2,4 trilioni di parametri, il primo del team Qwen sopra i trilioni di parametri, con l'autodescrizione "secondo solo a Fable 5" e la promessa che i pesi aperti arriveranno presto. L'anteprima è live; la tabella dei benchmark, la scheda del modello, la licenza e i pesi non lo sono, quindi considera ogni affermazione come anteprima del fornitore fino a quando non saranno disponibili.
- DeepSeek V4 (24 aprile 2026, licenza MIT) è stato, nella frase di OpenRouter, il primo modello open che i team hanno inserito in pipeline agentiche reali come plausibile sostituto frontier. La variante Pro domina le classifiche degli agenti di codifica open-weight su SWE-bench Verified con l'80,6%; la variante Flash mantiene quasi tutto questo a prezzi che si aggirano sui centesimi.
- GLM-5.2 di Z.ai (metà giugno 2026, MIT, 753B mixture-of-experts) è stato il leader di qualità open-weight fino all'arrivo di K3, descritto da OpenRouter come il sostituto open più vicino per la pianificazione in stile Opus e la codifica a lungo termine. Vizio noto: pensa in modo costoso, bruciando token di output.
- MiniMax M3 (1 giugno 2026, MIT modificato) è la corsia multimodale open: comprensione nativa di immagini e video su un contesto di un milione di token, che conta nel momento in cui il tuo loop deve leggere screenshot o ispezionare stati dell'interfaccia.
- NVIDIA Nemotron 3 Ultra è il più forte concorrente open-weight costruito negli Stati Uniti, differenziato per il deployment e lo stack NVIDIA piuttosto che per il punteggio massimo.
- Inoltre in lizza: Thinking Machines Lab, l'azienda di Mira Murati, ha pubblicato il suo primo modello, Inkling, il 15 luglio 2026: un mixture-of-experts multimodale open-weight da 975 miliardi di parametri con licenza Apache 2.0. Un altro laboratorio di primo livello che scommette che i pesi aperti siano il fattore decisivo.
Leggilo come: se il tuo loop è ad alto volume, sensibile alla privacy o deve sopravvivere alle roadmap dei fornitori, l'onda open non è più l'opzione di compromesso. Il divario con la frontiera chiusa è ora misurato in singoli punti, e non si sta allargando.
Parte 3: Cosa funziona davvero
Ecco la cosa sorprendente dopo settimane nella documentazione di sette fornitori: togli il branding e danno tutti gli stessi consigli. Quando rivali accaniti convergono su indicazioni identiche, è la cosa più vicina alla verità fondamentale in questo campo. Sette regole, ciascuna triangolata tra i laboratori.
1. Definisci "fatto" prima di iniziare. /goal di Anthropic esiste così che un valutatore possa verificare una condizione esplicita; la guida di OpenAI richiede condizioni di uscita su ogni esecuzione; Google limita la ricerca a 60 minuti netti. Un loop senza una chiara condizione di stop non è automazione, è un abbonamento a bruciare token. Il deterministico batte le sensazioni: test superati, numero corrispondente, checklist completata, massimo N tentativi.
2. Il verificatore è il prodotto. Il tetto di qualità del loop è il suo passo di controllo, non il modello. Anthropic ti dice di codificare la verifica come abilità e di puntare un secondo agente con contesto fresco alle revisioni. OpenAI è andata oltre e ha reso l'approvatore un modello strutturalmente separato dall'esecutore, per la ragione dichiarata che l'esecutore vuole finire. Google basa i report su citazioni cliccabili. E questa settimana ha fornito la prova migliore della regola: il modello open più impressionante in classifica è migliorato misurabilmente nel produrre risposte corrette, peggiorando nel sapere quando sbaglia. In una chat è una nota a piè di pagina. In un loop non verificato è una fabbrica di errori sicuri di sé. Se investi un'ora da qualche parte, investila in cosa significa "controllato" per il tuo compito.
3. Non lasciare mai che l'esecutore si valuti su nulla di importante. Lo stesso principio dall'altro lato, perché è l'unica lezione che l'intera industria ha pagato per imparare: un modello che completa compiti tratta ogni barriera come un ostacolo. Modello verificatore separato, agente revisore separato, o un umano al passo irreversibile.
4. Gestisci il contesto come la risorsa scarsa che è. La guida all'ingegneria del contesto di Anthropic (il set più piccolo di token ad alto segnale, file di note, sub-agenti che restituiscono riassunti), la compattazione attiva di Meta, la guida alla compattazione di Grok, il controargomento del contesto enorme di Kimi: tutti rispondono alla stessa domanda, ovvero come un lungo loop rimane coerente. La risposta di consenso è memoria fuori dalla finestra più recupero su richiesta, non riempimento.
5. Scala il tipo di loop solo quando il gradino precedente fallisce. Anthropic dice di iniziare con la primitiva più semplice. OpenAI dice di massimizzare un singolo agente prima di passare a multi-agente. Google ti fa approvare un piano prima di un'ora di esecuzione. La scala della Parte 1 è anche una disciplina: passa il controllo, poi la condizione di stop, poi il trigger, poi il prompt, in quest'ordine, un gradino alla volta.
6. Prezza il loop, non il messaggio. Il costo di un loop è costo per ciclo moltiplicato per i cicli, ecco perché Google prezza la ricerca per compito (da $1 a $7), perché Grok guida con l'efficienza dei token, perché Anthropic ha appena dimezzato il prezzo dei cicli quasi-frontier con Opus 5, e perché ogni stack serio include strumenti di ispezione dell'utilizzo. Decidi quanto può costare un'esecuzione prima di iniziarla.
7. Tieni un umano ai cancelli che non possono essere annullati. Denaro in uscita, email inviate, dati cancellati, codice unito in produzione. I checkpoint di approvazione di Work mode, la pianificazione collaborativa, le modalità di autorizzazione, le escalation di Auto-review: ogni fornitore, senza eccezione, ha mantenuto un gate umano al passo irreversibile. I fornitori con i loop più capaci sono anche quelli più insistenti su questo. Dovrebbe dirti qualcosa.
Parte 4: Quello che nessuno ti dice
Qui finiscono i post di lancio. L'esperienza operativa no.
I loop moltiplicano tutto, compresi gli errori. Un'ipotesi sbagliata in una chat è una risposta errata. La stessa ipotesi sbagliata in un loop sono cinquanta artefatti errati, coerenti e sicuri di sé entro mattina. Ecco perché la verifica è la regola numero uno, e perché i loop non presidiati dovrebbero iniziare in sola lettura finché non si guadagnano l'accesso in scrittura.
Il conto si accumula silenziosamente. Ogni guida dei fornitori ha una sezione sulla gestione dei token per un motivo. I modelli che richiedono molto pensiero possono bruciare dollari in token di output su un singolo passo difficile; una routine che viene eseguita ogni ora quando la cosa sottostante cambia ogni giorno sta pagando 24x per nulla. Abbina l'intervallo al tasso di cambiamento, limita i turni e controlla il contatore.
L'iniezione di prompt peggiora in un loop. Nel momento in cui il tuo loop legge il web aperto, le caselle di posta o i caricamenti degli utenti, supponi che qualcuno alla fine inserirà istruzioni in quel contenuto. Un assistente chat che viene ingannato ti mette in imbarazzo una volta; un loop ingannato con accesso agli strumenti agisce su di esso, ripetutamente, mentre dormi. Gli stessi documenti di sicurezza di OpenAI dicono la parte non detta: anche con mitigazioni, gli agenti non saranno perfetti e possono ancora essere ingannati. Tratta tutto ciò che il loop ingerisce come dati, mai come ordini, e delimita le sue autorizzazioni come se fosse serio.
Il divario demo-produzione è reale. Una progettazione autonoma di chip di 48 ore è una demo magnifica e anche controllata. Multipli di efficienza auto-riportati, benchmark privati, conteggi di parametri in anteprima dei fornitori annunciati senza schede del modello: segnali utili, nessuno di essi è un sostituto per eseguire il loop sui tuoi compiti con il tuo verificatore. Ogni laboratorio è d'accordo in silenzio, ecco perché ti dicono tutti di costruire valutazioni.
Le piattaforme cambiano sotto i tuoi piedi. Nei dodici mesi precedenti questo articolo: OpenAI ha interrotto il suo prodotto agente standalone, ritirato Pulse e programmato la chiusura del suo visual Agent Builder (30 novembre 2026); un nuovo Opus ha rimescolato la linea di piani di Claude dall'oggi al domani; le API sono state ricostruite attorno a design amichevoli per loop; e una direttiva sul controllo delle esportazioni di giugno ha persino messo offline brevemente i modelli Claude frontier per molti utenti. Costruisci i tuoi loop in modo che la logica (l'obiettivo, il verificatore, le note) viva nei tuoi file, non nell'interfaccia di un fornitore, e il motore rimanga sostituibile.
Il fossato non è il modello. La frontiera è ora un divario inferiore a tre punti che si rimescola settimanalmente, e un modello open si è appena unito. Ciò che si accumula è tuo: il set di valutazione costruito dai tuoi fallimenti, il verificatore che codifica i tuoi standard, le note che i tuoi loop hanno accumulato. Cambiare modello è un cambiamento di configurazione. Ricostruire un anno di logica di verifica no.
Quale stack di loop è il tuo?
L'abbinamento onesto, dato tutto quanto sopra:
- Vivi in un terminale e vuoi il massimo controllo: Claude Code, con Fable 5 per le esecuzioni più difficili e Opus 5 come nuovo valore predefinito. Le primitive più chiare (/goal, /schedule, workflow dinamici) e la filosofia meglio documentata.
- Vuoi loop all'interno di un prodotto che tutti già usano: Work mode di ChatGPT più Scheduled Tasks (i compiti di monitoraggio sono criminalmente sottoutilizzati), o Codex con Auto-review per il codice.
- Il tuo loop è "investiga X a fondo e dammi un report citato": noleggia Deep Research o Deep Research Max di Google per compito e salta la costruzione.
- Stai orchestrando molti sub-agenti e guardando i costi: Muse Spark 1.1 o Grok 4.5 come motore; entrambi sono prezzati e costruiti proprio per questo, un gradino sotto il trio frontier.
- Vuoi automazioni in tasca con zero configurazione: agenti consumer in stile Mira all'interno dell'app di chat che già usi.
- Hai bisogno di volume, privacy o permanenza: l'onda open. DeepSeek V4 Flash per il costo, GLM-5.2 per la qualità di pianificazione, MiniMax M3 per il multimodale, e Kimi K3 se vuoi capacità frontier-band che puoi (dal 27 luglio, se i pesi arrivano nei tempi) effettivamente scaricare. Porta solo un vero verificatore; i numeri di K3 stessi ne richiedono uno.
Il tuo primo loop questa settimana
Una ricetta onesta, neutrale rispetto ai fornitori:
- Scegli un compito che già ripeti manualmente, dove sei tu il collo di bottiglia.
- Scrivi prima la condizione di stop. Se non puoi scrivere "fatto significa X", il compito non è ancora pronto per il loop.
- Scrivi il controllo. Uno script, un test, una rubrica per un secondo modello. Questa è l'ora che conta.
- Eseguilo a turni alcune volte, osservando ogni ciclo.
- Passa la condizione di stop (un loop goal con un limite di turni). Osserva dove si blocca o supera i limiti; stringi i criteri.
- Solo allora passa il trigger (programmalo), con un limite di budget e autorizzazioni di sola lettura per iniziare.
- Quando fallisce, e fallirà, trasforma il fallimento in un caso di test. Questa è la parte di auto-miglioramento, e sei tu e il loop insieme.
Scala un gradino alla volta. Le persone che ottengono risultati eccezionali da questi sistemi non hanno trovato un modello segreto. Hanno trovato un compito degno di essere messo in loop, hanno definito "fatto" e hanno costruito un controllo di cui si fidano.
Un'ultima cosa
L'era dei prompt ha insegnato a tutti a fare domande migliori. L'era del loop ti chiede qualcosa di diverso: definire i risultati in modo sufficientemente preciso che una macchina possa perseguirli mentre tu sei altrove, e progettare i controlli che mantengono onesta quella ricerca.
Questa è una vera abilità, e non è scrivere prompt. È più vicina al management. Un obiettivo, uno standard di "fatto", gli strumenti giusti, un budget, un controllo di cui ti fidi e un percorso di escalation per decisioni delicate. Ogni laboratorio in questo articolo, da un'azienda da tre trilioni di dollari a una startup Telegram di due persone, sta convergendo su macchinari che premiano esattamente quella abilità.
La via lenta funziona ancora, se scrivere, aspettare, correggere e richiedere è la relazione che vuoi con questa tecnologia. Ma la manovella è ora opzionale, e i laboratori hanno deciso collettivamente in quale direzione va. L'unità di lavoro è il loop. La persona che definisce il loop sei tu.
Inizia con uno. Definisci "fatto". Fidati, ma verifica. Poi lascia andare la manovella.
Fonti
Tutto quanto sopra è stato verificato rispetto alle fonti primarie nella settimana conclusasi il 25 luglio 2026. Raggruppato per laboratorio:
Il concetto di loop
- Anthropic, Guida introduttiva ai loop: claude.com/blog/getting-started-with-loops
- OpenAI, Una guida pratica alla creazione di agenti: openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents
- Anthropic, Costruire agenti efficaci: anthropic.com/engineering/building-effective-agents e Ingegneria efficace del contesto: anthropic.com/engineering/effective-context-engineering-for-ai-agents
Anthropic
- Claude Fable 5: anthropic.com/claude/fable e post di lancio: anthropic.com/news/claude-fable-5-mythos-5
- Claude Opus 5 (24 luglio 2026): anthropic.com/news/claude-opus-5
- Routines: code.claude.com/docs/en/routines · Workflow dinamici: code.claude.com/docs/en/workflows
OpenAI
- GPT-5.6: openai.com/index/gpt-5-6 · Work e Codex: help.openai.com/en/articles/20001275 · Agente ChatGPT interrotto: help.openai.com/en/articles/11752874 · Guida agli agenti: developers.openai.com/api/docs/guides/agents· Auto-review: alignment.openai.com/auto-review
- Annuncio di Deep Research Max: blog.google · Documentazione di Deep Research: ai.google.dev/gemini-api/docs/deep-research
Meta
- Annuncio di Muse Spark 1.1: ai.meta.com/blog/introducing-muse-spark-meta-model-api · Guida agli agenti di codifica: dev.meta.ai/docs/guides/coding-agents
xAI
- Grok 4.5: x.ai/news/grok-4-5 · Documentazione: docs.x.ai/developers/grok-4-5
Mira
- Sito del prodotto: mira.tg · Post di traguardo: mira.tg/blog/mira-1-million-monthly-users
Onda open-weight
- Valutazione indipendente di Kimi K3 e tempistica dei pesi: TechTimes, 24 luglio 2026 · lancio: VentureBeat, 16 luglio 2026
- Anteprima di Qwen3.8-Max: MarkTechPost, 19 luglio 2026
- OpenRouter, I modelli open weight che contano, giugno 2026: openrouter.ai/blog
- Thinking Machines Inkling: TechCrunch, 15 luglio 2026
- Punteggi indipendenti: Artificial Analysis Intelligence Index v4.1, come riportato il 24 luglio 2026





