L'arte della Loop Engineering

243K
1.6K
249
30
3.9K

TL;DR

Questo articolo esplora la 'loopcraft', un framework per combinare loop di agenti, verifica, event-driven e hill-climbing, al fine di creare agenti AI capaci di automatizzare il lavoro, garantire la qualità e migliorare continuamente.

Gli agenti sono utili perché ci aiutano ad automatizzare il lavoro compiendo azioni nel mondo reale. Ma ottenere che gli agenti svolgano lavoro di valore in modo affidabile richiede più di un buon modello: serve un'architettura attentamente progettata e adatta a un insieme di compiti.

L'algoritmo principale dell'agente è semplice: fornisci contesto al LLM e lascia che chiami gli strumenti in un ciclo finché non ha finito. Questo è il ciclo più fondamentale. Ma è lontano dall'essere l'unico ciclo che alimenta gli agenti. @swyx ha recentemente scritto un ottimo articolo su "loopcraft: l'arte di impilare i cicli", l'idea che puoi impilare ed estendere i cicli per costruire agenti più efficaci.

Ecco come la pensiamo su questa pila e come strumentare ogni livello con i primitivi LangChain.

Ciclo 1: L'Agente

In sostanza, un agente è solo un modello che chiama strumenti in un ciclo finché un compito non è completato.

Sydney Runkle - inline image

Questo è ciò che ti offre create_agent di LangChain. Scegli un modello qualsiasi, collega gli strumenti, e hai un ciclo d'agente funzionante. Gli strumenti sono ciò che dà all'agente il potere di agire nel mondo reale.

Prendiamo come esempio il nostro agente per la documentazione interna (che useremo come esempio guida per il resto di questo blog). Al primo livello del ciclo, riceve una richiesta per un miglioramento della documentazione, il modello pianifica e abbozza le modifiche, e usa strumenti per clonare repository, leggere file, scrivere documentazione, aprire una pull request, ecc.

Sydney Runkle - inline image

Livello 2: Ciclo di verifica

Il ciclo dell'agente svolge il lavoro, ma non sempre produce risultati corretti o coerenti al primo tentativo. Quando la coerenza è importante, è spesso utile racchiuderlo in un ciclo di verifica che controlla l'output e invia feedback al modello quando non è all'altezza.

Sydney Runkle - inline image

Il ciclo di verifica aggiunge un valutatore: qualcosa che controlla l'output dell'agente rispetto a una rubrica e, se fallisce, restituisce il risultato con feedback. I valutatori possono essere deterministici o agentivi (LLM come giudice è un classico esempio, qui).

RubricMiddleware gestisce questo schema, oppure puoi implementarlo con un hook after_agent su create_agent.

Per il nostro esempio di scrittore di documentazione, il valutatore esegue i test dopo ogni tentativo, verificando che tutti i link funzionino, tutti i controlli CI siano superati e il diff sia limitato a ciò che è stato effettivamente richiesto. Nessuna revisione manuale necessaria per individuare questi tipi di errore.

Sydney Runkle - inline image

Un compromesso: aggiungere la verifica aumenta la latenza e il costo per esecuzione. Ne vale la pena quando la qualità è più importante della velocità, che è il caso della maggior parte dei casi d'uso in produzione.

Livello 3: Ciclo guidato dagli eventi

Una delle parti più importanti dello sviluppo di agenti è il livello di integrazione: collegare il tuo agente al tuo ecosistema in modo che possa funzionare in background.

Il ciclo guidato dagli eventi collega il tuo agente al tuo ecosistema. Un evento si attiva — un nuovo documento arriva, una pianificazione scatta, un webhook arriva — e l'agente viene eseguito. L'agente non è qualcosa che invochi manualmente; è un componente che funziona continuamente all'interno di un sistema più grande.

Sydney Runkle - inline image

LangSmith Deployment supporta l'infrastruttura di attivazione, inclusi il supporto per pianificazioni cron e webhook. Un esempio popolare di cron in azione sono i "battiti del cuore" in openclaw, che trasformano il tuo agente in un assistente sempre attivo e proattivo.

Il nostro agente per la documentazione è alimentato da Fleet, il nostro builder di agenti senza codice. I canali e le pianificazioni di Fleet gestiscono i trigger guidati dagli eventi e in stile cron. Usiamo un canale per attivare l'agente della documentazione ogni volta che un messaggio viene inviato nel nostro canale Slack #docs-plz.

Sydney Runkle - inline image

Livello 4: Ciclo di hill climbing

I primi tre cicli automatizzano il lavoro. Il quarto (e probabilmente il più importante) automatizza il miglioramento!

Sydney Runkle - inline image

Ogni esecuzione di un agente produce una traccia: una registrazione di ciò che il modello ha fatto, gli strumenti che ha chiamato, il feedback del valutatore, ecc. Quelle tracce contengono segnali di alto valore su cosa funziona e cosa no. Il ciclo di hill climbing esegue un agente di analisi su quelle tracce e usa i risultati per riscrivere l'architettura con una configurazione migliorata. Ciò può includere modifiche ai prompt/strumenti o modifiche al valutatore.

In LangSmith, puoi usare Engine, il nostro agente di analisi delle tracce, per strumentare questo quarto ciclo.

Per concludere l'analogia con l'agente della documentazione, eseguiamo Engine sulle tracce dell'agente della documentazione per rilevare eventuali problemi. Quando più tracce segnalano un potenziale problema, viene archiviato un issue che richiede modifiche al prompt o allo strumento incriminato.

Sydney Runkle - inline image

La mossa chiave qui è che la freccia di ritorno non si limita a tornare all'inizio — raggiunge l'interno e aggiorna direttamente il ciclo dell'agente. Ogni ciclo del ciclo esterno rende i cicli interni più efficaci.

Prospettive future:

la configurazione di prompt e strumenti sono le cose più semplici da migliorare, ma non sono le uniche opzioni. Per i team che utilizzano modelli a pesi aperti, il ciclo di hill climbing può alimentare il fine-tuning RL, utilizzando i risultati delle tracce o delle valutazioni come segnale di addestramento per migliorare il modello stesso. Il contesto ausiliario come la memoria e le competenze recuperate può essere migliorato allo stesso modo. Il ciclo è lo schema; ciò che ottimizza dipende da te.

Supervisione umana e competenza

L'automazione non significa rimuovere gli esseri umani dal ciclo. A ogni livello, ci sono punti naturali in cui la supervisione umana aggiunge valore. Un valutatore automatizzato può controllare se i link funzionano; ci vuole un umano per notare che l'approccio è sbagliato per il pubblico. Quel tipo di giudizio, guadagnato dal contesto, dall'esperienza e dal gusto, è esattamente il punto in cui la revisione umana trova il suo posto.

Alcune competenze dovrebbero essere codificate nei prompt/strumenti stessi, ma per azioni sensibili, la revisione umana dal vivo è essenziale (pensa a transazioni finanziarie, operazioni su database, ecc.). LangChain rende semplice strumentare questi punti di contatto in ogni ciclo:

  1. Nel ciclo dell'agente, richiedi l'input umano prima di azioni/chiamate a strumenti sensibili
  2. Nel ciclo di verifica, un umano può fungere da valutatore per flussi di lavoro sensibili
  3. Nel ciclo applicativo, un umano può approvare gli output prima che vengano restituiti all'utente finale
  4. Nel ciclo di hill climbing, i miglioramenti dell'architettura possono passare attraverso la revisione umana prima della distribuzione

Tutti i framework open source di LangChain rendono l'aggiunta di un "umano nel ciclo" un primitivo di prima classe.

Mettendo tutto insieme

Nel caso preferissi una vista più tabellare, ecco come questi quattro cicli si impilano insieme:

Ciclo

Cosa fa

Impatto

Primitivo LangChain

1: Ciclo agente

(modello + strumenti)

Il modello chiama gli strumenti ripetutamente finché un compito non è completato

Automatizza il lavoro

create_agent

, qualsiasi modello supportato da LangChain

2: Ciclo di verifica

(agente + valutatore)

L'agente viene eseguito, l'output viene valutato rispetto a una rubrica, riprovato con feedback se fallisce

Garantisce la qualità

RubricMiddleware

3: Ciclo di eventi

(verifica + sistema)

Gli eventi attivano esecuzioni dell'agente che aggiornano un sistema reale

Lavoro su larga scala

LangSmith Deployment / canali Fleet

4: Ciclo di hill climbing

(sistema + engine)

Le tracce di produzione alimentano un agente di analisi che migliora la configurazione dell'architettura

Miglioramento continuo

LangSmith Engine

Questo è ciò che l'ingegneria dei cicli — o loopcraft, come lo chiama @swyx — sembra effettivamente nella pratica. Leader dell'IA come Steipete, Boris e Andrej sono tutti arrivati alla stessa conclusione: il potenziale degli agenti risiede nei cicli che costruisci attorno a loro.

Abbiamo pensato ai cicli 1 e 2 per un po'. Ma l'attenzione dovrebbe spostarsi sui cicli 3 e 4 dove il valore si accumula integrando gli agenti nel tuo ecosistema che migliorano continuamente in risposta ai tuoi criteri.

Satya inquadra le poste in gioco organizzative: le aziende che costruiscono cicli di apprendimento presto, dove il giudizio umano e il capitale di token si accumulano insieme, costruiranno un vantaggio difficile da replicare.

Ringraziamenti

Grazie a @Vtrivedy10, @masondrxy, @hwchase17 e @huntlovell per la revisione attenta.

Riferimenti

Salva con un clic

Leggi in profondità gli articoli virali con l’AI di YouMind

Salva la fonte, fai domande mirate, riassumi l’argomentazione e trasforma un articolo virale in note riutilizzabili in un unico spazio di lavoro AI.

Scopri YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali