ループエンジニアリングの極意

@sydneyrunkle
英語4 週間前 · 2026年6月16日
243K
1.6K
249
30
3.9K

TL;DR

本記事では、エージェントループ、検証ループ、イベント駆動ループ、ヒルクライミングループを組み合わせるフレームワーク「ループクラフト」を紹介します。業務を自動化し、品質を担保し、継続的な改善を実現する AI エージェントの構築手法を学びましょう。

エージェントは、現実世界でアクションを起こすことで作業を自動化するのに役立つため、非常に便利です。しかし、エージェントに価値ある作業を確実に実行させるには、優れたモデルだけでは不十分です。タスクのセットに適合するように慎重に設計されたハーネスが必要です。

コアとなるエージェントのアルゴリズムはシンプルです。LLM にコンテキストを与え、完了するまでツールを呼び出すループを実行させるだけです。これが最も基本的なループです。しかし、エージェントを動かすループはこれだけではありません。@swyx 氏は最近、「loopcraft:ループを積み重ねる技術」 という素晴らしい記事を執筆しました。これは、ループを積み重ねて拡張することで、より効果的なエージェントを構築できるという考え方です。

ここでは、そのスタック構造と、各レベルを LangChain のプリミティブでどのように実装するかについて説明します。

ループ 1: エージェント

その核となるのは、エージェントとは、タスクが完了するまでツールを呼び出すループ内のモデルにすぎないということです。

Sydney Runkle - inline image

これが、LangChain の create_agent が提供する機能です。任意のモデルを選択し、ツールを接続するだけで、動作するエージェントループが完成します。ツールこそが、エージェントに現実世界でアクションを起こす力を与えます。

例として、当社の内部ドキュメントエージェントを考えてみましょう(このブログ記事全体を通して、動機付けの例として使用します)。最初のループレベルでは、ドキュメント改善のリクエストを受け取ると、モデルが計画を立てて変更案を作成し、リポジトリのクローン、ファイルの読み取り、ドキュメントの作成、プルリクエストのオープンなどを実行するためのツールを使用します。

Sydney Runkle - inline image

レベル 2: 検証ループ

エージェントループは作業を完了させますが、最初のパスで常に正しい、または一貫性のある成果を生み出すとは限りません。一貫性が重要な場合、出力をチェックし、基準に満たない場合にモデルにフィードバックを送信する検証ループでラップすると便利です。

Sydney Runkle - inline image

検証ループは採点者(グレーダー)を追加します。これは、エージェントの出力を評価基準に照らしてチェックし、不合格だった場合、結果をフィードバックとともに送り返します。採点者は、決定論的なものにも、エージェントベース(ここでの典型的な例は、LLM を判定者として使用する方法)にもすることができます。

RubricMiddleware がこのパターンを処理するか、create_agent の after_agent フックを使用して配線することもできます。

当社のドキュメント作成エージェントの例では、採点者は各試行後にテストを実行し、すべてのリンクが解決されること、すべての CI チェックに合格すること、差分が実際に要求された範囲に限定されていることを確認します。これらの種類のエラーを検出するために手動レビューは必要ありません。

Sydney Runkle - inline image

トレードオフの 1 つ:検証を追加すると、実行あたりのレイテンシとコストが増加します。速度よりも品質が重要である場合に価値がありますが、これはほとんどのプロダクションユースケースに当てはまります。

レベル 3: イベント駆動型ループ

エージェント開発の最も重要な部分の 1 つは、統合レイヤーです。つまり、エージェントをエコシステムに接続して、バックグラウンドで実行できるようにすることです。

イベント駆動型ループは、エージェントをエコシステムに接続します。イベントが発生します(新しいドキュメントが届く、スケジュールがトリガーされる、Webhook が到着するなど)。そして、エージェントが実行されます。エージェントは手動で呼び出すものではなく、より大きなシステム内で継続的に実行されるコンポーネントです。

Sydney Runkle - inline image

LangSmith Deployment は、cron スケジュールや Webhook のサポートを含むトリガーインフラストラクチャをサポートしています。cron の一般的な使用例として、openclaw での「ハートビート」があり、エージェントを常時オンでプロアクティブなアシスタントに変えます。

当社のドキュメントエージェントは、ノーコードのエージェントビルダーである Fleet を基盤としています。Fleet のチャンネルスケジュールは、イベント駆動型および cron スタイルのトリガーを処理します。私たちはチャンネルを使用して、Slack の #docs-plz チャンネルにメッセージが送信されるたびにドキュメントエージェントを起動します。

Sydney Runkle - inline image

レベル 4: 山登りループ

最初の 3 つのループは作業を自動化します。4 つ目の(そして間違いなく最も重要な)ループは、改善を自動化します!

Sydney Runkle - inline image

エージェントが実行されるたびにトレースが生成されます。これは、モデルが何をしたか、呼び出したツール、採点者のフィードバックなどの記録です。これらのトレースには、何が機能していて何が機能していないかに関する価値の高いシグナルが含まれています。山登りループは、これらのトレースに対して分析エージェントを実行し、その結果を使用してハーネスを改善された設定で書き換えます。これには、プロンプト/ツールの調整や採点者の調整が含まれます。

LangSmith では、トレース分析エージェントである Engine を使用して、この 4 つ目のループを実装できます。

ドキュメントエージェントの例でまとめると、Engine をドキュメントエージェントのトレースに対して実行し、問題を検出します。複数のトレースが潜在的な問題を示している場合、問題のあるプロンプトまたはツールへの変更を要求する issue が作成されます。

Sydney Runkle - inline image

ここでの重要なポイントは、戻り矢印が単にトップにループバックするだけではないということです。内部に到達して、エージェントループを直接更新します。外側のループの各サイクルにより、内側のループがより効果的になります。

今後の展望:

プロンプトとツールの設定は改善するのに最も簡単なものですが、それだけが選択肢ではありません。オープンウェイトモデルを実行しているチームにとって、山登りループは RL のファインチューニングにフィードし、トレースや評価結果をトレーニングシグナルとして使用してモデル自体を改善することができます。メモリや取得したスキルなどの補助コンテキストも同じ方法で改善できます。ループはパターンであり、何を最適化するかはあなた次第です。

人間による監視と専門知識

自動化は、ループから人間を排除することを意味しません。すべてのレベルにおいて、人間による監視が価値を発揮する自然なポイントがあります。自動化された採点者はリンクが解決するかどうかをチェックできますが、フレーミングが視聴者にとって適切でないことに気付くのは人間です。コンテキスト、経験、センスから得られるその種の判断こそが、人間によるレビューの価値が発揮される点です。

ある種の専門知識はプロンプト/ツール自体にコード化されるべきですが、機密性の高いアクション(金融取引、データベース操作など)には、ライブの人間によるレビューが不可欠です。LangChain を使用すると、すべてのループでこれらのタッチポイントを簡単に実装できます。

  1. エージェントループでは、機密性の高いアクション/ツール呼び出しの前に人間の入力を要求します。
  2. 検証ループでは、機密性の高いワークフローに対して人間が採点者として機能できます。
  3. アプリケーションループでは、出力がエンドユーザーに返される前に人間が承認できます。
  4. 山登りループでは、ハーネスの改善をデプロイ前に人間によるレビューにかけることができます。

LangChain のすべてのオープンソースフレームワークは、「人間のループへの参加」を第一級のプリミティブとして提供しています。

すべてをまとめると

より表形式で表示したい方のために、これら 4 つのループがどのように積み重なるかを以下に示します。

ループ

機能

影響

LangChain プリミティブ

1: エージェントループ

(モデル + ツール)

モデルがタスク完了までツールを繰り返し呼び出す

作業の自動化

create_agent

、LangChain がサポートする任意のモデル

2: 検証ループ

(エージェント + 採点者)

エージェント実行、出力を評価基準でスコアリング、不合格時はフィードバック付きで再試行

品質の保証

RubricMiddleware

3: イベントループ

(検証 + システム)

イベントがエージェント実行をトリガーし、実際のシステムを更新する

大規模な作業

LangSmith Deployment / Fleet channels

4: 山登りループ

(システム + エンジン)

プロダクションのトレースが分析エージェントにフィードされ、ハーネス設定を改善する

継続的な改善

LangSmith Engine

これこそが、ループエンジニアリング、つまり @swyx 氏が言うところの loopcraft が実際にどのように機能するかです。SteipeteBorisAndrej などの AI リーダーは皆、同じ結論に達しています。エージェントの可能性は、その周りに構築するループにあるということです。

私たちはしばらくループ 1 と 2 について考えてきました。しかし、焦点はループ 3 と 4 に移るべきです。そこでは、エージェントをエコシステムに組み込み、ユーザーの基準に応じて継続的に改善することで、価値が倍増します。

Satya 氏は組織的な重要性を次のように述べています。人間の判断とトークン資本が協調して成長する学習ループを早期に構築した企業は、複製が難しい優位性を築くでしょう。

謝辞

@Vtrivedy10@masondrxy@hwchase17@huntlovell の各氏の丁寧なレビューに感謝します。

参考資料

ワンクリック保存

YouMindでバイラル記事をAI深読み

Save the source, ask focused questions, summarize the argument, and turn a viral article into reusable notes in one AI workspace.

Explore YouMind
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る