手動式の方法
すべての主要な研究所は、同じアイデアを中心に静かに再構築されています。それは、あなたがタイピングをやめた後も働き続けるループです。これは、2026 年 7 月 25 日時点での、Claude、GPT、Gemini、Grok、Meta の Muse Spark、Mira、そしてオープンウェイトの波にわたるループの実際の動作に関するフィールドガイドであり、すべての主張には出典が付いています。
誰かが仕事で AI を使っているのを見ると、たいてい同じ儀式を目にすることになるでしょう。リクエストを入力する。待つ。答えを読む。問題を見つける。問題を説明する。また待つ。結果をどこかに貼り付ける。翌日戻ってきて、ゼロからすべてをやり直す。
ここが不快な部分です。その儀式はまさにループなのです。質問し、確認し、修正し、繰り返す。それと現在研究所が出荷しているものとの唯一の違いは、誰がクランクを回すかです。手動で行う場合、あなたがトリガーであり、メモリであり、検証者であり、停止条件であり、そしてあなたは高コストです。
過去 1 年間、すべての真剣な AI 研究所は同じ解決策に収束しました。クランクを機械の中に移すことです。Anthropic は Claude 用のループの公式分類法を公開しています。OpenAI は、マルチステップのジョブを自律的に実行するワークモードを中心に ChatGPT を再構築しました。Google は、タスクごとにレンタルする研究ループを販売しています。Meta は、サブエージェントのフリートを調整するために特別に Muse Spark モデルをトレーニングしました。この物語の中で最も小さなプレイヤーである、Mira と呼ばれる Telegram ボットを運営する 2 人組のスタートアップでさえ、実際にはターミナルを開くことのない人々にループを販売しています。
そして、これを書いている今も、状況は動き続けています。このアップデートの前の 7 日間だけでも、Anthropic は日常的なエージェント作業向けに構築された新しい Opus を出荷し、Alibaba は 2.4 兆パラメータの Qwen をプレビューし、これまでにリリースされた最大のオープンウェイトモデルは、そのウェイトを公開するまで約 48 時間となっています。
その結果、チャットインターフェースが登場して以来、このテクノロジーの使われ方における最大の静かな変化が起きています。仕事の単位はもはやプロンプトではありません。それはループ、つまりあなたが定義した条件が満たされるまで動作し続ける作業のサイクルなのです。
この記事は、そのストーリーの詳細版です。ループが実際に何であるか、誇大広告を削ぎ落として。各研究所のループスタックが現在どのようなものか、1 ヶ月前には存在しなかったモデルも含めて。実際に機能するもの、それは驚くほどすべてのベンダーで一貫していることが判明しています。そして、ローンチ投稿では触れられていない障害モードとコストについて。
方法についての注意事項です。AI に関する議論は自信に満ちたナンセンスで溢れかえっているため、以下に記載するすべては、研究所自身の文書と発表、または名前のある独立した評価に基づいており、2026 年 7 月 25 日までの週にライブで確認されたものです。数字がベンダー自身による報告である場合は、その旨を明記します。何かが未検証であるか、まだプレビュー段階である場合も、その旨を明記します。完全なソースリストは下部にあります。
パート 1: ループの正体
専門用語を削ぎ落とすと、ループとは 4 つのビートと停止する理由に他なりません。
この分野の標準的な定義に最も近いものを公開している Anthropic の Claude Code チームは、これを一文で表現しています。ループとは、「エージェントが停止条件が満たされるまで作業サイクルを繰り返す」ことです。OpenAI の独自のエージェントガイドも、エンジニア用語で同じことを述べています。「すべてのオーケストレーションアプローチには、'ラン'の概念が必要です。これは通常、エージェントが終了条件に達するまで動作できるようにするループとして実装されます」。ここで終了条件には、最終出力、エラー、または最大ターン数が含まれます。
平易な言葉で言えば、4 つのビートは次のとおりです。
- トリガー。 何かがランを開始します。あなた、スケジュール、アラート、新しいプルリクエスト、メールの到着など。
- 作業。 モデルがコンテキストを収集し、ツールを使ってアクションを実行します。ファイルを読み、クエリを実行し、メッセージを下書きし、コードを編集します。
- チェック。 結果が実際の何かに対して検証されます。テストが合格するか不合格になるか。数値がソースと一致するか。別のモデルがあなたの基準に対してドラフトを評価します。
- 繰り返すか停止するか。 チェックが失敗した場合、ループは学んだことを活かしてもう一周します。チェックが合格した場合、または上限に達した場合、停止します。
これが全体の仕組みです。プロンプトは、ビート 2 と 3 を 1 回通過するもので、あなたが頭の中でビート 3 を行います。ループは、チェックと繰り返しを機械に任せ、さらに 2 つの安全レール、つまり無限に実行されないための停止条件と、無限に費用がかからないための予算を備えた同じものです。
サポートキャスト
これら 4 つのビートの周りには、すべての本格的なループスタックが、ベンダーが何と呼ぼうと、同じ 5 つのサポート要素を搭載しています。
- メモリ。 ラン間で存続するメモ。ラン 40 がラン 1 で学んだことを知っているように。
- 状態。 ループが現在どこにあるか。何が完了し、何が失敗し、次は何か。
- 検証者。 「十分良い」を決定するもの。あなたが行う最も重要な設計上の選択です。
- 停止条件。 「テスト合格」、「キューが空」、「5 回の試行後に停止」、「午前 9 時でダイジェストが送信された」。
- コストメーター。 サイクルあたりのトークンとドル。ループは、接触するものすべて、つまり請求書も含めて増幅させるからです。
4 種類のループ
Anthropic の分類法は、名前は異なっていても、他のすべてのベンダーの製品にきれいにマッピングされるため、学ぶ価値があります。彼らのチームは、何を委譲するかによってループを分類しています。
- ターンベースのループ。 あなたがプロンプトを送信し、エージェントが 1 サイクル(収集、実行、チェック、応答)を行い、あなたがレビューし、再びプロンプトを送信します。あなたは依然として停止条件です。これは誰もが始める場所であり、Anthropic はすべてのプロンプトがすでに内部でこのマイクロループを実行していると指摘しています。
- ゴールベースのループ。 あなたは停止条件を委譲します。完了の状態を定義すると、エージェントはそこに到達するか、ターン上限に達するまで繰り返します。Claude Code では、これは文字通り /goal コマンドであり、モデルが停止しようとするたびに、「評価モデルがあなたの条件をチェックし、目標が達成されるまで作業に送り返します」。決定論的な基準が最も効果的です。テスト合格、スコアクリア、チェックリスト完了。
- タイムベースのループ。 あなたはトリガーを委譲します。ループは間隔またはスケジュールで実行され、変更されたものに反応します。毎朝 Slack を要約する、CI がパスするまでプルリクエストをチェックするなど。
- プロアクティブループ。 あなたはプロンプト自体を委譲します。イベントまたはスケジュールが、人間がリアルタイムで関与せずにランを開始します。新しいバグレポートが到着次第トリアージされる、依存関係が毎週アップグレードされるなど、各タスクは独自の目標が達成されると終了します。
この梯子(チェック、次に停止条件、次にトリガー、次にプロンプトを委譲する)を頭に入れておけば、この記事の残りの部分は、7 つのベンダーが異なる方向からそれを登っていくのを見るだけです。
パート 2: 現状のスナップショット
ラボ別のツアーに入る前に、状況を把握しておきましょう。この記事の 5 週間前に、フロンティアは驚異的な速さで動きました。Grok 4.5 が 7 月 8 日に、Meta の Muse Spark 1.1 と OpenAI の GPT-5.6 がともに 7 月 9 日に、Thinking Machines が 7 月 15 日に最初のモデルを、Moonshot の Kimi K3 が 7 月 16 日に、Alibaba が 7 月 19 日に Qwen3.8-Max をプレビューし、Anthropic はこのアップデートの前日である 7 月 24 日に Claude Opus 5 をリリースしました。
中立的な指標として、独立した評価機関である Artificial Analysis は、Intelligence Index で一般的な能力をスコアリングしています。今週のスナップショット(v4.1)によると、公開されているトップの表は次のとおりです。
- Claude Fable 5 (Anthropic): 59.9
- GPT-5.6 Sol Max (OpenAI): 58.9
- Kimi K3 (Moonshot、オープンウェイト間近): 57.1、全体で 4 位
- 以下、Claude Opus 4.8、Grok 4.5、Muse Spark 1.1、GLM-5.2 など
2 つの注意点があります。Claude Opus 5 は、これを書いている時点でリリースから 1 日しか経っておらず、まだインデックスに登録されていません。また、単一の複合指標では、長期的なエージェント作業(ループが実際に行うこと)を捉えることはできません。そのため、ラボがエージェント固有の結果を公開している場合は、そのラボのセクションで引用し、自己報告である場合はその旨を明記します。
それでも、2 つの点に注目してください。トップの表は現在、3 ポイント未満の差になっています。つまり、ループ構築の目的においては、そのバンド内でのモデル選択は、その周りのループほど重要ではないということです。そして、オープンウェイトモデルが初めてそのバンド内に位置しています。
Claude: 第一級のプリミティブとしてのループ
モデル。 2026 年 6 月 9 日にリリースされた Claude Fable 5 は、Anthropic の最も高性能なモデルであり、この種の作業のために最も明確に構築されたモデルです。Anthropic 自身の枠組みでは、Claude Code のようなハーネス内で実行すると、「複数の段階にわたって計画し、サブエージェントに委任し、自身の作業をチェックしながら、数日間連続して作業できる」とされています。その思考は適応的で常にオンになっており、努力設定によって調整され、100 万トークンのコンテキストウィンドウを備えています。これは依然として独立した指標でトップに位置しています。その兄弟モデルである Mythos 5 は、Anthropic がサイバーセキュリティタスクで最も強力だと評価するスペシャリストです。
今週のニュースは、7 月 24 日にリリースされた Claude Opus 5 です。Anthropic は、Fable 5 のフロンティア知能に半分の価格(入力トークン 100 万あたり 5 ドル、出力 25 ドル)で迫り、発表によると GDPval-AA のような知識作業評価で新たな最先端であり、Claude の Max プランにおける新しいデフォルトモデルであると説明しています。ループ構築者にとっての売り込みは率直です。フロンティアに近いサイクルを半額で提供することで、1 日中実行しても手が届く範囲が変わります。
ループスタック。 Anthropic を際立たせているのは、ループがアプリに埋もれた機能ではないということです。それらは、あなたがタイプできる名前付きのプリミティブです。
- /goal は完了を定義し、評価モデルが条件が満たされるかターン上限に達するまでエージェントを作業に戻せるようにします。これは文字通り製品化されたゴールベースのループです。
- /loop は、あなたのマシン上の間隔でプロンプトを再実行します。/schedule はそのループをルーチンとして Anthropic のクラウドに移動し、ラップトップを閉じた状態でも、スケジュール、API コール、または GitHub イベントによってトリガーされ、実行し続けます。
- 動的ワークフローは極端なケースを処理します。Claude は実際のオーケストレーションスクリプトを書き、1 回の実行で最大 1,000 のサブエージェントを調整できます。代表的な逸話は、開発者が Bun ランタイム(約 75 万行)を Zig から Rust に、数百の並列エージェントを使用して約 11 日間で移植したというものです。
- スキル、フック、サブエージェントがサポートキャストを補完します。スキルは作業の検証方法をエンコードし、新しいコンテキストのセカンドエージェントがコードレビューを行い、メモリはセッション間でファイルに永続化されます。
哲学。 Anthropic のガイダンスは、抑制について異例なほど明確です。すべてのタスクに複雑なループが必要なわけではない、最も単純なプリミティブから始める、決定論的な停止基準を設定する、大規模実行の前に小さなスライスでパイロットする、組み込みコマンドで使用状況を監視する、というものです。この分野全体が再発見し続けている彼らの言葉は、「自身の出力をチェックし改善できるエージェントは、根本的により信頼性が高い」というものです。
読み解き方: 開発者のためのループ研究所。あらゆるループタイプの最もわかりやすく、最も構成可能なバージョンであり、現在は内部で実行するためのより安価なフロンティアに近いエンジンを備えています。
OpenAI: 3 つのモードと独立した承認者
モデル。 OpenAI の GPT-5.6 世代は、2026 年 7 月 9 日に 3 つのティア で GA になりました。Sol(フラッグシップ、トークン 100 万あたり 5 ドル/30 ドル)、Terra(バランスの取れた中間)、Luna(高速で低コスト)で、すべて約 100 万トークンのコンテキストウィンドウを備えています。Sol は独立した指標で 2 位であり、Fable 5 と実質的に同点です。その代表的なループ機能は、難しい問題に対してデフォルトで 4 つのエージェントを並列に調整するウルトラモードです。
コンシューマーループスタック。 OpenAI のここでのストーリーは再構築です。2025 年のスタンドアロンの「ChatGPT エージェント」は廃止され、その代わりに、ChatGPT は現在 3 つのモードを備えています。会話用の Chat、完成した成果物を生成する長期マルチステップタスク用の Work、そしてソフトウェア用の Codex です。Work はクラウドでジョブを実行し、承認チェックポイントで一時停止でき、重要なことに、トリガーで実行できます。スケジュールされたタスクには、間隔で何かをチェックし、報告すべきことがある場合にのみ通知する監視タスクが含まれるようになりました。これは、コードを一切使わずに消費者に販売されるタイムベースのループです。エージェントモードは、ウェブ上のタスクを実行するための Atlas ブラウザ内にも存在します。
開発者ループスタック。 区分線は OpenAI のドキュメントで明確に述べられています。「ループを自分で所有したい場合は Responses API を使用してください。SDK に実行させたい場合は Agents SDK を使用してください。」 Responses API はデフォルトでエージェント的であり、モデルが 1 つのリクエスト内でウェブ検索、ファイル検索、コンピューター使用、コード実行、およびあなたの関数を呼び出すことを可能にします。ループに特に関係する GPT-5.6 時代の追加機能が 2 つあります。1 つは、モデルがサンドボックス内で小さな JavaScript プログラムを記述して独自のツールコールを調整するプログラムによるツールコーリング、もう 1 つは、ルートエージェントがサブエージェントのツリーを生成して管理するマルチエージェントベータ版です。
特徴的なアイデア:実行役と承認者を分離する。 OpenAI の最も興味深いループへの貢献は、Auto-review(2026 年 4 月 30 日)です。Codex エージェントがサンドボックスの外部で何かをしようとするとき、エージェント自身ではなく、別のレビューモデルが、そのアクションがユーザーの要求と一致しているかどうかを決定します。彼らの論理は率直です。メインエージェントはタスクを完了するように最適化されており、それが承認境界を単なる別の障害物として扱う圧力を生み出します。承認判断を別のモデル呼び出しに保持することで、監査可能になります。OpenAI によると、結果として、セッションが人間に確認を求める頻度は約 200 分の 1 になり、レビュアーはまだエスカレーションされたものの約 99 パーセントを承認します。これらの数字は自己報告ですが、設計原則は普遍的です。完了したいモデルに、完了したと判断させることを決して許してはいけません。
読み解き方: 消費者のループへの入り口であり、本格的な開発者スタックを備えています。そして、プラットフォームビルダーへの警告でもあります。OpenAI は、ビジュアルエージェントビルダーをローンチから 1 年以内に非推奨とし、2026 年 11 月 30 日に完全にシャットダウンすることを決定しました。
Google: タスクごとにレンタルする研究ループ
モデル。 Google の現在のフラッグシップは Gemini 3.1 Pro(2026 年 4 月)ですが、このストーリーにとって興味深い部分はチャットモデルではありません。Google がループ全体を製品に変えたことです。
ループスタック。 2026 年 4 月 21 日に 2 つのフレーバー(速度重視の標準と網羅性重視の Max)でローンチされた Deep Research エージェント は、1 回の API リクエストで呼び出すゴールベースの研究ループです。ドキュメントはサイクルを明確に説明しています。計画、検索、読み取り、反復、出力、バックグラウンドで数分から 1 時間実行され、最終レポートには引用が含まれます。設計の詳細は、ループエンジニアリングの小さなマスタークラスです。
- バックグラウンド実行は必須です。 研究ループは HTTP タイムアウトを超えて存続するため、結果をポーリングします。仕事の単位はリクエストではなく、ループです。
- 協調的計画は、前面にある人間のゲートです。エージェントが研究計画を提案し、あなたが編集または承認してから実行されます。ループ中に babysitting するのではなく、ループの前に方向付けを行います。
- ハードストップ条件が組み込まれています。 最大研究時間は 60 分で、ほとんどのタスクは約 20 分で完了します。
- ツールは実行ごとにスコープが設定されます。 デフォルトでは Google 検索、URL 読み取り、コード実行、オプションで独自の MCP サーバーとファイルストア、そしてオープンウェブを完全にオフにしてプライベートデータのみを研究することもできます。
- コストはループごとに[正直に](http://honestly.google/) 価格設定されています。 Google の独自の見積もりによると、標準的なタスクでは約 80 回の検索と約 25 万の入力トークンを消費し、1 ドルから 3 ドルになります。Max 実行では、160 回の検索と約 3 ドルから 7 ドルに達する可能性があります。ループはチャットメッセージではなく、Google はそのように課金します。
読み解き方: ループがモデル呼び出しではなく、製品になりつつあるという最も明確な商業的証明です。あなたはトークンを購入するのではなく、完成した調査結果を購入するのです。
1 つ正直な注意点があります。この記事を書いている時点では、Deep Research エージェントは Interactions API を介したプレビュー段階にあるため、インターフェースが変更される可能性があります。
Muse Spark 1.1: オーケストレーション用にトレーニングされた新参者
モデル。 Muse Spark 1.1 は、2026 年 7 月 9 日に 4 月の Muse Spark 1.0 のアップグレードとしてリリースされた Meta Superintelligence Labs のマルチモーダル推論モデルであり、このラウンドアップで最も重要な新参者の 1 つです。その理由は 3 つあります。
第一に、戦略です。これは Meta 初の有料モデル API であり、入力トークン 100 万あたり 1.25 ドル、出力 4.25 ドルで、クローズドウェイトであり、オープンな Llama 時代からの完全な決別です。Llama ラインの支持者は、以下でカバーするオープンウェイトの波に実質的に明け渡されており、Meta は将来の Muse バージョンをオープンソース化することを望んでいるだけだと述べています。
第二に、トレーニング目標です。ほとんどのモデルがエージェント的な振る舞いを副産物として学習するのに対し、Meta はこのモデルが組織図のために直接トレーニングされたと述べています。「メインエージェントとして、コンテキストを収集し、計画を立て、並列サブエージェントに実行を委任できます。サブエージェントとして、自身の役割を遵守し、利用可能なツールを理解し、いつメインエージェントにエスカレーションすべきかを認識します。」 新しいツール、MCP サーバー、カスタムスキルをゼロショットで習得し、100 万トークンのコンテキストを積極的に管理し(作業中に記憶、取得、圧縮)、複数のアプリケーションにわたるコンピューター使用ワークフローを処理します。
第三に、価格性能比の位置付けです。独立した指標では、バージョン 1.0 から 3 ヶ月で 8 ポイント上昇し、フロンティアの 3 社には及ばないものの、タスクあたりのコストはその数分の一であり、現在 MCP Atlas ツール使用ベンチマークで 88.1 をリードしています(ベンダーに近い数字です。いつものように割り引いて受け止めてください)。
これがすべてどこに向かっているのかを示す、ループ構築者への注意事項。 Meta 自身の開発者向けドキュメントは、古い Chat Completions スタイルの API でマルチターンエージェントを構築すると、モデルの推論がターン間で破棄され、ループがドリフトして作業を繰り返すため、暗号化された推論をターン間で引き継ぐ Responses スタイルの API に誘導すると警告しています。業界の基盤は、非推奨になる API を 1 つずつ、ループを中心に再構築されています。
読み解き方: フロンティアの 3 社がコスト的に過剰である場合に、オーケストレーションが重いループのためにレンタルするエンジン。まだ若いですが、バージョン 1.0 から 1.1 への傾きは、注目する理由です。
Grok 4.5: 安価で高速なサイクル、実務でトレーニング
モデル。 Grok 4.5 は、2026 年 7 月 8 日に Musk の xAI(現在は公開上場企業 SpaceXAI の傘下で運営)から出荷され、コーディング、エージェントタスク、知識作業において最もスマートなモデルとして売り出されました。Musk 自身のポジショニングは異例なほど直接的でした。Opus クラスのモデルで、Claude Opus 4.7 とほぼ同等だが、より高速で安価であると。独立したスコアリングもその雰囲気と一致しています。以前の Opus 世代を上回り、フロンティアの 3 社には及びません。
ループにとって特に重要な理由。 2 つの主張があり、いずれも xAI からのものであり、マーケティングを割り引いてもループに関連します。
- ループ内でトレーニングされました。 xAI によると、強化学習は、トレーニングが続いている間にエージェントのロールアウトが何時間も実行されるインフラストラクチャ上で、自動採点による数十万のマルチステップエンジニアリングタスクをカバーしました。ベンチマークが何と言おうと、トレーニングの材料は仕事そのものでした。
- ループの経済性が売りです。 トークン 100 万あたり 2 ドル/6 ドル、毎秒約 80 トークン、そして主張されている 2 倍のトークン効率(同等のモデルの半分以下のステップでタスクを解決)により、主張は「最もスマートなサイクル」ではなく、「1 ドルあたりのサイクル数が最も多い」です。コストがサイクルあたりのコスト×サイクル数であるループにとって、この計算こそがすべてです。ドキュメントは、会話に固定されたプロンプトキャッシュ(長いループがコールドキャッシュのコストを支払わないようにする)や、ツールが多い実行のためのコンテキスト圧縮ガイダンスなど、地味なループの基礎でそれを補強しています。
製品化されたループは、コーディングエージェントである Grok Build に存在します(Cursor と並行してトレーニングされ、Cursor のすべてのプランで利用可能)。これは、ウェブ調査を伴う複数シートの Excel モデル、ネイティブの PowerPoint 図、Word 文書など、奇妙なほど実用的な領域にまで及びます。
読み解き方: 大量のループのための予算の働き手であり、効率性の数値のほとんどはベンダー自身によるものであるという通常の注意事項が付きます。
Mira: ターミナルを開くことのない人々のためのループ
ここに、フロンティアモデルのリストでは間違いのように見えるエントリがありますが、実際には最も示唆に富むものの 1 つです。
Mira とは何か。 Mira はモデルではありません。それは、完全に Telegram 内に存在する コンシューマー向け AI エージェントであり、2 人に満たないスタートアップによって構築され、Daria Yakovleva が率い、Telegram エコシステムのソフトウェア企業である The Open Platform からインキュベートされました。2026 年 2 月に静かにローンチされ、6 月初旬までに 100 万人の月間ユーザーを超えたと報告されています(自己報告、約 117 万人)。内部ではモデルに依存せず、各タスクを独自のモデルではなくサードパーティのモデル(GPT、Claude など)にルーティングします。
なぜこの記事に登場するのか。 Mira の製品はループであり、ループだけであり、その言葉を聞くことのない人々に販売されているからです。パッケージ化された自動化機能である Skills は、それぞれがパート 1 の正確な構造をバンドルしています。トリガー(スケジュール、音声メモ、グループチャットイベント)、接続されたアプリ(カレンダー、メール、プロジェクトトラッカー、コンテンツツール)にわたるアクション、そしてチャットへの自律的な配信。フライト価格を監視してアラートする。音声メモを 3 つのプラットフォーム向けの投稿に変換する。このグループが今日決定したことを要約し、アクションアイテムをファイルする。そのマテリアル内のポジショニングラインは、ループ時代全体の最も明確な要約です。「ChatGPT は答え、Mira は行動する。」
正直な注意点。 ユーザー数とコネクタ数(マテリアルによって 200 から 1,000 以上のサービスとさまざまに記載されています)は自己報告であり、ページ間で一貫性がなく、同社はループがどのように何かを検証するかについてのエンジニアリングガイダンスを公開しておらず、Skills を「ループ」と呼ぶのは外部の解釈であり、Mira 自身の語彙ではありません。小さなチームが他の研究所のモデルをラッピングしていることも、このリストの他のすべてと比較して脆弱な基盤です。
読み解き方: 需要シグナル。2 人組の Telegram ボットが、トリガー、アクション、自律的な配信を一般の人々向けにパッケージ化することで 100 万ユーザーに達したとき、ループはもはや開発者の概念ではなくなっています。配布とゼロセットアップは、実際の作業の大部分において、能力よりも重要です。
オープンウェイトの波: 自分でループを持ち込む
2026 年半ばの最も大きなストーリーは、オープンウェイトの世界が数年遅れるのをやめ、数ヶ月遅れ、そしてここ 2 週間では数ポイント差になったことです。ループ構築者にとって、これは計算を完全に変えます。なぜなら、オープンモデルは、誰もあなたの足元から非推奨にできない唯一のループエンジンだからです。
簡単なツアー、日付とライセンスは確認済みです。
- Moonshot の Kimi K3 が今、話題の中心です。2026 年 7 月 16 日に 2.8 兆パラメータでリリースされ、独立系インデックスのフロンティア帯に初めて到達したオープントラックモデルとなりました。Artificial Analysis (v4.1) で 57.1 を記録し、公開スコアでは Fable 5 と GPT-5.6 Sol Max に次ぐ全体 4 位。また、Arena.ai のブラインド投票による Frontend Code Arena で Fable 5 を抑えて 1 位を獲得しました。完全な重みは 2026 年 7 月 27 日に HuggingFace で修正 MIT ライセンスのもと公開予定で、これにより同クラスで初のダウンロード可能なモデルとなります。ただし、7 月 24 日時点ではまだ重みは公開されていないため、これは予定通りの進行として捉えてください。Moonshot の代表的なデモはピュアループシアターです。48 時間の連続自律動作で小さな機能的なチップを設計し、単一エージェントが 100 万トークンのコンテキストで実行します。同じ独立系評価によるもう一つの重要な数字:K3 の測定された幻覚率は、事実に敏感なタスクで約 51% に上昇し、前モデルの 39% から増加しました。一方で事実精度は向上しています。正しい答えを出すのが得意になった一方で、間違っていることを認識するのが苦手になったのです。この点はパート 3 で覚えておいてください。
- アリババの Qwen3.8-Max は、2026 年 7 月 19 日の世界 AI 会議でプレビューされました。主張される 2.4 兆パラメータのマルチモーダルモデルで、Qwen チーム初の 1 兆パラメータ超えとなり、「Fable 5 に次ぐ」と自称し、オープンウェイトが近日公開予定とされています。プレビューは公開されていますが、ベンチマークテーブル、モデルカード、ライセンス、重みはまだ公開されていないため、すべての主張はベンダープレビューとして扱ってください。
- DeepSeek V4 (2026 年 4 月 24 日、MIT ライセンス) は、OpenRouter の言葉 を借りれば、オープンモデルとして初めて、実用的なエージェントパイプラインに plausible なフロンティア代替として投入されたものです。Pro バリアントは SWE-bench Verified でオープンウェイトのコーディングエージェントチャートを 80.6% でトップに。Flash バリアントは、そのほとんどすべてをセント単位の価格で維持しています。
- Z.ai の GLM-5.2 (2026 年 6 月中旬、MIT、753B 混合エキスパート) は、K3 が登場するまでのオープンウェイト品質リーダーで、OpenRouter は Opus スタイルの計画と長期コーディングに最も近いオープン代替品と評しています。既知の欠点:高コストな思考を行い、出力トークンを大量に消費します。
- MiniMax M3 (2026 年 6 月 1 日、修正 MIT) は、オープンマルチモーダルレーンです。100 万トークンのコンテキストでネイティブの画像と動画理解を備え、ループがスクリーンショットや UI 状態を読み取る必要がある場合に重要です。
- NVIDIA Nemotron 3 Ultra は、米国製の最強のオープンウェイト参入モデルで、ピークスコアよりも展開と NVIDIA スタックで差別化されています。
- その他の注目株: Mira Murati の会社である Thinking Machines Lab は、2026 年 7 月 15 日に最初のモデル Inkling をリリースしました。975B パラメータのオープンウェイトマルチモーダル混合エキスパートで、Apache 2.0 ライセンスです。オープンウェイトが楔となると確信する一流の研究所がまた一つ増えました。
こう解釈してください: ループが大量処理、プライバシー重視、またはベンダーのロードマップを超えて存続する必要がある場合、オープンウェーブはもはや妥協の選択肢ではありません。クローズドフロンティアとの差は今やわずか数ポイントで、その差は広がっていません。
パート 3: 実際に効果的なこと
7 つのベンダーのドキュメントを数週間調査して驚いたのは、ブランドを取り除けば、すべてが同じアドバイスをしていることです。激しい競合他社が同一のガイダンスに収束するとき、それはこの分野で可能な限り真実に近いものです。各ラボで三角測量された 7 つのルールです。
1. 開始前に完了を定義する。 Anthropic の /goal は、評価者が明示的な条件をチェックできるように存在します。OpenAI のガイドは、すべての実行に終了条件を要求します。Google は研究を 60 分で打ち切ります。明確な停止条件のないループは自動化ではなく、トークンを消費するサブスクリプションです。雰囲気より決定論:テストに合格、数値が一致、チェックリスト完了、最大試行回数 N 回。
2. 検証こそが製品である。 ループの品質上限は、モデルではなくチェックステップです。Anthropic は、検証をスキルとしてエンコードし、新しいコンテキストを持つ別のエージェントをレビューに割り当てるよう指示しています。OpenAI はさらに進んで、承認者を実行者とは構造的に別のモデルにしました。その理由は、実行者は完了したいからです。Google は、クリックできる引用でレポートを裏付けています。そして今週、このルールの最良の証拠がもたらされました。ボード上で最も印象的なオープンモデルは、正しい答えを生成する能力が測定可能なほど向上した一方で、間違っていることを認識する能力が低下したのです。チャットではこれは脚注に過ぎません。検証されていないループでは、これは自信過剰なエラーの工場です。どこかに 1 時間投資するなら、「チェック済み」があなたのタスクにとって何を意味するかに投資してください。
3. 実行者自身に重要なことを評価させてはいけない。 同じ原則を別の側面から見たものです。なぜなら、業界全体が代償を払って学んだ唯一の教訓だからです。タスクを完了するモデルは、すべてのゲートを障害物と見なします。検証モデルを分離し、レビューアーエージェントを別に設けるか、不可逆的なステップには人間を配置してください。
4. コンテキストを貴重なリソースとして管理する。 Anthropic のコンテキストエンジニアリングガイダンス(最小限の高シグナルトークンセット、ノートファイル、サマリーを返すサブエージェント)、Meta のアクティブコンパクション、Grok のコンパクションガイダンス、Kimi の巨大コンテキストの反論:誰もが同じ質問に答えています。それは、長いループがどのように一貫性を保つかです。コンセンサスは、ウィンドウ外のメモリとオンデマンドの検索であり、詰め込みではありません。
5. 前の段階が失敗した場合にのみ、ループタイプをアップグレードする。 Anthropic は最も単純なプリミティブから始めるように言います。OpenAI は、マルチエージェント化する前に単一エージェントを最大化するように言います。Google は、1 時間の実行の前に計画を承認させます。パート 1 のラダーは、規律でもあります。チェック、停止条件、トリガー、プロンプトの順に、一度に一段ずつ引き渡します。
6. メッセージではなくループに価格を付ける。 ループのコストは、サイクルあたりのコスト × サイクル数です。そのため、Google は研究タスクあたり $1 から $7 で価格設定し、Grok はトークン効率を前面に打ち出し、Anthropic は Opus 5 でフロンティアに近いサイクルの価格を半分に引き下げ、すべての本格的なスタックは使用状況検査ツールを提供しています。開始する前に、実行にかけてもよいコストを決定してください。
7. 元に戻せないゲートには人間を残す。 お金の流出、メールの送信、データの削除、コードの本番マージ。Work モードの承認チェックポイント、共同計画、権限モード、Auto-review のエスカレーション:すべてのベンダーが、例外なく、不可逆的なステップに人間のゲートを残しました。最も強力なループを持つベンダーは、これに最もこだわっています。それは何かを物語っているはずです。
パート 4: 誰も教えてくれないこと
ローンチ投稿はここで終わります。運用経験は続きます。
ループは、間違いも含めてすべてを増幅する。 チャットでの 1 つの誤った仮定は、悪い答えをもたらします。ループでの同じ誤った仮定は、朝までに 50 の一貫性のある自信過剰な誤ったアーティファクトを生み出します。これが検証がルール 1 であり、無人ループは書き込みアクセスを獲得するまで読み取り専用で開始すべき理由です。
請求額は静かに膨らむ。 すべてのベンダーのガイダンスにトークン管理セクションがあるのには理由があります。思考重視のモデルは、1 つの難しいステップで出力トークンにドルを費やす可能性があります。基礎となるものが 1 日に 1 回変化するのに、毎時間実行されるルーチンは、何のためにも 24 倍のコストを支払っています。間隔を変化率に合わせ、ターンを制限し、メーターを確認してください。
プロンプトインジェクションはループで悪化する。 ループが Web、受信箱、ユーザーアップロードを読み取る瞬間、誰かがそのコンテンツに指示を埋め込むと仮定してください。だまされたチャットアシスタントは一度だけ恥をかかせます。ツールアクセスを持つだまされたループは、あなたが寝ている間に繰り返し行動します。OpenAI 自身の安全ドキュメントは、暗黙の部分を認めています。緩和策があっても、エージェントは完璧ではなく、だまされる可能性があります。ループが取り込むすべてをデータとして扱い、命令として決して扱わず、権限を真剣にスコープしてください。
デモとプロダクションのギャップは現実です。 48 時間の自律チップ設計は素晴らしいデモであると同時に、管理されたデモでもあります。自己報告された効率倍数、プライベートベンチマーク、モデルカードなしで発表されたベンダープレビューのパラメータ数:有用なシグナルですが、どれも独自の検証器で独自のタスクでループを実行することの代替にはなりません。すべてのラボが静かに同意しており、それが評価を構築するように指示する理由です。
プラットフォームは足元で変化する。 この記事の前の 12 か月で:OpenAI はスタンドアロンのエージェント製品を廃止し、Pulse を引退させ、ビジュアル Agent Builder のシャットダウンを予定(2026 年 11 月 30 日)。新しい Opus が一夜で Claude のプランラインナップを再編。API はループフレンドリーなデザインに再構築されました。そして 6 月の輸出管理指令により、フロンティアの Claude モデルが多くのユーザーに対して一時的にオフラインになりました。ロジック(目標、検証器、ノート)がベンダーの UI ではなくあなたのファイルに存在し、エンジンが交換可能なままになるように、ループを構築してください。
堀はモデルではない。 フロンティアは現在、毎週再編成される 3 ポイント未満のスプレッドであり、オープンモデルがそれに加わりました。複利効果があるのはあなたのものです:失敗から構築された評価セット、あなたの基準をエンコードする検証器、あなたのループが蓄積してきたノート。モデルの切り替えは設定変更です。1 年間の検証ロジックの再構築はそうではありません。
あなたに合ったループスタックは?
上記すべてを考慮した、正直なマッチメイキング:
- ターミナルで生活し、最大限の制御を望む場合: Claude Code。最も難しい実行には Fable 5、新しいデフォルトの価値提案として Opus 5。最も読みやすいプリミティブ(/goal、/schedule、動的ワークフロー)と最もよく文書化された哲学。
- 誰もがすでに使っている製品内でループを望む場合: ChatGPT の Work モードと Scheduled Tasks(監視タスクは犯罪的にも過小評価されています)、または Codex と Auto-review をコード用に。
- あなたのループが「X を徹底的に調査し、引用付きのレポートをくれ」という場合: Google の Deep Research または Deep Research Max をタスクごとにレンタルし、自分で構築するのはスキップ。
- 多くのサブエージェントをオーケストレーションし、コストを監視している場合: エンジンとして Muse Spark 1.1 または Grok 4.5。どちらも、フロンティアトリオから一段下で、まさにこの目的のために価格設定され構築されています。
- 設定不要でポケットに入る自動化を望む場合: すでに使っているチャットアプリ内の Mira スタイルのコンシューマーエージェント。
- ボリューム、プライバシー、または永続性が必要な場合: オープンウェーブ。コストには DeepSeek V4 Flash、計画品質には GLM-5.2、マルチモーダルには MiniMax M3、そして(7 月 27 日から、重みが予定通りに公開されれば)実際にダウンロード可能なフロンティア帯の機能が必要なら Kimi K3。ただし、本物の検証器を持参してください。K3 自身の数字がそれを主張しています。
今週の最初のループ
ベンダーニュートラルな、正直なレシピ:
- すでに手動で繰り返しているタスクを選んでください。そこであなたがボトルネックになっているものです。
- 最初に停止条件を書いてください。「完了は X を意味する」と書けない場合、そのタスクはループの準備ができていません。
- チェックを書いてください。スクリプト、テスト、または別のモデル用のルーブリック。これが重要な 1 時間です。
- ターンベースで数回実行し、すべてのサイクルを監視してください。
- 停止条件を引き渡します(ターンキャップ付きのゴールループ)。どこで停止したり過剰に達したりするかを見て、基準を厳しくしてください。
- その後にのみトリガーを引き渡します(スケジュール設定)。予算キャップと開始時の読み取り専用権限を付けて。
- 失敗したとき(そして失敗します)、その失敗をテストケースに変えてください。それが自己改善の部分であり、あなたとループが一緒に行うものです。
一度に一段ずつ登ってください。これらのシステムから驚くべき結果を得ている人々は、秘密のモデルを見つけたわけではありません。彼らはループする価値のあるタスクを見つけ、完了を定義し、信頼できるチェックを構築したのです。
最後にもう一つ
プロンプト時代は、誰もがより良い質問をするように訓練しました。ループ時代は、あなたに別のものを求めています:あなたが他の場所にいる間に機械が追求できるように、結果を十分に正確に定義し、その追求を正直に保つチェックを設計することです。
それは本当のスキルであり、プロンプト作成ではありません。それは管理に近いものです。目標、完了の基準、適切なツール、予算、信頼できるチェック、そして判断が必要な場合のエスカレーションパス。この記事のすべてのラボ(3 兆ドル企業から 2 人の Telegram スタートアップまで)は、まさにそのスキルに報いる機械に収束しています。
タイピング、待機、修正、再質問がこのテクノロジーとの関係として望むものであれば、遅い方法でもまだ機能します。しかし、手回しハンドルは今やオプションであり、ラボは集合的にこの方向性を決定しました。作業の単位はループです。ループを定義するのはあなたです。
一つから始めてください。完了を定義してください。信頼するが、検証してください。そして、ハンドルを放してください。
出典
上記のすべては、2026 年 7 月 25 日までの週に一次情報源と照合されました。ラボ別にグループ化:
ループの概念
- Anthropic, ループ入門: claude.com/blog/getting-started-with-loops
- OpenAI, エージェント構築の実践ガイド: openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents
- Anthropic, 効果的なエージェントの構築: anthropic.com/engineering/building-effective-agents および 効果的なコンテキストエンジニアリング: anthropic.com/engineering/effective-context-engineering-for-ai-agents
Anthropic
- Claude Fable 5: anthropic.com/claude/fable およびローンチ投稿: anthropic.com/news/claude-fable-5-mythos-5
- Claude Opus 5 (2026 年 7 月 24 日): anthropic.com/news/claude-opus-5
- ルーチン: code.claude.com/docs/en/routines · 動的ワークフロー: code.claude.com/docs/en/workflows
OpenAI
- GPT-5.6: openai.com/index/gpt-5-6 · Work と Codex: help.openai.com/en/articles/20001275 · ChatGPT エージェント廃止: help.openai.com/en/articles/11752874 · エージェントガイド: developers.openai.com/api/docs/guides/agents· Auto-review: alignment.openai.com/auto-review
- Deep Research Max 発表: blog.google · Deep Research ドキュメント: ai.google.dev/gemini-api/docs/deep-research
Meta
- Muse Spark 1.1 発表: ai.meta.com/blog/introducing-muse-spark-meta-model-api · コーディングエージェントガイド: dev.meta.ai/docs/guides/coding-agents
xAI
- Grok 4.5: x.ai/news/grok-4-5 · ドキュメント: docs.x.ai/developers/grok-4-5
Mira
- プロダクトサイト: mira.tg · マイルストーン投稿: mira.tg/blog/mira-1-million-monthly-users
オープンウェイトウェーブ
- Kimi K3 独立評価と重み公開スケジュール: TechTimes, 2026 年 7 月 24 日 · ローンチ: VentureBeat, 2026 年 7 月 16 日
- Qwen3.8-Max プレビュー: MarkTechPost, 2026 年 7 月 19 日
- OpenRouter, 重要なオープンウェイトモデル, 2026 年 6 月: openrouter.ai/blog
- Thinking Machines Inkling: TechCrunch, 2026 年 7 月 15 日
- 独立スコア: Artificial Analysis Intelligence Index v4.1, 2026 年 7 月 24 日報告





