Anthropic がこれまでに構築した中で最も強力なモデルをリリースしましたが、ベンチマークの飛躍はほとんど最も興味深い部分ではありません。
Claude Fable 5.1 は、より優れたチャットボットというよりも、新しい種類のオペレーターのように感じられます。問題に何時間も向き合い、計画が崩れた時に回復し、他のエージェントを調整し、自身の出力を検査し、10 分ごとに誰かに助けを求める必要なく動き続けることができます。
数字もそれを裏付けています。Anthropic の公開評価によると、Fable 5.1 はエージェント型科学研究で Fable 5 の 2 倍以上のスコアを達成し、ビジネス自動化では 17.1% から 31.4% に跳ね上がり、CursorBench では 73.4% に達しました。また、Anthropic が報告したコーディング、自動化、コンピューター使用、ナレッジワークのテストのほとんどで、Fable 5、Opus 5、GPT-5.6 Sol をリードしました。
https://x.com/claudeai/status/2094848581425377479
箱から出してすぐに、難しいコーディング、長期間の作業、研究、計画、コンピューター使用、完全な成果物の作成に優れています。しかし、より大きな機会は、すべてのタスクを実行する人として使用するのをやめ、作業を行うシステムの指揮を任せたときに何が起こるかです。
このコースで扱うのは、Fable 5.1 が真に異なる点、リーダーの席に据える方法、その下で働くワーカーを構築する方法、息苦しくさせずにプロンプトを与える方法、目標とループを使用する方法、そしてその差が実際の収益に変わる 5 つのワークフローです。
ターミナル、エージェントファイル、オーケストレーションに関心がなく、単にアイデアを動くアプリに変えたいだけなら、そのために Shipper を構築しました。
このモデルが実際に優れている点
メソッドの前に、マシンについて知ってください。これらは、Fable 5.1 を以前のモデルとは異なるものにしている 5 つの能力です。
非常に長い実行でも一貫性を保つ
何時間もかかる仕事を与えても、途中で筋道を見失う可能性がはるかに低くなります。
ある初期テスターは、38 時間の無人機械学習実行について報告しました。その中で Fable は、以前の悪い結果を診断し、修正し、6 つの実験を並行して起動し、結果と次のステップを提示しました。別のテスターは、自身の記録を保持し、状況が変化したときに優先順位を再設定し、中断したところから再開したと述べています。
100 万トークンのコンテキストウィンドウ は役立ちますが、コンテキストサイズが本当のアップグレードではありません。アップグレードは、モデルがそのコンテキスト内で有用な決定を下し続けることができることであり、単に情報が存在することを記憶しているだけではありません。
最速の修正ではなく、根本原因を探す
以前のエージェントは、エラーを消す最初の修正を見つけることがよくありました。Fable 5.1 は、エラーが存在する理由を理解するまで掘り下げ続けることを厭いません。
Anthropic のローンチテストでは、Millennium は約 100 万回に 1 回発生し、4 ~ 5 年間説明されていなかったクラッシュを Fable に与えました。Fable 5.1 は外部ライブラリを分解し、それをコアダンプに接続し、クラッシュを実際のバグにまで追跡しました。Fable 5 を含め、彼らが試した他のすべてのモデルはそれを見逃しました。
これはデバッグをはるかに超えて重要です。同じ本能が研究、戦略、財務分析、運用にも現れます。根本的なシステムが間違っているときに、症状を最適化してはいけません。
見て、行動して、検証できる
Fable 5.1 は、スクリーンショット、チャート、PDF、インターフェース、ドキュメントを検査し、その情報を使って次のアクションを導くことができます。
つまり、参照からインターフェースを再構築し、財務書類に埋め込まれた数値を読み取り、ブラウザを操作し、実装を元のデザインと比較し、作業が完了したと主張する前に視覚的な問題をキャッチできます。
Anthropic のテストでは、OSWorld のコンピューター使用スコアが Fable 5 と Opus 5 の両方を上回りました。さらに重要なことに、モデルは、与えられた画像を説明するだけでなく、検証ループの一部として視覚をますます使用できるようになっています。
作業に関する講義ではなく、作業自体を返す
ドキュメントのフォルダを与えて、投資メモ、デッキ、動作するプロトタイプ、または分析を依頼すると、成果物自体を返す可能性がはるかに高くなります。
初期のテスターは、Anthropic のこれまでで最高の PowerPoint 結果、財務書類に対するより強力な引用想起、より簡潔な契約レッドライン、複雑な複数部分のリクエストのより良い完了を報告しました。MongoDB のエンジニアは、モデルが既存のサービスを調査し、システムを設計し、無人ステージで実装し、各ステージが機能したという証拠を含むビジュアルウォークスルーを返した、3 日間のプロトタイプ実行について説明しました。
実用的な違いは単純です。回答を使える作業に変換する時間が減ります。
リードするために構築された
Fable 5.1 は、次に何が起こるべきかを決定するときに最も価値があります。
Claude Code はすでに、サブエージェント、バックグラウンドセッション、エージェントチーム、動的ワークフロー、目標、ループ、ブラウザ、ターミナル、プロジェクトファイルを提供できます。Fable は、以前のモデルよりもはるかに長く、それらのピースを 1 つのゴールラインに向け続けるのに十分な計画の深さとコンテキストを備えています。
だからこそ、以下のセットアップが機能し、コースが Fable をワーカーの席から外すことから始まるのです。
コックピット: 実際に必要なすべてのコントロール
何よりも先に Claude Code を更新してください。現在のモデル設定ドキュメントによると、バージョン 2.1.255 以降では、fable エイリアスが Fable 5.1 に解決され、最近のリリースには以下で使用される goal、loop、background-agent、effort コントロールが含まれています。
次に、モデルと努力レベルを選択します:
/model fable
/effort high
High は、重要な作業に対する賢明なデフォルトです。より安価で高速なパスには medium に下げます。問題がより多くの思考を正当化するほど難しい場合にのみ、xhigh または max に移動します。Fable の適応的思考は常にオンになっているため、effort が重要なコントロールです。
残りのコントロールはシンプルです:
/plan または Shift+Tab: ファイルを変更する前に検査して計画を立てさせる
/goal: テスト可能な条件が満たされるまで、ターンをまたいで作業を続ける
/loop: セッションがアクティブな間、スケジュールに従ってプロンプトを再実行する
/tasks: バックグラウンドワーカーが何をしているかを確認する
/context: コンテキストウィンドウを何が消費しているかを確認する
これがコックピットです。
コースの残りの部分は、どのコントロールに、そしていつ手を伸ばすかを知ることです。
メインイベント: Fable をワーカーではなくリーダーにする
最大のアップグレードは役割の変更です。
Fable にすべてのキーボードタスクを与えるのをやめてください。Fable に作業を定義させ、それを明確なレーンに分割させ、それらのレーンをより安価なエージェントに送り、返ってきたものを判断させます。
セットアップは次のようになります:
Fable が計画を形作る:
計画モードにして、変更を提案する前にプロジェクトを検査させます。リクエストがまだ曖昧な場合は、Matt Pocock の
スキルコレクション を使用してアイデアを吟味し、会話を仕様に変え、仕様をチケットに分割します。
Fable が独立した作業を委任する:
実装は Opus または Sonnet のサブエージェントに任せ、各ワーカーが 1 つの境界のあるレーンを担当します。Codex も、すでに使用している場合は別のワーカーにできますが、同じファイル境界と証拠ルールに従う必要があります。
別のエージェントが検証する:
ワーカーは自分の宿題を採点しません。新しい検証者が計画を読み、実際の差分を検査し、チェックを実行し、ステージを合格させるか、具体的な失敗とともに返却します。
あなたはチェックポイントで舵を取る:
計画を承認し、意味のあるトレードオフをレビューし、最後に証拠を検査します。すべてのコマンドを見守る必要はありません。
これが機能する理由: 高価なモデルは、アーキテクチャ、優先順位付け、回復、判断にトークンを使います。安価なモデルは、境界のある実行にトークンを使います。
経済性が機能するのは、レーンが真に独立している場合のみです。Anthropic の現在のAPI 価格では、Fable 5.1 は入力 100 万トークンあたり 10 ドル、出力 100 万トークンあたり 50 ドルですが、Opus 5 はその半分、Sonnet 5 は 5 分の 1 です。Fable 5.1 はキャッシュ読み取りも 100 万トークンあたり 0.25 ドルに削減し、安定したプロジェクトコンテキストでの長時間セッションをはるかに実用的にしました。
見せかけのために並列化しないでください。5 つのエージェントが同じファイルを編集すると、5 つの請求書と 1 つのマージ問題が発生します。研究、独立したモジュール、テスト、ドキュメントなど、互いに待つことなく完了できるレーンを並列化します。
ワーカーを構築する
リーダーには小さなチームが必要であり、カスタムワーカー は .claude/agents/ 内の Markdown ファイルにすぎません。
1 つの実装ワーカーから始めます:
name: implementation-worker
description: 承認された計画から 1 つの独立したステージを実装します。ステージが個別のファイルを所有している場合にのみ使用します。
model: opus
tools: Read, Grep, Glob, Edit, Write, Bash
maxTurns: 25
あなたは自分に割り当てられたステージのみを所有します。
編集する前に、自分のレーン内の正確なファイルと合格基準を特定します。
別のワーカーが所有するファイルは変更しないでください。
最小限の完全なソリューションを実装し、関連するテストを実行します。
以下を返します:
- 変更されたファイル
- 実行されたチェックとその実際の出力
- まだ不確かな点
この実行からの証拠なしに成功を宣言しないでください。
次に、最も重要なワーカーである検証者を作成します:
name: verifier
description: 完了したステージを、その計画と合格基準に対して独立して検証します。すべての実装ステージの後に使用します。
model: opus
tools: Read, Grep, Glob, Bash
maxTurns: 15
実装の要約は信頼できない主張として扱います。
計画を読み、実際の差分を検査します。関連するテストを自分で実行します。
正確性、リグレッション、スコープ、およびすべての合格基準をチェックします。
PASS または FAIL を返します。
すべての失敗について、証拠と必要な最小限の修正を含めます。
採点している実装を決して変更しないでください。
新しい目は、作者が正常化したものを見抜きます。すぐにチェックされたステージは、さらに 4 つのステージがそれに依存した後に発見された欠陥よりもはるかに安価です。
4 つのルールがチームを迅速に保ちます:
1 ワーカー、1 レーン、明示的なファイル所有権
レーンが互いに依存しない場合にのみ並列作業
Fable はリーダーの席に留まり、Opus または Sonnet が労働を処理する
すべての完了主張は、ファイル、テスト、またはライブ結果に対してチェックされる
秘密 1: ルートを指示しない
ほとんどのプロンプトアドバイスは、弱いモデルが迷子になるのを防ぐために書かれました。
長い手順、厳格なステップリスト、巨大なルールブロックは、モデルが計画できなかったときに役立ちました。Fable 5.1 では、同じ足場が、モデルが自分で見つけたであろう道よりも悪い道に強制する可能性があります。
コツは、目的地に厳格であり、ルートに緩やかであることです。
4 つのことを与えます:
成果:
作業が完了したときに何が存在しなければならないか
制約:
壊せない、使えない、公開できない、変更できないもの
理由:
これは誰のためで、結果がどのような決定や仕事をサポートしなければならないか
証明:
どのような観察可能な証拠が完了とみなされるか
最後の部分がすべてを変えます。「チェックアウトを機能させる」は、もっともらしい主張を招きます。「サンドボックスでテスト購入を完了し、結果の注文行を表示する」は、モデルにごまかせないゴールラインを与えます。
隠れた思考連鎖のパフォーマンスを求めないでください。計画、重要な決定、証拠、残りの不確実性を求めてください。Fable の思考は常にオンになっています。あなたにとって重要なのは、結果が検査に耐えられるかどうかです。
そして、予算がなくなっていることをモデルに思い出させ続けないでください。代わりに、境界をシステムに組み込みます。ワーカーのターンを制限し、許可される支出を定義し、制限に達したときに何をすべきかを伝えます。
秘密 2: CLAUDE.md を軽く保つ
CLAUDE.md は、すべての Claude Code セッションの開始時に読み込まれます。そのため便利ですが、すべての無関係な行が将来のすべてのタスクに負担をかけます。
Anthropic は現在、各ファイルを 200 行未満 に保つことを推奨しています。実際には、通常はもっと短くできます。
3 つのセクションでほとんどのプロジェクトをカバーできます:
このプロジェクトが何であるか:
製品、アーキテクチャ、重要な境界
作業を検証する方法:
ビルド、テスト、lint、ローカルプレビューのコマンド
繰り返し間違えること:
プロジェクト固有の規則と繰り返し発生する間違い
時々しか重要でない手順はスキルに属します。特定のファイルにのみ適用されるルールは、パススコープルールに属します。履歴メモは、すべてのセッションのプロンプトではなく、ドキュメントに属します。
今夜、あなたの CLAUDE.md を開き、すべての行に挑戦してください。削除しても実際の間違いが発生しないなら、削除してください。
軽いファイルの方が、通常は強力です。
秘密 3: 目標とループを活用する
ここで Fable は会話ではなくなり、あなたが他のことをしている間も動き続けられるプロセスになります。
目標: /goal は、セッションに 1 つのテスト可能な完了条件を与えます。各ターンの後、別の小さなモデルが条件が満たされているかどうかをチェックします。満たされていない場合、Fable は制御をあなたに戻す代わりに別のターンを開始します。目標は、合格するか、不可能になるか、回復不能なエラーが発生するか、あなたがクリアするまで終了しません。
技術は、ごまかせないゴールラインを書くことです:
観察可能な証明を要求する: 「すべての認証テストが合格し、出力が添付されている」は「認証を修正」よりも強力です
失敗パスを定義する: 実際のブロッカーが目標を不可能にする場合、進捗をでっち上げる代わりに、ブロッカーと証拠を報告する
リスクのある部分を制限する: ワーカーには maxTurns、有料サービスには支出制限、デプロイや本番データの周りには明示的な境界を使用する
すべてのブリーフに 1 つの正直ルールを保持する: すべての進捗主張は、この実行中に生成または検査された結果を指し示さなければならない
目標は、無人にしても問題ない境界内でのみ自動モードで実行します。よりスマートなエージェントは、ブリーフが間違っている場合、より大きな爆発半径を持ちます。
ループ: /loop は、間隔でプロンプトを再実行します。固定のケイデンスで /loop 15m check the deployment and investigate any failure を使用するか、間隔を省略して Claude に次にいつチェックするかを選択させます。
Claude Code 内のループはセッションスコープであり、最終的には期限切れになります。ビルド、プルリクエスト、移行、一時的な監視に使用します。セッションまたはマシンが閉じた後も存続する必要がある作業には、永続的なルーチンまたはデスクトップのスケジュールされたタスクを使用します。
目標とループの間で、仕事が本当に必要とする限り Fable を働かせ続け、最後には別の自信に満ちた段落ではなく、証拠が待っている状態にできます。
実際のプロジェクトを一発で完了する方法
ここで、1 つのビルドを中心にシステム全体を組み立てます。
例は、機能するウェイティングリスト付きのランディングページです。プロジェクトを置き換えても、同じシーケンスが有効です。
ステップ 1、ブリーフを書く
1 つのメッセージを送信します:
[製品] を [オーディエンス] 向けにローンチします。彼らには、1 つの明確な約束をし、[メールアドレス] をキャプチャするランディングページが必要です。 Build 1 つのレスポンシブページを構築し、サインアップを保存する動作するフォームを用意します。 制約: 手間のかかるフレームワークなし、有料依存関係なし、モバイルで高速、私が承認するまでデプロイなし。 完了条件: ページがローカルで実行され、テストメールがストレージに表示され、モバイルレイアウトが 390px で検証され、結果がテスト出力とスクリーンショットとともに表示されること。 最初にプロジェクトを検査し、計画を立ててください。独立したステージのみを委任してください。完了したすべてのステージを検証してください。
ブリーフは、実装を設計することなく、目的地を与えます。
ステップ 2、計画を承認する
何かを変更する前に、/plan または Shift+Tab で計画モードに入ります。
アイデアが十分に具体化されていない場合は、/plugin install mattpocock-skills で Matt Pocock のコレクションをインストールし、/setup-matt-pocock-skills を 1 回実行し、結果を仕様に変える前に /grill-with-docs を使用します。
計画を読みます。必要のない機能は削除します。すべてのステージに観察可能な合格条件があることを確認します。その後、承認します。
ステップ 3、チームに作業させる
Fable は最初の独立したステージを実装ワーカーに割り当てます。検証者は実際の差分とテスト出力をチェックします。依存するステージは、前のステージが合格した後にのみ開始されます。
ターミナルを離れることができます。まだ実行中のものを確認したい場合は、/tasks を使用します。
ステップ 4、ゴールラインを設定する
状態と証明を指定する目標を使用します:
/goal ページがローカルで実行され、フォームがテストサインアップを保存し、レイアウトが 390px で機能すること。実際のテスト出力、保存されたレコード、および現在のスクリーンショットによって証明されること。真のブロッカーがこれを不可能にする場合、成功を主張する代わりに停止し、証拠を報告すること。
この条件は、言葉だけで満たすのははるかに困難です。
ステップ 5、結果をレビューする
差分、テスト出力、保存されたサインアップ、スクリーンショットに戻ります。
モデルのマネージャーとしてではなく、ユーザーとして製品をレビューします。実際に確認できる変更を要求し、最後の独立した検証パスを 1 回実行し、証拠がブリーフと一致したときにリリースします。
最初の実行は手の込んだものに感じられるでしょう。
2 回目には、同じシーケンスが、先延ばしにしていたほとんどすべてのプロジェクトで機能することに気付くでしょう。
実際に収益を生む 5 つのワークフロー
ここで、モデルを正当化するのに十分な価値のある作業にセットアップを向けます。
これらは、Fable 5.1 が測定可能な差を生み出すことができる 5 つのワークフローです。
誰もやりたがらないコードベースの仕事: 3 週間と見積もられた移行、まれな本番障害、8 つのサービスに分散したパフォーマンス問題。Fable がシステムをマッピングし、ワーカーが独立したスライスを担当し、検証者がすべてのステージをチェックし、進捗は楽観主義ではなくテストに結び付けられます。
意思決定グレードの調査: 1 つの質問が入り、調査ワーカーが一次情報源から並行して収集し、懐疑的なレビューアがすべての重要な主張を攻撃し、リーダーが生き残ったものをメモに変えます。これは、買収、ローンチ、市場の決定、または投資テーゼに情報を提供できます。
ビジネスオペレーション: 適切なツールへのアクセスを与え、データの調整、異常の調査、レポートの準備、プロセスの監視、または運用バックログの処理を任せます。Fable 5.1 は、Anthropic の AutomationBench で Fable 5 のスコアをほぼ 2 倍にしました。これは、リリースの中で最も明確な実用的な飛躍の 1 つです。
参照駆動型の製品作業: 希望するエクスペリエンスのスクリーンショット、実際のアセット、実行中のアプリへのアクセスを与えます。参照に基づいて実装し、結果を開き、2 つを比較し、目に見えるギャップがなくなるまで続けることができます。あなたはセンスを提供します。モデルは目、手、そして忍耐を提供します。
複合的な知識システム: 会社内で保存する価値のあるすべてのものを指定し、散在するドキュメントを維持されたリンクされた信頼できる情報源に変換させます。コピーライターは優れたセールスページから、代理店はケーススタディから、SaaS 企業はカスタマーコール、決定、実験、サポート履歴から構築できます。将来のすべてのエージェントは、有用なコンテキストがすでに存在するため、よりスマートにスタートします。
これらのそれぞれは、かつては「いつか」のプロジェクトでした。
Fable 5.1 は、それらの多くを「今週中」のプロジェクトにします。ただし、システムに本当のゴールラインと、それを越えたことを証明する方法を与えることが条件です。
1 つのブロックでの完全なセットアップ
Fable 5.1 をリーダーとして実行する: 計画、委任、レビュー、決定を行う
Opus または Sonnet を境界のある労働に使用し、独立したレーンごとに 1 つのワーカーを配置する
成果、制約、理由、証明を与え、ルートを選択させる
CLAUDE.md を短く保ち、時々の手順はスキルに移動する
検証可能な完了には目標を、スケジュールされたチェックにはループを使用する
努力レベル、より安価なワーカー、キャッシュされたコンテキスト、ハードな境界でコストを制御する
システムをコードベース、研究、運用、製品作業、複合的な知識に向ける
モデルはセットアップの中で最も目に見える部分ですが、それがすべての利点ではありません。
利点は、これほど有能なモデルに、明確な目的地、有能なチーム、現実へのアクセス、そして説得力のある回答と完了した作業を混同する方法を与えないことです。





