過去 3 年間で、私は AI を使って 2,000 時間以上コーディングしてきました。また、Agentic Engineering の分野で最も生産性の高い人々を個人的に何人もインタビューしてきました。
以下が、2026 年第 3 四半期時点での、私の完全な Agentic Engineering 環境です。
インターフェース
これは、エージェントと対話するための UI / CLI を意味します。私のメインインターフェースは bb です。
これはオープンソースで完全に無料であり、単一の GUI 内で任意のサブスクリプション、任意のエージェント、任意のモデルを使用できます。Codex、Claude Code、Pi、Cursor CLI、OpenCode、Grok Build、Hermes を、すべて同じ UI で使用できます。
Codex や Cursor のようなアプリの問題は、自社のモデルとサブスクリプションしか許可しないことです。目標は、最小限のコストで最大限のトークンを得ることです。
Codex や Cursor アプリの好きな機能はすべて bb に含まれており、毎週改善されています(さらに、完全にオープンソースで 100% 無料で使用できます)。
もう一つよく使うのは cmux です。
新しい cmux ワークスペースを起動すると、tmux と同じように画面を分割でき(これが名前の由来です)、各ペインで異なるターミナルを起動でき、内蔵ブラウザもあります。
cmux の限界は、多数のエージェントとワークスペースがある場合です。左側のサイドバーは、本当に適切なプリミティブではありません。いくつかのことを同時に行うには問題ありませんが、大規模な本格的な Agentic Engineering 作業には最適とは言えません。
ターミナルとしては Ghostty を使っています。非常に高速でネイティブだからです。
Ghostty 内で Herdr を実行できます。これは基本的にエージェント用の tmux であり、エージェントのバックエンドランタイムです。非常にミニマルで軽量で、ターミナル内で動作し、エージェントが終了すると、その状態が左側に表示されます(完了、アイドル、ブロック中、実行中)。
AI エージェントの状態を追跡することは不可欠です。私の予測では、3 ~ 6 ヶ月以内に、この「エージェント状態追跡」の重要性がますます高まるでしょう。なぜなら、あなたは単一のエージェントと話すのではなく、多くのワーカーエージェントを管理するマネージャーエージェントと話すことになるからです。
最後に言及すべきインターフェースは、私自身が開発した Corral です。
エージェントが終了するたびにランダムに切り替える代わりに(Herdr には実際の順序がありません)、各エージェントには優先順位があります。タスクに異なる優先度/重要度レベルがあるのと同じです。P1 エージェントが終了した場合、P4 エージェントが実行を終了したときに応答するべきではありません。(ええ… Corral をオープンソースにする必要があります。まだできていません。)
モデルとサブスクリプション
可能な限り少ないコストで最大限のトークンを得たいものです。これは、すべての Agentic Engineer の主要な目標の一つであるべきです(仕事をやり遂げることの次に)。
現在、主要なサブスクリプションは 4 つあります。そして、はい… これは 2 ヶ月後には完全に変わっている可能性があります。
現在、最も「コストパフォーマンス」に優れた取引は OpenCode Go です。たったの $10 で、Kimi K3、Grok 4.6、GLM 5.3、DeepSeek V4 Pro、その他多くのモデルが利用できます… ただし、Fable 5 や GPT-5.6 Sol のような最高のモデルは含まれておらず、使用制限もかなり小さいです。
そのため、もう少し予算がある場合は、次のようにするべきです:
- $30 -- OpenCode Go + ChatGPT Plus ($20) を取得
- $50 -- さらに Claude Code の $20 サブスクリプションを追加
- $70 -- Cursor の月額 $20 を追加すると、すべてのサブスクリプションの最低ティアになります。
- $110 -- OpenCode + 大きなプランのいずれか。ChatGPT の $100 プランは Claude よりもお得です。現状はそうなっています。OpenAI はより多くの計算リソースを持っており、より多くの補助金を出す用意があります。
- $210 -- 両方の $100 プランを取得するだけ。
- そして、本当に本気なら(私のように)、すべての $200 プラン(Codex、Claude、Cursor)を取得してください。これらは 20 倍の使用量であり、最高の取引を提供します。
ちなみに… Cursor プランは非常に過小評価されています。Cursor、別名 Grok は、SpaceX の買収により、素晴らしいサブスクリプションになりつつあります。SpaceXAI は大量の計算リソースを持っているため、補助金ゲームをプレイできます。そして、Cursor/Grok プランは Cursor と Grok Bot に別々の制限を与えると思いますが、これは本当に素晴らしいことです。
Grok Bot は急速に人々がエージェントと対話する新しい方法になりつつあり、Cursor のサブスクリプションを持つことがこれまで以上に重要になっています(スポンサーではありません笑、ただ事実です)。さらに、新しいモデル Grok 4.7 も間もなく登場します。
何があっても、API 料金は支払わないでください。それは最悪の取引です。サブスクリプションを取得してください。
クラウドエージェント
クラウドエージェントが未来であることは明らかです。Cursor、Amp、Devin、Codex… これらの企業はすべて、クラウドエージェントに全力を注いでいます。
クラウドエージェントが未来であることの証拠は、以下のグラフです。
[画像]
これは Cursor における、クラウドエージェントからのマージされた PR の内部シェアです。今年の初めは約 10 ~ 15% でしたが、現在は 60% に近づいています。そして、これは実際に使用されるマージされた PR です。すぐに 70%、80%、そして 90% になるでしょう。
すべてのエージェントをローカル、つまり自分のマシンで実行することの問題は、スケーラブルではないことです。一度に何百ものエージェントを実行することはできません。数台のエージェントが同時にテストスイート全体を実行しようと決心するだけで、コンピューターは奇妙な音を発し始めます(私の $7,000 の MacBook Pro でも苦労します)。
クラウドエージェントは、分離された環境、永続的なセッション、インターネットと電力への安定したアクセスを提供します。ラップトップを閉じると、セッションは失われます。数分間インターネットが切断されると、ハーネスは自己復旧できません。
既存のクラウドエージェントソリューションの問題は、非常に高いエコシステムロックインです。環境とすべてのシークレットの設定には多くの時間がかかり、その後ロックインされます。セッションはそこにあり、彼らの価格設定に縛られ、すべてのデータを提供することになります。たとえモデルのトレーニングに使用しなくても、データを利用する方法は他にもたくさんあります。
解決策は、独自のサーバーを持つことです。そして、AI のおかげで、これには約 10 分しかかかりません(本当です)。VPS を取得し、その上で Herdr を実行し、SSH で接続するだけです。
Herdr は永続的なエージェントセッションを提供し、SSH を使用すると、スマートフォン、ラップトップ、あらゆるデバイスから接続できます。文字通り、クラウドエージェントの 80/20 を、ロックインなしで数ドルで実現できます。
独自のクラウド環境を構築する
VPS には Hostinger を使用しており、KVM2 プランで十分です。ここで伝えたい主なことは… VPS、DevOps、Linux の専門家である必要はないということです。そんなものは一切必要ありません。
エージェントに普通の英語で話しかけるだけです!
今後の動画では、この全体をライブでセットアップします。cmux ワークスペース、左ペインのコーディングエージェント(Grok 4.6 を実行する Cursor CLI)、右側の空のターミナルペイン。
私の cmux スキルにより、エージェントはその他のペインを見つけて、そこでコマンドを実行できます。私自身が新しい VPS に SSH で接続し、エージェントに「そのサーバーについてすべてを学習し、開発環境をセットアップしてください。Herdr、Node.js、Python 3、Git」と指示しました。
エージェントは数秒で VPS を分析し、すべてをインストールし、Herdr を起動し、Pi Agent をインストールし、私の MacBook で OpenRouter キーを見つけ、セットアップ全体を自分で実行しました。いくつかの短いプロンプトの後、Pi が GPT-5.6 Sol を実行し、別のセッションが Fable を実行している状態になりました。両方ともクラウド上、自分の VPS 上で、完全なルートアクセス権を持っています。
私のコンピューターや Wi-Fi に何かが起こっても… MacBook が爆発しても、それらのエージェントは実行を続けます。完全なチュートリアルは動画にあります。私の YouTube へのリンクはこちら。
もう一つ、スピードに関することです… 私は SuperWhisper でディクテーションしています。これを読んでいるほとんどの人は、おそらく毎分 40 ~ 50 語のタイピング速度でしょう。それは非常に遅いです。
しかし! あなたは毎分 250 語以上で話すことができます。音声 AI ツール(Superwhisper、Glaido、Whispr Flow など)を使用すると、プロンプトの送信が即座に 3 ~ 4 倍速くなります。使用してください。愚かなことをしないでください。
ハーネス
最初に言及すべきハーネスは Pi Agent、GOAT です。
最もミニマルなハーネス:わずか 4 つのツール、常に YOLO モードで実行、任意のモデル、任意のプロバイダーをサポート。非常にエレガントで、非常に設定可能であり、それが多くの人々が Pi の上に構築する理由です。オープンソースで完全に無料です。pi.dev にアクセスして入手してください。これは譲れません。VPS に最初にインストールするハーネスです。
Cursor CLI。 非常に過小評価されています。なぜなら、すべてのモデル(Grok、GPT モデル、Anthropic モデル、Kimi)を使用できるからです。スキルにタグを付けたり、メッセージを事前送信したりできます。全体的に優れたハーネスです。
次のカテゴリのハーネスは、私が「自己改善型」ハーネスと呼んでいるものです。
最も人気のある 2 つは、Hermes Agent と Prime Agent です。これは、自分が何をしているのかわからない場合に使用します。タスクに多くの不確実性や解明すべき点が多い場合は、自己改善型ハーネスを使用してください。スキルを作成し、時間の経過とともにあなたとともに改善されるからです。
そして最後に、定番の Claude Code と Codex です。これらはエイリアスとして設定しています。多くの人が毎日 claude --dangerously-skip-permissions と入力しています。非常に遅く、非常に非効率的です。私は cc と入力して、権限をバイパスした Claude Code を起動します。cx と入力して、YOLO モードで Codex を起動します。
頻繁に実行する長いコマンドには、必ずグローバルエイリアスを作成してください。これは Agentic Engineering の法則の一つです:同じ時間で、どうすればより多くのことを成し遂げられるか?
スキル
私のスキルリポジトリは先月話題になりました。(github.com/davidondrej/skills を参照)これも完全に無料で、オープンソースです。
Agentic Engineering に最も関連するスキルは以下の通りです:
(1) /total-review
- これは他の 2 つのスキル、/gpt-review と /fable-review を実行します。これらのスキルは、GPT-5.6 Sol と Fable 5 で行ったコード変更をレビューし、両方のリストから重複を排除して、実際に重要な問題のみの単一のリストを作成します。これは、最も賢い友人全員にあなたの仕事の応募書類をレビューしてもらい、最も大きな問題だけを教えてもらうようなものです。中規模から大規模な変更、特に異なるモデルで構築された場合に実行してください。Grok 4.6 が作業を行った場合、まったく異なるモデルにレビューを依頼したいところです。
重要:頻繁に繰り返すことは、プリセットにすべきです。
単一のステップの場合は、テキスト置換を使用してください。私は Raycast スニペットとして持っています。「簡潔に平易な英語で答えて。」「前の回答をよりシンプルかつ短くして。」「すべてのファイルをステージングし、明確なコミットメッセージを書き、GitHub にプッシュして。」
複数ステップのワークフローの場合は、スキルに変換してください。
(2) /ask-then-build
- このスキルは、何かを構築する前に、毎日使用しています。「これを Windows 互換にして」とモデルに伝え、後で後悔するような重要なアーキテクチャ上の決定をモデルに黙ってさせさせる代わりに、主要な決定事項を一つずつ、選択肢と共に提示します。AI モデルはコーディングや実装が得意です。しかし、センスはありません。良い判断力もありません。人間であるあなたが、その主導権を握り続ける必要があります。
(3) /deepapi
- このスキルは、詳細な調査、スクレイピング、ウェブ関連のあらゆることに使用します。Codex と Claude Code には基本的なウェブ検索機能はありますが、スクレイピング機能や詳細な調査機能はなく、簡単にブロックされてしまいます。8 回の高速ウェブ検索を実行し、上位 3 つの選択肢を提示し、Twitter をスクレイピングし、GitHub をスクレイピングし、人物に連絡する 3 つの方法を見つけます。私のチームの全員が使用しています。必須です。
(4) ガードレールとプッシュロック
- より地味ですが、絶対に不可欠であり、一度設定するだけです。グローバルエージェントガードレールは、ツール呼び出し前のフックであり、エージェントがディスクを消去したり、Git 履歴を上書きしたり、パスワードマネージャーに触れたりするのを防ぎます。そしてプッシュロックは、15 以上のエージェントを並行して実行している場合に使用します。システム全体に対する OS レベルのカーネルロックです。マージ、検証、プッシュ、CI、デプロイ、ヘルスチェック。
私のスキルをすべてインストールしないでください。必要なものだけを取得してください。
ワークツリー
ワークツリーは基本的に、プライマリチェックアウトのコピーを別のフォルダに作成し、そこに新しい Git ブランチを作成するものです。これにより、エージェントは完全に分離された状態で並行して作業できます。
小規模なプロジェクトでは、これは完全に過剰です。単一のブランチに留まり、より速く作業してください。
常時 20 ~ 30 以上のエージェントを実行している中規模から大規模なプロジェクトでは、これを避ける方法はありません。ワークツリーがないと、エージェントは競合し、互いの変更を元に戻し、互いに戦うことになります。BB のもう一つの良い点は、ワークツリーが組み込まれていることです。大きなリポジトリでは、常に origin/main に基づいた新しいワークツリーが必要であることを覚えています。
その他の Agentic Engineering のヒント
各モデルをいつ使用するかを知る。
- 計画を立案したり、新しいプロジェクトを開始したりする場合? Fable。最も天才的なひらめきがあります。深く深刻なバグを修正する場合? GPT-5.6 Sol、最大推論努力。デフォルトのチャット? Grok 4.6(高)。ほぼ同じ知能ですが、2 倍安く、2 倍高速です。フロントエンド? Kimi K3。
- そして、主要な新しいモデルがリリースされたら、そのモデルだけを使用する日を設けてください。Twitter の意見に耳を傾けないでください。自分で試してみてください。
いつレビューするかを知る。
- すべての変更に対して total review を実行しているわけではありません。小さなフロントエンドの調整は、すぐに本番環境に送られます。
- そして、再帰的なレビューは決して行わないでください。モデルに「5 つの最大の問題点を見つけて」と指示すると、コードベースが完全に問題なくても、5 つの問題点を見つけ出します。これらのモデルは架空のバグを作り出します。
事前送信。
- 通常、エージェントが次に何をするかはわかっているので、事前にメッセージをキューに入れます。「計画を実行して」「これに対して Fable レビューを実行して」「今度はそれらの問題を修正して」。
- 時には 2 メッセージ、時には 6 メッセージです。
- 事前送信ができないハーネスは決して使用しないでください。
サブエージェントは使いすぎです。
- 多くの人が単に制限を消費しています。私は自分が制御している場合にのみ使用します。サブエージェントでどのモデルを実行するかを選択したいからです。自分のサブスクリプションと制限を知っているからです。
- 未来は、マネージャーエージェントがワーカーを起動することですが、それでもそのシステムを設計する必要があります:ルール、権限、サブエージェントが起動される条件。Anthropic や OpenAI の誰かにそれを決めてもらいたくはありません。
ADR。
- これは、決定事項をコードベースに組み込む方法です。/docs/adr は、どのプロジェクトでも最初に作成するフォルダの一つです。
- すべての主要なアーキテクチャ上の決定事項は、短いファイルに記録されます:何が決定されたか、なぜか、そしてその時点でのプロジェクトの状態はどうだったか。コードから読み取れることもありますが、すべてではありません。
- 読み取れないものは文書化されるべきであり、将来のエージェントや人間が、なぜこのように構築されたのかを即座に理解できるようにします。
テスト。
- 現在のモデルは、リポジトリをテストで肥大化させます。単体テスト、統合テスト、データベーステスト、意味のない最小のリポジトリでも同様です。
- モデルにテストを追加するように指示すると、途方もない量を追加します。「テストを追加しないで」と指示しても、いくつかは追加され、適切な量になります。
本番 DB アクセス。
- 実際に使用されている製品は、これを行う必要があります… 読み取り専用の Postgres ロールを作成し、エージェントにそれを与えてください。
- 書き込みアクセス権は与えないでください。たった一度の元に戻せない変更で後悔することになります。
- しかし、アクセス権がないのも間違いです。読み取り専用アクセスがあれば、すべての機能を現実と照らし合わせて確認できます。これは本番環境で実際に発生しているのか? 人々はこれを使っているのか? もっと早くやっておけばよかったと思います。
エージェントの生産性を追跡する。
- Vectal Labs の下で、agentic-productivity という新しいオープンソースリポジトリを公開したばかりです。これは、コミット、エージェントセッション、ユーザープロンプトを追跡します。
- それぞれ単独では悪い指標ですが、3 つを組み合わせて長期的な傾向を見ることで、自分がより優れた Agentic Engineer になっているかどうかを確認できます。
以上が現時点での環境です。1 ヶ月後には、おそらく変わっているでしょう。これは常に変化しています。
by David Ondrej(YouTube 向けに話した内容を、記事形式に書き直したものです)





