「オズの魔法使い」の黄色いレンガ道で死なないために

@joeschmidtiv
英語2 か月前 · 2026年5月27日
1.2M
1.6K
195
85
4.7K

TL;DR

AI ラボが汎用的なツールを支配する一方で、スタートアップは、複雑で多段階の業界タスクや独自のデータフライホイールを扱うバーティカルな「業務システム」を構築することで成功を収めることができます。

アプリレイヤーは死んでいない理由

創業者や将来の従業員からよく聞かれる質問があります。それは、AI アプリケーションレイヤーに構築すべきものはまだ残っているのか、それとも OpenAI や Anthropic がすべてを破壊してしまうのか、というものです。

この質問の背景には、ある種の AI 心理症があります。永続的な下層階級を避けられる唯一の場所は、大手研究所の中か、ロボット工学、ハードテック、または類似の分野の最前線で構築することだ、と結論づける人もいます。理論的には「研究所が手を出せない」ものなら何でも良いのです。もしすべてのソフトウェアが、Codex や Claude に直接仕事を吸収されるか、あるいはあなたが構築したものを不要にする将来のモデルによって食い尽くされようとしているのなら、逃げ出したくなりますよね!

私も大概の人間と同じくらい AI マキシマリストであり、彼らの言い分は半分正しいと思っています。研究所は本当に、アプリケーションサーフェスの大部分を狙っています。しかし、「アプリケーションレイヤー」は単一の均質な機会ではありません。適切な捉え方は、自分がイエローブリックロード(黄道)にいるのか、それともオズの国の別の場所にいるのか、ということです。

イエローブリックロードとは、研究所が歩んでいる道、つまり彼らが莫大なリソースを投入している道を指す私たちの略語です。コード生成、ライティング、画像作成のような問題に研究所が最も適している理由は、これらの問題がモデルの生の能力によって改善されるからです。つまり、事前学習と事後学習に費やされた 1 ドル 1 ドルが製品の品質を向上させるのです。一方、オズの国の残りの部分には、より複雑で、しばしば垂直的な問題が存在します。それは、ビジネスユーザーに標準ツールとコンピューター使用へのアクセスを備えた水平ツールを与えるほど単純ではありません。価値は、基礎となるモデルの生の能力(それも重要ですが!)からではなく、その周りの足場、つまり特定の業界内で出力を信頼性が高く、準拠し、運用可能にするものから生まれます。

これは、OpenAI と Anthropic が、汎用的な AI 共同作業者ですべての問題を解決できるわけではないことを事実上市場に伝えていることから、リアルタイムで展開されているのを私たちは目にしています。彼らは、エンタープライズ向けにモデルを構成・カスタマイズするための企業全体を構築するために、大規模な前方展開型ジョイントベンチャーを発表しました。次のモデルリリースがそれを解決してくれると思うなら、そんなプログラムに数十億ドルを注ぎ込んだりはしません。

ですから、AI アプリで成功したいのであれば、イエローブリックロードを避け、オズの国の別の場所で構築しましょう。以下は、私たちが学んだこと、そして私たちのポートフォリオ企業の創業者たちが学んだ、何がうまくいくかについての教訓です。

イエローブリックロード

会社を始めるなら、イエローブリックロードは最も明白な道ですが、最も危険でもあります。高性能なモデルを取り出し、既製のコネクタ(G Drive、Slack、Salesforce、Notion、GitHub など)を接続し、その上に何らかのエージェントオーケストレーションレイヤーを出荷する。魔法のようです!

この問題点は、これこそが研究所が Cowork や Codex でやっていることだということです。明らかに、彼らはモデルを所有しており、それがより良いマージン、コントロール、そして下流にいる誰に対しても価格決定権を行使する能力を与えています。しかし、おそらく最も重要なのは、彼らが自社製品をうまく解決できるように定義するアーキテクチャ上の選択も所有していることです。彼らはこれまで、モデルとツールコールのパターンについて意図的に行動してきましたが、これはまさに道路上の水平方向の低ステップ数の作業に必要なものです。たとえスタートアップが何とかして Codex や Claude Code を凌駕できたとしても、研究所は巨大な流通網と AI における最大のブランド力を持っています。

もしあなたが AI アプリ企業で、同じコネクタ、その下にサブエージェントや設定もなく、流通もないというプレイブックを実行しているなら、おそらくどこにも通じない道を歩んでいることになります。

オズの国の残りの部分

スタートアップにとって、すべてが暗澹たるものというわけではありません。イエローブリックロードの外側には、スタートアップが自社の顧客を掌握し、複雑な問題を解決する明確な道筋がある、巨大な機会が存在します。

これらのビジネスは、モデルが複雑なツール、自動化、統合(つまりソフトウェア)の網の目に織り込まれたエージェント体験を構築しており、その結果、これらのスタートアップのほとんどはデフォルトで垂直的になります。彼らは、Anthropic や OpenAI が水平プラットフォームでは到達できない、複数ステップかつ複数プレイヤーによる作業に焦点を当てることができます。つまり、システム間でコンテキストを収集し、異なる段階で承認しなければならない複数の人間にルーティングする、役割や業界固有のタスクのためのサブエージェントを使用するのです。これにはしばしば 1 つ以上のレガシーシステムが関与し、曖昧さが許されない決定論的な結果を必要とする傾向があり、時には価値のあるビジネス成果に結びついています。研究所はこれらの問題がどれほど価値があるかを理解しています。だからこそ、彼らは独自の外部委託設定ショップを構築しており、強化学習ビジネスのアップマーケットクラス全体が存在するのです。

オズの国の残りの部分が魔法使いに所有されない理由

上記に対する反応としては、これまでのところ、モデルや研究所の改善に反対するのはかなり悪いトレードだった、というものがあるでしょう。彼らはおそらく改善を続け、最終的にはこれらのアプリケーションレイヤービジネスがサービスを提供する市場を侵食するでしょう。

研究所は確かに改善するでしょうが、オズの国の残りの部分が長期的に身を守る方法がいくつかあると私は主張します。

データと学習のフライホイール:

あなたが内面化することの多くは、どのトレーニングセットにも含まれていません。つまり、書かれていない業界の規範、文書化されていない標準、実務家の頭の中にある部族の知識です。そのどれもがパブリックウェブ上にはありません。どんなにトレーニング計算量を増やしても、この知識が実際に存在するワークフローの中に入り込むことには代わりません。ここには 2 つのフライホイールが積み重なっています。1 つは顧客間のもので、同じ問題のより多くのバリエーションを見るにつれて複合するパターンです。もう 1 つは顧客内のもので、特定の決定の背後にある理由、言われていない例外、システムとの実際のやり取りを通じて初めて表面化する企業独自の経験則です。

たとえ顧客データを顧客間で使用できなくても、アプリケーション企業は顧客の問題タイプ全体にわたるパターン認識を活用し、それを将来の問題に対する適切なアーキテクチャに情報提供するために使用できるでしょう。100 件の法務審査、1000 件の保険引受サイクル、または 10,000 件の SDR キャンペーンを通じてエージェントを実行してきた企業は、新規参入者が初めて新しいエージェントを立ち上げるだけでは再現できない方法で、問題の形状を内面化しています。

水平エージェントは、原理的には同じ学習インフラを構築できます。それができない理由は、純粋な焦点の問題を除けば、UX です。この種の知識を捉えることは、ユーザーに提供するワークフローサーフェスに完全に依存しており、垂直プレイヤーはそれらのサーフェスを、ワークフローが表面化する必要があるものに正確に合わせて形成できます。水平ツールにはそれができません。評価セット、ラベル付けされた出力、エッジケースの分類法は、垂直固有のデータフライホイールに複合し、同等の本番環境での露出なしには新規参入者が生成できない微調整を促進できます。これが可能かどうかは、データ権利、蓄積された本番露出の量、顧客契約の構造に依存しますが、パターン認識は関係なく蓄積されます。

モデルの変動性と複雑性の管理: 研究所はすでに内部でルーティングを行っています。つまり、異なるリクエストに対して異なるモデルクラスを使用し、内部でアンサンブルを使用しています。彼らができないことは、ベンダー間でのルーティング、特定のサブタスクに対する競合他社のモデルの評価、あるいはそれが実際に最適である狭い部分にオープンソースのファインチューンを使用することです。オズの国の残りの部分の企業は、親ラボが出荷するものだけでなく、モデル市場全体から各サブタスクに適したモデルを選択します。また、新しいモデルが登場するたびに、誰もやりたがらない仕事、つまりアップグレードの評価の再実行、顧客のエッジケースに合わせたプロンプトの再調整、本番環境を壊さずにロールアウトすることを行います。研究所は顧客に代わってこれを行っているわけではありません。彼らは次のモデルを販売し、移行するように指示するだけです。オズの国の残りの部分の企業は移行を吸収します。顧客が得るものは、市場全体で利用可能な最高のインテリジェンスと、すべてのアップグレードを通じた継続性です。

コスト最適化: すべてのクエリを Opus 4.7 で実行することは、マイナスの粗利益への最短ルートです。最高のオズの国の残りの部分の企業は、モデルの階層間でルーティングを行います。最も難しいタスクにはフロンティアモデル、大部分にはミッドティア、そしてそれらを使用する権利を得た場所では、より小さなカスタムモデルまたはファインチューンモデルを使用します。現在、その上で独自のモデルを事後学習し、顧客が気にする狭い作業範囲に最適化し、フロンティア API コールの数分の一のコストで提供している企業もあります。研究所は下限価格を設定します。つまり、$X で利用可能な最低限のインテリジェンスです。オズの国の残りの部分の企業はその逆を販売します。つまり、ワークフローが実際に必要とする特定のレベルのインテリジェンスに対する最低のドルコストです。これは、各サブタスクに必要なレベルを正確に把握している場合にのみ可能であり、研究所は構造的にすべての垂直分野を把握することはできません。これは直接的に、成果に対するより低く、管理された価格につながります。

ガバナンス: 顧客がその垂直分野で AI を実行する方法のコントロールプレーン、つまり権限、監査、エージェントが何を許可されているか、エージェントが実際に何をしたかがすべて収束する場所になることには、かなりの価値があります。そのコントロールプレーンは、業界や職種によってまったく異なる、ユースケース固有のガードレールから構築されています。エージェントが触れるツール、ワークフロー、データをエンドツーエンドで所有しているため、水平ツールが苦労する方法で決定論的な結果を提供できます。また、エンドバイヤーにとっての規制の複雑さを吸収する主体でもあります。法律における FRCP と弁護士規則、医療における HIPAA、金融における SEC と FINRA、州の保険規制などです。水平プレイヤーは、同時に 100 の異なる垂直分野にならない限り、それを信頼できる形で行うことはできません。CIO は、提供するエージェントのコンプライアンスを処理することを契約上明記しているパートナーを求めています。

これらすべては、同じこと、つまり焦点に帰着します。それは、垂直分野(保険、法律、会計)である場合もあれば、深く行われる機能(営業、カスタマーサポート、財務)である場合もあります。いずれにせよ、その作業には、1 つの顧客セット、つまりそのワークフロー、エッジケース、規制に専念するチームが必要です。研究所はそのために作られていません。彼らはどこにでも、誰にでも対応しなければならず、それがそもそも彼らがイエローブリックロードを構築した方法です。同じトレードオフが彼らをオズの国の残りの部分から遠ざけています。つまり、どこにでも同時に存在することもできますし、1 つのことに優れることもできます。両方はできません。

営業を例に – 11x のテクニカル CEO からの実践的なヒント

これを実際にどのように考えるべきでしょうか?以下は、11x の CEO である Prabhav Jain からの実践的なヒントです。

成果に焦点を当てる

研究所に対して回復力のある会社を構築するための戦術的な道は、顧客が本当に気にかけている特定の成果から始めることです。私たちにとって、それは企業がより多くのパイプラインを生成するのを支援することでした。そこから、質問は戦術的になります。実際にパイプラインを推進するために、どの活動をエンドツーエンドで所有したいですか?各活動をタスクに分解します。どのタスクがエージェンティックで、どれがそうでないか。どれが複雑なドメインインサイトを必要とし、どれがそうでないか。研究所もワークフローを出荷するでしょうが、ワークフローに多くのステップ、乱雑な入力、解釈が難しい状態、または現実世界の制約がある場合、より良いモデルだけではそこに到達できません。その作業は昔ながらのソフトウェアエンジニアリングに委ねられ、研究所はその表面において、焦点を絞ったアプリケーション企業に対して何の優位性も持ちません。例えば、私たちが処理するタスクの一部を以下に示します。エージェンティックなものもあれば、そうでないものもあります。カスタムシグナルに基づくリードプロスペクティング、リードエンリッチメント、深いアカウントリサーチ、CRM からのコンテキストフェッチャー、チャネル固有のメッセージライター、リードクオリフィケーションエージェント、メール到達性システム。これらは、ワンショットで実行できるタスクではなく、深いエンジニアリングを必要とします。

オズの国のアナロジーにおける重要な洞察は、実際のワークフローの約半分はエージェンティックではなく、研究所の優位性はないということです。彼らは、モデルレイヤーの下にある決定論的なソフトウェアを書くことにおいて、あなたより優れているわけではありません。そして、エージェンティックな半分でさえ、実際に望む結果に対してモデルを調整、トレーニング、制約する必要があります。ドメイン知識は、一般的なトレーニングデータには含まれていないことがよくあります。これらのスキルは、垂直分野または機能のためにゼロから構築され、ワークフロー内の適切なタイミングでモデルに供給されます。私たちのエージェントが電話でインバウンドリードを評価するとき、私はその特定の業界とペルソナにとって良い営業会話とは何かについてトレーニングを受けなければなりません。これはアプリケーション企業の仕事であり、それは複合していきます。

さらに重要なことに、これらのスキルは、ビジネスが進化するにつれて常に時代遅れになるため、これらのワークフローとコンテキストを進化させる能力が競争上の優位性になります。例として、私たちがスケールドメールアウトリーチ製品を開始したとき、「AI」によって書かれたメールが登場し始めたばかりでした。今日では、人々は AI が書いたメールと人間が書いたメールに対して調整された感覚を持っており、重要なことに、これは数ヶ月ごとに変化します。私たちのエージェントは、市場のダイナミクスを考慮して常に適応する必要がありますが、ここに堀が築かれています。実際、このダイナミクスにもかかわらず、私たちのポジティブな返信率は過去数ヶ月で 4 倍に向上し、顧客のために数億ドル相当のパイプラインを生み出しました。

複雑性が高い問題に取り組む

複雑な問題こそ、真のビジネス価値が引き出される場所です。そうでなければ、薄いラッパーを構築していることに気づくでしょう。

十分に複雑なビジネス問題を分解すると、すぐに混乱が現れます。GTM の世界からの例で、些細に聞こえるものを挙げます。ある企業がすでに顧客である場合、その企業の連絡先にアプローチすべきではありません。しかし、それは決して簡単ではありません。CRM にその企業に関連付けられたドメインがあるかもしれません。数十の子会社を持つ企業はどうでしょうか?CRM レコードに親会社のドメインがある場合はどうでしょうか?Salesforce の古いマッチングフィールドが、現在の顧客の CRO にコールドピッチを送信してしまう場合はどうでしょうか?現実世界のデータは乱雑です。人間でさえ苦労します。モデルが魔法のようにそのハードルをクリアするわけではありません。その混乱から秩序を導き出すには、問題の特定の形状に合わせて設計された目的特化型エージェントが必要であり、CRM を指す汎用コパイロットではありません。実際、私たちが持っているデータに基づいて、私たちのデータの品質と鮮度は顧客のものよりもはるかに高いことに気づきました。そのため、デフォルトでは、私たちは自社のデータに基づいて行動します。

ガードレールは、悪いことが起こるのを防ぐためだけにあるわけではありません。それは、顧客があなたに支払っているものです。

ガードレールはひどく過小評価されています。同じ製品内であっても、すべてのユースケースに独自のガードレールが必要です。私たちにとって、規制された金融サービス企業の見込み客は、ミッドマーケットの SaaS 顧客とは異なる保証を要求し、それらの保証は、エージェントがどのように書くことを許可されるか、誰に連絡できるか、どのデータに触れることができるか、電話で何を言えるか、そしてすべての決定がどのように記録されるかにまで及びます。

万能のシステムは、そのようなばらつきの前で崩壊します。ガードレールは、ユースケースごとに構築され、顧客ごとに設定され、継続的に監査される必要があり、その作業はアプリケーション企業にしっかりと委ねられています。これが、私たちが FDE とテクニカルデプロイメントストラテジストを擁し、各顧客の要件に合わせて調整する必要がある理由です。例として、私たちは F1000 の機関と協力し、大規模な SMB 顧客ベースに対して音声による同意済みアウトバウンドを実施しました。最初の数回のイテレーションでは応答率が低く、この特定のタイプのオーディエンスに電話の最初の 10 秒間でエンゲージしてもらう方法を迅速に反復して学習する必要がありました。SMB のビジネスオーナーは、大規模な B2B バイヤーや消費者とは非常に異なる行動をとります。現在では、そのセグメントの営業チーム全体が 1 ヶ月で生み出すよりも多くの営業機会を、私たちは 1 日で彼らのために生み出しています。

保険を例に – FurtherAI の CEO からの実践的なヒント

営業は一例です。保険も別の例であり、異なる角度から同じ点を示しています。以下は、FurtherAI の CEO である Aman Gour が、道路から離れて構築することについてどのように考えているかです。

実際の保険業務の中に AI を導入し始めたとき、私たちは特定の前提を繰り返し耳にしました。それは、モデルがインテリジェンスであり、ワークフローはその周りの単なる足場にすぎない、というものです。

協力する保険会社が増えるにつれて、これは逆であると確信するようになりました。

保険において、インテリジェンスの多くはワークフロー自体の中に存在します。2 つの保険会社は、一見同じ経路で申込を処理します。申込、審査、見積もり、契約です。しかし、経路は簡単な部分です。2 つの保険会社を区別するのは、その内部のすべてです。どのリスクがエスカレーションされるか、どの損失シグナルが重要か、2 つのアペタイトルールが競合した場合にどちらが優先されるか、いつ人間が承認しなければならないか、どの外部データが取り込まれるか、最終決定がどのように文書化されるかです。

そのロジックは、1 つのきれいなルールエンジンに存在するわけではありません。それは、SOP、マネージャーレビュー、引受哲学、保険会社固有のアペタイト、そして長年の運用経験に分散しています。その多くは、モデルが単純に読み取れる形式で文書化されていません。

これが、私たちが毎回ゼロから推論する純粋なエージェントを信じず、現実が乱雑になった瞬間に壊れてしまう rigid なワークフローも信じない理由です。その代わりに、私たちはエージェンティックワークフローを構築してきました。ワークフローは、再現性、監査可能性、コスト管理を提供します。エージェントは変動性を処理し、ハッピーパスが壊れたときに回復します。説明責任が重要な判断には、人間がループに留まります。

初日、これは手動作業を自動化します。しかし、時間の経過とともに、すべてのエスカレーションがシグナルになり、すべての例外がフィードバックになり、すべての人間による修正は、プレイブックが不完全であった場所を示します。時間の経過とともに、ワークフローはスクリプトではなくなり、保険会社の運用メモリーになり始めます。これは、研究所が到達するのが難しいと感じる部分です。彼らはより良いモデルとより良い汎用エージェントを出荷し続けるでしょうし、そうすべきです。しかし、彼らは保険会社の本番ワークフローの中に、あるアカウントがなぜエスカレーションされたのか、あるリスクがなぜ拒否されたのか、あるいは引受担当者がなぜアペタイトガイドを無視して、それが正しかったのかを学ぶのに十分な長さ、留まることはありません。

その理解は、本番環境で、何千回もワークフローを実行することからのみ得られます。初日に出荷するワークフローは堀ではありません。本番環境での使用が時間の経過とともに生み出すループこそが堀なのです。

私たちにとって、それが道路から離れて構築するということの意味です。

自分がオズの国の残りの部分にいるかどうかを判断する方法

ツールとステップのテスト: その作業には何ステップかかり、それをサポートするために構築しなければならないツールはどれほど複雑ですか?Google ドライブ全体の水平 AI 検索(1 つのツールに対する 1 ステップで、結果が寛容であり、ユーザーが要約を読んで間違っていれば再度質問する)と、3 年間の企業の先例に対する多段階の法務審査(多くのツールにわたる数十のステップ、パートナーレビューを通過しなければならず、法廷で議論される可能性のある出力)を比較してください。どちらも「エージェントが仕事をしている」ように見えますが、そのうちの 1 つだけが、集中したチームが構築するのに何年もかかるような深いソフトウェアを必要とします。

システムテスト: 顧客がその作業を実行するためのシステムを構築していますか、それとも顧客がすでに持っているシステムの上に位置するツールを構築していますか?システムは、ワークフローをエンドツーエンドで所有します。つまり、データキャプチャ、ガバナンス、実行されたことの記録であり、顧客が実際の作業がどのように行われるかを説明するときに指すものです。一方、ツールは、顧客がすでに実行しているワークフローにインテリジェンスを追加するだけです。ツールのケースは実際の収益を生み出しますが、顧客がオーケストレーションレイヤーとしてあなたに依存していないため、研究所はそれを奪うことができます。高い ACV は通常、システムのシグナルです。なぜなら、システムは実際の人員を置き換え、それに応じて支払われるからです。しかし、それは保証ではありません。研究所があなたと直接競合するはずのものを出荷した場合、顧客はそれでもあなたのツールを必要とするかどうかを自問してください。もし「はい」なら、あなたはシステムを構築しています。「いいえ」なら、たとえ ACV が高くても、あなたはツールです。

ヘッジファンド / P&L テスト: 研究所のパフォーマンスがベンチマークに対して判断されるのに対し、オズの国の残りの部分のパフォーマンスは顧客の P&L に対して判断されます。あなたの顧客は、あなたのモデルが SWE-Bench や MMLU で良いスコアを取ったことを気にしません。彼らが気にするのは、あなたのエージェントが取引を成立させたか、契約書を正しく審査したか、適切な保険を契約したかです。彼らが汎用的な能力スコアではなく、ワークフロー固有の成果に固執しているなら、あなたはオズの国の残りの部分にいます。彼らが汎用的な能力に対して支払っているなら、あなたは彼らに Claude や Codex のシートで得られるものを販売していることになります。最高のエージェントビジネスは、ヘッジファンドのように実行する必要があります。つまり、ベンチマークスコアではなく、顧客の P&L で測定されるアルファで勝つことです。

両方が(そして、そうなるだろう)勝つことができる

私たちは、イエローブリックロードの上でも外でも、大規模な勝者を見ることになるでしょう。モデルは、モデルを所有し、彼らが設計した水平ツールの流通を所有しているため、勝ち続けるでしょう。

オズの国の残りの部分は、ワークのシステム、つまり企業の作業が実際に実行され、そこから流れるデータがキャプチャされるサーフェスを所有していれば、勝つことができます。これらの企業は、データキャプチャ、ワークフローアクションのシステム、ガバナンスを所有しています。より複雑なワークフローが垂直分野で成熟するにつれて、それらは顧客が依存するようになる 1 つのコア体験に複合していきます。既存企業や新規参入者から新しいモデル世代が出荷されるにつれて、企業はそれらを統合し、顧客に提供するレイヤーになります。モデルはその下で代替可能ですが、ワークのシステムは代替不可能です。

次世代のエンタープライズソフトウェアは、道路から離れて構築されるでしょう。

もしあなたがそれを構築しているなら、ご連絡ください:jschmidt@a16z.com。

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る