为什么应用层并未消亡
我经常从创始人和潜在员工那里听到一个问题:还有 AI 应用层可以构建吗?还是 OpenAI 和 Anthropic 会吞噬一切?
这个问题背后有一种特殊的 AI 焦虑症。有些人得出结论,认为唯一能避免沦为永久底层的位置,要么是在大型实验室内部,要么是在前沿领域从事机器人、硬科技或类似方向——理论上,这些是"实验室无法触及"的领域。如果每一款软件都即将被吞噬,无论是被 Codex 或 Claude 直接吸收工作,还是被未来某个模型让你所构建的一切变得多余,那就赶紧跑吧!
听着,我和几乎任何人一样都是 AI 最大化主义者,我认为他们只说对了一半。实验室确实正在蚕食应用层的很大一部分。但"应用层"并非一个同质化的机会。正确的思考框架是,你是在黄砖路上,还是在奥兹国的其他地方。
黄砖路是我们对实验室正在走的道路的简称,他们正在这条路上投入非凡的资源。实验室最适合解决代码生成、写作或图像创作这类问题的原因在于,这些问题会随着原始模型能力的提升而改善:每一分钱花在预训练和后训练上,都能提高产品质量。与此同时,奥兹国的其他地方则存在着更复杂、通常是垂直领域的问题,这些问题不像给业务用户一个带有标准工具和计算机使用功能的水平工具那么简单。其价值更多来自于围绕模型构建的脚手架(尽管底层模型的原始能力仍然很重要!),这些脚手架使得输出在特定行业内值得信赖、合规且可操作。
我们正在实时看到这一点,因为 OpenAI 和 Anthropic 实际上是在告诉市场,他们无法用一个通用的 AI 同事解决所有问题。他们已经宣布了大规模的前沿部署合资企业,围绕为企业配置和定制他们的模型来构建整个公司。如果你认为下一个模型发布就能解决这个问题,你是不会向这些项目投入数十亿美元的。
所以,如果你想通过构建 AI 应用来致富——那就避开黄砖路,在奥兹国的其他地方构建。以下是我们学到的东西,以及我们投资组合中的一些创始人学到的关于什么有效的东西。
黄砖路
如果你正在创办一家公司,黄砖路是最明显的路径,但也是最危险的。拿一个高性能模型,接入一些现成的连接器(比如 G Drive、Slack、Salesforce、Notion、GitHub),然后在上面加一个某种 Agent 编排层。神奇!
问题在于,这正是实验室在用 Cowork 和 Codex 做的事情。显然,他们拥有模型,这给了他们更好的利润率、控制权,以及对其下游任何人施加定价权的能力。但也许最重要的是,他们还拥有定义其产品擅长解决什么问题的架构选择。到目前为止,他们一直刻意采用模型加工具调用的模式,而这正是道路上水平低步骤工作所需要的。即使一家初创公司能以某种方式超越 Codex 或 Claude Code,实验室也拥有巨大的分销渠道和 AI 领域最大的品牌光环。
如果你是一家 AI 应用公司,用同样的连接器、没有子 Agent 或底层配置、也没有分销渠道来执行这套打法,那么你很可能正走在一条通往死胡同的路上。
奥兹国的其他地方
对初创公司来说,并非全是悲观和沮丧。在黄砖路之外存在着巨大的机遇,初创公司有一条清晰的路径来拥有自己的客户并解决复杂问题。
这些企业正在构建 Agent 体验,其中模型被编织进一个由工具、自动化和集成(即:软件)组成的复杂网络中,这使得大多数此类初创公司默认是垂直的。他们可以专注于多步骤和多角色工作,使用针对特定角色和垂直任务的子 Agent,这是 Anthropic 和 OpenAI 用水平平台无法触及的:跨系统收集上下文,然后路由给需要在不同阶段审批的多个人员。这通常涉及一个或多个遗留系统,倾向于需要确定性结果(即歧义不可接受的情况),并且有时与某个有价值的业务成果挂钩。实验室明白这些问题有多有价值:这就是为什么他们正在构建自己的外包配置部门,以及为什么存在一整个高端强化学习业务类别。
为什么奥兹国的其他地方不会被巫师占据
对上述观点的回应是,迄今为止,押注模型/实验室的改进一直是一笔相当糟糕的交易。他们很可能会继续变得更好,并最终蚕食这些应用层企业所服务的市场。
实验室当然会改进,但我认为奥兹国的其他地方可以通过几种方式来长期保护自己:
数据和学习的飞轮:
你内化的很多东西都不在任何训练集中——不成文的行业规范、未文档化的标准、存在于从业者头脑中的隐性知识。这些都不在公共网络上。再多的训练算力也无法替代置身于这些知识实际存在的工作流程中。这里有两个叠加的飞轮:一个是跨客户的——当你看到同一问题的更多变体时,模式会不断累积;另一个是客户内部的——特定决策背后的原因、未言明的例外、公司自己的经验法则,这些只有通过与系统的真实互动才会浮现。
即使客户数据不能跨客户使用,应用公司也能利用跨客户问题类型的模式识别,并用它来为未来的问题构建正确的架构。一家已经让其 Agent 处理过一百次法律红线审查、一千次保险承保周期或一万次 SDR 活动的公司,已经将问题的形态内化,这是后来者通过首次启动一个全新的 Agent 所无法复制的。
原则上,一个水平 Agent 也可以构建同样的学习基础设施。除了纯粹的专注之外,它之所以不这样做,原因在于用户体验:捕捉这类知识完全取决于你提供给用户的工作流程界面,而垂直玩家可以围绕其工作流程需要呈现的内容来塑造这些界面。水平工具做不到。评估集、标注输出和边缘案例分类法可以累积成一个垂直特定的数据飞轮,这可以为微调提供燃料,而后来者如果没有类似的生产环境暴露是无法生成的。这是否可能取决于数据权利、积累的生产环境暴露量以及客户合同的结构,但模式识别无论如何都会累积。
管理模型的变异性和复杂性: 实验室已经在内部进行路由——针对不同请求使用不同的模型类别,底层使用集成模型。但他们做不到的是跨供应商路由,或者为特定子任务评估竞争对手的模型,或者在某个狭窄的领域使用实际上最好的开源微调模型。奥兹国其他地方的公司会为每个子任务从整个模型市场中选择合适的模型,而不仅仅是其母公司实验室发布的模型。他们还会做没人愿意做的工作——每次新模型发布时,重新运行评估、为客户边缘案例重新校准提示、在不破坏生产环境的情况下进行部署。实验室不会代表客户做这些事;他们卖给你他们的下一个模型,然后告诉你去迁移。奥兹国其他地方的公司则吸收迁移的工作。客户得到的是整个市场上可用的最佳智能,以及每次升级的连续性。
成本优化: 每次查询都通过 Opus 4.7 运行是通向负毛利率的最快路径。最好的奥兹国其他地方的公司会在不同模型层级之间进行路由——最困难的任务用前沿模型,大部分任务用中端模型,在他们已经证明有能力使用的地方用较小的定制或微调模型。有些公司现在还在其基础上对自己的模型进行后训练,针对客户关心的那部分工作进行优化,并以前沿 API 调用成本的一小部分来提供服务。实验室为智能设定了价格下限:以 X 美元提供最低限度的智能。奥兹国其他地方的公司则销售相反的东西——为工作流程实际需要的特定智能水平提供最低的美元成本。这只有在你确切知道每个子任务需要什么水平时才有可能,而实验室在结构上无法了解每个垂直领域的情况。这直接转化为更低、可控的结果成本。
治理: 成为客户在该垂直领域运行 AI 的控制平面具有相当大的价值——权限、审计、Agent 被允许做什么、Agent 实际做了什么,所有这些都汇聚于此。这个控制平面是由特定用例的护栏构建的,这些护栏在不同行业和工作类型中看起来完全不同。由于他们端到端地拥有 Agent 接触的工具、工作流程和数据,他们能够以水平工具难以做到的方式提供确定性结果。他们也是为最终买家吸收监管复杂性的实体——法律领域的 FRCP 和律师执业规则、医疗保健领域的 HIPAA、金融领域的 SEC 和 FINRA、州保险法规等等。一个水平玩家如果不一下子变成一百个不同的垂直领域,就无法可信地做到这一点。CIO 们希望有一个合作伙伴,能在合同上声明他们正在为其提供的 Agent 处理合规问题。
所有这些都归结为同一件事:专注。这可以是一个垂直领域(保险、法律、会计),也可以是一个深度执行的功能(销售、客户支持、财务)。无论哪种方式,这项工作都需要一个团队埋头于一个客户群体——他们的工作流程、他们的边缘案例、他们的法规。实验室不是为此而建的。他们必须无处不在,为所有人服务,这正是他们最初建造黄砖路的原因。同样的权衡也使他们无法进入奥兹国的其他地方——你可以同时无处不在,或者你可以擅长一件事。不能两者兼得。
以销售为例——来自 11x 技术 CEO 的实用建议
你应该如何在实际中思考这个问题?以下是来自 Prabhav Jain(11x 的 CEO)的一些实用建议。
专注于结果
构建一家对实验室具有韧性的公司的战术路径是,从你的客户真正关心的特定结果开始。对我们来说,那就是帮助公司产生更多的销售管道。从那里开始,问题就变得战术化了。我们想要端到端地拥有哪些真正驱动管线的活动?将每个活动分解为任务。哪些任务是 Agent 化的,哪些不是。哪些需要复杂的领域洞察,哪些不需要。实验室也会发布工作流程,但当工作流程有很多步骤、混乱的输入、难以解释的状态或现实世界的约束时,仅仅一个更好的模型是无法解决问题的。这项工作落到了老式但可靠的软件工程上,而实验室在这方面对专注的应用公司没有任何优势。例如,以下是我们处理的一些任务,有些是 Agent 化的,有些不是:基于自定义信号的潜在客户挖掘、潜在客户信息丰富、深度账户研究、来自 CRM 的上下文获取器、特定渠道的消息撰写器、潜在客户资格认定 Agent 和邮件送达率系统。这些不是你可以一次性完成的任务,需要深入的工程。
奥兹国类比中的关键洞察是,任何真实工作流程中大约一半的非 Agent 化部分,实验室并不具备优势。在编写模型层之下的确定性软件方面,他们并不比你强。而另一半 Agent 化的部分,仍然需要你针对你实际想要的结果来调整、训练和约束模型。领域知识通常不在通用训练数据中。这些技能需要为垂直领域或功能从头开始构建,并在工作流程中的正确时刻输入到模型中。当我们的 Agent 在电话中资格认定一个入站潜在客户时,我必须接受训练,了解对于那个特定行业和那个角色来说,什么才是一场好的销售对话。这是应用公司的工作,并且它会不断累积。
更重要的是,这些技能会不断过时,因为企业在发展,所以你发展这些工作流程和上下文的能力就变成了一个竞争优势。举个例子,当我们开始做规模化邮件外展产品时,"AI" 撰写的邮件才刚刚开始出现。快进到今天,人们对 AI 撰写的邮件和人类撰写的邮件有了敏锐的感知,关键是,这种感觉每几个月就会变化一次。我们的 Agent 必须根据市场动态不断适应,而这正是护城河所在。事实上,尽管存在这种动态变化,我们的正面回复率在过去几个月里提高了 4 倍,并且我们为客户创造了数亿美元的销售管道。
致力于解决复杂度高的问题
复杂的问题是真正商业价值被解锁的地方。否则,你会发现自己在构建一个薄薄的包装层。
分解任何足够复杂的业务问题,混乱很快就会显现出来。这里有一个来自 GTM 世界的例子,听起来微不足道:你不应该联系一个已经是客户的公司的联系人。但这远非如此。也许你的 CRM 中有与该公司关联的域名。那拥有几十个子公司的公司呢?如果 CRM 记录有母公司的域名呢?如果 Salesforce 中一个过时的匹配字段向现有客户的 CRO 发送了一封冷邮件呢?现实世界的数据是混乱的。人类都难以处理。模型并不能神奇地跨越这个障碍。从这种混乱中建立秩序需要为问题的特定形态量身定制的、有目的的 Agent,而不是一个指向 CRM 的通用副驾驶。事实上,根据我们拥有的数据,我们意识到我们的数据质量和新鲜度远高于我们的客户,所以默认情况下,我们以我们自己的数据为准。
护栏不仅仅是为了防止坏事发生。这正是你的客户付钱给你的原因。
护栏被严重低估了。即使在同一个产品内部,每个用例也需要自己的护栏。对我们来说,一个受监管的金融服务潜在客户要求与一个中端市场 SaaS 客户不同的保证,而这些保证会向下影响到 Agent 被允许如何写作、它可以联系谁、它可以接触什么数据、它可以在电话中说什么以及每个决定如何被记录。
一个一刀切的系统在这种差异下会崩溃。护栏必须为每个用例构建,为每个客户配置,并持续审计,而这项工作 squarely 属于应用公司。这就是为什么我们有 FDE 和技术部署策略师,需要为每个客户的需求进行调整。例如,我们与一家 F1000 机构合作,通过语音向其庞大的 SMB 客户群进行经同意的外呼。最初的几次迭代接通率很低——我们必须快速迭代并学习如何让这种特定类型的受众在通话的前 10 秒内参与进来。SMB 企业主的行为与大型 B2B 买家或消费者截然不同。我们现在一天内为他们创造的销售机会,比他们整个销售团队在那个细分市场一个月内创造的还要多。
以保险为例——来自 FurtherAI CEO 的实用建议
销售是一个例子。保险是另一个例子,它从不同的角度说明了同样的问题。以下是 Aman Gour(FurtherAI 的 CEO)对在路外构建的看法:
当我们开始在真实的保险运营中部署 AI 时,我们不断听到一个特定的假设:模型就是智能,而工作流程只是围绕它的脚手架。
我们合作的承运商越多,我们就越确信这是本末倒置。
在保险业,很多智能实际上存在于工作流程本身之中。两家承运商可以通过看似相同的路径处理一份投保申请:提交、审核、报价、承保。但路径是容易的部分。将两家承运商区分开来的是路径内部的一切:哪些风险需要升级,哪些损失信号重要,当两条承保偏好规则冲突时哪条胜出,何时需要人工签字批准,拉取哪些外部数据,以及最终决定如何被记录。
这些逻辑并不存在于一个干净的规则引擎中。它分散在 SOP、经理审核、核保理念、承运商特定的承保偏好以及多年的运营经验中。其中很多并没有以模型可以简单阅读的形式记录下来。
这就是为什么我们不相信一个每次从头推理的纯粹 Agent,也不相信一个当现实变得混乱就会崩溃的僵化工作流程。相反,我们一直在构建 Agent 化的工作流程。工作流程为你提供了可重复性、可审计性和成本控制。Agent 则处理变异性,并在理想路径中断时进行恢复。人类则留在循环中,负责那些问责制至关重要的判断决策。
在第一天,这自动化了手动工作。但随着时间的推移,每一次升级都成为一个信号,每一个例外都是一次反馈,每一次人工纠正都显示出运行手册的不完整之处。随着时间的推移,工作流程不再是一个脚本,而是开始成为承运商的运营记忆。这是实验室会发现难以触及的部分。他们会继续发布更好的模型和更好的通用 Agent,他们也应该这样做。但他们不会在承运商的生产工作流程中停留足够长的时间,来了解为什么一个账户被升级,为什么一个风险被拒绝,或者为什么一个核保员覆盖了承保偏好指南并且这样做是正确的。
这种理解只有通过在生产环境中运行工作流程成千上万次才能获得。你第一天发布的工作流程不是护城河。随着时间的推移,生产使用所创造的循环才是。
对我们来说,这就是在路外构建的意义所在。
你如何判断自己是否在奥兹国的其他地方?
工具与步骤测试: 工作需要多少步骤,以及你需要构建的工具来支持它的复杂度如何?比较一下跨 Google Drive 的水平 AI 搜索——一个步骤对应一个工具,结果容忍度高,用户阅读摘要,如果错了可以重新提问——与针对三年公司先例的多步骤法律红线审查:涉及许多工具的几十个步骤,输出必须通过合伙人审核,并且可能需要在法庭上辩论。两者看起来都像是"Agent 在工作",但只有其中一个需要专注团队花费数年才能构建的那种深度软件。
系统测试: 你是在构建一个客户用来运行其工作的系统,还是一个位于他们已有系统之上的工具?系统端到端地拥有工作流程——数据捕获、治理、已完成工作的记录——并且是客户在描述实际工作如何完成时所指向的东西。另一方面,工具只是为客户已经运行的工作流程增加智能。工具案例能产生真实的收入,但实验室可以拿走它,因为客户并不依赖你作为编排层。高 ACV 通常是系统的信号,因为系统取代了真实的人力并因此获得相应报酬,但这并非保证。问问自己,如果实验室发布了一个 supposedly 与你直接竞争的东西,客户是否仍然需要你的工具?如果是,你就是在构建一个系统。如果否,你就是个工具——即使你的 ACV 很高。
对冲基金 / P&L 测试: 实验室的表现是根据基准来评判的,而奥兹国其他地方的表现是根据客户的 P&L 来评判的。你的客户不在乎你的模型在 SWE-Bench 或 MMLU 上得分高——他们在乎你的 Agent 是否完成了交易,是否正确审查了合同,或者是否承保了正确的保单。如果他们专注于其工作流程特定的结果,而不是一个通用的能力分数,那么你就在奥兹国的其他地方。如果他们为通用能力付费,那么你就是在向他们出售他们可以通过 Claude 或 Codex 席位获得的东西。最好的 Agent 企业需要像对冲基金一样执行——以客户 P&L 衡量的阿尔法获胜,而不是以基准分数获胜。
两者都可以(并且将会)获胜
我们将在黄砖路上和路外都看到巨大的赢家。模型将继续获胜,因为他们拥有模型,并且他们拥有他们设计的水平工具的分销渠道。
奥兹国的其他地方可以获胜,如果他们拥有工作系统——公司实际工作执行的界面以及从中产生的数据被捕获的地方。这些公司拥有数据捕获、工作流行动系统和治理。随着更复杂的工作流程在一个垂直领域成熟,它们会累积成一个客户依赖的核心体验。随着现有玩家和新进入者发布新的模型世代,这家公司就成为集成它们并将其交付给客户的层面。底层的模型是可替换的;但工作系统不是。
下一代企业软件将在路外构建。
如果你正在构建它,请联系:jschmidt@a16z.com。





