YouMind
登录

从 Token 最大化到 Token 管理

@fukkyy
日语2026年6月01日
293K
606
108
0
726

TL;DR

随着 AI 无限制使用时代的结束,企业必须从 Token 最大化转向 Token 管理,以确保投资回报率(ROI)。本文探讨了 AI 成本如何成为继劳动力和营销支出之后,又一个关键的管理议题。

今天我们来聊聊 "Token Maxing"(最大化 AI Token 使用量)这个阶段如何走完一个轮回,以及趋势正转向 "Token Management"(Token 管理)——它开始质疑 AI 的投资回报率。Token 管理如今已成为与人员规划或营销投资决策同等重要的管理议题。

在海外,"Token Management" 这个概念通常被更技术性地称为 "Token Optimization"。为清晰起见,我在此使用 "Token Management",但请将其视为与 "Token Optimization" 同义。

Token Maxing 及其反噬

福島良典 | LayerX - inline image

过去一年,生成式 AI 的使用一直处于可称为 "Token Maxing" 的阶段。它意味着用 Token 淹没任务,反复调用最强模型,并将上下文喂到极限。AI 供应商也将使用量扩张作为成功指标,通过固定费率订阅提供实际上的补贴。在用户端,无需担心成本地使用最强模型,曾被视作一种竞争优势。

然而,进入 2026 年,对这种模式的明显反噬已经开始显现。

Uber 是一个标志性案例。该公司内部设立了一个 Claude Code 排行榜,让工程师比拼使用量,结果他们在短短四个月内就耗尽了 2026 年全年的 AI 编程预算。Uber 首席运营官 Andrew Macdonald 在播客中提到:

"从现在起,我们必须将 Token 消耗及其相关成本与人力成本一同讨论。如果我们无法画出一条直线,证明到达客户的功能增长与我们的投入成正比,那么这种权衡就很难站得住脚。"

https://www.youtube.com/watch?v=y_mQ6xLcKyc&t=1776s

类似的担忧也来自 AI 的销售方。微软的 Satya Nadella 在 2026 年 3 月的摩根士丹利 TMT 大会上表示:

"为什么我们使用了这么多 Token?在很多情况下,我们在 Token 效率方面做得最差。接下来一年,每个人都将致力于工具使用和软件,以使 AI 更高效。"

https://www.investing.com/news/transcripts/microsoft-at-morgan-stanley-conference-ais-transformative-role-93CH-4542000

事实上,微软已经大幅缩减了其内部刚引入的 Claude Code 直接许可数量。

从现在开始,AI 将不再是一个可以"随便用多少"的工具,而是一个像人力或营销成本一样,需要被追问 ROI 的议题。 管理层的关注点将从使用了多少 Token,转向这些 Token 产出了什么,以及下一步该分配到哪里。

大规模 Token 使用是竞争的前提

虽然这听起来有点负面,但前提是 AI 的进化极其强大。在开发领域,不使用编程 Agent 是没有选择余地的。无法承担一定水平 Token 成本的公司,基本上就是在退出竞争。而且,这个"一定水平"的 Token 成本门槛相当高。我们必须面对一个残酷的现实:没有投资能力,就无法加速。

事实上,工程师消耗的 Token 成本达到其薪资的百分之几十甚至一半的情况并不少见。将"雇佣一名工程师的成本"不仅仅视为"薪资",而是视为"薪资加 AI Token 成本"的组合,正变得越来越必要。对管理层来说,这是一个全新成本类别的出现。

Token Maxing 并非毫无意义的运动;通过全力使用 AI,我相信在哪些地方该踩油门、哪些地方该更克制方面,学习进展迅速。展望未来,能够进行 Token Management——在该踩的地方踩,在该控制的地方控制——的公司将会脱颖而出。

Token Management 本身已成为一个管理议题。 Token Maxing 是公司结构性转型的重要第一步。

在我们公司,单纯为了使用 Token 而使用的阶段已经结束,我们正处于如何产出成果的阶段。在 LayerX 的 "Compass"(指导原则)中,有诸如 "让 AI 成为增长引擎" 和 "不要构建不会被使用的东西。不要陷入 AI 构建陷阱。" 这样的指导方针。

福島良典 | LayerX - inline image

来自 https://speakerdeck.com/layerx/compass_202209?slide=34

福島良典 | LayerX - inline image

来自 https://speakerdeck.com/layerx/compass_202209?slide=36

在这些指导方针下,我们在内部优化了 Token。我们在该用的地方用,在该优化的地方优化,然而在 LayerX,使用的 Token 数量与我们进行 Token Maxing 时相比并没有显著变化。我感觉 一定水平以上的大规模 Token 使用已成为竞争的前提条件。

编程 Agent 仅仅是一个"先例"

这里重要的是,这种爆炸性的 Token 消耗并不仅限于编程这个专业领域。

目前,除了编程之外,各种业务操作正以与编程 Agent 相同的方式被解决。销售线索收集和方案创建、客户支持查询、自动费用报告和审批、法律合同审查、营销广告运营、HR 招聘筛选——这些正被一个接一个地重新设计为自主执行 Agent。

自主 Agent 消耗的 Token 数量,与之前人类使用的"一问一答"模式相比,是不可同日而语的。随着 Agent 做更多工作,所有 AI 的使用都将收敛到我们目前在编程 Agent 上看到的相同模式。编程 Agent 只是恰好成为第一个达到这种模式的先例。

福島良典 | LayerX - inline image

目前看起来像是"工程师专属问题"的 AI Token 成本管理挑战,很快就会成为公司范围内的管理议题。 这是因为公司内部的每个业务领域,在未来几年内都将出现相同的 Token 消耗特征。

Token 成本是一颗定时炸弹

福島良典 | LayerX - inline image

这里我们还需要认识到另一个事实。我们目前支付的 AI 订阅费用,远低于实际成本。

目前,基础模型提供商以亏损方式提供 AI 订阅是很常见的,我们支付的固定费用与实际产生的成本之间存在巨大差距。如果用 API 按量付费模式重新计算同样的使用量,成本会跃升几个数量级。订阅模式使得用户看不到实际成本。

问题在于,基础模型公司随时可能让这种实际成本的差异显现出来。一旦补贴部分开始以从固定费率转向基于 Token 的计费、引导至更高套餐或涨价的形式转嫁给客户,那种"每个 ID 每月几万日元,一家 100 名员工的公司每年数千万日元"的感觉,可能在短时间内跃升至"全公司每年数亿或数十亿日元"的量级。 订阅模式所隐藏的实际成本差异,就是这颗定时炸弹的威力。

首先需要做的,是在爆炸显现之前,让公司内部正在发生的事情变得可见。

(这篇文章对细节很有帮助:https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))

首先,可视化

解决这个问题首先需要的东西非常基础:让"谁在使用哪个模型、使用了多少 Token"变得可见。 仅此而已。

对于人员,我们已经有了庞大的管理基础,如人事评估、目标管理、薪酬体系和组织设计。对于营销费用,在衡量 CAC 和回收期的同时进行优化是理所当然的。采购有专门的团队和工作流程。

然而,对于 AI,即使是这种最基本的可视化也尚未到位。对于 CEO 和 IT 部门来说,无法看到"谁现在在 AI 上花了多少钱"这一事实,已经是一个主要的压力源。仅仅将数字放到仪表盘上就能创造价值。

我们目前提供的 "AI Token Advisor" 正是为填补这一空白而设计的产品。它是一个简单的工具,用于可视化谁为哪个任务使用了哪个模型以及使用了多少 Token。(Bakuraku 用户可以免费使用一个 ID!)

福島良典 | LayerX - inline image

来自 https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/

然而,可视化只是入口。真正重要的是,随之而来的必然问题。

"那个任务真的应该用那个模型吗?"

随着可视化的推进,下一个总是会出现的问题是:"那个任务真的应该用那个模型吗?"

例如,用顶级的推理模型(如 Claude Opus 4.8 或 GPT-5.5;截至 2026 年 5 月的最新模型)来回答"今天天气怎么样?"这样的问题,显然是过度了。最轻量的模型就足够了,甚至可能根本不需要推理模型。同样,在公司内部,对于像日常邮件创建这样成熟的任务,继续使用昂贵模型的情况比比皆是。

趋势也因人而异。不习惯使用 AI 的人,倾向于暂时只选最强的模型。相反,深度使用 AI 的人会根据任务性质切换模型。这种差异,无论在成本还是质量上,都大到组织无法忽视。

这里重要的是,所有输入到 AI 的内容最终都会转化为"提示词"的形式。聊天问题和传递给 Agent 的上下文,在内部都是作为提示词输入到模型中的。换句话说,如果你查看提示词,你基本能看出那个人让 AI 在做什么。

从这个提示词出发,我们可以检测任务与模型之间的不匹配,并提供指导,例如"对于这个任务,一个更轻量的模型就足够了。"更进一步,与其让人每次都选择模型,不如让系统自动分配最优模型。 我们正在朝着这样一个世界前进。

福島良典 | LayerX - inline image

在 Agent 时代,这一点变得更加重要。由于 Agent 是自主执行的,没有空间让人每次都去想"现在用 Opus 是不是太奢侈了?"从一开始,除了将基于任务性质的最优模型选择交给系统之外,别无选择。

我们在 Bakuraku 提供的服务,将作为托管服务提供,包括在用户无需意识到的情况下选择最优模型的后端实现。AI Token Advisor 仅仅是入口。

总结

AI Token 成本已经超出了可以用"只管砸钱"方式处理的规模。对于某些公司来说,它们正在成为与人力成本和营销成本相当的支出。

营销成本由 CAC 严格管理,没有人会说"不管 CAC 如何,只管投放广告"。人力成本也是如此;薪资、招聘和岗位安排都受到管理。你不会随便以任何薪资雇佣任何人。

在同样的层面上,AI 成本将进入管理范畴。那时首先需要的是可视化"花了多少钱"。其次是检查"是否为任务和人员选择了合适的模型"。

这看起来可能不那么光鲜,但掌握这两点将在未来几年成为一个关键的管理议题。

对于那些希望一起实现这种未来的人,LayerX 正在积极招募 AI Builder!

福島良典 | LayerX - inline image

我们正在积极招聘!https://jobs.layerx.co.jp/

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章