OpenAI 或 Anthropic 的账单里到底有什么?它们公开了哪些你在聊天框里永远触达不到的折扣?以及为什么那个能触达这些折扣的层级,刚刚变成了你可以拥有的资产。
问大多数人 AI 花了他们多少钱,他们会报出一个月度订阅费。
问一次对话花了多少钱,现场就会陷入沉默,这很合理,因为诚实的答案其实很复杂。OpenAI 和 Anthropic 都按你看不见的单位计费,在四个独立的维度上定价,并在其文档中发布了一套折扣——如果你只是坐在文本框前,这些折扣几乎完全无法触及。
这一切都没有被隐藏。所有内容现在都在它们的定价页面和开发者文档里。它只是需要你站在比大多数人低一层的视角来看。
公开价目表与普通用户实际支付价格之间的差距,并不是什么丑闻。这是一门生意,而且直到最近,你都无从站到它的另一侧。
这篇文章讲的是账单里到底有什么,为什么真正的杠杆存在于那些地方,以及当拉动这些杠杆的层级变成你可以持有而非仅仅付费的对象时,会发生什么变化。如果你想了解更多关于 AI 与所有权的内容,请关注 @MossAI_Official。
来自官方文档的 7 个账单真相
以下所有内容均由 OpenAI 或 Anthropic 发布。除了工程团队,几乎没人知道这些常识。费率经常变动,因此请将数字视为结构示例,而非固定报价。
- 在两个平台上,输出成本都是输入的数倍
两个价目表上的每个模型都将输入和输出分开计费,且输出总是贵得多。比例通常在四到六倍之间。

实用的重构才是重点。你输入的内容几乎是免费的。模型回复的内容才是账单所在。限制回答对降低成本的作用,远大于精简提问——这与几乎每个人的做法恰恰相反。
2. 你正在为你无权查看的推理过程付费
这一点应该真正让你感到惊讶。
OpenAI 自己的帮助文档指出,推理 token 不会作为答案文本显示,但会计入输出用量并按输出 token 计费,因此一个简短的可见答案可能比其显示的文本消耗更多的 token。他们的推理指南确认原始推理 token 不会被暴露,仅提供可选的摘要。
你正在以输出费率为你在结构上不被允许看到的文本付费。
3. 你的输出上限并不能限制隐藏部分
情况变得更尖锐。运行这些模型的文档指出,最大输出 token 参数仅限制可见输出,而隐藏的推理 token 不受该限制约束。
随之而来的后果已有记录。请求可能在推理阶段耗尽预算并返回空内容,此时 token 已被消耗。OpenAI 的推理指南直接承认了这一结果,指出你可能会为输入和推理 token 产生费用,却收不到任何可见响应。
计量器在运行,屏幕一片空白,这是文档记载的行为,而非 Bug。
4. 重复上下文可享九折优惠,两家都明确告知了你
Prompt 缓存是技术栈中最大的单一杠杆,但大多数人从未听说过它。
Anthropic 的缓存文档将缓存读取定为基础输入价格的 0.1 倍,5 分钟缓存写入为 1.25 倍,1 小时写入为 2 倍。OpenAI 在当前 GPT-5 系列上应用了相同的模式,将缓存输入定价为标准输入费率的约百分之十,缓存写入则带有其自身的溢价。
算术层面才显出用处。如果读取是十分之一,写入是 1.25 倍,那么对于相同的前缀,缓存未命中的成本大约是命中成本的十二点五倍,盈亏平衡点大约在两次读取。对于任何每次调用都重新发送相同系统提示、工具架构或参考文档的场景,这就是小账单和大账单之间的全部区别。

它也很脆弱,值得了解。两家提供商都基于精确的前缀匹配进行缓存,因此提示词顶部更改一个字节就会使其下方的所有内容失效,价格会静默地恢复为全价。
5. 对于可以等待的工作,两家都会让账单减半
OpenAI 和 Anthropic 各自运行异步批量层级,输入和输出均打五折。Anthropic 的定价文档明确指出,缓存乘数可以与批量折扣叠加。
将它们叠加起来,批量处理中的缓存输入 token 最终只占标准价格的一小部分。这对任何交互式任务都不起作用,这正是为什么没有消费级产品向你展示这一功能的原因。
6. 折扣取决于你锁定的是哪个模型 ID,而不是你以为自己在用哪个模型
这里有一个几乎没人检查的点。
缓存折扣在提供商的目录中并不统一。在 OpenAI 上,当前的 GPT-5 系列获得约百分之九十的缓存输入折扣,而较旧一代模型的折扣要少得多。在 Anthropic 上,标准缓存读取乘数是基础输入的 0.1 倍,某些较新的模型甚至更低。
同一个提供商,同一个功能名称,经济效应却因配置中的一个字符串而有实质性差异。遗留模型 ID 的情况比这更糟。通过云合作伙伴仍可访问的已退役 Anthropic 模型仍保持其原始费率,对于一个能力较弱的模型来说,这可能是当前价格的数倍。
某人曾经设置过那个字符串,之后再也没有人重新审视它。令人惊讶的超额支出实际上就藏在这里。
7. 跨越上下文阈值可能会使整个请求重新定价
最微妙的一点,也是形状最棘手的一点。
OpenAI 在某些模型上发布了单独的长上下文费率,其机制并非人们所假设的那样。超过阈值后,整个请求会重新定价,而不仅仅是超出部分的 token。只要多出一个 token,整个调用的成本就会大致翻倍。
Anthropic 在此采取了不同的立场。在最近的 Claude 模型上,完整的上下文窗口按标准的每 token 费率计费,缓存和批量折扣适用于整个窗口。
这是两个平台之间真正的结构性差异,从任何消费者界面都无法看到。如果你的工作负载涉及长上下文,它可以主导其他所有定价考量。

杠杆是公开的。但你仍然无法触及。
这里是结构性要点。
上述每一个杠杆都存在于 API 层。触及它们需要控制 prompt 结构以确保缓存命中,进行模型路由以便将正确的任务分配给正确的价格层级,对可容忍延迟的工作进行批处理,控制推理努力程度,以及了解请求落在哪个上下文层级。
从消费者聊天界面看,你只有一个文本框和一个月度费用。你无法路由,无法批处理,无法构建缓存前缀,也无法看到你的推理努力设置花费了多少。
因此存在一个价差。一边是有能力的操作员通过组合这些因素所实现的成果。另一边是普通用户所支付的金额。没有人被欺骗。这些折扣是工程接口,而非消费者功能,消费级产品也不是为了暴露它们而构建的。
生活在这个价差中的企业是中继站、网关和聚合器。它们位于用户和提供商之间,路由到最便宜且足够的模型,保持缓存热度以免重复上下文以全价重新购买,批处理可批处理的内容,并向用户提供比原始 API 更简单的东西。
它们的收入就是价差。这就引出了有趣的部分。

中继站是一门吞吐量业务,而这在这里很罕见
这个市场中的大多数事物都是赌注。你持有一个观点,要么对要么错,结果随之波动。
中继站是一个收费站。流量通过,利润随单位累积,经济效益随使用量增长,而非依赖于任何人是否正确。
由此衍生出三个特性,这三个特性都很罕见。
收入是按单位且连续的。 不是块状的,不是事件驱动的,也不取决于某个调用是否走向正确方向。Token 流动,利润累积,每小时如此。
需求与加密货币无关。 编写代码、生成视频和运行助手的人不会先查看市场。消费驱动力是 AI 采用率,这是本行业中极少数不随其他一切波动的因素之一。
活动是计数,而非解读。 吞吐量可以在无需归因争论的情况下测量。不存在好月份是靠技巧还是运气的疑问。请求要么通过了,要么没有。
最后一点比听起来更重要。使任何东西变得可拥有的难点在于证明它做了什么。吞吐量业务在“发生了什么”和“可以展示什么”之间有着异常短的距离。

Model Max:拥有收费站,而不仅仅是在那里付费
Model Max 是一个 Token API 中继站,目前作为兑换 Agent 在 Moss Agent Marketplace 上线。
产品部分很简单。通过一条路径访问模型,其中路由、缓存和批处理在那些决策实际可用的层级进行处理,而不是在你被困在文本框里的层级。
另一半才是值得关注之处。作为 Marketplace 上的一个 Agent,中继站不仅是你使用的东西。它是你可以持有头寸的东西。
这种形态与该类别中的大多数不同。中继站的活动接近于可验证声明的理想输入,因为吞吐量是事实而非叙事。没有需要解读的记录,没有需要信任接受的绩效故事。使用情况发生了或者没发生,这是清晰可读的。
这也是我们发布的第二个兑换 Agent,其中被使用的对象和被拥有的对象是同一个实体。你可以既是中继站的客户,又是它的持有者,同时这两种关系并存,而后一种关系不是忠诚度等级。它是一个头寸。
我们从交易 Agent 开始,因为交易是最严酷的试炼场。数字要么是真实的,要么是一个故事,链不允许你对哪一个是谎言。兑换 Agent 将同样的标准带给那些永远不会打开永续合约的人。在这些之后推出的系统将更进一步,迈向不仅在链上运行,而且在链上发行和运营的系统。
更多细节将在推出时公布,而不是之前。
本周无论用什么,都要做的 4 件事
这些都不需要 Moss。
停止优化 Prompt 长度,开始限制输出。 你付费是为了答案,而不是问题。要求五十个字而不是五百个字,对你的账单的影响大约是将 Prompt 编辑缩短十倍的效果。
检查你的推理努力设置买到了什么。 对于不需要深思熟虑的任务,高努力度意味着花钱购买隐藏 token,而这些 token 并没有改善你实际收到的任何东西。这是人们在不知不觉中过度支付的最常见方式。
打开你的配置并阅读模型 ID。 不是你以为自己在用的模型名称,而是实际的字符串。然后对照当前的价目表进行检查。旧的 ID 悄悄承载着旧的经济效应,有时对于能力较弱的模型来说,缓存折扣也差得多。
如果你构建任何东西,在优化其他事情之前先测量缓存命中率。 响应中的使用字段会给你新鲜输入、缓存写入和缓存读取之间的拆分。在重复调用中零读取意味着你的 Prompt 顶部有某些内容正在发生变化,并使下方所有内容失效。这是一个隐藏在单个字节背后的十二倍成本差异。
贯穿这四点的习惯才是真正的收获。将 AI 支出视为具有结构的账单,而不是具有数字的订阅。一旦结构可见,谁在其中处于什么位置的问题也就显而易见了。
现在该做什么
前往 moss.site 查看 Model Max。如果你需要,将其用作中继站。看看持有其中一个头寸意味着什么,如果这引起你的兴趣的话。两者都已上线,它们是同一个对象,这是我们认为是新颖的部分。
每个经济体最终都会确定谁拥有其基础设施。AI 经济目前正处于每个人都在收费站付费,却没人想过问问谁拥有收费站的阶段。
这个问题还会开放一段时间。
来源
- OpenAI Help Center, Understanding and counting tokens, on reasoning tokens being billed as output while not visible as answer text: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- OpenAI reasoning models guide, on raw reasoning tokens not being exposed and on incurring cost without a visible response: https://developers.openai.com/api/docs/guides/reasoning
- OpenAI API pricing page, for current per model input, cached input and output rates, batch and flex tiers, and long context rates: https://openai.com/api/pricing/
- Microsoft Learn Q&A on Azure OpenAI billing, on hidden reasoning tokens being included in billing and the maximum output tokens parameter not constraining them: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Anthropic prompt caching documentation, on cache reads at 0.1 times base input, write multipliers, and stacking with the Batch API discount: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Anthropic pricing page, for current per model rates and the Batch API discount: https://claude.com/pricing





