我一直想写这篇东西,但直到看到每月 Claude Max 订阅续费邮件时,才被粗暴地逼着动笔。在我有限的互联网生涯(大约 15 年)里,直到 Claude/ChatGPT 出现之前,我从没为任何软件付过超过每月 10 美元的费用。

我也真心不喜欢那种“论文式”的文章,但这次不得不写,因为我觉得没人意识到这个问题即将变得有多严重;至少我们政府的高层肯定没意识到,他们大概有更重要的事要操心(不是食用油那种事)。
本周总理在向全国发表的讲话中,强调了我国不断扩大的经常账户赤字(CAD),并因此建议同胞们“不要出国旅行”、“减少办公室出行”、“不要买黄金”等等。你可能会问,这些跟推理有什么关系?
自从我开始关注 IT 服务领域,尤其是 AI 将如何彻底颠覆这些公司的利润结构以来,就很难不去想 Daniel Gross 在 2024 年那篇关于 AGI 交易的文章。他在文中将印度当时 2500 亿美元的 IT 出口额等同于 GPT-4 的 token(而那时的 GPT-4 甚至还不具备推理能力)。如今 GPT 5.5 的 token 已经变得更有价值了……

石油美元作为事实上的货币组合已经存在了一段时间。历史上,石油和黄金的进口一直在扩大我们的经常账户赤字,并且当价格飙升时,会削弱卢比。石油让宏观经济学家、财政部长和央行行长们感到紧张,这并非没有原因。(持续的战争暴露了我们经济中的结构性弱点,让情况变得更糟。)
但 AI 经济正在创造一种新的进口依赖,它越来越像新的石油美元——token 美元。
如果印度的服务业经济开始依赖外国模型 token 来交付软件、分析、咨询、业务流程管理、客户支持、合规、财务运营和编码工作,那么我们正在为印度最重要的出口引擎创造一种新的美元计价投入。
印度需要一个世界级的本土推理服务商,不是因为听起来爱国,也不是因为主权很酷,而是因为卢比承受不起一个未来,在这个未来里,每一单位的 AI 驱动工作都要以美元计价来租赁。
印度的宏观缓冲一直是服务业(至少目前是)
印度的外部账户有一个简单的结构性问题。我们进口大量对我国经济至关重要的商品:石油、黄金、电子产品、机械、半导体、国防设备、工业投入品。这些进口创造了持续的美元需求。
一直以来拯救我们的是服务业,特别是 ITeS(IT 服务)。
印度在 FY26 结束时,服务出口额为 4183 亿美元,服务进口额则产生了 2139 亿美元的净服务贸易顺差。这个顺差是卢比没有更早崩溃的唯一原因。它支付了我们的石油、黄金、电子产品和机械。财政部自己四月份的评估报告也承认,服务顺差抵消了 64.2% 的商品贸易逆差。整个外部账户都依赖于服务出口,而服务出口又依赖于印度开发者、分析师、支持人员和工程师以一定利润率向外国客户出售时间。
印度多年来赖以生存的这种宏观交易,正在我们说话间被彻底颠覆……
印度懒惰的 AI 未来:将服务出口转化为 token 进口
今天,一家印度 IT 公司从全球客户那里赚取美元,并以卢比支付其大部分成本基础。
明天,同一家公司可能仍然从全球客户那里赚取美元,但每次 AI Agent 进行推理、编码、起草、检查、搜索、总结、分类或响应时,都要向外国模型公司支付推理费用。在日益 token 化的世界里,上一个时代的套利将不再成立。
风险不在于印度公司会使用外国 AI 工具。它们已经在用了,而且从最近与 OpenAI 和 Anthropic 签署的谅解备忘录来看,支出还会增加。风险在于,服务交付中的稀缺投入将从印度劳动力转变为外国推理能力。
一旦发生这种情况,印度 IT 业就会变成别人智能的转售商。
Token 的行为就像进口的中间产品
Token 很容易被忽视,因为它感觉很抽象,不像在 Jamnagar 卸货的一桶桶原油。
但在外部账户中,抽象并不重要,因为一笔经常性的美元支付仍然意味着卢比的外流。
现在把这个映射到印度的服务业。如果外国推理支出占 10%,那么每年 420 亿美元的 token 账单在贸易账上看起来不会像石油。但它会像一个重大的外部账户漏洞。
卢比的反馈循环
当你加上货币贬值时,情况会变得更糟。
外国推理以美元定价。印度公司通常以卢比赚取、支出或报告。如果卢比贬值,每个以美元计价的 token 在本地货币中就会变得更贵。
这就形成了一个恶性循环:
更多的 AI 采用增加了对外国推理的需求。外国推理需求增加了美元外流。美元外流给外部账户带来了压力。更弱的卢比使外国推理变得更贵。更高的推理成本压缩了印度的利润率。
这就是为什么本土推理不仅仅是一个主权面子工程,它几乎对印度的每家科技公司和初创企业都起到了外汇对冲的作用。

GPU 数据中心是未来的炼油厂
从战略上讲,GPU 是 AI 经济中最接近生产性能源资产的东西,因为它们将电力、芯片、模型和软件转化为认知/智能,以 token 的形式呈现。而现在,原始的 token 也越来越能自己生产和完成工作。
一个缺乏算力的国家将不得不从拥有算力的国家和公司那里租赁智能。至少在石油方面,你还需要上天的眷顾才能在自己的边界内找到石油,但生产 token 你只需要 Jensen 的祝福和一份采购订单(希望 Lisa Su 也能给力……)。
我们正迅速走向一个非常现实的未来:印度将被迫进口其所有的 token,因为它未能建立一个不依赖美元计价的可靠本土推理市场。
仅靠采购解决不了问题
政府已经朝着正确的方向迈出了步伐。在 IndiaAI 使命下,已经为公共计算设施接入了超过 38000 块 GPU,并向初创企业、学术界和公共机构开放使用。该使命下的 GPU 也被描述为每小时 65 卢比。
但是,一个没有强大推理层的 GPU 云只会变成另一个政府门户网站。对试点项目和新闻标题有用,对生产用例来说很弱,对开发者不可见,对企业无关紧要。
一个公共的印度推理平台应该是什么样子?它应该具备:
- 卢比定价。
- 以最高 token 效率提供服务的 SoTA 开源权重模型(vLLM、SGLang、TensorRT 等)。
- 实时更新的公开延迟和吞吐量基准。
- 私有部署选项。
- 快速的模型更新周期。
- 印度语言性能。
- 按解决的工作流成本计算,而不仅仅是按 token 成本计算。
基准应该很简单:一个印度开发者能否在不重写应用程序、不牺牲可靠性、不等待三到六个月让模型目录跟上的情况下,从外国 API 切换到国内端点?
如果答案是否定的,那么我们就还没有一个推理平台或战略。
我们可能已经错过了这次前沿 SoTA LLM 预训练的游戏
印度应该诚实地面对自己的处境。
训练一个能与 OpenAI、Google、Anthropic、Meta 和中国最强实验室竞争的前沿模型,需要算力、人才、数据、基础设施、评估深度、分发渠道以及数十亿美元的风险资本。
但眼前的宏观战役是推理,因为大多数企业工作流并不需要地球上最聪明的模型。它们需要的是能可靠完成任务的最便宜模型。
而且推理确实是一个赚钱机器,只要 GPU 不在你的资产负债表上。考虑到最先进的推理是软硬件协同设计,越接近底层硬件越有帮助,并能为你构建结构性的护城河。

一个后台理赔工作流并不总是需要最新的 Opus/5.5。一个合规 Agent 并不总是需要最大限度的前沿推理。一个客户支持摘要器并不总是需要最贵的可用模型。
一个强大的开源权重模型,经过路由、缓存、微调以适应特定工作流,经过真实世界评估,并以更低的成本在本地提供服务,可以赢得印度企业工作负载的很大份额。
这就是印度仍然拥有的窗口期。中国大约在两年前通过大语言模型意识到了这一点,在 15 年前通过云计算基础设施意识到了这一点。

中国的科技巨头已经意识到,他们不能保持沉默,将模型训练的控制权拱手让给西方——最近采购 H200 以及他们对华为自研 NPU 的重视,也表明了他们多么认真地对待这种迫在眉睫的进口税。而我们高层领导人却忙于高谈阔论,说我们应该停止预训练,学会热爱用例,却拿不出任何真正的推理能力来证明……
美国已经深刻理解了推理层,并正在成为推理研究实验室……
Together(其首席科学家 Tri Dao 是 Flash Attention 的发明者)、Fireworks(以 Cursor 为锚定客户进行 RL 后训练)、Baseten、DeepInfra、Modal,以及现在的 vLLM(Inferact)和 SGLang(Radixark),它们都筹集了数亿美元的资金,正在围绕开源权重模型构建高性能推理层——实际上成为了推理新实验室。
它们快速更新模型目录。它们在延迟、成本和开发者体验上竞争。NVIDIA 自己也强调了像 Baseten、DeepInfra、Fireworks 和 Together 这样的公司,通过 Blackwell 系统上的优化推理来降低 token 成本。

没有一家印度公司能达到这种规模,即使全世界传统上都认可我们在 IT 服务交付方面的能力。
因此,我们仍然缺乏一个默认的本土推理平台,让严肃的开发者、银行、SaaS 公司、IT 供应商或政府部门可以将其作为首选。
虽然我们有像 Simplismart、Neysa 和 Yotta 这样的公司,但快速浏览一下它们的平台,就能看出我们在所有不同参数上落后了多少。


印度现有企业的问题
印度的大型 GPU 和云服务商不能继续把推理当成一个目录页面来对待。如果世界正在从 Llama 转向 Qwen,再到 DeepSeek,再到 Kimi,再到下个月发布的任何东西(小米现在也有一个前沿开源权重模型了!),那么印度的推理提供商不能以 PSU 采购的速度来更新模型目录。
本土推理应该被要求达到与外国推理相同的标准。
- 在印度特定的工作负载上,要更好。
- 在卢比经济方面,要更便宜。
- 在监管方面,要更私密。
- 在模型性能方面,要更及时。
这是一个政策问题,也是一个创业机会
好消息是,这是可以构建的,我们不需要大海捞针。
我们已经知道 Anthropic、Google 和 OpenAI 都将印度视为其 AI 支出的第二大市场——需求显然是存在的。ElevenLabs 有望在印度仅通过销售语音推理就实现 1 亿美元的年收入。
虽然 IndiaAI 使命起步方向正确,但在某个环节上未能落地——因为我们以为采购 GPU 就足够了。
补贴算力应该奖励实际的生产使用,而不是为了收集标志。

问题在于,最终谁能抓住利润(除了 Jensen)。如果外国模型公司抓住了 token 利润,外国云服务商抓住了基础设施利润,而印度公司只保留了集成利润,那么 AI 就会吞噬我们唯一的优势(劳动力套利),使我们的外部依赖变得更糟。
如果印度构建了本土推理,情况就会改变,因为所有进口的 GPU 都变成了国内基础设施——一些美元 token 支出变成了卢比支出,一些利润留在了印度基础设施公司手中。
一些 AI 能力将可供印度初创企业和企业使用,而无需承受持续的外汇风险。一些服务出口将变得更具防御性。
结语
印度下一张类似石油进口的账单,可能不仅仅来自停靠在 Jamnagar 的油轮。
它肯定会来自印度服务公司和初创企业发出的数百万次 API 调用,这些公司自称是 AI 原生,却以美元租赁智能。
几十年来,印度进口能源,出口软件。
但这是可以避免的。印度需要停止将 GPU 采购与推理能力混为一谈,停止将爱国的主权品牌与非生产级基础设施混为一谈,并停止假装 AI 账单是别人的问题。账单已经来了。上个月我的账单是 138 美元,而且已经严重补贴过了。你的账单在不久的将来也不会便宜。
本土推理现在是宏观经济基础设施。我们需要以战时速度提升能力,就像卢比依赖它一样。





