我很久以前就想寫這篇文章了,但直到看到每月 Claude Max 訂閱續約帳單時,才被逼著動筆。在我有限的網路生涯(約 15 年)裡,直到 Claude/ChatGPT 出現之前,我從未為任何軟體支付過每月超過 10 美元的費用。

我也真心不喜歡「論述型」文章,但我不得不寫這篇,因為我認為沒有人意識到這個問題即將變得多麼嚴重;肯定不是我們政府高層目前關注的重點,他們大概有更棘手的問題要處理(不是指食用油那種)。
本週總理在對全國的演說中,強調了我們日益擴大的經常帳赤字,並因此建議國人「避免出國旅行」、「減少辦公室通勤」和「不要買黃金」等。你可能會問,這跟推論有什麼關係?
自從我開始研究 IT 服務,特別是 AI 將如何徹底顛覆這些公司的利潤結構以來,就很難不去思考 Daniel Gross 在 2024 年發表的 AGI 交易文章。他在文中將印度當時 2500 億美元的 IT 出口額,等同於 GPT-4 的 token(而當時的 GPT-4 甚至還不會推理)。如今,GPT 5.5 的 token 已經變得更有價值了...

石油美元長期以來一直是事實上的貨幣組合。石油和黃金的進口,歷史上持續擴大我們的經常帳赤字。當價格飆升時,它會削弱盧比。石油讓總體經濟學家、財政部長和央行行長感到緊張,這是有原因的。(持續的戰爭暴露了我們經濟的結構性弱點,使情況變得更糟)
但 AI 經濟正在創造一種新的進口依賴,它看起來越來越像新的石油美元——Token 美元。
如果印度的服務業經濟開始依賴外國模型 token 來交付軟體、分析、顧問、BPM、客戶支援、合規、財務運營和編碼工作,那麼我們正在為印度最重要的出口引擎創造一個新的美元計價投入。
印度需要世界級的國內推論服務商,不是因為聽起來很愛國,也不是因為主權聽起來很酷,而是因為盧比無法承擔一個未來,在那裡每一單位的 AI 驅動工作都必須用美元租用。
印度的宏觀緩衝一直是服務業(目前為止)
印度的外部帳戶有一個簡單的結構性問題。我們進口大量對經濟至關重要的商品。石油、黃金、電子產品、機械、半導體、國防設備、工業原料。這些進口創造了持續的美元需求。
拯救我們的一直是服務業;特別是 ITeS。
印度在 FY26 年結束時,服務出口額為 4183 億美元,而服務進口則產生了 2139 億美元的服務貿易順差。這個順差是盧比沒有更早崩盤的唯一原因。它支付了我們的石油、黃金、電子產品和機械。財政部自己四月份的報告也承認,服務順差抵消了 64.2% 的商品貿易逆差。整個外部帳戶平衡依賴於服務出口,而服務出口的平衡則依賴於印度開發者、分析師、支援人員和工程師向外國客戶出售時間以獲取利潤。
印度多年來賴以生存的這個宏觀交易,正在我們說話的當下被徹底顛覆...
印度懶惰的 AI 未來,將服務出口轉變為 Token 進口
今天,一家印度 IT 公司從全球客戶那裡賺取美元,並以盧比支付其大部分成本基礎。
明天,同樣的公司可能從全球客戶那裡賺取美元,但每次 AI Agent 進行推理、編碼、起草、檢查、搜尋、總結、分類或回應時,都必須向外國模型公司支付推論費用。在一個日益 Token 化的世界裡,上一個時代的套利將不再成立。
風險不在於印度公司會使用外國 AI 工具。他們已經在用了,而且從最近與 OpenAI 和 Anthropic 簽署的諒解備忘錄來看,支出還會增加。風險在於,服務交付中的稀缺投入,正從印度勞動力轉向外國推論。
一旦這種情況發生,印度 IT 就變成了他人智慧的轉售商。
Token 的行為就像進口的中間產品
一個 Token 很容易被忽視,因為它感覺很抽象,不像在 Jamnagar 卸貨的原油桶。
但在外部帳戶中,抽象並不重要,因為一筆經常性的美元支付仍然代表著盧比的流出。
現在,把這個情況映射到印度的服務業。一筆 420 億美元的年度 Token 帳單,如果只占外國推論支出的 10%,在貿易帳上不會看起來像石油。但它會像一個重大的外部帳戶漏洞。
盧比的回饋循環
當你加入貨幣貶值因素時,情況會變得更糟。
外國推論以美元計價。印度公司通常以盧比賺取、支出或報告。如果盧比貶值,每個以美元計價的 token 在當地貨幣計算下都會變得更貴。
這就形成了一個惡性循環:
更多的 AI 採用增加了外國推論需求。外國推論需求增加了美元流出。美元流出給外部帳戶帶來了壓力。更弱的盧比使外國推論變得更昂貴。更高的推論成本壓縮了印度的利潤空間。
這就是為什麼國內推論不僅僅是一個主權面子工程,它幾乎就像印度每家科技公司和新創企業的外匯避險工具。

GPU 資料中心是未來的煉油廠
從戰略上講,GPU 是 AI 經濟中最接近生產性能源資產的東西,因為它們將電力、晶片、模型和軟體轉化為 token 形式的認知/智慧。而如今,原始的 token 也越來越多地能夠產生並完成工作。
一個缺乏算力的國家,將不得不向擁有算力的國家和公司租用智慧。至少在石油的情況下,你必須有上天的眷顧才能在境內找到石油,但對於生產 token,你只需要 Jensen 的祝福和一張採購訂單(希望 Lisa Su 也能順利供貨...)
我們正迅速走向一個非常真實的未來:印度將被迫進口其所有的 token,因為它未能建立一個不以美元計價的、可靠的國內推論市場。
僅靠採購無法解決這個問題
政府已經朝著正確的方向邁進。在 IndiaAI 使命下,已經為一個通用算力設施接入了超過 38,000 個 GPU,並向新創企業、學術界和公共機構開放使用。該使命下的 GPU 也被描述為每小時 65 盧比。
但是,一個沒有強大推論層的 GPU 雲端,只會變成另一個政府入口網站。對試點項目和新聞頭條有用,但對生產級用例來說很薄弱,對開發者來說是隱形的,對企業來說是無關緊要的。
一個公共的印度推論平台應該是什麼樣子?它應該具備:
- 盧比定價。
- 以最高 token 效率提供服務的 SoTA 開放權重模型(vLLM、SGLang、TensorRT 等)。
- 即時更新的公開延遲和吞吐量基準測試。
- 私有部署選項。
- 快速的模型更新週期。
- 印度語系表現。
- 按已解決工作流程計算成本,而不僅僅是按 token 計算成本。
基準應該很簡單:一個印度開發者能否在不重寫應用程式、不犧牲可靠性、不等待三到六個月讓模型目錄趕上的情況下,從外國 API 切換到國內端點?
如果答案是否定的,那麼我們還沒有推論平台或策略。
這次我們可能錯過了前沿 SoTA LLM 預訓練的競賽
印度應該誠實面對自己的處境。
訓練一個能與 OpenAI、Google、Anthropic、Meta 和中國最強實驗室競爭的前沿模型,需要算力、人才、數據、基礎設施、評估深度、分銷管道以及數十億美元的風險資本。
但眼前的宏觀戰役是推論,因為大多數企業工作流程並不需要地球上最聰明的模型。他們需要的是能以可靠方式解決任務的最便宜模型。
而推論確實是一台印鈔機,只要 GPU 不在你的資產負債表上。考慮到最先進的推論是硬體-軟體協同設計,越接近底層硬體越有幫助,並能為你的業務建立結構性護城河。

一個後台理賠工作流程並不需要最新的 Opus/5.5。一個合規 Agent 並不需要最大限度的前沿推理。一個客戶支援摘要器並不需要最昂貴的可用模型。
一個強大的開放權重模型,經過路由、快取、微調以適應特定工作流程,經過真實世界評估,並以較低成本在本地提供服務,可以贏得印度企業工作負載的很大一部分份額。
這就是印度仍然擁有的機會窗口。中國大約在兩年前透過 LLM 意識到了這一點,並在 15 年前透過雲端運算基礎設施意識到了這一點。

中國的科技巨頭已經意識到,他們不能保持沉默,將模型訓練的控制權拱手讓給西方——最近的 H200 採購以及他們對華為國產 NPU 的關注,也顯示了他們對這種迫在眉睫的進口稅有多麼重視。而我們的頂層領導人卻忙於高談闊論,告訴我們應該停止預訓練,學會愛用例,卻沒有任何實際的推論能力可以展示...
美國已經深刻理解推論層,並正在成為推論研究實驗室..
Together(他們的首席科學家 Tri Dao 是 Flash Attention 的發明者)、Fireworks(以 Cursor 為基礎客戶進行 RL 後訓練)、Baseten、DeepInfra、Modal,以及現在的 vLLM(Inferact)和 SGLang(Radixark),這些公司都籌集了數億美元的資金,正在圍繞開放權重模型構建高性能推論層——實際上成為了推論新實驗室。
他們快速更新模型目錄。他們在延遲、成本和開發者體驗上競爭。NVIDIA 自己也強調了像 Baseten、DeepInfra、Fireworks 和 Together 這樣的公司,透過在 Blackwell 系統上進行優化推論來降低 token 成本。

沒有一家印度公司能達到這種規模,即使世界傳統上承認我們在 IT 服務交付方面的能力。
結果,我們仍然缺乏一個預設的國內推論平台,讓嚴肅的開發者、銀行、SaaS 公司、IT 供應商或政府部門可以信賴,並將其視為首選。
雖然我們有像 Simplismart、Neysa 和 Yotta 這樣的公司,但快速瀏覽一下他們的平台,就會發現我們在各個不同參數上落後了多少。


印度現有企業的問題
印度的大型 GPU 和雲端廠商不能繼續把推論當作一個產品目錄頁面來對待。如果世界正在從 Llama 轉向 Qwen,再到 DeepSeek,再到 Kimi,再到下個月推出的任何模型(小米現在也有一個前沿開放權重模型!!),印度的推論提供商不能以 PSU 採購的速度來更新模型目錄。
國內推論應該與國外推論達到相同的標準。
- 在印度特定工作負載重要的地方,要更好。
- 在盧比經濟學重要的地方,要更便宜。
- 在法規重要的地方,要更私密。
- 在模型性能重要的地方,要更即時。
這是一個政策問題,也是一個新創機會
好消息是,這是可以建立的,而且我們不需要煮沸整個海洋。
我們已經知道 Anthropic、Google 和 OpenAI 都將印度視為其 AI 支出的第二大市場——需求顯然存在。ElevenLabs 有望在印度僅透過語音推論就實現 1 億美元的年收入。
雖然 IndiaAI 使命起步方向正確,但在某個環節上未能落地——因為我們認為僅採購 GPU 就足夠了。
補貼算力應該獎勵實際的生產使用,而不是為了收集標誌。

問題是最終誰能抓住利潤(除了 Jensen 之外)。如果外國模型公司抓住了 token 利潤,外國雲端抓住了基礎設施利潤,而印度公司只保留了整合利潤,那麼 AI 就會吞噬我們唯一的優勢(勞動力套利),使其外部依賴性變得更糟。
如果印度建立國內推論,情況就會改變,因為所有進口的 GPU 都變成了國內基礎設施——一些美元 token 支出變成了盧比支出,一些利潤留在了印度基礎設施公司手中。
一些 AI 能力將在沒有持續外匯風險的情況下提供給印度新創企業和企業。一些服務出口將變得更加可防禦。
結語
印度下一張類似石油進口的帳單,可能不僅來自停靠在 Jamnagar 的油輪。
它肯定會來自印度服務公司和那些自稱 AI 原生、卻用美元租用智慧的新創企業所發出的數百萬次 API 呼叫。
幾十年來,印度進口能源,出口軟體。
但這是可以避免的。這需要印度停止將 GPU 採購與推論能力混為一談,停止將非生產級基礎設施的愛國主權品牌化混為一談,並停止假裝 AI 帳單是別人的問題。帳單已經來了。我上個月的帳單是 138 美元,而且還是嚴重補貼後的價格。你的帳單在不久的將來也不會便宜。
國內推論現在是宏觀經濟基礎設施。我們需要以戰時狀態加速建設產能,就像盧比依賴它一樣。





