NVIDIA、CUDA 與新挑戰者
「你無法向前連結這些點;你只能向後回顧才能把它們串連起來。」
史蒂夫・賈伯斯
這篇三部分系列文章的 第一部分 探討了 RISC 與 CISC 之間的戰爭,以及 Intel 的 x86 ISA 如何在 Wintel 飛輪、規模經濟效益以及對 PC 時代生態系統的完整鎖定下,擊敗了更優雅的一代 RISC 架構,同時讓 DEC 和 Sun Microsystems 這兩家傳奇公司逐漸淪為歷史的註腳。
本部分將探討 NVIDIA 如何用長達三十年的時間,建立了一個極為相似的帝國,從而在當今的 AI 時代確立其明確的領導地位,以及新一批挑戰者正如何試圖從中搶佔市場份額。
NVIDIA:從丹尼斯餐廳到數兆美元的堡壘
1993 年,Intel 推出了 Pentium 處理器,鞏固了其作為 PC 時代無可爭議的運算平台地位。同年,三位工程師——黃仁勳、Chris Malachowsky 和 Curtis Priem——在加州聖荷西一家丹尼斯餐廳的卡座上,草擬了後來成為 NVIDIA 的商業構想。
Priem 和 Malachowsky 曾是 Sun 的同事,該公司是 RISC 時代最著名的企業之一,正如 第一部分 所述,最終被 Intel 的 x86 生態系統摧毀。Sun 的 SPARC 架構、其專屬硬體利潤以及垂直整合模式,都在接下來的十年間被 x86 加上 Linux 徹底商品化。
然而,來自同一家公司的兩位工程師後來建立了一個 NVIDIA,到了 2023 年,它已經變成 Intel 在 1993 年時的樣子——在其所屬的運算時代中,主導一切、控制生態系統的平台。被 Intel 摧毀的那家公司,無意間催生了日後將超越 Intel 的公司。
1993 年的時候,完全看不出 NVIDIA 將會在三十年後結晶成如今的模樣。NVIDIA 的第一個十年是一家顯示卡公司,第二個十年則在打造一個利基科學運算平台,直到第三個十年,隨著 AI 熱潮的爆發,人們才明白 NVIDIA 已經建立了一道在結構上與 Intel 靠 x86 和 Wintel 建立的護城河完全相同,甚至可能更為深邃的屏障。那些目睹 Sun 敗給 Intel 生態系統劇本的 NVIDIA 創辦人,最終在一個世代之後,更有效地執行了同一套劇本。
在經歷了 NV1 晶片的近乎倒閉之後,NVIDIA 憑藉 1999 年推出的 GeForce 256(被譽為「世界上第一個 GPU」)確立了其圖形領域的領導地位。但 GPU 仍然只是針對玩家和 CAD 工程師的利基周邊設備。NVIDIA 轉變為 AI 巨頭的過程中,始於一個大膽的賭注:CUDA。
CUDA:創造帝國的絕地反擊
2006 年,NVIDIA 發布了統一計算設備架構,即 CUDA。其知識淵源可追溯到史丹佛博士生 Ian Buck,他的通用 GPU 語言 Brook 說服了 NVIDIA 在 2004 年僱用他。Buck 與 GPU 架構師 John Nickolls 將 Brook 轉變為一個完整的開發平台。這是開發者首次能夠使用 C/C++ 為 GPU 編寫非圖形任務的程式。
多年來,CUDA 成長緩慢,僅僅是計算科學家的一個利基工具。NVIDIA 投入巨資於函式庫、文件、大學合作夥伴關係以及開發者關係,抱持著堅定的信念,且沒有任何短期回報。黃仁勳後來回憶,他對 CUDA 不懈的投資差點讓 NVIDIA 破產。
然後在 2012 年,由多倫多大學 Geoffrey Hinton 團隊打造的類神經網路 AlexNet,使用兩塊 NVIDIA GPU 在 ImageNet 影像辨識基準測試中橫掃對手。一個利基研究領域的好奇心產物,突然看起來像是 AI 的未來。NVIDIA 以非凡的速度和完美的執行力抓住了這個機會:
- 建立了 cuDNN,TensorFlow 和 PyTorch 將其整合為預設的深度學習後端。
- 增加了用於深度學習矩陣運算的 Tensor Core。
- 推出了 DGX 系統,作為標準的 AI 研究設備。
- 2016 年,將第一台 DGX1 捐贈給 OpenAI,培育了後來創造 ChatGPT 的組織。
- 收購了 Mellanox,取得了連接 AI 超級電腦中數千個 GPU 的網路架構控制權。
當 ChatGPT 在 2022 年 11 月引爆了生成式 AI 的大眾市場需求時,CUDA 護城河已經歷時十六年的打造!H100 成為了 AI 熱潮中不可或缺的晶片,NVIDIA 的營收在接下來三年內呈拋物線成長了五倍。
NVIDIA 緩慢起步最終爆炸性崛起的過程,與 Intel 從 1968 年創立時的記憶體製造商,到 1990 年代成為微處理器和 PC 革命旗手的演變如出一轍。
Intel 和 NVIDIA 起初都在發展與它們最終核心成長引擎截然不同的技術。兩者都有效地利用了自己的核心競爭力,並在相隔三十年後成為主導的運算平台。兩者都面臨過一連串的挑戰者,包含既有巨頭和新創公司。
挑戰者:多種加速路徑
2026 年 NVIDIA 的挑戰者陣容,在結構上與 1990 年代 Intel 和 x86 的挑戰者有相似之處。每個挑戰者都帶來了真正的創新,而每個挑戰者都面臨同樣的生態系統重力。
AMD 是最接近的商業晶片競爭對手,並且扮演著當年對抗 Intel 的 x86 時同樣的影子角色。AMD 的硬體具有競爭力。但軟體生態系統的差距才是讓 CUDA 保持主導地位的原因,這正如同 x86 軟體基礎讓 Intel 保持主導,即使 RISC 硬體更快。
Google TPU 是最具可信度的訓練替代方案。Google 擁有從晶片到雲端最完整的 AI 堆疊。但 TPU 僅限於 Google Cloud 使用,只是從 NVIDIA 綁定換成了 Google 綁定。
Amazon Trainium 以顯著優於 NVIDIA 實例的性價比驅動前沿模型的訓練,但同樣僅限 AWS 使用,只是從 NVIDIA 綁定換成了 AWS 綁定。Amazon 正在補貼自己的 NVIDIA 逃脫計畫。
Microsoft Maia 100 的設計目的並非取代 NVIDIA,而是為了減少 Azure 對 NVIDIA 的依賴——這是一種 TCO 最佳化的策略,而非平台挑戰。Cerebras 建立了晶圓級引擎——幾乎將整個 300mm 矽晶圓作為單一處理器。一個顛覆性且大膽但屬於利基的解決方案,獲得了一些進展,但廣泛採用仍不明朗。
SambaNova 採用了不同的方法,即其可重新配置資料流單元 (RDU),這是一種不同於 GPU 和 TPU 的資料流架構。
Tenstorrent 也押注 GPU 從根本上來說是 AI 工作負載的錯誤抽象,並認為資料流將像當年 RISC 在技術論證上戰勝 CISC 一樣,在規模上勝出。Tenstorrent 開發了一種加速器架構,圍繞著一個由小型、相同的計算核心組成的網格,每個核心都有自己的本地 SRAM、矩陣運算單元、向量單元以及負責本地管理資料移動和排程的 RISC-V 處理器。
還有其他幾家新創公司。摩根大通預測,到 2028 年,客製化晶片可能佔據 AI 晶片市場的 45%。NVIDIA 現在面臨來自其自身客戶的競爭。
CUDA 護城河:Wintel 再現
今天 NVIDIA 與 1990 年代 Intel 之間的相似之處是結構性的,而不僅僅是表面上的:

CUDA 的鎖定並非單一依賴。它是跨越多個層級累積而成的——針對 NVIDIA 數學函式庫調整的核心、針對 cuDNN 校準的混合精度行為、圍繞 NVIDIA 集體通訊函式庫 (NCCL) 最佳化的分散式訓練、建立在 CUDA 工具鏈上的持續整合和部署流程,以及一整代甚至在畢業前就學會 CUDA 的工程師。
NVIDIA 的護城河可能比 Intel 建立的護城河更深,主要有兩個原因:
垂直整合:Wintel 控制了作業系統和 CPU,但其它一切依賴第三方。NVIDIA 則控制 GPU、網路 (NVLink, InfiniBand)、軟體 (CUDA, cuDNN, TensorRT, NCCL) 以及完整的機櫃級系統 (NVL72,將 72 個 Blackwell GPU 作為單一邏輯運算單元)。在 2026 年的 GTC 大會上,NVIDIA 推出了 Vera Rubin 平台,包含七種不同的晶片類型,構成五種機櫃級系統配置,將垂直控制延伸到 Intel 從未達到的水準。
資本密集的轉換成本:在 1990 年代將 Windows 應用程式移植到 Linux 成本高昂但尚有限度。在前沿 AI 模型上重新用替代硬體進行訓練則需要花費數億美元和數月的工程時間。
Groq:NVIDIA 吸收了一個挑戰者
過去一年中最具啟發性的發展莫過於一個正在獲得實際動能的挑戰者所發生的事。Groq 由前 Google TPU 工程師 Jonathan Ross 創立,構建了一個針對超低延遲推理進行最佳化的語言處理單元 (LPU)。其基於 SRAM 的架構號稱比 GPU 快 4-7 倍的令牌生成速度,且延遲確定。到 2025 年,Groq 的目標營收是 5 億美元,並以 69 億美元的估值籌集了 7.5 億美元。2025 年耶誕夜,NVIDIA 宣布了一筆 200 億美元的交易——這是其史上最大的一筆——以授權 Groq 的推理技術並僱用其大部分技術團隊,包括創辦人 Ross。
在 2026 年的 GTC 大會上,黃仁勳透露了他對 Groq 技術的計畫。Groq 3 LPX 推理加速器將作為專用的解碼階段協同處理器,整合到 Vera Rubin 平台中。根據黃仁勳的說法,這將約佔 AI 叢集中運算量的 25%。
這項收購承載著更深層的訊號。一方面,它驗證了非 GPU 加速器市場的存在,特別是針對推理工作負載。另一方面,它表明黃仁勳和 NVIDIA 可能願意吞掉任何對其 GPU 帝國構成的新興威脅。
值得注意的是,這也是有歷史先例的劇本。1998 年,Intel 收購了 DEC 的 Alpha IP 及其矽晶圓製造廠,並非為了使用,而是為了將其中立化。Groq 的交易則更為精妙——NVIDIA 整合了真正有用的技術——但其競爭效應相似:桌邊少了一位挑戰者。
總結
正如 Intel 在 PC 時代圍繞 x86 CPU 建立了強大的生態系統一樣,NVIDIA 圍繞可編程 GPU 建立了極為相似的帝國,開啟了 AI 時代。CUDA 護城河可能比 x86 和 Wintel 護城河更加深邃,而且與 Intel 不同的是,NVIDIA 迅速向上移動技術堆疊,成為系統和軟體提供者,而非僅僅停留於商業晶片供應商。
正如過去一樣,伴隨著 NVIDIA 的崛起,也出現了一批新的挑戰者,包括商業晶片公司、超大規模雲端業者以及許多建造客製化晶片的新創公司。這些挑戰者開發了創新且優雅的架構,試圖對抗 NVIDIA 這個巨頭。但正如過去一樣,它們缺乏 NVIDIA 所主導的規模、數量經濟、軟體鎖定以及系統整合能力。
正如 Intel 龐大的資金庫讓它能夠擊敗 1990 年代幾乎所有的半導體製造競爭對手一樣,NVIDIA 正利用其巨額收益在技術堆疊的各個層級進行明智的收購,涵蓋從光學互連到量子計算等幾乎每一個潛在的新興趨勢。
第三部分將跳出具體細節,思考一個引人入勝的問題:接下來會發生什麼事?





