YouMind
登录

计算领域的深层护城河与平台转型 —— 第二部分

@magicsilicon
英语2026年5月16日
243K
508
72
16
833

TL;DR

本文分析了 NVIDIA 在 AI 时代的战略主导地位,将其 CUDA 生态系统与 Intel 的 x86 遗产进行了对比,并评估了新的挑战者以及对 Groq 的收购。

NVIDIA、CUDA 与新挑战者

「你无法在向前看时把点连起来;你只能在回头看时把它们连起来。」

史蒂夫·乔布斯

第一部分 介绍了 RISC 与 CISC 之战,以及英特尔如何借助 Wintel 飞轮效应、规模经济和 PC 时代的完整生态锁定,击败了一代更优雅的 RISC 架构,而 DEC 和 Sun Microsystems 这两家标志性公司则沦为历史注脚。

本部分将探讨 NVIDIA 如何在三十年间建立起一个惊人相似的帝国,成为当今 AI 时代的明确领导者,以及新一批挑战者如何试图从它手中分走份额。

NVIDIA:从 Denny's 卡座到数万亿美元堡垒

1993 年,英特尔推出了 Pentium 处理器,巩固了其作为 PC 时代无可争议的计算平台地位。同年,三位工程师——Jensen Huang、Chris Malachowsky 和 Curtis Priem——在加利福尼亚州圣何塞的一家 Denny's 卡座上,在一顿早餐期间勾勒出了一家公司的雏形,这家公司后来成为了 NVIDIA。

Priem 和 Malachowsky 曾是 Sun(第一部分 中讨论的最著名的 RISC 时代公司之一)的同事。Sun 的 SPARC 架构、其专有的硬件利润率以及垂直整合模式,在随后的十年中被 x86 + Linux 完全商品化。

然而,正是这家公司走出来的两位工程师,后来创立了 NVIDIA,到 2023 年,NVIDIA 已经成为英特尔在 1993 年时的角色——其计算时代占据主导地位、控制生态的平台。英特尔扼杀的那家公司,反而无意中催生了有朝一日将超越英特尔的公司。

1993 年,NVIDIA 长达三十年的结晶过程毫无端倪可寻。NVIDIA 前十年是一家显卡公司,第二个十年打造了一个小众的科学计算平台,直到第三个十年,随着 AI 热潮的兴起,人们才清楚看到,NVIDIA 建立了一条与英特尔凭借 x86 和 Wintel 所建护城河结构上相同、甚至可能更深的护城河。那些亲眼目睹 Sun 输给英特尔生态策略的 NVIDIA 创始人,最终在一代人之后,更加高效地执行了同样的策略。

NVIDIA 在 NV1 芯片险些夭折后,凭借 1999 年推出的 GeForce 256 确立了自己在图形领域的领导地位,该芯片被宣传为「全球首款 GPU」。但 GPU 仍然只是游戏玩家和 CAD 工程师的小众外设。NVIDIA 向 AI 巨头的转型始于一个豪赌:CUDA。

CUDA:缔造帝国的赌注

2006 年,NVIDIA 发布了统一计算设备架构,即 CUDA。其思想起源可追溯到斯坦福大学博士生 Ian Buck,他开发的通用 GPU 语言 Brook 说服 NVIDIA 在 2004 年雇佣了他。Buck 与 GPU 架构师 John Nickolls 将 Brook 转变为一个完整的开发平台。开发者第一次可以用 C/C++ 为 GPU 编写非图形任务程序。

CUDA 多年来发展缓慢,仅作为计算科学家的一个利基工具。NVIDIA 投入巨资建设库、文档、大学合作和开发者关系,充满信念,且没有任何短期回报。Jensen 后来回忆说,他对 CUDA 不计成本的投入几乎把 NVIDIA 推到了破产边缘。

然后在 2012 年,多伦多大学 Geoffrey Hinton 团队构建的神经网络 AlexNet,使用两块 NVIDIA GPU 一举击败了 ImageNet 图像识别基准。一个利基的研究好奇心突然变成了 AI 的未来。NVIDIA 以惊人的速度和完美的执行力抓住了这个机会:

  1. 构建了 cuDNN,TensorFlow 和 PyTorch 将其集成为默认的深度学习后端。
  2. 为深度学习矩阵运算增加了 Tensor Core。
  3. 推出 DGX 系统,作为标准的 AI 研究设备。
  4. 2016 年,将第一台 DGX1 捐赠给 OpenAI,培养了后来创造 ChatGPT 的组织。
  5. 收购 Mellanox,获得了连接 AI 超级计算机中数千块 GPU 的网络架构。

当 ChatGPT 在 2022 年 11 月引爆了大众市场对生成式 AI 的需求时,CUDA 这条护城河已经挖了十六年!H100 成为 AI 热潮中的必备芯片,NVIDIA 的收入呈抛物线式增长,在接下来的三年里增长了 5 倍。

NVIDIA 从缓慢起步到最终爆发式崛起,与英特尔从 1968 年创立时的存储器制造商到 1990 年代成为微处理器和 PC 革命旗手的演变过程如出一辙。

英特尔和 NVIDIA 都是从与其最终核心增长引擎截然不同的技术起步的。两者都有效地利用了自己的核心竞争力,在三隔代的时间里成为了占主导地位的计算平台。两者都面临着一系列挑战者,既有老牌公司,也有初创公司。

挑战者:十几种加速方式

2026 年 NVIDIA 挑战者的阵容,在结构上与 1990 年代英特尔和 x86 的挑战者相似。每家都带来了真正的创新,并且每家都面临着同样的生态引力。

AMD 是最接近的商用芯片竞争对手,它扮演着与 x86 时代对抗英特尔时相同的影子角色。AMD 的硬件具有竞争力。但软件生态差距使得 CUDA 保持主导地位,正如同 x86 软件基础让英特尔保持主导地位,即使 RISC 硬件更快。

Google TPU 是最可信的训练替代方案。Google 拥有从芯片到云的最完整 AI 堆栈。但 TPU 仅限于 Google Cloud,用 NVIDIA 锁定换来了 Google 锁定。

Amazon Trainium 以大幅优于 NVIDIA 实例的性价比为前沿模型训练提供动力,但仅限 AWS,再次用 NVIDIA 锁定换来了 AWS 锁定。亚马逊正在补贴自己摆脱 NVIDIA 的努力。

Microsoft Maia 100 的设计目标不是取代 NVIDIA,而是减少 Azure 对 NVIDIA 的依赖——这是一次 TCO 优化策略,而非平台级挑战。Cerebras 构建了晶圆级引擎——几乎将一整块 300mm 硅晶圆作为一个单一处理器。这是一项颠覆性且大胆的解决方案,但属于利基应用,正在取得一些进展,但广泛采用仍不明朗。

SambaNova 另辟蹊径,采用了可重构数据流单元(RDU),这是一种不同于 GPU 和 TPU 的数据流架构。

Tenstorrent 也押注 GPU 本质上是 AI 工作负载的错误抽象,数据流将在规模上赢得胜利,就像 RISC 在技术论证上战胜了 CISC 一样。Tenstorrent 开发了一种加速器架构,围绕一个由小型、相同的计算核心组成的网格构建,每个核心都有自己的本地 SRAM、矩阵运算单元、向量单元以及用于在本地管理数据移动和调度的 RISC-V 处理器。

还有其他几家初创公司。摩根大通预测,到 2028 年,定制芯片可能占据 AI 芯片市场 45% 的份额。NVIDIA 现在面临着来自自己客户的竞争。

CUDA 护城河:Wintel 归来

NVIDIA 今天与 1990 年代英特尔之间的相似之处是结构性的,而非仅仅是表面现象:

Pushkar Ranade - inline image

CUDA 锁定并非单一依赖。它累积在多个层面——针对 NVIDIA 数学库调优的内核、针对 cuDNN 校准的混合精度行为、围绕 NVIDIA 集合通信库(NCCL)优化的分布式训练、基于 CUDA 工具链构建的持续集成/部署流水线,以及整整一代甚至在毕业前就接受 CUDA 培训的工程师。

NVIDIA 的护城河可能比英特尔当年挖的更深,主要原因有两个:

垂直整合:Wintel 控制了操作系统和 CPU,但其他一切依赖第三方。NVIDIA 控制着 GPU、网络(NVLink、InfiniBand)、软件(CUDA、cuDNN、TensorRT、NCCL)以及完整的机架级系统(NVL72,72 块 Blackwell GPU 作为一个逻辑计算单元)。在 GTC 2026 上,NVIDIA 推出了 Vera Rubin 平台,包含七种不同的芯片类型,构成五种机架级系统配置,将垂直控制延伸到英特尔从未达到的程度。

资本密集的转换成本:1990 年代将 Windows 应用移植到 Linux 虽然昂贵,但成本有限。而在替代硬件上重新训练一个前沿 AI 模型则要耗费数亿美元和数月的工程时间。

Groq:NVIDIA 吸收一个挑战者

过去一年中最能说明问题的事件,或许是一个原本势头正猛的挑战者最终的命运。Groq 由前 Google TPU 工程师 Jonathan Ross 创立,构建了针对超低延迟推理优化的语言处理单元(LPU)。其基于 SRAM 的架构自称比 GPU 快 4-7 倍的令牌生成速度,且延迟确定。到 2025 年,Groq 的目标收入为 5 亿美元,并已以 69 亿美元估值融资 7.5 亿美元。2025 年平安夜,NVIDIA 宣布了一项 200 亿美元的协议——这是其有史以来最大的一笔交易——获得 Groq 的推理技术授权,并雇佣了包括创始人 Ross 在内的大部分技术团队。

在 GTC 2026 上,Jensen 透露了他对 Groq 技术的计划。Groq 3 LPX 推理加速器将作为专用的解码阶段协处理器插入 Vera Rubin 平台,据 Jensen 称,这将占 AI 集群中约 25% 的计算量。

这次收购传递了更深层的信号。一方面,它证实了非 GPU 加速器——尤其是针对推理工作负载——的市场是真实存在的。另一方面,它表明 Jensen 和 NVIDIA 可能愿意吞掉任何对其 GPU 帝国构成的新兴威胁。

有趣的是,这同样是有历史先例的策略。1998 年,英特尔收购了 DEC 的 Alpha IP 及其硅制造工厂,不是为了使用,而是为了消除威胁。Groq 的交易更复杂一些——NVIDIA 整合了真正有用的技术——但竞争效果类似:场上又少了一个挑战者。

总结

正如英特尔在 PC 时代围绕 x86 CPU 建立了一个强大的生态系统一样,NVIDIA 围绕可编程 GPU 建立了一个惊人相似的帝国,开启了 AI 时代。CUDA 护城河可能比 x86 和 Wintel 的护城河更深,而且与英特尔不同,NVIDIA 迅速向上移动技术栈,成为系统和软件供应商,而不仅仅是商用芯片供应商。

和过去一样,随着 NVIDIA 的崛起,也出现了一批新的挑战者,包括商用芯片公司、超大规模云服务商以及众多构建定制芯片的初创公司。这些挑战者开发了创新且优雅的架构,与 NVIDIA 这艘巨轮抗衡。但和过去一样,它们缺乏 NVIDIA 所主导的规模、规模经济、软件锁定和系统集成能力。

正如英特尔庞大的资金储备使其能够击败 1990 年代几乎所有的半导体制造竞争对手一样,NVIDIA 正利用其巨额意外之财,在技术栈上进行明智的收购,涵盖了从光学互连到量子计算的几乎所有潜在新兴趋势。

第三部分将跳出具体细节,思考一个引人入胜的问题:接下来会发生什么?

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章