NVIDIA, CUDA, 그리고 새로운 도전자들
"미래를 예측하며 점들을 연결할 수는 없습니다. 오직 과거를 되돌아보며 점들을 연결할 수 있을 뿐입니다."
스티브 잡스
이 3부작 에세이의 1부에서는 RISC와 CISC의 전쟁, 그리고 인텔의 x86 ISA가 Wintel 플라이휠, 볼륨 경제학, 그리고 PC 시대의 완벽한 생태계 잠금 효과에 힘입어 어떻게 한 세대의 더 우아한 RISC 아키텍처들을 물리쳤는지, 그리고 두 상징적인 회사인 DEC와 Sun Microsystems가 어떻게 역사의 각주로 사라졌는지 다루었습니다.
이번 파트에서는 NVIDIA가 어떻게 30년에 걸쳐 놀라울 정도로 유사한 제국을 건설하여 현재 AI 시대의 확실한 리더로 자리매김했는지, 그리고 새로운 도전자들이 어떻게 NVIDIA의 점유율을 빼앗으려 하고 있는지 살펴봅니다.
NVIDIA: 테이블에서 시작된 멀티 트릴리언 달러 요새
1993년, 인텔은 펜티엄 프로세서를 출시하며 PC 시대의 확실한 컴퓨팅 플랫폼으로서의 지위를 공고히 했습니다. 같은 해, 세 명의 엔지니어 – 젠슨 황, 크리스 말라코스키, 커티스 프리엠 – 캘리포니아 산호세의 Denny's 테이블에서 아침 식사를 하며 NVIDIA가 될 비즈니스에 대한 아이디어를 스케치했습니다.
프리엠과 말라코스키는 1부에서 논의된, 가장 저명한 RISC 시대 기업 중 하나였던 Sun의 동료였으며, 결국 인텔의 x86 생태계가 파괴한 회사입니다. Sun의 SPARC 아키텍처, 독점 하드웨어 마진, 수직 통합 모델은 모두 이후 10년 동안 x86 + Linux에 의해 상품화되었습니다.
그러나 놀랍게도, 같은 회사의 두 엔지니어는 NVIDIA를 세웠고, 2023년이 되자 NVIDIA는 1993년의 인텔이었던 바로 그 존재가 되었습니다 – 즉, 자체 컴퓨팅 시대의 지배적이고 생태계를 장악하는 플랫폼이 된 것입니다. 인텔이 죽인 회사는, 의도치 않게, 언젠가 인텔을 능가할 회사를 탄생시켰습니다.
NVIDIA의 30년에 걸친 결정체화 과정 중 어떤 것도 1993년에는 가시적이지 않았습니다. NVIDIA는 첫 10년을 그래픽 카드 회사로, 두 번째 10년을 틈새 과학 컴퓨팅 플랫폼 구축에 보냈으며, 세 번째 10년이 되어서야 AI 붐과 함께 NVIDIA가 구조적으로 인텔이 x86과 Wintel로 구축했던 해자와 동일하며, arguably 더 깊은 해자를 구축했음이 분명해졌습니다. Sun이 인텔의 생태계 플레이북에 패배하는 것을 지켜본 NVIDIA 창업자들은 한 세대 후, 동일한 플레이북을 더 효과적으로 실행하게 되었습니다.
NV1 칩으로 거의 죽을 뻔한 후, NVIDIA는 1999년 "세계 최초의 GPU"로 마케팅된 GeForce 256으로 그래픽 리더로서 자리매김했습니다. 그러나 GPU는 여전히 게이머와 CAD 엔지니어를 위한 틈새 주변기기에 불과했습니다. NVIDIA의 AI 강자로의 변신은 단 한 번의 도박, 즉 CUDA로 시작되었습니다.
CUDA: 제국을 창조한 승부수
2006년, NVIDIA는 Compute Unified Device Architecture, 일명 CUDA를 출시했습니다. 지적 기원은 스탠포드 박사 과정 학생이었던 이안 벅으로 거슬러 올라갑니다. 그의 범용 GPU 언어인 Brook은 NVIDIA가 2004년 그를 고용하도록 설득했습니다. 벅과 GPU 아키텍트 존 니콜스는 Brook을 완전한 개발 플랫폼으로 변형시켰습니다. 처음으로 개발자들은 C/C++로 그래픽 외의 작업을 위해 GPU를 프로그래밍할 수 있게 되었습니다.
CUDA는 수년간 느리게 성장했으며, 단지 계산 과학자들을 위한 틈새 도구에 불과했습니다. NVIDIA는 라이브러리, 문서화, 대학 파트너십, 개발자 관계에 확신을 가지고, 단기적인 수익 없이 막대한 투자를 했습니다. 젠슨은 이후 자신이 CUDA에 지속적으로 투자한 것이 거의 NVIDIA를 파산 직전으로 몰고 갔다고 회상했습니다.
그러다 2012년, 토론토 대학의 제프리 힌튼 팀이 구축한 신경망 AlexNet이 두 개의 NVIDIA GPU를 사용하여 ImageNet 이미지 인식 벤치마크를 완전히 압도했습니다. 틈새 연구 호기심이 갑자기 AI의 미래처럼 보였습니다. NVIDIA는 놀라운 속도와 완벽한 실행으로 기회를 포착했습니다:
- TensorFlow와 PyTorch가 기본 딥러닝 백엔드로 통합한 cuDNN을 구축했습니다.
- 딥러닝 행렬 수학을 위한 Tensor Core를 추가했습니다.
- DGX 시스템을 표준 AI 연구 장비로 출시했습니다.
- 2016년, 첫 번째 DGX1을 OpenAI에 기증하여 ChatGPT를 만들 조직을 배양했습니다.
- Mellanox를 인수하여 AI 슈퍼컴퓨터에서 수천 개의 GPU를 연결하는 네트워킹 패브릭을 장악했습니다.
ChatGPT가 2022년 11월 생성형 AI에 대한 대규모 수요를 촉발했을 때, CUDA 해자는 이미 16년 동안 구축되어 있었습니다! H100은 AI 붐의 필수 칩이 되었고 NVIDIA 매출은 이후 3년 동안 5배로 급증했습니다.
NVIDIA의 느린 시작과 결국 폭발적인 상승은 1968년 메모리 제조사로 시작하여 1990년대 마이크로프로세서와 PC 혁명의 기수가 된 인텔의 진화를 반영합니다.
인텔과 NVIDIA 모두 궁극적으로 핵심 성장 엔진이 될 것과는 다른 기술을 개발하면서 시작했습니다. 둘 다 핵심 역량을 효과적으로 활용하여 30년 간격으로 지배적인 컴퓨팅 플랫폼이 되었습니다. 둘 다 기존 기업과 스타트업을 포함한 모든 도전자들을 맞이했습니다.
도전자들: 가속화를 위한 열두 가지 방법
2026년 NVIDIA 도전자들의 명단은 1990년대 인텔과 x86 도전자들과 구조적 유사성을 보입니다. 각각은 진정한 혁신을 가져오지만, 각각 동일한 생태계 중력에 직면합니다.
AMD는 가장 가까운 상용 실리콘 경쟁자이며, x86에서 인텔을 상대했던 것과 동일한 그림자 역할을 합니다. AMD의 하드웨어는 경쟁력이 있습니다. 그러나 소프트웨어 생태계 격차가 CUDA를 지배적으로 유지하게 하는데, 이는 RISC 하드웨어가 더 빠를 때조차 x86 소프트웨어 기반이 인텔을 지배적으로 유지했던 방식과 정확히 같습니다.
Google TPU는 가장 신뢰할 수 있는 학습 대안입니다. Google은 실리콘부터 클라우드까지 가장 완벽한 AI 스택을 보유하고 있습니다. 그러나 TPU는 Google Cloud 전용이며, NVIDIA 종속을 Google 종속으로 바꾸는 것입니다.
Amazon Trainium은 NVIDIA 인스턴스보다 훨씬 더 나은 가격 대비 성능으로 프론티어 모델 학습을 구동하지만, AWS 전용으로, 다시 한 번 NVIDIA 종속을 AWS 종속으로 바꿉니다. Amazon은 NVIDIA로부터의 독립을 위해 자체적으로 보조금을 지급하고 있습니다.
Microsoft Maia 100은 NVIDIA를 대체하기 위해 설계된 것이 아니라 Azure의 NVIDIA 의존도를 줄이기 위한 것입니다 – 플랫폼 도전이 아닌 TCO 최적화 전략입니다. Cerebras는 Wafer-Scale Engine, 즉 거의 전체 300mm 실리콘 웨이퍼를 단일 프로세서로 구축했습니다. 파괴적이고 대담하지만 틈새 솔루션으로, 일부 traction을 얻고 있지만 광범위한 채택은 여전히 불확실합니다.
SambaNova는 Reconfigurable Dataflow Unit (RDU)으로 다른 접근 방식을 취했으며, 이는 GPU 및 TPU와는 다른 데이터플로우 아키텍처입니다.
Tenstorrent 또한 AI 워크로드에 GPU가 근본적으로 잘못된 추상화이며, 데이터플로우가 RISC가 CISC에 대해 기술적 논쟁에서 승리했던 방식대로 규모에서 승리할 것이라고 베팅하고 있습니다. Tenstorrent는 각각 자체 로컬 SRAM, 행렬 수학 유닛, 벡터 유닛, 그리고 데이터 이동과 스케줄링을 로컬로 관리하는 RISC-V 프로세서를 갖춘 작고 동일한 컴퓨팅 코어 그리드를 중심으로 구축된 가속기 아키텍처를 개발했습니다.
몇몇 다른 스타트업들도 있습니다. JP Morgan은 맞춤형 실리콘이 2028년까지 AI 칩 시장의 45%를 차지할 수 있다고 예측합니다. NVIDIA는 이제 자체 고객으로부터 경쟁에 직면하고 있습니다.
CUDA 해자: Wintel, 리로디드
오늘날 NVIDIA와 1990년대 인텔 간의 유사점은 표면적일 뿐만 아니라 구조적입니다.

CUDA 종속은 단일 의존성이 아닙니다. 이는 여러 수준에 걸쳐 축적됩니다 – NVIDIA의 수학 라이브러리에 맞춰진 커널, cuDNN에 보정된 혼합 정밀도 동작, NVIDIA Collective Communications Library (NCCL) 주변으로 최적화된 분산 학습, CUDA 도구 체인 위에 구축된 지속적 통합 및 배포 파이프라인, 그리고 졸업하기 전부터 CUDA에 대해 교육받은 한 세대의 엔지니어들 전체.
NVIDIA의 해자는 두 가지 주요 이유로 인텔이 구축한 해자보다 더 깊을 수 있습니다:
수직 통합: Wintel은 OS와 CPU를 제어했지만 그 외 모든 것은 타사에 의존했습니다. NVIDIA는 GPU, 네트워킹 (NVLink, InfiniBand), 소프트웨어 (CUDA, cuDNN, TensorRT, NCCL), 그리고 전체 랙 스케일 시스템 (NVL72, 단일 논리 컴퓨팅 유닛으로서의 72개의 Blackwell GPU)을 제어합니다. 2026 GTC에서 NVIDIA는 7개의 개별 칩 유형으로 구성된 5개의 랙 스케일 시스템 구성을 포함하는 Vera Rubin 플랫폼을 공개하며, 인텔이 달성한 것보다 더 멀리 수직적 통제를 확장했습니다.
자본 집약적 전환 비용: 1990년대에 Windows 앱을 Linux로 포팅하는 것은 비용이 많이 들었지만 한계가 있었습니다. 프론티어 AI 모델을 대체 하드웨어에서 재훈련하는 것은 수억 달러와 수개월의 엔지니어링 비용이 소요됩니다.
Groq: NVIDIA, 도전자를 흡수하다
지난 1년 동안 가장 의미 있는 발전 중 하나는 실제 traction을 얻고 있던 한 도전자에게 일어난 일일 것입니다. 전 Google TPU 엔지니어 조나단 로스가 설립한 Groq는 초저지연 추론에 최적화된 Language Processing Unit (LPU)을 구축했습니다. SRAM 기반 아키텍처는 결정적 지연 시간으로 GPU보다 4-7배 빠른 토큰 생성을 제공한다고 주장했습니다. 2025년까지 Groq는 5억 달러의 매출을 목표로 하고 있었으며, 69억 달러의 평가액으로 7억 5천만 달러를 모금했습니다. 2025년 크리스마스 이브, NVIDIA는 Groq의 추론 기술을 라이선싱하고 창업자 로스를 포함한 대부분의 기술 팀을 고용하는 200억 달러 규모의 사상 최대 거래를 발표했습니다.
2026 GTC에서 젠슨은 Groq 기술에 대한 자신의 계획을 밝혔습니다. Groq 3 LPX 추론 가속기는 Vera Rubin 플랫폼에 전용 디코드 단계 코프로세서로 탑재될 것이며, 젠슨에 따르면 AI 클러스터 컴퓨팅의 약 25%를 차지할 것입니다.
이번 인수는 더 깊은 신호를 전달합니다. 한편으로는 특히 추론 워크로드를 위한 비 GPU 가속기 시장의 존재를 입증합니다. 다른 한편으로는 젠슨과 NVIDIA가 GPU 제국에 대한 모든 떠오르는 위협을 집어삼킬 의향이 있음을 나타냅니다.
흥미로운 점은 이것 역시 역사적 선례가 있는 플레이북이라는 것입니다. 1998년, 인텔은 DEC의 Alpha IP와 실리콘 제조 팹을 사용하기 위해서가 아니라 무력화하기 위해 인수했습니다. Groq 거래는 조금 더 정교합니다 – NVIDIA는 진정으로 유용한 기술을 통합하고 있습니다 – 하지만 경쟁 효과는 유사합니다: 테이블에 앉은 도전자가 하나 줄어든 것입니다.
요약
인텔이 PC 시대에 x86 CPU 주변에 강력한 생태계를 구축했던 것처럼, NVIDIA는 프로그래머블 GPU 주변에 놀라울 정도로 유사한 제국을 구축하여 AI 시대를 열었습니다. CUDA 해자는 x86과 Wintel 해자가 그랬던 것보다 더 깊을 수 있으며, 인텔과 달리 NVIDIA는 신속하게 기술 스택 위로 이동하여 단순한 상용 실리콘 공급업체에 머무르지 않고 시스템 및 소프트웨어 제공업체가 되었습니다.
과거와 마찬가지로, NVIDIA의 부상과 함께 상용 칩 회사, 하이퍼스케일러, 그리고 맞춤형 실리콘을 구축하는 수많은 스타트업을 포함한 새로운 도전자 명단이 등장했습니다. 이들 도전자는 NVIDIA 강자에 맞서는 혁신적이고 우아한 아키텍처를 개발했습니다. 그러나 과거와 마찬가지로, 그들은 NVIDIA가 지배하는 규모, 볼륨 경제학, 소프트웨어 잠금 효과 및 시스템 통합이 부족합니다.
인텔의 막대한 전쟁 자금이 1990년대 거의 모든 반도체 제조 경쟁사를 무찌를 수 있게 했던 것처럼, NVIDIA는 막대한 횡재를 사용하여 광학 인터커넥트부터 양자 컴퓨팅에 이르기까지 거의 모든 잠재적 신흥 트렌드를 포괄하는 기술 스택 전반에 걸쳐 스마트한 인수를 하고 있습니다.
3부에서는 구체적인 내용에서 한 걸음 물러나 흥미로운 질문에 대해 생각해 볼 것입니다: 다음에는 무슨 일이 일어날까?





