NVIDIA, CUDA und die neuen Herausforderer
„Man kann die Punkte nicht verbinden, wenn man nach vorne schaut; man kann sie nur verbinden, wenn man zurückblickt.“
Steve Jobs
Teil 1 dieses dreiteiligen Essays behandelte die RISC-gegen-CISC-Kriege und wie Intels x86-ISA, unterstützt durch das Wintel-Schwungrad, Volumenwirtschaftlichkeit und ein vollständiges Ökosystem-Monopol in der PC-Ära, eine Generation eleganterer RISC-Architekturen besiegte, während DEC und Sun Microsystems, zwei ikonische Unternehmen, zu Fußnoten degradiert wurden.
Dieser Teil untersucht, wie NVIDIA über drei Jahrzehnte ein bemerkenswert ähnliches Imperium aufbaute, um sich als klarer Marktführer der heutigen KI-Ära zu etablieren, und wie eine neue Reihe von Herausforderern versucht, ihm Marktanteile abzujagen.
NVIDIA: Vom Denny's-Stammtisch zur Multimilliarden-Dollar-Festung
1993 brachte Intel den Pentium-Prozessor auf den Markt, der seinen Status als unangefochtene Rechenplattform der PC-Ära zementierte. Im selben Jahr skizzierten drei Ingenieure – Jensen Huang, Chris Malachowsky und Curtis Priem – beim Frühstück an einem Tisch in einem Denny's in San Jose, Kalifornien, die Idee für ein Unternehmen, das zu NVIDIA werden sollte.
Priem und Malachowsky waren Kollegen bei Sun, einem der prominentesten Unternehmen der RISC-Ära, das, wie in Teil 1 erörtert, letztendlich von Intels x86-Ökosystem zerstört wurde. Suns SPARC-Architektur, seine proprietären Hardware-Margen und sein vertikal integriertes Modell wurden im Laufe des folgenden Jahrzehnts von x86 plus Linux wegrationalisiert.
Und doch bauten zwei Ingenieure desselben Unternehmens NVIDIA auf, das bis 2023 genau das geworden war, was Intel 1993 war – die dominierende, das Ökosystem kontrollierende Plattform seiner Rechenära. Das Unternehmen, das Intel vernichtete, brachte unbeabsichtigt das Unternehmen hervor, das Intel eines Tages überflügeln sollte.
Nichts von der drei Jahrzehnte währenden Kristallisation von NVIDIA war 1993 sichtbar. NVIDIA verbrachte sein erstes Jahrzehnt als Grafikkartenunternehmen, sein zweites Jahrzehnt mit dem Aufbau einer Nischen-Plattform für wissenschaftliches Rechnen, und erst in seinem dritten Jahrzehnt, mit dem KI-Boom, wurde klar, dass NVIDIA einen Burggraben errichtet hatte, der strukturell identisch mit – und wohl tiefer als – dem von Intel mit x86 und Wintel gebauten war. Die NVIDIA-Gründer, die zusahen, wie Sun gegen Intels Ökosystem-Playbook verlor, wandten eine Generation später dasselbe Playbook effektiver an.
Nachdem NVIDIA mit dem NV1-Chip fast gestorben wäre, etablierte es sich mit der GeForce 256, die 1999 als „die weltweit erste GPU“ vermarktet wurde, als Grafikmarktführer. Aber GPUs waren immer noch Nischen-Peripheriegeräte für Spieler und CAD-Ingenieure. NVIDIAs Verwandlung in einen KI-Giganten begann mit einer einzigen Wette: CUDA.
CUDA: Das Husarenstück, das ein Imperium schuf
2006 veröffentlichte NVIDIA eine Compute Unified Device Architecture, kurz CUDA. Die intellektuellen Ursprünge gehen auf Ian Buck, einen Stanford-Doktoranden, zurück, dessen universelle GPU-Sprache Brook NVIDIA 2004 dazu überzeugte, ihn einzustellen. Buck und GPU-Architekt John Nickolls verwandelten Brook in eine vollständige Entwicklungsplattform. Zum ersten Mal konnten Entwickler GPUs mit C/C++ für Nicht-Grafik-Aufgaben programmieren.
CUDA wuchs jahrelang langsam, lediglich als Nischenwerkzeug für Computerwissenschaftler. NVIDIA investierte mit Überzeugung und ohne kurzfristige Renditen massiv in Bibliotheken, Dokumentation, Universitätspartnerschaften und Entwicklerbeziehungen. Jensen erinnerte sich später daran, wie seine unermüdlichen Investitionen in CUDA NVIDIA beinahe an den Rand des Bankrotts trieben.
Dann, im Jahr 2012, deklassierte AlexNet, ein neuronales Netzwerk des Teams von Geoffrey Hinton an der University of Toronto, den ImageNet-Benchmark zur Bilderkennung unter Verwendung von zwei NVIDIA-GPUs. Eine Nischen-Forschungsneugier sah plötzlich wie die Zukunft der KI aus. NVIDIA handelte mit außergewöhnlicher Geschwindigkeit und fehlerfreier Ausführung, um die Gelegenheit zu ergreifen:
- Entwicklung von cuDNN, das TensorFlow und PyTorch als ihr standardmäßiges Deep-Learning-Backend integrierten.
- Hinzufügen von Tensor Cores für die Matrix-Mathematik des Deep Learning.
- Einführung der DGX-Systeme als Standard-KI-Forschungsgerät.
- 2016 Spende des ersten DGX1 an OpenAI, um die Organisation zu fördern, die ChatGPT entwickeln sollte.
- Übernahme von Mellanox, wodurch NVIDIA die Kontrolle über das Netzwerk-Geflecht erlangte, das Tausende von GPUs in KI-Supercomputern verbindet.
Als ChatGPT im November 2022 die Massennachfrage nach generativer KI entfesselte, war der CUDA-Graben seit sechzehn Jahren im Aufbau! Die H100 wurde zum unverzichtbaren Chip des KI-Booms, und NVIDIAs Umsatz stieg parabolisch an und wuchs in den nächsten drei Jahren um das Fünffache.
Der langsame Start und der schließlich explosive Aufstieg von NVIDIA spiegeln die Entwicklung Intels von einem Speicherhersteller bei seiner Gründung 1968 zum Fahnenträger der Mikroprozessor- und PC-Revolution in den 1990er Jahren wider.
Sowohl Intel als auch NVIDIA begannen mit der Entwicklung von Technologien, die sich von dem unterschieden, was schließlich zu ihren Kernwachstumsmotoren werden sollte. Beide nutzten ihre Kernkompetenzen effektiv zu ihrem Vorteil und wurden, drei Jahrzehnte auseinander, zu dominanten Rechenplattformen. Beide standen einer ganzen Reihe von Herausforderern gegenüber, etablierten Unternehmen und Start-ups gleichermaßen.
Die Herausforderer: Ein Dutzend Wege zur Beschleunigung
Die Liste der NVIDIA-Herausforderer im Jahr 2026 weist eine strukturelle Ähnlichkeit mit den Intel- und x86-Herausforderern der 1990er Jahre auf. Jeder bringt echte Innovationen mit, und jeder steht vor derselben Schwerkraft des Ökosystems.
AMD ist der engste kommerzielle Silizium-Wettbewerber und spielt dieselbe Schattenrolle, die es gegen Intel bei x86 spielte. AMDs Hardware ist wettbewerbsfähig. Aber die Lücke im Software-Ökosystem hält CUDA dominant, genau wie die x86-Softwarebasis Intel dominant hielt, selbst als RISC-Hardware schneller war.
Google TPUs sind die glaubwürdigste Trainingsalternative. Google hat den umfassendsten KI-Stack vom Silizium bis zur Cloud. Aber TPUs sind exklusiv für Google Cloud, was NVIDIAs Lock-in durch Googles Lock-in ersetzt.
Amazon Trainium betreibt Frontline-Modelltraining zu einem wesentlich besseren Preis-Leistungs-Verhältnis als NVIDIA-Instanzen, aber exklusiv für AWS, was wiederum NVIDIAs Lock-in durch AWS-Lock-in ersetzt. Amazon subventioniert seine eigene Flucht vor NVIDIA.
Microsoft Maia 100 wurde entwickelt, um nicht NVIDIA zu ersetzen, sondern Azures Abhängigkeit von NVIDIA zu verringern – ein TCO-Optimierungsspiel, keine Plattform-Herausforderung. Cerebras baute den Wafer-Scale Engine – fast einen gesamten 300-mm-Siliziumwafer als einen einzigen Prozessor. Eine disruptive und mutige, aber Nischenlösung, die etwas an Boden gewinnt, deren breite Akzeptanz jedoch unklar bleibt.
SambaNova wählte mit seiner Reconfigurable Dataflow Unit (RDU) einen anderen Ansatz, einer Datenflussarchitektur, die sich von GPUs und TPUs unterscheidet.
Tenstorrent wettet ebenfalls darauf, dass GPUs grundsätzlich die falsche Abstraktion für KI-Workloads sind und dass Datenfluss im großen Maßstab gewinnen wird, so wie RISC die technische Argumentation gegen CISC gewann. Tenstorrent hat eine Beschleunigerarchitektur entwickelt, die auf einem Gitter aus kleinen, identischen Rechenkernen aufgebaut ist, jeder mit eigenem lokalem SRAM, einer Matrix-Mathematikeinheit, einer Vektoreinheit und RISC-V-Prozessoren, die Datenbewegung und -planung lokal verwalten.
Es gibt auch mehrere andere Start-ups. JP Morgan prognostiziert, dass kundenspezifisches Silizium bis 2028 45 % des KI-Chipmarktes erobern könnte. NVIDIA sieht sich nun Konkurrenz von seinen eigenen Kunden ausgesetzt.
Der CUDA-Graben: Wintel, neu aufgelegt
Die Parallelen zwischen NVIDIA heute und Intel in den 1990er Jahren sind strukturell und nicht nur oberflächlich:

CUDA-Lock-in ist keine einzelne Abhängigkeit. Es ist auf mehreren Ebenen akkumuliert – Kerne, die auf NVIDIAs Mathebibliotheken abgestimmt sind, auf cuDNN kalibriertes Mixed-Precision-Verhalten, auf die NVIDIA Collective Communications Library (NCCL) optimiertes verteiltes Training, auf CUDA-Tooling aufgebaute CI/CD-Pipelines und eine ganze Generation von Ingenieuren, die bereits vor ihrem Abschluss in CUDA geschult wurden.
NVIDIAs Burggraben könnte tiefer sein als der, den Intel einst baute, und zwar aus zwei Hauptgründen:
Vertikale Integration: Wintel kontrollierte das Betriebssystem und die CPU, war aber für alles andere auf Drittanbieter angewiesen. NVIDIA kontrolliert die GPU, das Networking (NVLink, InfiniBand), die Software (CUDA, cuDNN, TensorRT, NCCL) und komplette Rack-Scale-Systeme (NVL72, 72 Blackwell-GPUs als eine einzige logische Recheneinheit). Auf der GTC 2026 enthüllte NVIDIA die Vera-Rubin-Plattform mit sieben verschiedenen Chip-Typen, die fünf Rack-Scale-Systemkonfigurationen umfassen, und erweiterte die vertikale Kontrolle weiter, als Intel sie je erreicht hat.
Kapitalintensive Wechselkosten: Die Portierung einer Windows-App auf Linux in den 1990er Jahren war teuer, aber begrenzt. Das Neutrainieren eines KI-Modells an der Frontlinie auf alternativer Hardware kostet Hunderte Millionen Dollar und Monate an Ingenieursarbeit.
Groq: NVIDIA absorbiert einen Herausforderer
Die vielleicht aufschlussreichste Entwicklung des vergangenen Jahres ist, was mit einem Herausforderer geschah, der wirklich an Boden gewann. Groq, gegründet vom ehemaligen Google-TPU-Ingenieur Jonathan Ross, hatte eine Language Processing Unit (LPU) entwickelt, die für Inferenz mit extrem niedriger Latenz optimiert war. Seine SRAM-basierte Architektur beanspruchte, eine 4- bis 7-mal schnellere Token-Generierung als GPUs mit deterministischer Latenz zu liefern. Bis 2025 visierte Groq einen Umsatz von 500 Millionen Dollar an und hatte 750 Millionen Dollar bei einer Bewertung von 6,9 Milliarden Dollar eingesammelt. Am Heiligabend 2025 gab NVIDIA einen 20-Milliarden-Dollar-Deal bekannt, den größten seiner Geschichte, um Groqs Inferenztechnologie zu lizenzieren und den Großteil seines technischen Teams, einschließlich Gründer Ross, einzustellen.
Auf der GTC 2026 enthüllte Jensen seinen Plan für die Groq-Technologie. Der Groq 3 LPX-Inferenzbeschleuniger wird in die Vera-Rubin-Plattform als dedizierter Decode-Phase-Co-Prozessor eingesetzt und laut Jensen etwa 25 % der Rechenleistung in einem KI-Cluster ausmachen.
Die Übernahme trägt eine tiefere Botschaft in sich. Einerseits bestätigt sie die Existenz eines Marktes für Nicht-GPU-Beschleuniger, insbesondere für Inferenz-Workloads. Andererseits deutet sie darauf hin, dass Jensen und NVIDIA bereit sein könnten, jede aufkommende Bedrohung ihres GPU-Imperiums zu schlucken.
Es ist faszinierend festzustellen, dass auch dies ein Playbook mit historischem Präzedenzfall ist. 1998 erwarb Intel das Alpha-IP von DEC und dessen Siliziumfertigungsfabrik, nicht um es zu nutzen, sondern um es zu neutralisieren. Der Groq-Deal ist etwas raffinierter – NVIDIA integriert wirklich nützliche Technologie –, aber der Wettbewerbseffekt ist ähnlich: ein Herausforderer weniger am Tisch.
Zusammenfassung
So wie Intel während der PC-Ära ein formidables Ökosystem um x86-CPUs aufbaute, errichtete NVIDIA ein bemerkenswert ähnliches Imperium um programmierbare GPUs, um die KI-Ära einzuläuten. Der CUDA-Graben könnte tiefer sein als der x86- und Wintel-Graben es je war, und anders als Intel stieg NVIDIA schnell im Technologie-Stack auf und wurde zum System- und Softwareanbieter, anstatt ein bloßer kommerzieller Siliziumlieferant zu bleiben.
Genau wie in der Vergangenheit kam mit dem Aufstieg von NVIDIA eine neue Riege von Herausforderern, darunter kommerzielle Chip-Unternehmen, Hyperscaler und eine Vielzahl von Start-ups, die kundenspezifisches Silizium bauen. Diese Herausforderer haben innovative und elegante Architekturen entwickelt, die sich gegen den NVIDIA-Giganten stemmen. Aber genau wie in der Vergangenheit mangelt es ihnen an der Größe, der Volumenwirtschaftlichkeit, dem Software-Lock-in und der Systemintegration, die NVIDIA dominiert.
So wie es Intel durch seine massive Kriegskasse ermöglicht wurde, fast alle Halbleiterfertigungswettbewerber der 1990er Jahre zu besiegen, nutzt NVIDIA seine massiven Gewinne, um kluge Akquisitionen im gesamten Technologie-Stack zu tätigen, die nahezu jeden potenziell aufkommenden Trend von optischen Verbindungen bis hin zum Quantencomputing abdecken.
Teil 3 wird von den Einzelheiten einen Schritt zurücktreten, um eine faszinierende Frage zu erörtern: Was passiert als nächstes?





