NVIDIA, CUDA e i Nuovi Sfidanti
“Non puoi connettere i punti guardando avanti; puoi solo connetterli guardando indietro.”
Steve Jobs
La Parte 1 di questo saggio in tre parti ha trattato le guerre RISC vs CISC e come l'ISA x86 di Intel, aiutata dal volano Wintel, dall'economia di scala e da un blocco completo dell'ecosistema nell'era del PC, abbia sconfitto una generazione di architetture RISC più eleganti, mentre DEC e Sun Microsystems, due aziende iconiche, sono diventate semplici note a piè di pagina.
Questa parte esamina come NVIDIA ha costruito un impero sorprendentemente simile in tre decenni per affermarsi come leader indiscusso nell'era dell'AI di oggi, e come un nuovo gruppo di sfidanti stia cercando di sottrarle quote di mercato.
NVIDIA: Da un Tavolo di Denny’s a una Fortezza da Miliardi di Dollari
Nel 1993, Intel lanciò il processore Pentium che cementò il suo status di piattaforma informatica indiscussa dell'era del PC. Quello stesso anno, tre ingegneri – Jensen Huang, Chris Malachowsky e Curtis Priem – abbozzarono l'idea di un'impresa che sarebbe diventata NVIDIA – a colazione in un tavolo di un Denny's a San Jose, California.
Priem e Malachowsky erano colleghi alla Sun, una delle aziende più importanti dell'era RISC, discussa nella Parte 1, che l'ecosistema x86 di Intel alla fine distrusse. L'architettura SPARC di Sun, i suoi margini hardware proprietari e il suo modello verticalmente integrato furono tutti commoditizzati da x86 + Linux nel decennio successivo.
Eppure, due ingegneri della stessa azienda costruirono NVIDIA, che nel 2023 era diventata proprio ciò che Intel era nel 1993 – la piattaforma dominante che controlla l'ecosistema della sua era computazionale. L'azienda che Intel uccise, involontariamente generò l'azienda che un giorno avrebbe eclissato Intel.
Nulla della cristallizzazione trentennale di NVIDIA era visibile nel 1993. NVIDIA trascorse il suo primo decennio come azienda di schede grafiche, il suo secondo decennio a costruire una piattaforma di calcolo scientifico di nicchia, e solo nel suo terzo decennio, con il boom dell'AI, divenne chiaro che NVIDIA aveva costruito un fossato strutturalmente identico, e probabilmente più profondo, di quello che Intel costruì con x86 e Wintel. I fondatori di NVIDIA che videro Sun perdere contro il playbook dell'ecosistema di Intel finirono per eseguire lo stesso playbook, in modo più efficace, una generazione dopo.
Dopo essere quasi morta con il chip NV1, NVIDIA si affermò come leader della grafica con GeForce 256, commercializzata come "la prima GPU al mondo" nel 1999. Ma le GPU erano ancora solo periferiche di nicchia per giocatori e ingegneri CAD. La trasformazione di NVIDIA in un colosso dell'AI iniziò con una singola scommessa: CUDA.
CUDA: La Mossa che Creò un Impero
Nel 2006, NVIDIA rilasciò una Compute Unified Device Architecture, nota come CUDA. Le origini intellettuali risalgono a Ian Buck, un dottorando di Stanford il cui linguaggio GPU per uso generico, Brook, convinse NVIDIA ad assumerlo nel 2004. Buck e l'architetto GPU John Nickolls trasformarono Brook in una piattaforma di sviluppo completa. Per la prima volta, gli sviluppatori potevano programmare GPU per compiti non grafici in C/C++.
CUDA crebbe lentamente per anni, rimanendo un semplice strumento di nicchia per scienziati computazionali. NVIDIA investì pesantemente in librerie, documentazione, partnership universitarie e relazioni con gli sviluppatori, con convinzione e senza alcun ritorno immediato. Jensen avrebbe poi ricordato come il suo incessante investimento in CUDA portò NVIDIA quasi sull'orlo della bancarotta.
Poi, nel 2012, AlexNet, una rete neurale costruita dal team di Geoffrey Hinton all'Università di Toronto, distrusse il benchmark di riconoscimento immagini ImageNet utilizzando due GPU NVIDIA. Una curiosità di ricerca di nicchia sembrò improvvisamente il futuro dell'AI. NVIDIA si mosse con straordinaria velocità ed esecuzione impeccabile per cogliere l'opportunità:
- Costruì cuDNN, che TensorFlow e PyTorch integrarono come backend predefinito per il deep learning.
- Aggiunse Tensor Cores per la matematica matriciale del deep learning.
- Lanciò i sistemi DGX come appliance standard per la ricerca sull'AI.
- Nel 2016, donò il primo DGX1 a OpenAI, coltivando l'organizzazione che avrebbe creato ChatGPT.
- Acquisì Mellanox, ottenendo il controllo della rete di interconnessione che collega migliaia di GPU nei supercomputer AI.
Quando ChatGPT scatenò la domanda di massa per l'AI generativa nel novembre 2022, il fossato di CUDA era in costruzione da sedici anni! L'H100 divenne il chip indispensabile del boom dell'AI e i ricavi di NVIDIA diventarono parabolici, crescendo di 5 volte nei successivi 3 anni.
L'inizio lento e la successiva esplosiva ascesa di NVIDIA rispecchiano l'evoluzione di Intel da produttore di memoria al momento della sua fondazione nel 1968 a portabandiera della rivoluzione del microprocessore e del PC negli anni '90.
Sia Intel che NVIDIA sono partite sviluppando tecnologie diverse da quelle che sarebbero diventate i loro motori di crescita principali. Entrambe hanno efficacemente sfruttato le loro competenze chiave e sono diventate piattaforme di computing dominanti, a tre decenni di distanza. Entrambe hanno affrontato una schiera completa di sfidanti, sia incumbent che startup.
Gli Sfidanti: Una Dozzina di Modi per Accelerare
La rosa degli sfidanti di NVIDIA nel 2026 presenta una somiglianza strutturale con gli sfidanti di Intel e x86 degli anni '90. Ciascuno porta innovazione genuina, e ciascuno affronta la stessa gravità dell'ecosistema.
AMD è il concorrente commerciale di silicio più vicino, e gioca lo stesso ruolo d'ombra che ha giocato contro Intel in x86. L'hardware di AMD è competitivo. Ma il divario nell'ecosistema software è ciò che mantiene CUDA dominante, esattamente come la base software x86 manteneva Intel dominante anche quando l'hardware RISC era più veloce.
Le TPU di Google sono l'alternativa di training più credibile. Google ha lo stack AI più completo dal silicio al cloud. Ma le TPU sono esclusive di Google Cloud, scambiando il lock-in di NVIDIA con il lock-in di Google.
Amazon Trainium alimenta l'addestramento di modelli all'avanguardia con un rapporto prezzo-prestazioni sostanzialmente migliore delle istanze NVIDIA, ma è esclusivo AWS, scambiando nuovamente il lock-in NVIDIA con il lock-in AWS. Amazon sta sovvenzionando la propria fuga da NVIDIA.
Microsoft Maia 100 è progettato non per sostituire NVIDIA ma per ridurre la dipendenza di Azure da NVIDIA – un'ottimizzazione del TCO, non una sfida alla piattaforma. Cerebras ha costruito il Wafer-Scale Engine – quasi un intero wafer di silicio da 300 mm come un singolo processore. Una soluzione dirompente e audace ma di nicchia, che sta guadagnando un po' di trazione, ma l'adozione diffusa rimane incerta.
SambaNova ha adottato un approccio diverso con la sua Reconfigurable Dataflow Unit (RDU), un'architettura dataflow distinta da GPU e TPU.
Tenstorrent scommette anche che le GPU siano fondamentalmente l'astrazione sbagliata per i carichi di lavoro AI e che il dataflow vincerà su larga scala come il RISC vinse la discussione tecnica contro il CISC. Tenstorrent ha sviluppato un'architettura acceleratore costruita attorno a una griglia di core di calcolo piccoli e identici, ciascuno con la propria SRAM locale, unità di matematica matriciale, unità vettoriale e processori RISC-V che gestiscono localmente il movimento dei dati e la schedulazione.
Ci sono anche diverse altre startup. JP Morgan proietta che il silicio personalizzato potrebbe catturare il 45% del mercato dei chip AI entro il 2028. NVIDIA ora affronta la concorrenza dei propri clienti.
Il Fossato di CUDA: Wintel, Ricaricato
I parallelismi tra NVIDIA oggi e Intel negli anni '90 sono strutturali, non semplicemente superficiali:

Il lock-in di CUDA non è una singola dipendenza. Si accumula su più livelli – kernel ottimizzati per le librerie matematiche di NVIDIA, comportamento a precisione mista calibrato su cuDNN, training distribuito ottimizzato attorno a NVIDIA Collective Communications Library (NCCL), pipeline di integrazione continua e distribuzione costruite sugli strumenti CUDA e un'intera generazione di ingegneri formati su CUDA ancor prima di laurearsi.
Il fossato di NVIDIA potrebbe essere più profondo del fossato costruito da Intel per due ragioni principali:
Integrazione verticale: Wintel controllava il sistema operativo e la CPU ma si affidava a terze parti per tutto il resto. NVIDIA controlla la GPU, il networking (NVLink, InfiniBand), il software (CUDA, cuDNN, TensorRT, NCCL) e i sistemi rack-scale completi (NVL72, 72 GPU Blackwell come singola unità logica di calcolo). Al GTC 2026, NVIDIA ha svelato la piattaforma Vera Rubin con sette diversi tipi di chip che compongono cinque configurazioni di sistema rack-scale, estendendo il controllo verticale oltre quanto Intel abbia mai raggiunto.
Costi di switching ad alta intensità di capitale: Portare un'app Windows su Linux negli anni '90 era costoso ma limitato. Riadattare un modello AI all'avanguardia su hardware alternativo costa centinaia di milioni di dollari e mesi di ingegneria.
Groq: NVIDIA Assorbe uno Sfidante
Forse lo sviluppo più rivelatore dell'ultimo anno è ciò che è successo a uno sfidante che stava guadagnando vera trazione. Groq, fondata dall'ex ingegnere delle TPU di Google Jonathan Ross, aveva costruito una Language Processing Unit (LPU) ottimizzata per inferenza a latenza ultra-bassa. La sua architettura basata su SRAM prometteva una generazione di token 4-7X più veloce rispetto alle GPU con latenza deterministica. Entro il 2025, Groq mirava a 500 milioni di dollari di fatturato e aveva raccolto 750 milioni di dollari con una valutazione di 6,9 miliardi di dollari. La vigilia di Natale 2025, NVIDIA annunciò un accordo da 20 miliardi di dollari, il più grande della sua storia, per concedere in licenza la tecnologia di inferenza di Groq e assumere la maggior parte del suo team tecnico, incluso il fondatore Ross.
Al GTC 2026, Jensen rivelò i suoi piani per la tecnologia Groq. L'acceleratore di inferenza Groq 3 LPX si inserirà nella piattaforma Vera Rubin come co-processore dedicato alla fase di decodifica e, secondo Jensen, rappresenterà circa il 25% del calcolo in un cluster AI.
L'acquisizione porta con sé un segnale più profondo. Da un lato, convalida l'esistenza di un mercato per acceleratori non-GPU, specialmente per carichi di lavoro di inferenza. Dall'altro lato, indica che Jensen e NVIDIA potrebbero essere disposti a inglobare qualsiasi minaccia emergente al loro impero GPU.
È affascinante notare che anche questa è una strategia con un precedente storico. Nel 1998, Intel acquisì l'IP Alpha di DEC e la sua fabbrica di silicio, non per usarlo, ma per neutralizzarlo. L'accordo con Groq è un po' più sofisticato – NVIDIA sta integrando tecnologia genuinamente utile – ma l'effetto competitivo è simile: un concorrente in meno sul tavolo.
Riassunto
Proprio come Intel costruì un formidabile ecosistema attorno alle CPU x86 durante l'era del PC, NVIDIA ha costruito un impero sorprendentemente simile attorno a GPU programmabili per lanciare l'era dell'AI. Il fossato di CUDA potrebbe essere più profondo di quanto lo sia mai stato il fossato di x86 e Wintel, e, a differenza di Intel, NVIDIA è stata rapida a salire lungo lo stack tecnologico e a diventare un fornitore di sistemi e software, invece di rimanere un mero fornitore commerciale di silicio.
Proprio come in passato, insieme all'ascesa di NVIDIA, è arrivata una nuova schiera di sfidanti, tra cui aziende di chip commerciali, hyperscaler e una moltitudine di startup che costruiscono silicio personalizzato. Questi sfidanti hanno sviluppato architetture innovative ed eleganti che si oppongono al colosso NVIDIA. Ma proprio come in passato, mancano loro di scala, economia di volume, lock-in software e integrazione di sistema dominate da NVIDIA.
Proprio come il massiccio arsenale di Intel le permise di sconfiggere quasi tutti i concorrenti nella produzione di semiconduttori degli anni '90, NVIDIA sta usando la sua enorme manna per fare acquisizioni intelligenti in tutto lo stack tecnologico, coprendo quasi ogni potenziale tendenza emergente, dalle interconnessioni ottiche al calcolo quantistico.
La Parte 3 si allontanerà dai dettagli per riflettere su una domanda affascinante: Cosa succederà dopo?





