Traccio ogni dollaro speso in infrastruttura AI. L'anno scorso, una voce di costo continuava a crescere: il noleggio di GPU cloud. Entro il terzo trimestre aveva raggiunto 1.900 $ al mese – ed ero io a fatturare ai clienti il lavoro che lo generava.
Questo conto non torna. Non costruisci un'azienda cedendo il 40% dei costi operativi al data center di qualcun altro.
Poi ho comprato un DGX Spark. Ecco la ripartizione.
1 / Cos'è Realmente il DGX Spark
NVIDIA ha passato il 2025 a comprimere hardware da data center in un desktop. Lo ha annunciato come Project DIGITS al CES di gennaio, lo ha rinominato DGX Spark al GTC di marzo e ha iniziato le spedizioni a ottobre. Il risultato è una scatola di 150×150×50 mm che pesa 1,2 kg e funziona con una normale presa a muro.
Le specifiche:
Componente
Dettaglio
Chip
GB10 Grace Blackwell Superchip
Potenza di calcolo AI
1 PFLOP (FP4)
CPU
20-core ARM (Grace)
Memoria
128 GB LPDDR5x, unificata
Archiviazione
4 TB Gen5 NVMe
Rete
ConnectX-7 (collega due unità)
Consumo energetico
~150–240 W sotto carico
Prezzo
2.999 $
Il numero dei petaflop è una cifra di marketing. Il numero che conta davvero è 128 GB di memoria unificata.
Le GPU consumer hanno un tetto massimo rigido. Una 4090 ti dà 24 GB di VRAM – nel momento in cui un modello è più grande, non si carica. Una 5090 alza il tetto a 32 GB. Lo Spark lo porta a 128 GB, il che significa che esegue modelli che una scheda consumer da 2.000 $ non può nemmeno aprire.
2 / Il Muro della Memoria, Spiegato
Ecco cosa sbloccano realmente 128 GB di memoria unificata:
- Llama 3.3 70B – precisione BF16 completa, nessun trucco di quantizzazione necessario
- Qwen 3 (gamma 30B–110B) – ci sta perfettamente
- Modelli classe DeepSeek fino a 200B – quantizzati, funzionano bene
- Generazione immagini FLUX.1 – sì
- Parametri 405B – due Spark collegati tramite ConnectX-7
Una GPU consumer si ferma a circa 30B strizzati. Lo Spark inizia esattamente dove finisce quel tetto. Quel divario è l'intera giustificazione per acquistarne uno.
3 / Il Conto: Da Dove Arrivano 22.000 $
Costi GPU cloud per carichi di lavoro AI seri:
Attività
Costo mensile
A100 80 GB, part-time
600–1.200 $
H100 per esecuzioni di fine-tuning
1.000–2.500 $
Inferenza 70B ospitata
300–900 $
Istanza che hai dimenticato di spegnere
sorpresa
Totale realistico per un costruttore AI
1.500–3.000 $
DGX Spark sugli stessi carichi di lavoro:
Voce di costo
Costo
Hardware
2.999 $ (una tantum)
Energia a ~200 W
8–15 $/mese
Noleggio cloud
0 $
Mensile dopo l'acquisto
~10 $
A 1.900 $/mese di costi cloud, lo Spark si ripaga in meno di 7 settimane.
Dopodiché: 1.890 $ al mese che prima uscivano dalla tua attività, ci restano. Con lo stesso lavoro per i clienti. Con le stesse fatture emesse.
Totale primo anno reindirizzato alla tua attività: 22.680 $.
4 / Il Livello Software Non è un Problema
Lo Spark esegue DGX OS – la build Ubuntu di NVIDIA con l'intero stack AI preinstallato: CUDA, NIM, NeMo. Ollama, vLLM, PyTorch, Hugging Face e llama.cpp funzionano tutti senza modifiche dal primo giorno.
Se stavi già usando un endpoint cloud, la migrazione è una modifica di una singola riga:
1# Prima: paghi a ore2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# Dopo: la tua scrivania, contatore spento5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
Stesso percorso del codice. Stesso output JSON. Stesso comportamento. Niente viene fatturato. Niente esce dall'edificio.
5 / Il Business Case Oltre al Risparmio sui Costi
Lo Spark non è solo un taglia-costi. Rimuove la barriera economica per lavori che prima erano troppo costosi da eseguire liberamente.
Se fai lavoro AI per clienti:
Le esecuzioni di fine-tuning che costavano 400 $ di cloud ora sono gratuite. Eseguile di notte. Esegui tre varianti con iperparametri diversi. Nessuna fattura arriva al mattino. Puoi distribuire un agente di codifica privato sull'intero codebase proprietario di un cliente, o un assistente sempre attivo usato da tutto il team – e il tuo costo unitario è l'elettricità, non i token API. Ogni cliente dopo il primo è puro margine.
Se gestisci dati sensibili:
Questo è l'aspetto che la maggior parte delle persone sottovaluta. Contratti. Documenti legali. Cartelle cliniche. Dati finanziari. Qualsiasi cosa coperta da un NDA che non metteresti mai attraverso un'API pubblica. Sullo Spark, quei dati non attraversano mai la tua rete. Nessun termine di servizio regola una macchina che possiedi completamente.
"I tuoi dati non escono mai dall'edificio" chiude accordi in settori regolamentati che i fornitori cloud semplicemente non possono toccare. Studi legali, cliniche, consulenti finanziari – questi clienti pagheranno un premio significativo per quella garanzia.
Il cambio di mentalità che nessuno menziona:
I prezzi del cloud ti addestrano a razionare il calcolo. Esiti prima di lasciare che un agente esegua un ciclo, prima di rieseguire un archivio completo, prima di ottimizzare su un'idea che potrebbe non funzionare. Ogni esecuzione ha un costo in dollari, quindi ne esegui di meno.
Possiedi la scatola e quell'esitazione scompare. La maggior parte delle volte, il lavoro migliore era dietro quell'esitazione.
6 / Cosa Non è lo Spark
Essere diretti sui limiti:
- Velocità pura – una 5090 è più veloce su qualsiasi cosa entri nei suoi 32 GB di VRAM
- Scala – servire migliaia di utenti simultanei è ancora lavoro da data center
- Modelli all'avanguardia oltre 405B – due Spark collegati gestiscono 405B; oltre, serve hardware diverso
- Utenti con volumi bassi – se spendi 20 $/mese in chiamate API, questo non è lo strumento giusto
La soglia onesta: 1.000+ $/mese in spesa GPU cloud è il punto in cui lo Spark diventa una decisione ovvia. Sotto i 500 $/mese, una scheda consumer o l'accesso API sono la scelta più intelligente. La scatola è dimensionata per carichi di lavoro seri, non per uso occasionale.
7 / Il Ritorno a Diversi Livelli di Spesa
Spesa cloud mensile
Periodo di ammortamento
1.900 $/mese
~6 settimane
1.000 $/mese
~3 mesi
500 $/mese
~6 mesi
200 $/mese
Resta sul cloud
8 / Il Quadro Generale
Nel 2024, eseguire un modello 70B richiedeva un data center o una bolletta cloud da 1.900 $/mese. Nel 2026, richiede una scatola da 2.999 $ grande quanto un tascabile e una presa a muro.
NVIDIA ha prezzato il DGX Spark a 2.999 $ deliberatamente – vogliono che la prossima generazione di prodotti AI sia costruita sul loro silicio, localmente, su larga scala. Jensen ha consegnato personalmente le prime unità a Musk e Altman. Dell, HP, ASUS e Lenovo stanno tutti costruendo le proprie macchine GB10. Lo stack software viene ottimizzato per questo chip praticamente ogni settimana.
Le tariffe GPU cloud non stanno diminuendo. I requisiti di privacy dei dati si stanno inasprendo. I clienti chiedono sempre più spesso dove vadano fisicamente i loro dati prima di firmare qualsiasi cosa.
Le persone che eseguono modelli di classe frontier su una scrivania nel 2026 sembreranno profetiche nel 2028.
L'aritmetica è semplice: 2.999 $ una volta contro 1.900 $ ogni mese. La scatola si ripaga prima della fine del primo trimestre, poi funziona a 10 $/mese per tutto il tempo che ti serve.
Questo è lo scambio. Vorrei averlo fatto un anno fa.
Se è stato utile, segui @cryptowluha
Metti un segnalibro prima che venga sepolto. Se è stato utile, condividilo con una persona che ne ha bisogno.





