Da qualche parte, in questo momento, uno sviluppatore paga 200 dollari al mese per l'AI e non ha mai fatto i conti. ChatGPT Plus. Claude Pro. Cursor. Costi delle API che salgono silenziosamente ogni mese. Rinnova per sempre, e per sempre è un tempo lungo per affittare qualcosa che potresti possedere.
C'è un altro modo di pensarci. Una scatola che sta in casa tua, esegue l'AI localmente, costa pochi dollari al mese di elettricità, tiene i tuoi dati sulla tua macchina e non invia mai un solo byte al server di qualcun altro.
L'AI locale nel 2026 non è il triste compromesso di due anni fa. Quantizzazione migliore, architetture di modello più snelle e chip con memoria unificata fanno sì che una macchina sulla tua scrivania gestisca ora forse l'80% del lavoro AI quotidiano: scrivere, assistenza alla programmazione, analisi di documenti, riassunti, classificazione, automazioni, rispondere a domande sui tuoi file. L'altro 20%, il ragionamento avanzato e la programmazione all'avanguardia, appartiene ancora al cloud. Ma quel 20% non giustifica un conto da 200 dollari quando una scatola acquistata una volta sola copre il resto.
Questa è la scala. Dieci gradini, dalla macchina che già possiedi a un supercomputer da scrivania, e i compromessi onesti a ogni passo.
L'idea che cambia tutto
Non stai comprando velocità. Stai comprando memoria.
Ogni storia "non funziona" riconduce allo stesso muro: un modello che non entrava nella memoria della scatola. Un modello o si carica o non si carica. La velocità decide solo come ci si sente una volta che è in esecuzione; la memoria decide se funziona del tutto.
Quindi l'intera scala è in realtà una scala di memoria. 8GB eseguono un modello da 7B. 24GB eseguono comodamente un modello da 32B. 128GB eseguono un modello da 70B e iniziano a flirtare con quelli veramente grandi. Leggi ogni gradino qui sotto attraverso questa lente, e nota lo schema: le scatole che arrivano più lontano sono quelle con memoria unificata, dove CPU e GPU condividono un unico grande pool invece di litigare per una piccola porzione di VRAM recintata.
Un avvertimento prima delle specifiche, valido per tutta la lista: una carenza globale di DRAM sta spingendo i prezzi della memoria verso l'alto nel 2026, non verso il basso. Ogni numero qui è approssimativo e in aumento, il che è un argomento per comprare la scatola che userai effettivamente piuttosto che aspettare un calo che potrebbe non arrivare.
La scala
Gradino 1. La macchina che già possiedi ($0)
Prima di spendere qualsiasi cosa, prova il flusso di lavoro su ciò che è già sulla tua scrivania. Qualsiasi laptop con 8GB di RAM esegue un modello da 7B tramite Ollama. Non sarà veloce, ma risponde all'unica domanda che conta: l'AI locale è abbastanza buona per quello che fai veramente? Passa un weekend qui prima di spendere un dollaro altrove.

Gradino 2. Raspberry Pi 5, 16GB (circa $120)
Il gradino del smanettone. Un Pi 5 con 16GB eseguirà modelli da 1B a 3B tramite Ollama, lentamente. Questo non è un driver quotidiano, è una prova di concetto che puoi lasciare accesa in un cassetto: un minuscolo assistente sempre attivo, un cervello per l'home automation, un progetto del weekend. Compralo per imparare, non per lavorare.

Gradino 3. NVIDIA Jetson Orin Nano Super ($249)
Il punto di ingresso serio più economico. Una vera GPU NVIDIA in una scatola più piccola di un portafoglio.
1Prestazioni AI: 67 TOPS2GPU: Ampere da 1024 core3RAM: 8GB LPDDR5 (condivisa)4Consumo: 7-25W5Funziona bene: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B
67 TOPS eseguono un modello da 7B in modo privato e per sempre. La classe 7B è abbastanza veloce da sembrare istantanea e abbastanza buona per la maggior parte dei compiti quotidiani. Non toccherà nulla sopra i 7B o contesti lunghi che superano gli 8GB, ma a $100/mese di abbonamenti si ripaga in dieci settimane.

Gradino 4. Apple Mac mini M4 (da $599)
Il server AI domestico silenzioso predefinito, grazie alla memoria unificata. Su un PC normale, la VRAM della GPU è un muro duro. Apple condivide la memoria tra CPU e GPU, quindi il Mac mini esegue modelli più grandi di quanto suggerisca la sua scheda tecnica, rimane quasi silenzioso e consuma poca energia.
1Chip: Apple M42Memoria unificata: 16-32GB (CPU + GPU condivisa)3Consumo: 10-30W sotto carico4Costo elettrico 24/7: circa $3-8/mese5Funziona bene: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium
Fa tutto ciò che fa il Jetson, più modelli più grandi, contesto più lungo e diversi servizi contemporaneamente. Questa è la scatola che la gente lascia accesa 24 ore su 24 come backend per le proprie automazioni. I $599 sono la base, però, e Apple fa pagare cara la memoria. Per l'AI locale, la memoria è il punto, quindi prezza la configurazione di cui hai veramente bisogno, non il prezzo di listino.

Gradino 5. RTX 3090 usata, 24GB (circa $700 per la scheda)
La leggenda del valore che si rifiuta di morire. Sei anni e ancora la migliore VRAM-per-dollaro sul mercato consumer. Una 3090 usata ti dà 24GB di memoria veloce per circa $700, abbastanza per eseguire modelli da 24B a 32B con throughput reale, con pieno supporto CUDA quindi ogni strumento funziona subito.
1VRAM: 24GB GDDR6X2Banda: ~936 GB/s3Prezzo usato: ~$600-800 (solo scheda)4Funziona bene: Qwen 32B, Llama 3.1 8B-70B (quantizzato), la maggior parte della classe 32B
L'onesto asterisco: una GPU non è un computer. Hai bisogno di un PC host intorno, quindi budget altri $400-$600 per il resto della macchina. Ma se hai già un desktop con uno slot libero e un alimentatore abbastanza grande, nient'altro su questa scala ti dà 24GB a così poco prezzo.

Gradino 6. AMD Radeon RX 7900 XTX, 24GB (circa $900 per la scheda)
Gli stessi 24GB della 3090, nuova, con garanzia, e il software AMD ha finalmente raggiunto il livello. Su ROCm 7.x, la 7900 XTX esegue Llama 3.1 8B a circa 96 token al secondo, circa tre quarti di una RTX 4090 a una frazione del prezzo. Per pura VRAM-per-dollaro su hardware nuovo, nulla di NVIDIA la tocca a livello consumer.
1VRAM: 24GB GDDR62Software: ROCm 7.x (supporto di prima classe)3Prezzo nuovo: ~$899-1.400 (solo scheda)4Funziona bene: Llama 3.1 8B (~96 tok/s), classe 32B quantizzato
Il problema è lo stesso che segue AMD ovunque: ROCm ha chiuso gran parte del divario con CUDA, ma alcuni strumenti presumono ancora NVIDIA per impostazione predefinita. Per Ollama e Open WebUI funziona bene oggi. Per stack di fine-tuning esotici, aspettati qualche passaggio manuale in più.

Gradino 7. AMD Ryzen AI Max+ 395 "Strix Halo," 128GB (circa $1.999)
Il punto di forza del 2026, e la scatola che la maggior parte di queste liste dimentica. Il chip Strix Halo di AMD abbina una CPU Zen 5 a 16 core con una grande iGPU RDNA 3.5 e fino a 128GB di memoria unificata in una scatola piccola, per circa quanto costa un desktop NVIDIA con un quarto della memoria.
1Chip: Ryzen AI Max+ 395 (16-core Zen 5)2GPU: Radeon 8060S (40-core RDNA 3.5)3NPU: XDNA 2, 50 TOPS (~126 TOPS a livello di sistema)4Memoria unificata: fino a 128GB LPDDR5X (~96GB utilizzabili come VRAM)5Prezzo: ~$1.999 per 128GB / 2TB6Funziona bene: Llama 3.3 70B, Mixtral, la maggior parte dei modelli classe 70B
Lo compri in due modi. Il GMKtec EVO-X2 è un mini PC 128GB già pronto a circa $1.999. Il Framework Desktop è lo stesso chip in un telaio riparabile e aggiornabile, a partire da $1.999 per la scheda e circa $2.850 completamente assemblato. In entrambi i casi carichi un modello da 70B a velocità di conversazione, cosa che nulla sotto questo gradino può fare. La maturità di ROCm è il compromesso, come al Gradino 6.

Gradino 8. NVIDIA RTX 5090, 32GB (circa $3.000 per la scheda)
La cosa più veloce che una persona normale può mettere in un normale tower. 32GB della memoria consumer più rapida mai realizzata, e una velocità grezza che lascia indietro tutto ciò che sta sotto. Questo è il gradino per chi vuole inferenza locale di classe frontier e training occasionale, e a cui importa più dei token al secondo che dei dollari per gigabyte.
1VRAM: 32GB GDDR72Prezzo nuovo: ~$3.000+ (solo scheda)3Funziona bene: 32B a velocità, 70B quantizzato, modelli di immagini e video
Il calcolo è brutale, però. Costa da tre a quattro volte una 3090 usata per 8GB di memoria in più, più un PC host aggiuntivo. Comprala perché hai bisogno della velocità e del margine extra, non perché è efficiente. Non lo è.

Gradino 9. Apple Mac Studio M3 Ultra, 96GB (da $3.999)
La grande workstation silenziosa a memoria unificata. Il Mac Studio raggruppa fino a 96GB tra CPU e GPU con accelerazione Metal, esegue modelli grandi quasi in silenzio e lo fa in una scatola che sta su una scrivania senza una curva di ventola da motore a reazione.
1Chip: M3 Ultra (fino a CPU a 32 core / GPU a 80 core)2Memoria unificata: fino a 96GB3Prezzo: da $3.9994Funziona bene: Modelli classe 70B, contesto lungo, servizi multipli
Vale la pena saperlo onestamente: Apple ha ritirato la configurazione da 512GB all'inizio del 2026 quando la carenza di DRAM ha colpito, quindi 96GB è ora il tetto massimo dove prima arrivava molto più in alto. Tuttavia, per una macchina silenziosa che funziona tutto il giorno, esegue modelli grandi e funge anche da tuo computer vero, poche cose sono piacevoli da usare quanto questa.

Gradino 10. NVIDIA DGX Spark, 128GB ($3.999 - $4.699)
Il desktop che pensa di essere un datacenter. Per il fine-tuning di modelli aperti, ospitare assistenti da 70B-plus ed eseguire pipeline di inferenza che necessitano di un throughput reale.
1Chip: GB10 Grace Blackwell2Throughput AI: 1 PFLOP3Memoria unificata: 128GB LPDDR5x4Archiviazione: 4TB Gen5 NVMe5Consumo: 150-240W sotto carico6Ideale per: Modelli 70B-200B, fine-tuning, inferenza di produzione
128GB di memoria unificata caricano modelli che una GPU consumer non può nemmeno aprire, e due unità collegate raggiungono il territorio dei 400B. Onestà sul prezzo: è stato lanciato a $3.999 nell'ottobre 2025 e da allora è stato maggiorato a circa $4.699 a causa della carenza di memoria (Tom's Hardware). Rispetto alla scatola Strix Halo al Gradino 7, costa circa il doppio per gli stessi 128GB. Stai pagando per la maturità di CUDA e il throughput, non per più memoria.

Il conto onesto
1Spesa AI mensile tipica:2ChatGPT Plus $203Claude Pro $204Cursor Pro $205Costi API $50-2006Totale $110-260 / mese78AI locale mensile:9Hardware $0 (già acquistato)10Elettricità $2-1511API $012Totale $2-15 / mese
A $100/mese in abbonamenti, un Jetson da $249 si ripaga in dieci settimane, un Mac mini da $599 in sei mesi, un build con 3090 usata in meno di un anno, una scatola Strix Halo da $2.000 in circa diciotto mesi, e i gradini da $4.000-plus solo se stavi già bruciando noleggi di GPU cloud a quattro cifre al mese.
Ora la parte che l'hype salta sempre. La scatola è un costo irrecuperabile, e si "ripaga" solo se avresti genuinamente continuato a pagare l'abbonamento. Comprare una macchina da $2.000 per risparmiare $20 al mese è un affare peggiore dell'abbonamento, non migliore. Il gradino giusto è quello che corrisponde al tuo utilizzo reale, non alla versione fantastica di esso.
Qual è il tuo gradino
Uso quotidiano leggero e curiosità: inizia dal Gradino 1, poi compra il Jetson. Un assistente silenzioso sempre attivo per una casa o una piccola impresa: il Mac mini. Il percorso più economico verso veri 24GB e modelli 32B: una 3090 usata, o la RX 7900 XTX se la vuoi nuova con garanzia e non ti dispiace ROCm. La migliore esperienza 70B senza soldi da datacenter: la scatola Strix Halo. Massima velocità consumer: la RTX 5090. Una workstation silenziosa con tanta memoria in cui vivi anche tu: il Mac Studio. Fine-tuning e pipeline di produzione: il DGX Spark.
La configurazione che richiede un pomeriggio
Il processo è identico su ogni gradino.
1. Installa Ollama. Open source, trasforma qualsiasi modello in un'API locale che parla il linguaggio di OpenAI.
1curl -fsSL https://ollama.com/install.sh | sh
2. Scarica un modello dimensionato per la memoria della tua scatola.
1# Jetson 8GB o Mac mini 16GB:2ollama pull llama3.234# 3090 / 7900 XTX 24GB:5ollama pull qwen2.5:32b67# Strix Halo / DGX Spark 128GB:8ollama pull llama3.3:70b
3. Cambia una riga nel codice che già hai.
1# Prima, pagando per richiesta:2client = OpenAI(api_key="sk-...")34# Dopo, locale e gratuito:5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
Il tuo codice funziona allo stesso modo. Niente lascia la macchina, niente costa soldi per richiesta.
4. (Opzionale) Aggiungi un'interfaccia browser con Open WebUI, e avrai un ChatGPT privato su localhost:3000.
1docker run -d -p 3000:8080 \2 --add-host=host.docker.internal:host-gateway \3 -v open-webui:/app/backend/data \4 ghcr.io/open-webui/open-webui:main
Cosa eseguirci effettivamente sopra
L'hardware è metà della decisione. Il modello è l'altra metà. Una mappa approssimativa per il 2026:
Piccolo e veloce (sta in 8-16GB): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B. Ottimo per bozze, classificazione e domande e risposte sui tuoi appunti. Il livello cavallo di battaglia (sta in 24GB): Qwen 2.5 32B e Llama quantizzato, abbastanza potenti per un vero aiuto nella programmazione e nel lavoro con i documenti. Il livello pesante (richiede 64-128GB): Llama 3.3 70B e le grandi varianti Qwen e Mixtral, dove l'output locale inizia a sembrare vicino a un modello cloud per le attività quotidiane.
La quantizzazione è la leva silenziosa alla base di tutto questo. Un modello da 70B con una quantizzazione a 4 bit sta dove la versione a piena precisione non ci entrerebbe mai, con un costo di qualità piccolo e solitamente accettabile. Q4-Q6 è l'intervallo sensato per la maggior parte delle persone. Al di sotto, la qualità cala più velocemente di quanto valgano i risparmi di memoria.
Cosa costruisci una volta che funziona
Per uso personale copre le cose quotidiane per pochi dollari al mese. La parte interessante è l'automazione aziendale, dove colleghi il modello locale a n8n, lo strumento open source che lo collega a Telegram, email, calendario, CRM e centinaia di servizi. Ognuna di queste funziona senza che nulla esca dal tuo edificio e senza alcun costo per token:
1Centralinista AI:2messaggi del cliente su Telegram -> n8n li riceve -> modello locale legge l'intento3-> calendario controlla la disponibilità -> prenotazione confermata45Analisi di documenti:6carica 50 PDF -> modello locale li legge tutti -> estrae i fatti chiave7-> scrive un report strutturato89Brief giornaliero:10trigger alle 7:00 -> modello legge i tuoi appunti e compiti -> riassume ciò che conta11-> lo invia al tuo telefono1213Arricchimento lead:14nuova riga in un foglio di calcolo -> modello ricerca l'azienda -> scrive un'apertura su misura15-> lo mette in coda per la tua revisione1617Riciclo di contenuti:18una lunga registrazione -> modello trascrive e taglia -> scrive i post19-> salva bozze per la tua approvazione2021Smistamento posta:22nuova email -> modello smista, etichetta e scrive una bozza di risposta -> tu premi invia o modifichi
Per il lavoro sensibile alla privacy, smette di essere una decisione di costo e diventa l'unica possibile. Documenti legali, cartelle cliniche, dati finanziari, qualsiasi cosa sotto NDA non ha nulla a che fare su un'API di terze parti. L'AI locale lo elabora sulla tua macchina e non lo lascia mai.
Cosa va effettivamente storto
Il 20% è reale. I modelli frontier vincono ancora sul ragionamento difficile, la programmazione all'avanguardia e la ricerca dove conta la singola risposta migliore. L'AI locale è il cavallo di battaglia affidabile, privato e sempre acceso per l'altro 80%, non un sostituto per tutto. Tieni un abbonamento cloud per il difficile 20% ed esegui il resto a casa, e avrai entrambi.
La memoria è il tetto, non i TOPS. Compra per la dimensione del modello che vuoi eseguire, e ricorda che le scatole con memoria unificata arrivano più lontano di un PC con specifiche corrispondenti e VRAM separata.
Una GPU non è un computer. I gradini 3090, 7900 XTX e 5090 hanno tutti bisogno di una macchina host intorno. Il prezzo della scheda non è il prezzo del sistema, quindi aggiungi $400-$600 prima di confrontarlo con un mini PC già pronto.
I prezzi stanno salendo. La carenza di DRAM ha già fatto aumentare il DGX Spark del 18% e ha costretto Apple a ritirare il suo Mac Studio da 512GB. Il buon affare di oggi potrebbe costare di più il prossimo trimestre.
AMD fa risparmiare soldi e costa tempo. Strix Halo e la 7900 XTX ti danno la maggior memoria per dollaro, ma ROCm è ancora indietro rispetto a CUDA per quanto riguarda gli strumenti chiavi in mano. Va bene per Ollama oggi, ma serve più pazienza per training pesanti.
Calore, rumore e quantizzazione sono la stampa fine. I build con GPU grandi sono rumorosi e caldi. La quantizzazione aggressiva risparmia memoria ma mangia la qualità se la spingi troppo oltre. Nessuno dei due è un rompicapo, ma nessuno li menziona nel discorso di vendita.
Due cose da fare ora
Prova gratis prima. Installa Ollama sul computer che già possiedi ed esegui un modello da 7B questo weekend. Qualsiasi macchina con 8GB lo fa. Prova il flusso di lavoro prima di spendere un centesimo in hardware.
Poi compra un gradino sopra le tue reali esigenze, non cinque. Le persone che hanno impostato silenziosamente l'AI locale nel 2025 sembreranno molto avanti rispetto alla curva entro il 2027, mentre i prezzi del cloud continueranno a salire e l'hardware locale continuerà a migliorare. La maggior parte delle persone continuerà a pagare $200 al mese per abitudine. Alcuni spenderanno un pomeriggio questa settimana e non invieranno mai più un byte al server di qualcun altro.
Analizzo strumenti AI e i soldi che si fanno con loro regolarmente. Seguimi per il prossimo, e unisciti al mio Telegram: https://t.me/+lzSPoQ0svRU1ZWZi





