Due anni fa, "eseguire un LLM localmente" era un esperimento del fine settimana che finiva in delusione. Scaricavi un modello 13B, guardavi la ventola del tuo portatile impazzire, e ottenevi un token al secondo di output mediocre.
Oggi, nel giugno 2026, questa conversazione è superata. Un Raspberry Pi 5 può eseguire un chatbot coerente. Un MacBook Air può eguagliare la qualità di GPT-3.5 nella maggior parte dei compiti. Una RTX 3090 usata ti darà qualcosa di vicino a GPT-4 per $700.
L'hardware ha recuperato. I modelli sono diventati più piccoli. Gli strumenti sono maturati.
Quindi ora la domanda non è se puoi eseguire un LLM locale. È quale strumento dovresti usare per farlo. E ci sono almeno dodici opzioni serie, con punti di forza sovrapposti, nomi confusi e filosofie molto diverse.
Questa guida fa chiarezza.
Perché eseguire un LLM localmente?
Prima di parlare degli strumenti, le ragioni oneste per scegliere il locale:
- Privacy. I tuoi prompt e i tuoi dati non lasciano mai la tua macchina. Per avvocati, medici, analisti finanziari e chiunque gestisca informazioni sensibili, questo non è un optional.
- Costo. Se usi molto l'AI, i modelli locali si ripagano da soli in pochi mesi. Niente fatturazione per token, niente limiti di velocità.
- Offline. Aerei, scantinati, strutture sicure, regioni con internet scadente: gli LLM locali funzionano dove il cloud non arriva.
- Niente censura. I modelli open-weight non rifiutano compiti benigni a causa di un RLHF eccessivamente cauto.
- Apprendimento. Se vuoi capire davvero come funzionano questi sistemi, eseguirli tu stesso è la strada più veloce.
Le ragioni oneste contro:
- Limite di qualità. A giugno 2026, anche i migliori modelli locali sono indietro rispetto a GPT-5.1 e Claude Opus 4.8 nei compiti di ragionamento più difficili. Stai scegliendo privacy e costo a scapito dell'intelligenza massima.
- Vincolo hardware. Sei limitato da ciò che possiedi. Un modello 7B su un portatile non eguaglierà mai un modello 405B in un data center.
- Costo di configurazione. Anche gli strumenti più facili hanno una curva di apprendimento iniziale.
Per l'80% del lavoro quotidiano – scrivere bozze, riassumere, assistenza alla programmazione, ricerca – i modelli locali sono ora veramente abbastanza buoni. Per il 20% più difficile, tieni anche un abbonamento al cloud.
Il panorama generale
Prima di confrontare gli strumenti, comprendi i livelli. La maggior parte degli strumenti LLM locali è costruita su un motore: llama.cpp. È il motore di inferenza in C/C++ che rende possibile tutto il resto. Ollama, LM Studio, GPT4All, Jan e molti altri usano tutti llama.cpp (o un fork) alla base.
Ciò che differisce tra gli strumenti non è la velocità di inferenza grezza, ma il wrapper. L'esperienza utente, l'API, la gestione dei modelli, il supporto delle piattaforme, la filosofia.
Gli strumenti si dividono approssimativamente in quattro categorie:
Categoria
Cosa sono
Esempi
Motori di inferenza
Il runtime grezzo che carica ed esegue i modelli
llama.cpp, MLX, vLLM
Esecutori CLI
Motore + gestione modelli + API, basati su terminale
Ollama
App desktop
Interfaccia grafica per navigare, scaricare e chattare con i modelli
LM Studio, Jan, GPT4All
Server di produzione
Inferenza ad alto throughput per molti utenti simultanei
vLLM, LocalAI, SGLang
Scegli il tuo livello in base a ciò che vuoi fare.
Gli 8 strumenti che contano, classificati per caso d'uso
1. Ollama - il punto di partenza predefinito per la maggior parte delle persone
Cosa è: Un esecutore LLM locale basato su CLI con un'API REST integrata. Installa, esegui un comando, hai un endpoint compatibile con OpenAI su localhost.
Perché domina: Ogni importante toolchain LLM – LangChain, LlamaIndex, Aider, Continue, Cursor, Zed, Open WebUI – ha un supporto di prima classe per Ollama o funziona subito tramite il livello di compatibilità OpenAI. Se stai automatizzando qualcosa, Ollama è il percorso di minor resistenza.
Hardware: Funziona su Mac (Metal), Windows (CUDA/Vulkan), Linux (CUDA/ROCm) e persino su Raspberry Pi. L'accelerazione GPU è automatica dove supportata.
Vantaggi:
- Configurazione più semplice possibile:
ollama pull llama3.2e sei operativo - La modalità headless funziona su server e Docker immediatamente
- Supporto massiccio dell'ecosistema – praticamente ogni IDE e strumento AI si integra con esso
- Licenza MIT, nessuna telemetria
Svantaggi:
- Nessuna interfaccia grafica. Solo terminale per impostazione predefinita (le interfacce web esistono come progetti separati)
- Il supporto Vulkan predefinito non è ancora presente – necessita di compilazione personalizzata per AMD su Windows
- L'uso del disco può aumentare se collezioni modelli (usa ~4,6 GB di per sé più i modelli)
Ideale per: Sviluppatori, chiunque costruisca app sopra LLM locali, distribuzioni su server, flussi di lavoro di automazione.
Salta se: Vuoi un'esperienza GUI raffinata per chat occasionali.
2. LM Studio - l'esperienza desktop rifinita
Cosa è: Un'app desktop completa per scoprire, scaricare ed eseguire modelli. Interfaccia bellissima, visualizzazione dello streaming dei token in tempo reale, chat UI integrata, server compatibile con OpenAI attivabile.
Perché piace: È il percorso più semplice da "Ho sentito parlare di LLM locali" a "Sto chattando con uno". Il browser di Hugging Face all'interno dell'app ti permette di filtrare per dimensione del file e quantizzazione, vedere le schede dei modelli e scaricare con barre di avanzamento.
Hardware: Mac (con accelerazione MLX nativa su Apple Silicon – un vero vantaggio), Windows, Linux. Ha supporto Vulkan integrato, che è importante se sei su AMD.
Vantaggi:
- La migliore interfaccia grafica per la scoperta dei modelli e la chat
- Il supporto MLX nativo su Apple Silicon offre un reale vantaggio prestazionale sui Mac
- Server API integrato (compatibile con OpenAI) per quando vuoi scrivere codice contro di esso
- Le versioni recenti (0.3.5+) hanno aggiunto la modalità headless "Local LLM Service" e il caricamento JIT dei modelli
- Supporto MCP aggiunto nella 0.4.0 – connetti strumenti in stile Claude al tuo modello locale
Svantaggi:
- Closed source. Analisi anonime attivate per impostazione predefinita (disattivabile nelle impostazioni)
- Più pesante su disco e RAM rispetto agli strumenti CLI (app Electron)
- La modalità server è opzionale e richiede l'app in esecuzione – non ideale per distribuzioni server headless reali
- La CLI (lms) è funzionale ma meno ricca di funzionalità di quella di Ollama
Ideale per: Persone che vogliono esplorare visivamente gli LLM locali, utenti Mac (MLX è la funzionalità killer), ingegneri dei prompt che iterano sui system prompt.
Salta se: Devi distribuire su un server headless, o l'open source è un requisito tassativo.
3. llama.cpp - il motore che tutti gli altri usano
Cosa è: La libreria di inferenza in C/C++ che alimenta la maggior parte dell'ecosistema LLM locale. Creata originariamente per eseguire modelli LLaMA su CPU consumer, ora è uno standard del settore.
Perché è importante: Eseguire llama.cpp direttamente salta il sovraccarico del wrapper. È l'opzione più snella – un confronto recente lo ha cronometrato a meno di 90 MB su Windows, contro ~4,6 GB di Ollama con tutte le sue dipendenze in bundle.
Hardware: Funziona su tutto. x86, ARM, Apple Silicon, NVIDIA CUDA, AMD ROCm, Intel oneAPI, Vulkan, OpenCL. Inclusi Raspberry Pi, telefoni Android (tramite Termux) e vecchi portatili.
Vantaggi:
- Impronta minuscola, zero dipendenze non necessarie
- Massime prestazioni e personalizzazione
- Il backend Vulkan funziona su tutti i vendor GPU – percorso migliore per AMD su Windows
- Include una CLI (llama-cli), un server (llama-server) e una web UI di base
- Licenza molto permissiva
Svantaggi:
- Curva di apprendimento più ripida – flag, formati di quantizzazione, opzioni di compilazione
- Nessun registro modelli amichevole – trovi e scarichi i GGUF da solo (di solito da Hugging Face)
- Nessuna "magia pronta all'uso" – configuri tutto
Ideale per: Utenti avanzati, utenti AMD su Windows, chiunque distribuisca su hardware embedded o insolito, sviluppatori che vogliono il minimo overhead.
Salta se: Vuoi un percorso veloce per chattare e non ti piace leggere la documentazione.
4. GPT4All - lo specialista per hardware datato
Cosa è: Un'app desktop di Nomic AI ottimizzata specificamente per essere eseguita su macchine senza accelerazione GPU.
Perché esiste: La maggior parte degli strumenti LLM locali presuppone che tu abbia almeno una GPU decente. GPT4All ribalta questa situazione – è progettato per vecchi portatili, macchine fornite dal lavoro e qualsiasi computer dove CUDA non è disponibile.
Hardware: Funziona su CPU senza accelerazione GPU ed è ottimizzato per macchine con 8 GB di RAM o meno. Requisiti hardware: 4 GB di RAM minimo, 8 GB consigliati. Qualsiasi CPU degli ultimi 5 anni.
Vantaggi:
- Il requisito hardware più basso di qualsiasi strumento in questa guida
- Interfaccia grafica rifinita, facile onboarding per utenti non tecnici
- Forte attenzione alla privacy (solo telemetria opt-in)
- Multipiattaforma (Mac, Windows, Linux)
Svantaggi:
- Libreria di modelli più piccola di Ollama o LM Studio
- L'API è meno matura rispetto ai concorrenti
- Il limite di prestazioni è basso – lo supererai se aggiorni l'hardware
Ideale per: Utenti con hardware vecchio, macchine fornite dal lavoro senza diritti di amministratore per installare driver, scuole, organizzazioni che necessitano di AI locale accessibile con budget limitati.
Salta se: Hai una GPU moderna – stai lasciando prestazioni sul tavolo.
5. Jan AI - l'alternativa open-source a ChatGPT
Cosa è: Un'app desktop che mira a essere un'alternativa completamente locale e completamente open-source a ChatGPT. Interfaccia pulita, supporto multi-modello, integrazioni cloud opzionali se vuoi un uso ibrido.
Perché si distingue: È l'opzione più esplicitamente incentrata sulla privacy. Jan AI e Ollama non raccolgono telemetria (open source MIT). Costruito per utenti che vogliono la certezza, non solo dichiarazioni, che nulla lasci la loro macchina.
Hardware: Mac, Windows, Linux. Più leggero di LM Studio ma più pesante di GPT4All.
Vantaggi:
- Completamente open source, completamente verificabile
- Zero telemetria per impostazione predefinita
- Aspetto pulito da app di chat – il più vicino a "ChatGPT ma locale"
- Supporta provider di modelli (locale + cloud opzionale) se vuoi l'ibrido
- Server API integrato
Svantaggi:
- Ecosistema più piccolo di Ollama o LM Studio
- Alcune funzionalità avanzate (MCP, flussi di agenti avanzati) sono in ritardo rispetto ai leader
- La libreria di modelli non è così completa come il browser HuggingFace di LM Studio
Ideale per: Utenti attenti alla privacy, professionisti UE che lavorano sotto GDPR, chiunque voglia un'esperienza simile a ChatGPT con verificabilità rigorosa.
Salta se: Hai bisogno di funzionalità all'avanguardia come l'integrazione MCP oggi, o la più ampia selezione possibile di modelli.
6. vLLM - il re del throughput di produzione
Cosa è: Un server di inferenza ad alte prestazioni progettato per servire molti utenti concorrenti da una singola GPU. Creato a UC Berkeley, ora la scelta de facto per API LLM self-hosted in produzione.
Perché è importante: La maggior parte degli strumenti locali ottimizza per la latenza del singolo utente. vLLM ottimizza per il throughput. La sua tecnica PagedAttention riduce la frammentazione della memoria del 50%+ e offre 2-4x più richieste concorrenti rispetto alle alternative sullo stesso hardware.
Hardware: Principalmente Linux + NVIDIA. Territorio A100/H100 per distribuzioni serie, anche se funziona su GPU consumer per lo sviluppo.
Vantaggi:
- Throughput 2-4x superiore rispetto al serving ingenuo sulla stessa GPU
- Amichevole per Kubernetes, metriche integrate, API compatibile con OpenAI
- Parallelismo tensoriale su più GPU
- Supporta modelli multimodali (LLaVA, Qwen-VL)
- La scelta giusta se stai servendo un LLM agli utenti
Svantaggi:
- Solo Linux + NVIDIA. Se sei su Mac o Windows, questo non fa per te
- Configurazione più complessa, basata sulla configurazione
- Esagerato per flussi di lavoro a utente singolo
Ideale per: Aziende che ospitano da sole un'API LLM, chiunque serva AI locale a più utenti, team di infrastruttura.
Salta se: Sei un singolo utente su un portatile. Usa Ollama invece.
7. LocalAI - l'hub API universale
Cosa è: Un livello di orchestrazione compatibile con OpenAI che può instradare le richieste a più backend di inferenza, gestire modelli di testo/immagine/audio/video e fungere da middleware tra le tue app e qualsiasi motore di inferenza tu stia effettivamente usando.
Perché è utile: Se vuoi una superficie API singola che astrae qualsiasi backend tu stia eseguendo (llama.cpp oggi, vLLM domani, un server MLX l'anno prossimo), LocalAI è il wrapper.
Hardware: Linux preferito, amichevole per Docker.
Vantaggi:
- Endpoint singolo compatibile con OpenAI indipendentemente dal backend
- Multimodale (testo, generazione immagini, audio, embeddings, rerank, video)
- Sostituto diretto per l'API di OpenAI nelle app esistenti
- Forte per scenari middleware aziendali
Svantaggi:
- Significativamente più complesso di Ollama per configurazioni a utente singolo
- La documentazione può essere scarsa
- Community più piccola di Ollama o LM Studio
Ideale per: Distribuzioni aziendali, team che costruiscono prodotti che necessitano di un'API locale stabile attraverso backend mutevoli, chiunque serva AI multimodale localmente.
Salta se: Stai solo cercando di chattare con un modello.
8. MLX (nativo Apple Silicon) - la scelta per utenti Mac esperti
Cosa è: Il framework di machine learning di Apple, ottimizzato per l'architettura di memoria unificata di Apple Silicon. LM Studio lo usa nativamente; puoi anche usarlo direttamente tramite Python.
Perché i Mac stanno silenziosamente dominando: La memoria unificata significa che un MacBook Pro M4 Max con 128 GB può eseguire modelli con 70 miliardi di parametri che richiederebbero una GPU dedicata da $5.000 su PC. La migliore esperienza LLM locale nel 2026 è su Apple Silicon, punto. La memoria unificata significa che i modelli che richiederebbero una GPU dedicata su PC possono essere eseguiti su un Mac usando RAM condivisa e memoria GPU.
Hardware: Solo Apple Silicon (da M1 in poi).
Vantaggi:
- Miglior rapporto prestazioni/prezzo su hardware Mac
- Nativo per la piattaforma – nessun livello di traduzione goffo
- La combinazione di MLX + LM Studio dà agli utenti Mac un vero vantaggio
- L'architettura di memoria unificata rende i modelli grandi accessibili senza GPU aziendali
Svantaggi:
- Solo Mac
- Ecosistema più piccolo di llama.cpp
- Richiede LM Studio o una certa dimestichezza con Python per essere utilizzato
Ideale per: Chiunque sia seriamente intenzionato a usare LLM locali su un Mac.
Salta se: Non sei su Apple Silicon.
L'abbinamento hardware-strumento
Ecco la domanda pratica che la maggior parte degli articoli evita: cosa dovrei effettivamente installare in base a ciò che ho?
Se hai un Raspberry Pi 5 (8 GB o 16 GB)
Usa: Ollama (Raspberry Pi OS lo supporta nativamente) Modelli da provare: TinyLlama 1.1B, Phi-3 Mini 3.8B, Gemma 3 1B Aspettativa realistica: 2-8 token/sec a seconda della dimensione del modello. Usabile per chatbot, automazione domestica, semplici Q&A. Non per programmazione seria o ragionamento lungo.
Se hai un portatile vecchio (Intel i5, nessuna GPU, 8 GB di RAM)
Usa: GPT4All Modelli da provare: Phi-3 Mini, Llama 3.2 1B, TinyLlama Aspettativa realistica: Lento ma funzionale. Meglio per query brevi che per generazione lunga.
Se hai un portatile moderno con grafica integrata (16 GB di RAM, nessuna GPU dedicata)
Usa: LM Studio (modalità CPU) o Ollama Modelli da provare: Llama 3.2 3B, Gemma 3 4B, Qwen 3 7B (con pazienza) Aspettativa realistica: Buono per chat, bozze, riassunti. 5-15 token/sec su modelli piccoli.
Se hai un MacBook Air M2/M3/M4
Usa: LM Studio con backend MLX Modelli da provare: Llama 3.2 8B, Qwen 3 14B, Mistral Nemo Aspettativa realistica: Sorprendentemente veloce – la memoria unificata di Apple Silicon e il Neural Engine danno più del loro peso. 20-40 token/sec su modelli di medie dimensioni.
Se hai un MacBook Pro M3/M4 Max (36 GB+ di RAM)
Usa: LM Studio + MLX, o Ollama Modelli da provare: Llama 3.3 70B (con 64 GB+), Qwen 3 32B, DeepSeek-V3 distillato Aspettativa realistica: Veramente usabile per lavoro serio. Mac Studio M4 Max (128 GB di memoria unificata): esegui Llama 3.3 70B a ~20 t/s mantenendo aperte altre app.
Se hai un desktop Windows/Linux con GPU NVIDIA (RTX 3060–4070)
Usa: Ollama (più facile) o llama.cpp (più performante) Modelli da provare: Llama 3.2 8B, Qwen 3 14B, Mistral 7B Aspettativa realistica: Inferenza veloce, 30-80 token/sec su modelli quantizzati che stanno nella VRAM.
Se hai una GPU AMD su Windows
Usa: llama.cpp con backend Vulkan (più affidabile) o LM Studio (Vulkan integrato) Perché: Il supporto ROCm per AMD su Windows è praticamente inesistente. Vulkan è la salvezza. Aspettativa realistica: Le prestazioni sono significativamente inferiori a NVIDIA ma molto migliori della sola CPU.
Se hai una workstation seria (RTX 4090, RTX 5090, multi-GPU)
Usa: vLLM per il serving, Ollama o llama.cpp per uso personale Modelli da provare: Llama 3.3 70B, Qwen 3 72B, DeepSeek-V3 Aspettativa realistica: Qualità quasi cloud per la maggior parte dei compiti. Qui è dove l'AI locale smette di essere un compromesso.
Se stai eseguendo la produzione per un team (più utenti)
Usa: vLLM o LocalAI Hardware: A100/H100 ideale, RTX 4090 minima per piccoli team Aspettativa realistica: 10-50 utenti concorrenti su una singola A100 a seconda della dimensione del modello.
Matrice di confronto rapido

Il verdetto onesto: cosa installare realmente
Se vuoi che tagli corto e ti dica solo cosa fare:
Per la maggior parte delle persone: installa sia Ollama che LM Studio. Usa LM Studio per scoprire e testare i modelli con la sua interfaccia grafica. Usa Ollama come runtime effettivo a cui si collegano i tuoi script, IDE e app. I due si completano a vicenda – non sono concorrenti. Usa LM Studio sul tuo portatile per la scoperta e l'iterazione dei prompt, ed esegui Ollama sul server – o in Docker sulla tua workstation – per tutto ciò che riguarda l'automazione.
Per hardware vecchio: GPT4All. Nient'altro ha senso.
Per un Raspberry Pi o dispositivo edge: Ollama. Il Pi 5 con 16 GB e un buon modello 3B quantizzato è veramente usabile.
Per utenti con GPU AMD: llama.cpp con Vulkan, o LM Studio se vuoi un'interfaccia grafica. Salta Ollama su Windows per ora.
Per utenti Mac con Apple Silicon: LM Studio con MLX. Il backend MLX è la funzionalità killer e solo LM Studio lo presenta in modo pulito.
Per i massimalisti della privacy: Jan AI. Completamente open source, zero telemetria, GDPR-friendly.
Per servire più utenti: vLLM su Linux con NVIDIA. Nient'altro compete sul throughput.
Per personalizzazione profonda o distribuzione embedded: llama.cpp diretto. La curva di apprendimento ne vale la pena.
Cosa ci aspetta dopo
Tre tendenze da osservare nel resto del 2026:
- MCP diventa standard. Il Model Context Protocol – lo standard per connettere strumenti agli LLM – è già in LM Studio. Ollama seguirà. Entro il quarto trimestre, ogni strumento locale serio lo supporterà nativamente, rendendo i modelli locali sostituti diretti di Claude nei flussi di lavoro agentici.
- Il mobile decolla. I modelli on-device di Apple, llama.cpp su Android tramite Termux e i miglioramenti nella quantizzazione significano che un'inferenza locale seria sta arrivando sui telefoni. Non "riassumi questa email" – veri flussi di lavoro agentici.
- Il divario con il cloud si restringe ma non si chiude. Modelli open-weight come Llama 4 e Qwen 4 continueranno a ridurre il divario di qualità. Ma la frontiera assoluta (Claude Opus 4.7, GPT-5.1, Gemini 3) rimarrà solo cloud per il prossimo futuro, perché il vantaggio di scala è strutturale.
In conclusione
Gli LLM locali non sono più un progetto da laboratorio. Sono un'opzione reale e pratica che complementa, non sostituisce, l'AI nel cloud. Per lavoro che richiede privacy, scenari offline, uso quotidiano intenso e apprendimento, la scelta locale è quella giusta. Per i compiti di ragionamento assolutamente più difficili, il cloud vince ancora.
La buona notizia è che gli strumenti sono finalmente maturati al punto che non serve un dottorato per configurarli. Scegli lo strumento corrispondente al tuo hardware e caso d'uso dall'elenco sopra. Installalo stasera. Entro il fine settimana, avrai un assistente AI privato in esecuzione sulla tua macchina.
Questo è quello che nessuno ti sta dicendo: nel 2026, la domanda non è se puoi eseguire un LLM utile localmente. È quale flusso di lavoro dovresti affidargli.
Se è stato utile – segui il mio canale Telegram:





