Hace dos años, "ejecutar un LLM localmente" era un experimento de fin de semana que terminaba en decepción. Descargabas un modelo de 13B, escuchabas el ventilador de tu portátil gritar y obtenías un token por segundo de resultados mediocres.
Hoy, en junio de 2026, esa conversación ha terminado. Una Raspberry Pi 5 puede ejecutar un chatbot coherente. Un MacBook Air iguala la calidad de GPT-3.5 en la mayoría de las tareas. Una RTX 3090 usada te dará algo cercano a GPT-4 por 700 dólares.
El hardware se puso al día. Los modelos se hicieron más pequeños. Las herramientas maduraron.
Así que ahora la pregunta no es puedes ejecutar un LLM local. Es qué herramienta deberías usar para hacerlo. Y hay al menos doce opciones serias, con fortalezas superpuestas, nombres confusos y filosofías muy diferentes.
Esta guía lo aclara todo.
¿Por qué ejecutar un LLM localmente?
Antes de meternos en las herramientas, los argumentos honestos a favor de lo local:
- Privacidad. Tus indicaciones y datos nunca salen de tu máquina. Para abogados, médicos, analistas financieros y cualquiera que maneje información sensible, esto no es opcional.
- Costo. Si usas IA intensamente, los modelos locales se pagan solos en pocos meses. Sin facturación por token, sin límites de velocidad.
- Sin conexión. Aviones, sótanos, instalaciones seguras, regiones con mal internet: los LLM locales funcionan donde la nube no llega.
- Sin censura. Los modelos de pesos abiertos no rechazan tareas benignas por un RLHF demasiado cauteloso.
- Aprendizaje. Si quieres entender realmente cómo funcionan estos sistemas, ejecutarlos tú mismo es el camino más rápido.
Los argumentos honestos en contra:
- Techo de calidad. A junio de 2026, incluso los mejores modelos locales están por detrás de GPT-5.1 y Claude Opus 4.8 en las tareas de razonamiento más difíciles. Estás eligiendo privacidad y costo sobre inteligencia máxima.
- Limitación de hardware. Estás limitado por lo que posees. Un modelo de 7B en un portátil nunca igualará a un modelo de 405B en un centro de datos.
- Curva de configuración. Incluso las herramientas más fáciles tienen una curva de aprendizaje inicial.
Para el 80% del trabajo diario (redactar, resumir, asistencia con código, investigación), los modelos locales ya son realmente suficientemente buenos. Para el 20% más difícil, mantén también una suscripción a la nube.
El panorama general
Antes de comparar herramientas, entiende las capas. La mayoría de las herramientas locales para LLM se construyen sobre un motor: llama.cpp. Es el motor de inferencia en C/C++ que hace posible todo lo demás. Ollama, LM Studio, GPT4All, Jan y muchos otros usan llama.cpp (o un fork) internamente.
Lo que diferencia a las herramientas no es la velocidad de inferencia bruta, sino la envoltura. La experiencia de usuario, la API, la gestión de modelos, la compatibilidad con plataformas, la filosofía.
Las herramientas se dividen aproximadamente en cuatro categorías:
Categoría
Qué son
Ejemplos
Motores de inferencia
El runtime base que carga y ejecuta modelos
llama.cpp, MLX, vLLM
Ejecutores CLI
Motor + gestión de modelos + API, basados en terminal
Ollama
Aplicaciones de escritorio
GUI para explorar, descargar y chatear con modelos
LM Studio, Jan, GPT4All
Servidores de producción
Inferencia de alto rendimiento para muchos usuarios concurrentes
vLLM, LocalAI, SGLang
Elige tu capa según lo que intentas hacer.
Las 8 herramientas que importan, ordenadas por caso de uso
1. Ollama: el punto de partida por defecto para la mayoría
Qué es: Un ejecutor local de LLM basado en CLI con una API REST incorporada. Instálalo, ejecuta un comando y tienes un endpoint compatible con OpenAI en localhost.
Por qué domina: Cada cadena de herramientas importante de LLM (LangChain, LlamaIndex, Aider, Continue, Cursor, Zed, Open WebUI) tiene soporte de primera clase para Ollama o funciona de serie a través de la capa de compatibilidad con OpenAI. Si estás automatizando algo, Ollama es el camino de menor resistencia.
Hardware: Funciona en Mac (Metal), Windows (CUDA/Vulkan), Linux (CUDA/ROCm) e incluso Raspberry Pi. La aceleración por GPU es automática donde se admite.
Ventajas:
- Configuración más simple posible:
ollama pull llama3.2y ya estás ejecutándolo - El modo sin interfaz gráfica funciona en servidores y Docker de serie
- Ecosistema masivo: prácticamente todos los IDE y herramientas de IA se integran con él
- Licencia MIT, sin telemetría
Desventajas:
- Sin GUI. Solo terminal por defecto (las interfaces web existen como proyectos separados)
- El soporte Vulkan por defecto aún no está listo: necesita compilación personalizada para AMD en Windows
- El uso de disco puede inflarse si acumulas modelos (usa ~4.6 GB por sí mismo más los modelos)
Ideal para: Desarrolladores, cualquiera que construya aplicaciones sobre LLM locales, despliegues en servidores, flujos de trabajo de automatización.
Evítalo si: Quieres una experiencia GUI pulida para charlas informales.
2. LM Studio: la experiencia de escritorio pulida
Qué es: Una aplicación de escritorio completa para descubrir, descargar y ejecutar modelos. Interfaz hermosa, visualización de transmisión de tokens en tiempo real, interfaz de chat incorporada, servidor compatible con OpenAI conmutable.
Por qué la gente lo adora: Es el camino más fácil desde "he oído hablar de los LLM locales" hasta "estoy chateando con uno". El navegador de Hugging Face dentro de la aplicación te permite filtrar por tamaño de archivo y cuantización, ver tarjetas de modelo y descargar con barras de progreso.
Hardware: Mac (con aceleración MLX nativa en Apple Silicon, una ventaja real), Windows, Linux. Tiene soporte Vulkan de serie, lo que importa si tienes AMD.
Ventajas:
- La mejor GUI del mercado para descubrimiento de modelos y chat
- Soporte nativo de MLX en Apple Silicon da una ventaja de rendimiento real en Mac
- Servidor API incorporado (compatible con OpenAI) para cuando quieras programar contra él
- Versiones recientes (0.3.5+) añadieron modo "Servicio LLM local" sin interfaz y carga de modelos JIT
- Soporte MCP añadido en 0.4.0: conecta herramientas de estilo Claude a tu modelo local
Desventajas:
- Código cerrado. Analíticas anónimas activadas por defecto (se pueden desactivar en ajustes)
- Más pesado en disco y RAM que las herramientas CLI (aplicación Electron)
- El modo servidor es opcional y requiere que la aplicación esté ejecutándose: no es ideal para despliegues reales sin interfaz en servidores
- La CLI (lms) es funcional pero menos rica en funciones que la de Ollama
Ideal para: Personas que quieran explorar LLM locales visualmente, usuarios de Mac (MLX es la función estrella), ingenieros de prompts que iteran sobre prompts del sistema.
Evítalo si: Necesitas desplegar en un servidor sin interfaz gráfica, o el código abierto es un requisito innegociable.
3. llama.cpp: el motor que todos los demás usan
Qué es: La biblioteca de inferencia en C/C++ que impulsa la mayor parte del ecosistema local de LLM. Creada originalmente para ejecutar modelos LLaMA en CPUs de consumo, ahora es un estándar de la industria.
Por qué importa: Ejecutar llama.cpp directamente evita la sobrecarga de la envoltura. Es la opción más ligera: una comparación reciente lo midió en menos de 90 MB en Windows, frente a ~4.6 GB de Ollama con todas sus dependencias incluidas.
Hardware: Funciona en todo. x86, ARM, Apple Silicon, NVIDIA CUDA, AMD ROCm, Intel oneAPI, Vulkan, OpenCL. Incluyendo Raspberry Pi, teléfonos Android (vía Termux) y portátiles viejos.
Ventajas:
- Huella mínima, cero dependencias innecesarias
- Máximo rendimiento y personalización
- El backend Vulkan funciona con cualquier proveedor de GPU: mejor opción para AMD en Windows
- Incluye una CLI (llama-cli), un servidor (llama-server) y una interfaz web básica
- Licencia muy permisiva
Desventajas:
- Curva de aprendizaje más empinada: banderas, formatos de cuantización, opciones de compilación
- No tiene un registro de modelos amigable: tú encuentras y descargas los GGUF tú mismo (normalmente de Hugging Face)
- Sin "magia de serie": configuras todo
Ideal para: Usuarios avanzados, usuarios de AMD en Windows, cualquiera que despliegue en hardware integrado o inusual, desarrolladores que quieran mínima sobrecarga.
Evítalo si: Quieres un camino rápido para chatear y no disfrutas leyendo documentación.
4. GPT4All: el especialista en hardware de baja gama
Qué es: Una aplicación de escritorio de Nomic AI optimizada específicamente para ejecutarse en máquinas sin aceleración GPU.
Por qué existe: La mayoría de las herramientas locales para LLM asumen que tienes al menos una GPU decente. GPT4All da la vuelta: está diseñado para portátiles viejos, máquinas del trabajo y cualquier ordenador donde CUDA no esté disponible.
Hardware: Se ejecuta en CPUs sin aceleración GPU y está optimizado para máquinas con 8 GB de RAM o menos. Requisitos de hardware: 4 GB de RAM mínimo, 8 GB recomendado. Cualquier CPU de los últimos 5 años.
Ventajas:
- El listón de hardware más bajo de cualquier herramienta en esta guía
- GUI pulida, incorporación fácil para usuarios no técnicos
- Fuerte historial de privacidad (solo telemetría opcional)
- Multiplataforma (Mac, Windows, Linux)
Desventajas:
- Biblioteca de modelos más pequeña que Ollama o LM Studio
- API menos madura que la competencia
- El techo de rendimiento es bajo: lo superarás si mejoras el hardware
Ideal para: Usuarios con hardware antiguo, máquinas del trabajo sin derechos de administrador para instalar controladores, escuelas, organizaciones que necesiten IA local accesible con presupuestos ajustados.
Evítalo si: Tienes una GPU moderna: estás dejando rendimiento sobre la mesa.
5. Jan AI: el sustituto de ChatGPT de código abierto
Qué es: Una aplicación de escritorio que aspira a ser una alternativa totalmente local y totalmente de código abierto a ChatGPT. Interfaz limpia, soporte multimodelo, integraciones opcionales en la nube si quieres uso híbrido.
Por qué destaca: Es la opción más explícitamente centrada en la privacidad. Jan AI y Ollama no recopilan telemetría (código abierto MIT). Construido para usuarios que quieren garantía, no solo afirmaciones, de que nada sale de su máquina.
Hardware: Mac, Windows, Linux. Más ligero que LM Studio pero más pesado que GPT4All.
Ventajas:
- Completamente código abierto, completamente auditable
- Cero telemetría por defecto
- Sensación limpia de aplicación de chat: lo más parecido a "ChatGPT pero local"
- Admite proveedores de modelos (local + nube opcional) si quieres uso híbrido
- Servidor API incorporado
Desventajas:
- Ecosistema más pequeño que Ollama o LM Studio
- Algunas funciones avanzadas (MCP, flujos de agente avanzados) van por detrás de los líderes
- La biblioteca de modelos no es tan completa como el navegador de HuggingFace de LM Studio
Ideal para: Usuarios centrados en la privacidad, profesionales de la UE que trabajan bajo el RGPD, cualquiera que quiera una experiencia similar a ChatGPT con auditoría estricta.
Evítalo si: Necesitas funciones de vanguardia como integración MCP hoy, o la mayor selección posible de modelos.
6. vLLM: el rey del rendimiento en producción
Qué es: Un servidor de inferencia de alto rendimiento diseñado para servir a muchos usuarios concurrentes desde una sola GPU. Creado en UC Berkeley, ahora la opción de facto para APIs de LLM autoalojadas en producción.
Por qué importa: La mayoría de las herramientas locales optimizan para la latencia de un solo usuario. vLLM optimiza para el rendimiento. Su técnica PagedAttention reduce la fragmentación de memoria en más del 50% y ofrece de 2 a 4 veces más solicitudes concurrentes que las alternativas en el mismo hardware.
Hardware: Principalmente Linux + NVIDIA. Territorio A100/H100 para despliegues serios, aunque se ejecuta en GPUs de consumo para desarrollo.
Ventajas:
- 2-4 veces más rendimiento que el servicio ingenuo en la misma GPU
- Amigable con Kubernetes, métricas incorporadas, API compatible con OpenAI
- Paralelismo tensorial a través de múltiples GPUs
- Soporta modelos multimodales (LLaVA, Qwen-VL)
- La elección correcta si estás sirviendo un LLM a usuarios
Desventajas:
- Solo Linux + NVIDIA. Si estás en Mac o Windows, esto no es para ti
- Configuración más pesada, basada en configuración
- Excesivo para flujos de trabajo de un solo usuario
Ideal para: Empresas que autoalojan una API de LLM, cualquiera que sirva IA local a múltiples usuarios, equipos de infraestructura.
Evítalo si: Eres un solo usuario en un portátil. Usa Ollama en su lugar.
7. LocalAI: el concentrador universal de API
Qué es: Una capa de orquestación compatible con OpenAI que puede enrutar solicitudes a múltiples backends de inferencia, manejar modelos de texto/imagen/audio/vídeo y actuar como middleware entre tus aplicaciones y el motor de inferencia que realmente uses.
Por qué es útil: Si quieres una superficie de API única que abstraiga cualquier backend que estés ejecutando (llama.cpp hoy, vLLM mañana, un servidor MLX el año que viene), LocalAI es la envoltura.
Hardware: Linux preferido, amigable con Docker.
Ventajas:
- Un único endpoint compatible con OpenAI independientemente del backend
- Multimodal (texto, generación de imágenes, audio, embeddings, rerank, vídeo)
- Sustituto directo de la API de OpenAI en aplicaciones existentes
- Fuerte para escenarios de middleware empresarial
Desventajas:
- Significativamente más complejo que Ollama para configuraciones de un solo usuario
- La documentación puede ser escasa
- Comunidad más pequeña que Ollama o LM Studio
Ideal para: Despliegues empresariales, equipos que construyen productos que necesitan una API local estable a través de backends cambiantes, cualquiera que sirva IA multimodal localmente.
Evítalo si: Solo intentas chatear con un modelo.
8. MLX (nativo de Apple Silicon): la elección del usuario avanzado de Mac
Qué es: El framework de aprendizaje automático de Apple, optimizado para la arquitectura de memoria unificada de Apple Silicon. LM Studio lo usa de forma nativa; también puedes usarlo directamente vía Python.
Por qué los Mac dominan silenciosamente: La memoria unificada significa que un MacBook Pro M4 Max con 128 GB puede ejecutar modelos de 70B de parámetros que requerirían una GPU dedicada de 5.000 dólares en PC. La mejor experiencia local de LLM en 2026 está en Apple Silicon, punto. La memoria unificada significa que los modelos que requerirían una GPU dedicada en PC pueden ejecutarse en un Mac usando memoria RAM+GPU compartida.
Hardware: Solo Apple Silicon (M1 en adelante).
Ventajas:
- Mejor rendimiento por dólar en hardware Mac
- Nativo de la plataforma: sin capas de traducción torpes
- La combinación de MLX + LM Studio da a los usuarios de Mac una ventaja real
- La arquitectura de memoria unificada hace que los modelos grandes sean accesibles sin GPUs empresariales
Desventajas:
- Solo Mac
- Ecosistema más pequeño que llama.cpp
- Requiere LM Studio o algo de comodidad con Python para usarlo
Ideal para: Cualquiera que hable en serio sobre LLM locales en un Mac.
Evítalo si: No estás en Apple Silicon.
La combinación hardware-herramienta
Aquí está la pregunta práctica que la mayoría de los artículos evitan: ¿qué debería instalar realmente según lo que tengo?
Si tienes una Raspberry Pi 5 (8 GB o 16 GB)
Usa: Ollama (Raspberry Pi OS lo soporta de forma nativa) Modelos para probar: TinyLlama 1.1B, Phi-3 Mini 3.8B, Gemma 3 1B Expectativa realista: 2-8 tokens/segundo según el tamaño del modelo. Útil para chatbots, automatización del hogar, preguntas y respuestas simples. No para programación seria o razonamiento largo.
Si tienes un portátil viejo (Intel i5, sin GPU, 8 GB de RAM)
Usa: GPT4All Modelos para probar: Phi-3 Mini, Llama 3.2 1B, TinyLlama Expectativa realista: Lento pero funcional. Mejor para consultas cortas que para generación larga.
Si tienes un portátil moderno con gráficos integrados (16 GB de RAM, sin GPU dedicada)
Usa: LM Studio (modo CPU) u Ollama Modelos para probar: Llama 3.2 3B, Gemma 3 4B, Qwen 3 7B (con paciencia) Expectativa realista: Bueno para chat, redacción, resumen. 5-15 tokens/segundo en modelos pequeños.
Si tienes un MacBook Air M2/M3/M4
Usa: LM Studio con backend MLX Modelos para probar: Llama 3.2 8B, Qwen 3 14B, Mistral Nemo Expectativa realista: Sorprendentemente rápido: la memoria unificada de Apple Silicon y el Neural Engine rinden por encima de su peso. 20-40 tokens/segundo en modelos medianos.
Si tienes un MacBook Pro M3/M4 Max (36 GB+ de RAM)
Usa: LM Studio + MLX, u Ollama Modelos para probar: Llama 3.3 70B (con 64 GB+), Qwen 3 32B, DeepSeek-V3 destilado Expectativa realista: Realmente útil para trabajo serio. Mac Studio M4 Max (128 GB de memoria unificada): ejecuta Llama 3.3 70B a ~20 t/s mientras mantienes otras aplicaciones abiertas.
Si tienes un escritorio Windows/Linux con GPU NVIDIA (RTX 3060–4070)
Usa: Ollama (el más fácil) o llama.cpp (el más eficiente) Modelos para probar: Llama 3.2 8B, Qwen 3 14B, Mistral 7B Expectativa realista: Inferencia rápida, 30-80 tokens/segundo en modelos cuantizados que quepan en VRAM.
Si tienes una GPU AMD en Windows
Usa: llama.cpp con backend Vulkan (el más fiable) o LM Studio (Vulkan de serie) Por qué: El soporte ROCm para AMD en Windows es básicamente inexistente. Vulkan es el salvavidas. Expectativa realista: El rendimiento va muy por detrás de NVIDIA pero es mucho mejor que solo CPU.
Si tienes una estación de trabajo seria (RTX 4090, RTX 5090, multi-GPU)
Usa: vLLM para servir, Ollama o llama.cpp para uso personal Modelos para probar: Llama 3.3 70B, Qwen 3 72B, DeepSeek-V3 Expectativa realista: Calidad casi de nube para la mayoría de las tareas. Aquí es donde la IA local deja de ser un compromiso.
Si estás ejecutando producción para un equipo (varios usuarios)
Usa: vLLM o LocalAI Hardware: A100/H100 ideal, RTX 4090 mínimo para equipos pequeños Expectativa realista: 10-50 usuarios concurrentes en una sola A100 según el tamaño del modelo.
Matriz de comparación rápida

El veredicto honesto: cuál instalar realmente
Si quieres que me salte todo y te diga exactamente qué hacer:
Para la mayoría de la gente: instala tanto Ollama como LM Studio. Usa LM Studio para descubrir y probar modelos con su GUI. Usa Ollama como el runtime real al que se conectan tus scripts, IDEs y aplicaciones. Los dos se complementan: no son competidores. Usa LM Studio en tu portátil para descubrimiento e iteración de prompts, y ejecuta Ollama en el servidor (o en Docker en tu estación de trabajo) para todo lo relacionado con automatización.
Para hardware antiguo: GPT4All. No tiene sentido otra cosa.
Para una Raspberry Pi o dispositivo periférico: Ollama. La Pi 5 con 16 GB y un buen modelo cuantizado de 3B es realmente utilizable.
Para usuarios de GPU AMD: llama.cpp con Vulkan, o LM Studio si quieres una GUI. Salta Ollama en Windows por ahora.
Para usuarios de Mac con Apple Silicon: LM Studio con MLX. El backend MLX es la función estrella y solo LM Studio lo expone limpiamente.
Para maximalistas de la privacidad: Jan AI. Completamente código abierto, cero telemetría, compatible con RGPD.
Para servir a múltiples usuarios: vLLM en Linux con NVIDIA. Nada más compite en rendimiento.
Para personalización profunda o despliegue integrado: llama.cpp directamente. Vale la pena la curva de aprendizaje.
Lo que viene después
Tres tendencias a seguir en el resto de 2026:
- MCP se vuelve estándar. El Model Context Protocol, el estándar para conectar herramientas a LLM, ya está en LM Studio. Ollama lo seguirá. Para el cuarto trimestre, todas las herramientas locales serias lo soportarán de forma nativa, haciendo que los modelos locales sean sustitutos directos de Claude en flujos de trabajo de agentes.
- El móvil despega. Los modelos en el dispositivo de Apple, llama.cpp en Android vía Termux y las mejoras en cuantización significan que la inferencia local seria llegará a los teléfonos. No "resumir este correo", sino flujos de trabajo de agentes reales.
- La brecha con la nube se reduce pero no se cierra. Modelos de pesos abiertos como Llama 4 y Qwen 4 seguirán cerrando la brecha de calidad. Pero la frontera absoluta (Claude Opus 4.7, GPT-5.1, Gemini 3) seguirá siendo solo en la nube en el futuro previsible, porque la ventaja de escala es estructural.
El resumen final
Los LLM locales ya no son un proyecto de ciencia. Son una opción real y práctica que complementa, no reemplaza, a la IA en la nube. Para trabajo sensible a la privacidad, escenarios sin conexión, uso diario intensivo y aprendizaje, lo local es la respuesta correcta. Para las tareas de razonamiento más difíciles, la nube aún gana.
La buena noticia es que las herramientas finalmente han madurado hasta el punto de que no necesitas un doctorado para configurar esto. Elige la herramienta que coincida con tu hardware y caso de uso de la lista anterior. Instálala esta noche. Para el fin de semana, tendrás un asistente de IA privado funcionando en tu propia máquina.
Eso es lo que nadie te dice: en 2026, la pregunta no es si puedes ejecutar un LLM útil localmente. Es qué flujo de trabajo deberías delegarle a uno.
Si esto te fue útil, sígueme en mi canal de Telegram:





