La escalera de la IA local: 10 opciones para eliminar tu factura de IA de $200 (de $0 a $4,700)

@RetroChainer
INGLÉShace 2 días · 19 jul 2026
106K
50
5
8
82

TL;DR

Una guía completa sobre hardware para IA local, que clasifica 10 opciones desde $0 hasta $4,700 según su memoria y rendimiento. Explica cómo reemplazar las costosas suscripciones en la nube con configuraciones privadas y locales utilizando herramientas como Ollama.

En algún lugar, en este momento, un desarrollador está pagando 200 dólares al mes por IA y nunca ha hecho los cálculos. ChatGPT Plus. Claude Pro. Cursor. Costos de API que se acumulan silenciosamente cada mes. Se renueva para siempre, y para siempre es mucho tiempo para alquilar algo que podrías poseer.

Hay otra forma de pensar en esto. Una caja que se queda en tu casa, ejecuta IA localmente, cuesta unos pocos dólares al mes en electricidad, mantiene tus datos en tu propia máquina y nunca envía un solo byte al servidor de otra persona.

La IA local en 2026 no es el triste compromiso que era hace dos años. Mejor cuantización, arquitecturas de modelos más ligeras y chips con memoria unificada significan que una máquina en tu escritorio ahora maneja tal vez el 80% del trabajo diario de IA: escribir, ayuda con código, análisis de documentos, resumir, clasificar, automatizaciones, responder preguntas sobre tus propios archivos. El otro 20%, el razonamiento de frontera y la codificación de vanguardia, todavía pertenece a la nube. Pero ese 20% no justifica una factura de 200 dólares cuando una caja de pago único cubre el resto.

Esta es la escalera. Diez peldaños, desde la máquina que ya posees hasta una supercomputadora de escritorio, y las compensaciones honestas en cada paso.

La idea que lo cambia todo

No estás comprando velocidad. Estás comprando memoria.

Cada historia de "no funciona" se remonta al mismo muro: un modelo que no cabía en la memoria de la caja. Un modelo o se carga o no se carga. La velocidad solo decide cómo se siente una vez que está funcionando; la memoria decide si funciona en absoluto.

Así que toda la escalera es realmente una escalera de memoria. 8GB ejecuta un modelo de 7B. 24GB ejecuta un modelo de 32B cómodamente. 128GB ejecuta un modelo de 70B y comienza a coquetear con los realmente grandes. Lee cada peldaño a continuación a través de ese lente, y observa el patrón: las cajas que llegan más lejos son las que tienen memoria unificada, donde la CPU y la GPU comparten un gran grupo en lugar de pelearse por un pequeño pedazo de VRAM aislado.

Una advertencia antes de las especificaciones, válida para toda la lista: una escasez global de DRAM está empujando los precios de la memoria hacia arriba durante 2026, no hacia abajo. Cada número aquí es aproximado y tiende al alza, lo cual es un argumento para comprar la caja que realmente usarás en lugar de esperar una baja que quizás no llegue.

La escalera

Peldaño 1. La máquina que ya tienes (0 $)

Antes de gastar nada, prueba el flujo de trabajo en lo que ya tienes en tu escritorio. Cualquier portátil con 8GB de RAM ejecuta un modelo de 7B a través de Ollama. No será rápido, pero responde la única pregunta que importa: ¿es la IA local lo suficientemente buena para lo que realmente haces? Pasa un fin de semana aquí antes de gastar un dólar en cualquier otro lugar.

RetroChainer - inline image

Peldaño 2. Raspberry Pi 5, 16GB (aproximadamente 120 $)

El peldaño del aficionado. Una Pi 5 con 16GB ejecutará modelos de 1B a 3B a través de Ollama, lentamente. Esto no es un controlador diario, es una prueba de concepto que puedes dejar funcionando en un cajón: un asistente pequeñito siempre encendido, un cerebro para la automatización del hogar, un proyecto de fin de semana. Cómprala para aprender, no para trabajar.

RetroChainer - inline image

Peldaño 3. NVIDIA Jetson Orin Nano Super (249 $)

El punto de entrada serio más barato. Una GPU NVIDIA real en una caja más pequeña que una cartera.

text
1Rendimiento IA: 67 TOPS
2GPU: Ampere de 1024 núcleos
3RAM: 8GB LPDDR5 (compartida)
4Consumo: 7-25W
5Funciona bien: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B

67 TOPS ejecutan un modelo de 7B de forma privada y para siempre. La clase de 7B es lo suficientemente rápida para sentirse instantánea y lo suficientemente buena para la mayoría de las tareas diarias. No tocará nada por encima de 7B ni ningún contexto largo que exceda los 8GB, pero a 100 $/mes en suscripciones, se amortiza solo en diez semanas.

RetroChainer - inline image

Peldaño 4. Apple Mac mini M4 (desde 599 $)

El servidor de IA doméstico silencioso por defecto, gracias a la memoria unificada. En una PC normal, la VRAM de la GPU es un muro duro. Apple comparte la memoria entre la CPU y la GPU, por lo que el Mac mini ejecuta cosas más grandes de lo que sugiere su hoja de especificaciones, permanece casi silencioso y consume poca energía.

text
1Chip: Apple M4
2Memoria unificada: 16-32GB (CPU + GPU compartidas)
3Consumo: 10-30W bajo carga
4Costo eléctrico 24/7: aproximadamente 3-8 $/mes
5Funciona bien: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium

Hace todo lo que hace la Jetson más modelos más grandes, contexto más largo y varios servicios a la vez. Esta es la caja que la gente deja encendida las 24 horas como backend para sus automatizaciones. Los 599 $ son la base, eso sí, y Apple cobra fuerte por la memoria. Para IA local, la memoria es el punto, así que calcula el precio de la configuración que realmente necesitas, no la de etiqueta.

RetroChainer - inline image

Peldaño 5. RTX 3090 usada, 24GB (aproximadamente 700 $ por la tarjeta)

La leyenda del valor que se niega a morir. Seis años de antigüedad y sigue siendo la mejor relación VRAM-por-dólar en el mercado de consumo. Una 3090 usada te da 24GB de memoria rápida por alrededor de 700 $, suficiente para ejecutar modelos de 24B a 32B con rendimiento real, con soporte completo de CUDA para que todas las herramientas funcionen de inmediato.

text
1VRAM: 24GB GDDR6X
2Ancho de banda: ~936 GB/s
3Precio usado: ~600-800 $ (solo tarjeta)
4Funciona bien: Qwen 32B, Llama 3.1 8B-70B (cuantizado), la mayoría de clase 32B

El asterisco honesto: una GPU no es una computadora. Necesitas una PC anfitriona a su alrededor, así que presupuesta otros 400 a 600 $ para el resto de la máquina. Pero si ya tienes un escritorio con una ranura libre y una fuente de alimentación suficientemente grande, nada más en esta escalera te da 24GB tan barato.

RetroChainer - inline image

Peldaño 6. AMD Radeon RX 7900 XTX, 24GB (aproximadamente 900 $ por la tarjeta)

Los mismos 24GB que la 3090, nueva, con garantía, y el software de AMD finalmente se ha puesto al día. En ROCm 7.x, la 7900 XTX ejecuta Llama 3.1 8B a aproximadamente 96 tokens por segundo, aproximadamente tres cuartos de una RTX 4090 a una fracción del precio. Por VRAM pura por dólar en hardware nuevo, nada de NVIDIA la iguala a nivel de consumo.

text
1VRAM: 24GB GDDR6
2Software: ROCm 7.x (soporte de primera clase)
3Precio nuevo: ~899-1,400 $ (solo tarjeta)
4Funciona bien: Llama 3.1 8B (~96 tok/s), clase 32B cuantizado

El inconveniente es el mismo que persigue a AMD en todas partes: ROCm ha cerrado la mayor parte de la brecha con CUDA, pero algunas herramientas todavía asumen NVIDIA por defecto. Para Ollama y Open WebUI funciona bien hoy en día. Para pilas de ajuste fino exóticas, espera algunos pasos manuales adicionales.

RetroChainer - inline image

Peldaño 7. AMD Ryzen AI Max+ 395 "Strix Halo", 128GB (aproximadamente 1,999 $)

El punto óptimo de 2026, y la caja que la mayoría de estas listas olvidan. El chip Strix Halo de AMD combina una CPU Zen 5 de 16 núcleos con una iGPU RDNA 3.5 grande y hasta 128GB de memoria unificada en una caja pequeña, por aproximadamente lo que cuesta un escritorio NVIDIA con una cuarta parte de la memoria.

text
1Chip: Ryzen AI Max+ 395 (16 núcleos Zen 5)
2GPU: Radeon 8060S (40 núcleos RDNA 3.5)
3NPU: XDNA 2, 50 TOPS (~126 TOPS en todo el sistema)
4Memoria unificada: hasta 128GB LPDDR5X (~96GB utilizables como VRAM)
5Precio: ~1,999 $ por 128GB / 2TB
6Funciona bien: Llama 3.3 70B, Mixtral, la mayoría de modelos clase 70B

Lo compras de dos maneras. El GMKtec EVO-X2 es un mini PC de 128GB completo por aproximadamente 1,999 $. El Framework Desktop es el mismo chip en un chasis reparable y actualizable, desde 1,999 $ por la placa y alrededor de 2,850 $ completamente ensamblado. De cualquier manera, cargas un modelo de 70B a velocidad de conversación, algo que nada por debajo de este peldaño puede hacer. La madurez de ROCm es la compensación, igual que en el Peldaño 6.

RetroChainer - inline image

Peldaño 8. NVIDIA RTX 5090, 32GB (aproximadamente 3,000 $ por la tarjeta)

Lo más rápido que una persona normal puede poner en una torre normal. 32GB de la memoria de consumo más rápida fabricada, y velocidad bruta que deja atrás a todo lo que está por debajo. Este es el peldaño para personas que quieren inferencia local de clase fronteriza y entrenamiento ocasional, y que se preocupan más por los tokens por segundo que por los dólares por gigabyte.

text
1VRAM: 32GB GDDR7
2Precio nuevo: ~3,000 $+ (solo tarjeta)
3Funciona bien: 32B a velocidad, 70B cuantizado, modelos de imagen y video

Las matemáticas son brutales, sin embargo. Cuesta de tres a cuatro veces más que una 3090 usada por 8GB más de memoria, más una PC anfitriona adicional. Cómprala porque necesitas la velocidad y el margen extra, no porque sea eficiente. No lo es.

RetroChainer - inline image

Peldaño 9. Apple Mac Studio M3 Ultra, 96GB (desde 3,999 $)

La estación de trabajo grande, silenciosa y de memoria unificada. El Mac Studio agrupa hasta 96GB entre CPU y GPU con aceleración Metal, ejecuta modelos grandes casi en silencio, y lo hace en una caja que cabe en un escritorio sin una curva de ventilador de motor a reacción.

text
1Chip: M3 Ultra (hasta CPU de 32 núcleos / GPU de 80 núcleos)
2Memoria unificada: hasta 96GB
3Precio: desde 3,999 $
4Funciona bien: Modelos clase 70B, contexto largo, múltiples servicios

Vale la pena saberlo honestamente: Apple retiró la configuración de 512GB a principios de 2026 cuando la escasez de DRAM afectó, por lo que 96GB es el techo ahora donde solía llegar mucho más alto. Aún así, para una máquina silenciosa para todo el día que ejecuta modelos grandes y funciona como tu computadora real, pocas cosas son tan agradables de tener.

RetroChainer - inline image

Peldaño 10. NVIDIA DGX Spark, 128GB (3,999 $ a 4,699 $)

El escritorio que cree que es un centro de datos. Para ajuste fino de modelos abiertos, alojar asistentes de más de 70B y ejecutar pipelines de inferencia que necesitan rendimiento real.

text
1Chip: GB10 Grace Blackwell
2Rendimiento IA: 1 PFLOP
3Memoria unificada: 128GB LPDDR5x
4Almacenamiento: 4TB Gen5 NVMe
5Consumo: 150-240W bajo carga
6Mejor para: Modelos de 70B-200B, ajuste fino, inferencia de producción

128GB de memoria unificada cargan modelos que una GPU de consumo ni siquiera puede abrir, y dos unidades enlazadas llegan a territorio de 400B. Honestidad sobre el precio: se lanzó a 3,999 $ en octubre de 2025 y desde entonces ha subido a aproximadamente 4,699 $ debido a la escasez de memoria (Tom's Hardware). Al lado de la caja Strix Halo en el Peldaño 7, cuesta aproximadamente el doble por los mismos 128GB. Estás pagando por la madurez de CUDA y el rendimiento, no por más memoria.

RetroChainer - inline image

Las matemáticas honestas

text
1Gasto mensual típico en IA:
2ChatGPT Plus $20
3Claude Pro $20
4Cursor Pro $20
5Costos de API $50-200
6Total $110-260 / mes
7
8IA local mensual:
9Hardware $0 (ya comprado)
10Electricidad $2-15
11API $0
12Total $2-15 / mes

A 100 $/mes en suscripciones, una Jetson de 249 $ se amortiza sola en diez semanas, un Mac mini de 599 $ en seis meses, una construcción con 3090 usada en menos de un año, una caja Strix Halo de 2,000 $ en aproximadamente dieciocho meses, y los peldaños de más de 4,000 $ solo si ya estabas quemando alquiler de GPU en la nube a cuatro cifras al mes.

Ahora la parte que el bombo siempre omite. La caja es un costo hundido, y solo se "amortiza" si realmente hubieras seguido pagando la suscripción. Comprar una máquina de 2,000 $ para ahorrar 20 $ al mes es un peor negocio que la suscripción, no uno mejor. El peldaño correcto es el que coincide con tu uso real, no con la versión de fantasía del mismo.

Cuál es tu peldaño

Uso diario ligero y curiosidad: comienza en el Peldaño 1, luego compra la Jetson. Un asistente silencioso siempre encendido para un hogar o pequeña empresa: el Mac mini. El camino más barato a 24GB reales y modelos de 32B: una 3090 usada, o la RX 7900 XTX si la quieres nueva con garantía y no te importa ROCm. La mejor experiencia de 70B sin dinero de centro de datos: la caja Strix Halo. Máxima velocidad de consumo: la RTX 5090. Una estación de trabajo silenciosa de gran memoria en la que también vives: el Mac Studio. Ajuste fino y pipelines de producción: la DGX Spark.

La configuración que toma una tarde

El proceso es idéntico en cada peldaño.

1. Instala Ollama. Código abierto, convierte cualquier modelo en una API local que habla el lenguaje de OpenAI.

bash
1curl -fsSL https://ollama.com/install.sh | sh

2. Descarga un modelo del tamaño adecuado para la memoria de tu caja.

bash
1# Jetson de 8GB o Mac mini de 16GB:
2ollama pull llama3.2
3
4# 3090 / 7900 XTX de 24GB:
5ollama pull qwen2.5:32b
6
7# Strix Halo / DGX Spark de 128GB:
8ollama pull llama3.3:70b

3. Cambia una línea en el código que ya tienes.

python
1# Antes, pagando por solicitud:
2client = OpenAI(api_key="sk-...")
3
4# Después, local y gratuito:
5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

Tu código se ejecuta igual. Nada sale de la máquina, nada cuesta dinero por solicitud.

4. (Opcional) Añade una interfaz de navegador con Open WebUI, y tendrás un ChatGPT privado en localhost:3000.

bash
1docker run -d -p 3000:8080 \
2 --add-host=host.docker.internal:host-gateway \
3 -v open-webui:/app/backend/data \
4 ghcr.io/open-webui/open-webui:main

Qué ejecutar realmente en ello

El hardware es la mitad de la decisión. El modelo es la otra mitad. Un mapa aproximado para 2026:

Pequeño y rápido (cabe en 8-16GB): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B. Geniales para redactar, clasificar y preguntas y respuestas sobre tus propias notas. El nivel de caballo de batalla (cabe en 24GB): Qwen 2.5 32B y Llama cuantizado, lo suficientemente potentes para ayuda real con código y trabajo con documentos. El nivel pesado (necesita 64-128GB): Llama 3.3 70B y las grandes variantes de Qwen y Mixtral, donde la salida local comienza a sentirse cerca de un modelo en la nube para tareas cotidianas.

La cuantización es la palanca silenciosa debajo de todo esto. Un modelo de 70B con una cuantización de 4 bits cabe donde la versión de precisión completa nunca lo haría, con un costo de calidad pequeño y generalmente aceptable. Q4 a Q6 es el rango sensato para la mayoría de las personas. Por debajo de eso, la calidad cae más rápido de lo que valen los ahorros de memoria.

Lo que construyes una vez que está funcionando

Para uso personal, cubre lo cotidiano por unos pocos dólares al mes. La parte interesante es la automatización empresarial, donde conectas el modelo local a n8n, la herramienta de código abierto que lo conecta a Telegram, correo electrónico, calendario, CRM y cientos de servicios. Cada uno de estos se ejecuta sin que nada salga de tu edificio y sin costo por token:

text
1Recepcionista de IA:
2los clientes envían mensajes a Telegram -> n8n lo recibe -> el modelo local lee la intención
3-> el calendario verifica disponibilidad -> reserva confirmada
4
5Análisis de documentos:
6sube 50 PDFs -> el modelo local los lee todos -> extrae datos clave
7-> escribe un informe estructurado
8
9Resumen diario:
10disparador a las 7am -> el modelo lee tus notas y tareas -> resume lo importante
11-> lo envía a tu teléfono
12
13Enriquecimiento de clientes potenciales:
14nueva fila en una hoja de cálculo -> el modelo investiga la empresa -> redacta una apertura personalizada
15-> la pone en cola para tu revisión
16
17Reutilización de contenido:
18una grabación larga -> el modelo transcribe y la corta -> escribe las publicaciones
19-> guarda borradores para que los apruebes
20
21Clasificación de la bandeja de entrada:
22nuevo correo electrónico -> el modelo ordena, etiqueta y redacta una respuesta -> tú presionas enviar o editas

Para trabajo sensible a la privacidad, deja de ser una decisión de costo y se convierte en la única opción. Documentos legales, registros médicos, datos financieros, cualquier cosa bajo un acuerdo de confidencialidad no tiene cabida en una API de terceros. La IA local lo procesa en tu máquina y nunca sale de ella.

Lo que realmente sale mal

El 20% es real. Los modelos de frontera todavía ganan en razonamiento difícil, codificación de vanguardia e investigación donde la mejor respuesta única importa. La IA local es el caballo de batalla confiable, privado y siempre encendido para el otro 80%, no un reemplazo para todo. Mantén una suscripción en la nube para el 20% difícil y ejecuta el resto en casa, y tendrás ambas cosas.

La memoria es el techo, no los TOPS. Compra para el tamaño de modelo que quieres ejecutar, y recuerda que las cajas con memoria unificada llegan más lejos que una PC con especificaciones equivalentes y VRAM separada.

Una GPU no es una computadora. Los peldaños de la 3090, 7900 XTX y 5090 todas necesitan una máquina anfitriona a su alrededor. El precio de la tarjeta no es el precio del sistema, así que añade 400 a 600 $ antes de compararlo con un mini PC completo.

Los precios están subiendo. La escasez de DRAM ya elevó la DGX Spark un 18% e hizo que Apple retirara su Mac Studio de 512GB. El buen negocio de hoy puede costar más el próximo trimestre.

AMD ahorra dinero y cuesta tiempo. Strix Halo y la 7900 XTX te dan la mayor cantidad de memoria por dólar, pero ROCm todavía va por detrás de CUDA en herramientas listas para usar. Bien para Ollama hoy, se necesita más paciencia para entrenamiento pesado.

El calor, el ruido y la cuantización son la letra pequeña. Las construcciones con GPU grandes son ruidosas y calientes. La cuantización agresiva ahorra memoria pero come calidad si la llevas demasiado lejos. Ninguno es un problema insalvable, pero nadie los menciona en el discurso de venta.

Dos cosas que hacer ahora

Pruébalo gratis primero. Instala Ollama en la computadora que ya tienes y ejecuta un modelo de 7B este fin de semana. Cualquier máquina de 8GB lo hace. Prueba el flujo de trabajo antes de gastar un centavo en hardware.

Luego compra un peldaño por encima de tus necesidades reales, no cinco. Las personas que configuraron silenciosamente IA local en 2025 van a parecer muy adelantadas a la curva para 2027, a medida que los precios de la nube sigan subiendo y el hardware local siga mejorando. La mayoría de la gente seguirá pagando 200 $ al mes por costumbre. Unos pocos pasarán una tarde esta semana y nunca enviarán otro byte al servidor de otra persona.

Analizo herramientas de IA y el dinero que se gana con ellas como esta regularmente. Sígueme para la próxima, y únete a mi Telegram: https://t.me/+lzSPoQ0svRU1ZWZi

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales