Rastreo cada dólar que gasto en infraestructura de IA. El año pasado, una partida seguía creciendo: el alquiler de GPU en la nube. Para el tercer trimestre, había alcanzado los $1,900 al mes, y yo era quien facturaba a los clientes por el trabajo que lo generaba.
Esa cuenta no cierra. No construyes un negocio entregando el 40% de tus costos operativos al centro de datos de otra persona.
Entonces compré una DGX Spark. Aquí está el desglose.
1 / Qué es realmente la DGX Spark
NVIDIA pasó 2025 comprimiendo hardware de centro de datos en un escritorio. Lo anunciaron como Project DIGITS en CES en enero, lo renombraron como DGX Spark en GTC en marzo y comenzaron a enviarlo en octubre. El resultado es una caja de 150×150×50 mm que pesa 1,2 kg y funciona con un enchufe de pared estándar.
Las especificaciones:
Componente
Detalle
Chip
GB10 Grace Blackwell Superchip
Cómputo de IA
1 PFLOP (FP4)
CPU
ARM de 20 núcleos (Grace)
Memoria
128 GB LPDDR5x, unificada
Almacenamiento
4 TB Gen5 NVMe
Redes
ConnectX-7 (encadena dos unidades)
Consumo de energía
~150–240 W bajo carga
Precio
$2,999
El número de petaflops es una cifra de marketing. El número que realmente importa es 128 GB de memoria unificada.
Las GPU de consumo tienen un límite duro. Una 4090 te da 24 GB de VRAM; en el momento en que un modelo es más grande que eso, no se carga. Una 5090 eleva el límite a 32 GB. La Spark lo sitúa en 128 GB, lo que significa que ejecuta modelos que una tarjeta de consumo de $2,000 ni siquiera puede abrir.
2 / El muro de la memoria, explicado
Esto es lo que realmente desbloquean 128 GB de memoria unificada:
- Llama 3.3 70B - precisión BF16 completa, sin necesidad de trucos de cuantización
- Qwen 3 (rango 30B–110B) - encaja perfectamente
- Modelos tipo DeepSeek de hasta 200B - cuantizados, funcionan sólidos
- Generación de imágenes FLUX.1 - sí
- 405B parámetros - dos Sparks vinculadas con ConnectX-7
Una GPU de consumo se queda corta alrededor de unos ajustados 30B. La Spark comienza exactamente donde termina ese límite. Esa brecha es la justificación completa para comprar una.
3 / Las matemáticas: de dónde vienen los $22,000
Costos de GPU en la nube para cargas de trabajo serias de IA:
Tarea
Costo mensual
A100 80GB, tiempo parcial
$600–$1,200
H100 para ejecuciones de ajuste fino
$1,000–$2,500
Inferencia 70B alojada
$300–$900
Instancia que olvidaste apagar
sorpresa
Total realista para un creador de IA
$1,500–$3,000
DGX Spark en las mismas cargas de trabajo:
Partida
Costo
Hardware
$2,999 (una vez)
Electricidad a ~200W
$8–15/mes
Alquiler en la nube
$0
Costo mensual después de la compra
~$10
Con $1,900/mes en costos de nube, la Spark se paga sola en menos de 7 semanas.
Después de eso: $1,890 por mes que solían salir de tu negocio permanecen en él. Con el mismo trabajo para clientes. Con las mismas facturas emitidas.
Total del primer año redirigido de vuelta a tu negocio: $22,680.
4 / La capa de software no es un problema
La Spark ejecuta DGX OS, la compilación de Ubuntu de NVIDIA con la pila completa de IA precargada: CUDA, NIM, NeMo. Ollama, vLLM, PyTorch, Hugging Face y llama.cpp se ejecutan sin modificaciones desde el día uno.
Si ya estabas usando un endpoint en la nube, la migración es un cambio de una sola línea:
1# Antes: pagando por hora2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# Después: tu escritorio, medidor apagado5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
Misma ruta de código. Misma salida JSON. Mismo comportamiento. Nada se factura. Nada sale del edificio.
5 / El caso de negocio más allá del ahorro de costos
La Spark no solo reduce costos. Elimina la barrera económica para trabajos que antes eran demasiado costosos de ejecutar libremente.
Si haces trabajo de IA para clientes:
Las ejecuciones de ajuste fino que solían ser recibos de nube de $400 ahora son gratuitas. Ejecútalas durante la noche. Ejecuta tres variantes con diferentes hiperparámetros. No llega ninguna factura por la mañana. Puedes desplegar un agente de codificación privado en toda la base de código propietaria de un cliente, o un asistente siempre activo que todo el equipo use; y tu costo unitario es la electricidad, no los tokens de API. Cada cliente después del primero es margen puro.
Si manejas datos sensibles:
Este es el ángulo que la mayoría subestima. Contratos. Documentos legales. Registros de pacientes. Datos financieros. Cualquier cosa cubierta por un NDA que nunca pondrías en una API pública. En la Spark, esos datos nunca cruzan tu red. Ningún término de servicio gobierna una máquina que posees por completo.
"Tus datos nunca salen del edificio" cierra acuerdos en industrias reguladas que los proveedores de nube simplemente no pueden tocar. Firmas de abogados, clínicas, asesores financieros: estos clientes pagarán una prima significativa por esa garantía.
El cambio de mentalidad que nadie menciona:
Los precios de la nube te entrenan a racionar el cómputo. Dudas antes de dejar que un agente haga un bucle, antes de reejecutar un archivo completo, antes de ajustar una idea que podría no funcionar. Cada ejecución tiene un costo en dólares asociado, así que ejecutas menos.
Ten la caja y esa duda desaparece. La mayoría de las veces, el mejor trabajo estaba detrás de esa duda.
6 / Lo que la Spark no es
Siendo directo sobre las limitaciones:
- Velocidad bruta - una 5090 es más rápida en cualquier cosa que quepa en sus 32 GB de VRAM
- Escala - servir a miles de usuarios concurrentes sigue siendo trabajo de centro de datos
- Modelos de frontera más allá de 405B - dos Sparks vinculadas manejan 405B; más allá de eso, necesitas hardware diferente
- Usuarios de bajo volumen - si gastas $20/mes en llamadas de API, esta no es la herramienta adecuada
El umbral honesto: $1,000+/mes en gasto de GPU en la nube es donde la Spark se convierte en una decisión obvia. Por debajo de $500/mes, una tarjeta de consumo o acceso a API es la jugada más inteligente. La caja está dimensionada para cargas de trabajo serias, no para uso casual.
7 / El retorno de inversión en diferentes niveles de gasto
Gasto mensual en nube
Período de recuperación
$1,900/mes
~6 semanas
$1,000/mes
~3 meses
$500/mes
~6 meses
$200/mes
Quédate en la nube
8 / El panorama general
En 2024, ejecutar un modelo 70B requería un centro de datos o una factura de nube de $1,900/mes. En 2026, requiere una caja de $2,999 del tamaño de un libro de bolsillo y un enchufe de pared.
NVIDIA fijó el precio de la DGX Spark en $2,999 deliberadamente: quieren que la próxima generación de productos de IA se construya sobre su silicio, localmente, a escala. Jensen entregó personalmente las primeras unidades a Musk y Altman. Dell, HP, ASUS y Lenovo están construyendo sus propias máquinas GB10. La pila de software se ajusta para este chip prácticamente cada semana.
Las tarifas de GPU en la nube no están disminuyendo. Los requisitos de privacidad de datos se están endureciendo. Los clientes preguntan cada vez más dónde van físicamente sus datos antes de firmar cualquier cosa.
Las personas que ejecutan modelos de clase fronteriza en un escritorio en 2026 parecerán previsoras en 2028.
La aritmética es sencilla: $2,999 una vez versus $1,900 cada mes. La caja se paga sola antes de que termine el primer trimestre, luego funciona a $10/mes durante todo el tiempo que la necesites.
Ese es el intercambio. Ojalá lo hubiera hecho hace un año.
Si esto fue útil, sigue a @cryptowluha
Guarda esto antes de que se pierda. Si fue útil, compártelo con una persona que lo necesite.





