Eu rastreio cada centavo que gasto em infraestrutura de IA. No ano passado, uma rubrica não parava de crescer: aluguel de GPU em nuvem. No terceiro trimestre, já tinha chegado a US$ 1.900 por mês – e eu era quem faturava os clientes pelo trabalho que a gerava.
Essa conta não fecha. Você não constrói um negócio entregando 40% dos seus custos operacionais para o data center de outra pessoa.
Então comprei um DGX Spark. Aqui está o detalhamento.
1 / O Que o DGX Spark Realmente É
A NVIDIA passou 2025 comprimindo hardware de data center em um desktop. Eles o anunciaram como Project DIGITS na CES em janeiro, renomearam para DGX Spark na GTC em março e começaram a enviar em outubro. O resultado é uma caixa de 150×150×50mm que pesa 1,2kg e funciona em uma tomada comum.
As especificações:
Componente
Detalhe
Chip
GB10 Grace Blackwell Superchip
Computação de IA
1 PFLOP (FP4)
CPU
20 núcleos ARM (Grace)
Memória
128GB LPDDR5x, unificada
Armazenamento
4TB Gen5 NVMe
Rede
ConnectX-7 (encadeie duas unidades)
Consumo de energia
~150–240W sob carga
Preço
US$ 2.999
O número de petaflop é um número de marketing. O número que realmente importa é 128GB de memória unificada.
GPUs de consumo têm um teto rígido. Uma 4090 te dá 24GB de VRAM – no momento em que um modelo é maior que isso, ele não carrega. Uma 5090 eleva o teto para 32GB. O Spark coloca isso em 128GB, o que significa que ele roda modelos que uma placa de consumo de US$ 2.000 nem consegue abrir.
2 / O Muro da Memória, Explicado
Aqui está o que 128GB de memória unificada realmente desbloqueia:
- Llama 3.3 70B – precisão BF16 completa, sem truques de quantização necessários
- Qwen 3 (faixa de 30B–110B) – cabe perfeitamente
- Modelos classe DeepSeek de até 200B – quantizados, rodam sólidos
- Geração de imagem FLUX.1 – sim
- 405B parâmetros – dois Sparks ligados via ConnectX-7
Uma GPU de consumo termina em torno de uns apertados 30B. O Spark começa exatamente onde esse teto termina. Essa lacuna é toda a justificativa para comprar um.
3 / A Matemática: De Onde Vêm os US$ 22.000
Custos de GPU em nuvem para cargas de trabalho sérias de IA:
Tarefa
Custo mensal
A100 80GB, meio período
US$ 600–US$ 1.200
H100 para execuções de fine-tuning
US$ 1.000–US$ 2.500
Inferência 70B hospedada
US$ 300–US$ 900
Instância que você esqueceu de desligar
surpresa
Total realista para um construtor de IA
US$ 1.500–US$ 3.000
DGX Spark nas mesmas cargas de trabalho:
Item
Custo
Hardware
US$ 2.999 (uma vez)
Energia a ~200W
US$ 8–15/mês
Aluguel em nuvem
US$ 0
Mensal após a compra
~US$ 10
Com US$ 1.900/mês em custos de nuvem, o Spark se paga em menos de 7 semanas.
Depois disso: US$ 1.890 por mês que antes saíam do seu negócio permanecem nele. Com trabalho idêntico de clientes. Com faturas idênticas sendo emitidas.
Total do primeiro ano redirecionado de volta para o seu negócio: US$ 22.680.
4 / A Camada de Software Não É um Problema
O Spark roda DGX OS – a build Ubuntu da NVIDIA com a pilha completa de IA pré-carregada: CUDA, NIM, NeMo. Ollama, vLLM, PyTorch, Hugging Face e llama.cpp rodam sem modificação no primeiro dia.
Se você já estava usando um endpoint em nuvem, a migração é uma única alteração de linha:
1# Antes: pagando por hora2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# Depois: sua mesa, medidor desligado5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
Mesmo caminho de código. Mesma saída JSON. Mesmo comportamento. Nada é cobrado. Nada sai do prédio.
5 / O Caso de Negócio Além da Economia de Custos
O Spark não é apenas um cortador de custos. Ele remove a barreira econômica em trabalhos que antes eram caros demais para serem executados livremente.
Se você faz trabalho de IA para clientes:
Execuções de fine-tuning que antes custavam US$ 400 em recibos de nuvem agora são gratuitas. Rode durante a noite. Rode três variantes com hiperparâmetros diferentes. Nenhuma fatura chega de manhã. Você pode implantar um agente de codificação privado em toda a base de código proprietária de um cliente, ou um assistente sempre ativo que toda a equipe usa – e seu custo unitário é eletricidade, não tokens de API. Cada cliente após o primeiro é margem pura.
Se você lida com dados sensíveis:
Este é o ângulo que a maioria das pessoas subestima. Contratos. Documentos legais. Registros de pacientes. Dados financeiros. Qualquer coisa coberta por um NDA que você nunca colocaria em uma API pública. No Spark, esses dados nunca cruzam sua rede. Nenhum termo de serviço governa uma máquina que você possui totalmente.
"Seus dados nunca saem do prédio" fecha negócios em indústrias regulamentadas que os fornecedores de nuvem simplesmente não conseguem alcançar. Escritórios de advocacia, clínicas, consultores financeiros – esses clientes pagarão um prêmio significativo por essa garantia.
A mudança de mentalidade que ninguém menciona:
O preço da nuvem te treina a racionar computação. Você hesita antes de deixar um agente em loop, antes de reexecutar um arquivo completo, antes de ajustar uma ideia que pode não funcionar. Cada execução tem um custo em dólar anexado, então você executa menos delas.
Possua a caixa e essa hesitação desaparece. Na maioria das vezes, o melhor trabalho estava por trás dessa hesitação.
6 / O Que o Spark Não É
Sendo direto sobre as limitações:
- Velocidade bruta – uma 5090 é mais rápida em qualquer coisa que caiba em seus 32GB de VRAM
- Escala – atender milhares de usuários simultâneos ainda é trabalho de data center
- Modelos de fronteira além de 405B – dois Sparks ligados lidam com 405B; além disso, você precisa de hardware diferente
- Usuários de baixo volume – se você está gastando US$ 20/mês em chamadas de API, esta não é a ferramenta certa
O limite honesto: US$ 1.000+/mês em gastos com GPU em nuvem é onde o Spark se torna uma decisão óbvia. Abaixo de US$ 500/mês, uma placa de consumo ou acesso à API é a jogada mais inteligente. A caixa é dimensionada para cargas de trabalho sérias, não para uso casual.
7 / O Retorno em Diferentes Níveis de Gasto
Hábito mensal em nuvem
Período de retorno
US$ 1.900/mês
~6 semanas
US$ 1.000/mês
~3 meses
US$ 500/mês
~6 meses
US$ 200/mês
Fique na nuvem
8 / O Panorama Geral
Em 2024, rodar um modelo 70B exigia um data center ou uma conta de nuvem de US$ 1.900/mês. Em 2026, exige uma caixa de US$ 2.999 do tamanho de um livro de bolso e uma tomada.
A NVIDIA precificou o DGX Spark em US$ 2.999 deliberadamente – eles querem que a próxima geração de produtos de IA seja construída em seu silício, localmente, em escala. Jensen entregou pessoalmente unidades iniciais para Musk e Altman. Dell, HP, ASUS e Lenovo estão todas construindo suas próprias máquinas GB10. A pilha de software é ajustada para este chip praticamente toda semana.
As taxas de GPU em nuvem não estão diminuindo. Os requisitos de privacidade de dados estão se tornando mais rigorosos. Os clientes estão cada vez mais perguntando para onde seus dados vão fisicamente antes de assinar qualquer coisa.
As pessoas que estão rodando modelos de classe de fronteira em uma mesa em 2026 parecerão visionárias em 2028.
A aritmética é direta: US$ 2.999 uma vez versus US$ 1.900 todo mês. A caixa se paga antes do final do primeiro trimestre, depois roda a US$ 10/mês pelo tempo que você precisar.
Essa é a troca. Queria tê-la feito um ano atrás.
Se isso foi útil, siga @cryptowluha
Marque isso antes que seja enterrado. Se foi útil, compartilhe com uma pessoa que precisa.





