A Escada da IA Local: 10 Níveis para Eliminar sua Conta de US$ 200 em IA (De US$ 0 a US$ 4.700)

@RetroChainer
INGLÊShá 2 dias · 19 de jul. de 2026
106K
50
5
8
82

TL;DR

Um guia completo sobre hardware para IA local, classificando 10 opções de US$ 0 a US$ 4.700 com base em memória e desempenho. Explica como substituir assinaturas de nuvem caras por configurações privadas e locais usando ferramentas como o Ollama.

Em algum lugar agora mesmo um desenvolvedor está pagando US$ 200 por mês por IA e nunca fez as contas. ChatGPT Plus. Claude Pro. Cursor. Custos de API que sobem silenciosamente todo mês. Renova para sempre, e "para sempre" é muito tempo para alugar algo que você poderia ter.

Existe outra forma de pensar nisso. Uma caixa que fica na sua casa, roda IA localmente, custa alguns dólares por mês de eletricidade, mantém seus dados na sua própria máquina e nunca envia um único byte para o servidor de outra pessoa.

IA local em 2026 não é mais a triste alternativa que era há dois anos. Quantização melhor, arquiteturas de modelo mais enxutas e chips com memória unificada significam que uma máquina na sua mesa agora lida com talvez 80% do trabalho diário de IA: escrever, ajudar na programação, análise de documentos, resumir, classificar, automações, responder perguntas sobre seus próprios arquivos. Os outros 20%, o raciocínio de ponta e a programação de última geração, ainda pertencem à nuvem. Mas esses 20% não justificam uma conta de US$ 200 quando uma caixa única cobre o resto.

Esta é a escada. Dez degraus, da máquina que você já possui a um supercomputador de mesa, e as compensações honestas em cada etapa.

A ideia que muda tudo

Você não está comprando velocidade. Você está comprando memória.

Toda história de "não roda" volta para a mesma parede: um modelo que não coube na memória da caixa. Um modelo ou carrega ou não carrega. Velocidade só decide como ele se sente quando está rodando; memória decide se ele roda ou não.

Então, toda a escada é na verdade uma escada de memória. 8GB roda um modelo 7B. 24GB roda um modelo 32B confortavelmente. 128GB roda um modelo 70B e começa a flertar com os realmente grandes. Leia cada degrau abaixo através dessa lente e observe o padrão: as caixas que vão mais longe são aquelas com memória unificada, onde a CPU e a GPU compartilham um grande pool em vez de brigar por um pequeno pedaço murado de VRAM.

Uma ressalva antes das especificações, verdadeira para toda a lista: uma escassez global de DRAM está empurrando os preços da memória para cima ao longo de 2026, não para baixo. Cada número aqui é aproximado e subindo, o que é um argumento para comprar a caixa que você realmente vai usar, em vez de esperar por uma queda que pode não vir.

A escada

Degrau 1. A máquina que você já possui ($0)

Antes de gastar qualquer coisa, teste o fluxo de trabalho no que já está na sua mesa. Qualquer laptop com 8GB de RAM roda um modelo 7B através do Ollama. Não será rápido, mas responde à única pergunta que importa: a IA local é boa o suficiente para o que você realmente faz? Passe um fim de semana aqui antes de gastar um dólar em qualquer outro lugar.

RetroChainer - inline image

Degrau 2. Raspberry Pi 5, 16GB (cerca de $120)

O degrau do entusiasta. Um Pi 5 com 16GB rodará modelos de 1B a 3B através do Ollama, lentamente. Isso não é um motor diário, é uma prova de conceito que você pode deixar rodando em uma gaveta: um assistente minúsculo sempre ligado, um cérebro para automação residencial, um projeto de fim de semana. Compre para aprender, não para trabalhar.

RetroChainer - inline image

Degrau 3. NVIDIA Jetson Orin Nano Super ($249)

O ponto de entrada sério mais barato. Uma GPU NVIDIA real em uma caixa menor que uma carteira.

text
1Desempenho de IA: 67 TOPS
2GPU: 1024 núcleos Ampere
3RAM: 8GB LPDDR5 (compartilhada)
4Consumo: 7-25W
5Roda bem: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B

67 TOPS roda um modelo 7B de forma privada e para sempre. A classe 7B é rápida o suficiente para parecer instantânea e boa o suficiente para a maioria das tarefas diárias. Não tocará nada acima de 7B ou qualquer contexto longo que ultrapasse 8GB, mas a US$ 100/mês em assinaturas, ele se paga em dez semanas.

RetroChainer - inline image

Degrau 4. Apple Mac mini M4 (a partir de $599)

O servidor de IA doméstico silencioso padrão, por causa da memória unificada. Em um PC normal, a VRAM da GPU é uma parede dura. A Apple compartilha memória entre CPU e GPU, então o Mac mini roda maior do que sua ficha técnica sugere, permanece quase silencioso e consome pouca energia.

text
1Chip: Apple M4
2Memória unificada: 16-32GB (CPU + GPU compartilhada)
3Consumo: 10-30W sob carga
4Custo 24/7: aproximadamente US$ 3-8/mês
5Roda bem: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium

Ele faz tudo o que o Jetson faz, além de modelos maiores, contexto mais longo e vários serviços ao mesmo tempo. Esta é a caixa que as pessoas deixam ligada 24 horas por dia como o backend para suas automações. Os US$ 599 são o básico, no entanto, e a Apple cobra caro pela memória. Para IA local, a memória é o ponto, então precifique a configuração que você realmente precisa, não o preço de etiqueta.

RetroChainer - inline image

Degrau 5. RTX 3090 usada, 24GB (cerca de $700 pela placa)

A lenda do custo-benefício que se recusa a morrer. Seis anos de idade e ainda a melhor relação VRAM-por-dólar no mercado consumidor. Uma 3090 usada oferece 24GB de memória rápida por cerca de US$ 700, suficiente para rodar modelos de 24B a 32B com rendimento real, com suporte total a CUDA, então toda ferramenta funciona de fábrica.

text
1VRAM: 24GB GDDR6X
2Largura de banda: ~936 GB/s
3Preço usado: ~US$ 600-800 (apenas placa)
4Roda bem: Qwen 32B, Llama 3.1 8B-70B (quantizado), a maioria da classe 32B

O asterisco honesto: uma GPU não é um computador. Você precisa de um PC hospedeiro ao redor dela, então orce mais US$ 400 a US$ 600 para o resto da máquina. Mas se você já tem um desktop com um slot livre e uma fonte de alimentação grande o suficiente, nada mais nesta escada oferece 24GB tão barato.

RetroChainer - inline image

Degrau 6. AMD Radeon RX 7900 XTX, 24GB (cerca de $900 pela placa)

Os mesmos 24GB da 3090, nova, com garantia, e o software da AMD finalmente alcançou. No ROCm 7.x, a 7900 XTX roda Llama 3.1 8B a aproximadamente 96 tokens por segundo, cerca de três quartos de uma RTX 4090 por uma fração do preço. Para VRAM pura por dólar em hardware novo, nada da NVIDIA a toca no nível consumidor.

text
1VRAM: 24GB GDDR6
2Software: ROCm 7.x (suporte de primeira classe)
3Preço novo: ~US$ 899-1.400 (apenas placa)
4Roda bem: Llama 3.1 8B (~96 tok/s), classe 32B quantizada

A desvantagem é a mesma que segue a AMD em todos os lugares: o ROCm fechou a maior parte da lacuna com o CUDA, mas algumas ferramentas ainda assumem NVIDIA por padrão. Para Ollama e Open WebUI funciona bem hoje. Para pilhas de fine-tuning exóticas, espere alguns passos manuais a mais.

RetroChainer - inline image

Degrau 7. AMD Ryzen AI Max+ 395 "Strix Halo", 128GB (cerca de $1.999)

O ponto ideal de 2026, e a caixa que a maioria dessas listas esquece. O chip Strix Halo da AMD combina uma CPU Zen 5 de 16 núcleos com uma grande iGPU RDNA 3.5 e até 128GB de memória unificada em uma caixa pequena, por aproximadamente o que custa um desktop NVIDIA com um quarto da memória.

text
1Chip: Ryzen AI Max+ 395 (16 núcleos Zen 5)
2GPU: Radeon 8060S (40 núcleos RDNA 3.5)
3NPU: XDNA 2, 50 TOPS (~126 TOPS em todo o sistema)
4Memória unificada: até 128GB LPDDR5X (~96GB utilizáveis como VRAM)
5Preço: ~US$ 1.999 para 128GB / 2TB
6Roda bem: Llama 3.3 70B, Mixtral, a maioria dos modelos classe 70B

Você compra de duas maneiras. O GMKtec EVO-X2 é um mini PC 128GB completo por cerca de US$ 1.999. O Framework Desktop é o mesmo chip em um chassi reparável e atualizável, a partir de US$ 1.999 pela placa e cerca de US$ 2.850 totalmente montado. De qualquer forma, você carrega um modelo 70B em velocidade de conversação, o que nada abaixo deste degrau pode fazer. A maturidade do ROCm é a compensação, igual ao Degrau 6.

RetroChainer - inline image

Degrau 8. NVIDIA RTX 5090, 32GB (cerca de $3.000 pela placa)

A coisa mais rápida que uma pessoa normal pode colocar em uma torre normal. 32GB da memória de consumo mais rápida já feita, e velocidade bruta que deixa tudo abaixo para trás. Este é o degrau para pessoas que querem inferência local de ponta e treinamento ocasional, e que se importam mais com tokens por segundo do que com dólares por gigabyte.

text
1VRAM: 32GB GDDR7
2Preço novo: ~US$ 3.000+ (apenas placa)
3Roda bem: 32B em velocidade, 70B quantizado, modelos de imagem e vídeo

A matemática é brutal, no entanto. Custa três a quatro vezes mais que uma 3090 usada por 8GB extras de memória, mais um PC hospedeiro por cima. Compre porque você precisa da velocidade e da margem extra, não porque é eficiente. Não é.

RetroChainer - inline image

Degrau 9. Apple Mac Studio M3 Ultra, 96GB (a partir de $3.999)

A grande estação de trabalho silenciosa com memória unificada. O Mac Studio agrupa até 96GB entre CPU e GPU com aceleração Metal, roda modelos grandes quase silenciosamente, e faz isso em uma caixa que cabe em uma mesa sem uma curva de ventoinha de turbina de avião.

text
1Chip: M3 Ultra (até 32 núcleos CPU / 80 núcleos GPU)
2Memória unificada: até 96GB
3Preço: a partir de US$ 3.999
4Roda bem: Modelos classe 70B, contexto longo, múltiplos serviços

Vale a pena saber honestamente: a Apple retirou a configuração de 512GB no início de 2026 com a escassez de DRAM, então 96GB é o teto agora, onde antes alcançava muito mais. Ainda assim, para uma máquina silenciosa para o dia todo que roda modelos grandes e funciona como seu computador real, poucas coisas são tão agradáveis de se conviver.

RetroChainer - inline image

Degrau 10. NVIDIA DGX Spark, 128GB ($3.999 a $4.699)

O desktop que pensa que é um datacenter. Para fine-tuning de modelos abertos, hospedar assistentes 70B+, e executar pipelines de inferência que precisam de rendimento real.

text
1Chip: GB10 Grace Blackwell
2Rendimento IA: 1 PFLOP
3Memória unificada: 128GB LPDDR5x
4Armazenamento: 4TB Gen5 NVMe
5Consumo: 150-240W sob carga
6Melhor para: Modelos 70B-200B, fine-tuning, inferência de produção

128GB de memória unificada carrega modelos que uma GPU de consumo não consegue nem abrir, e duas unidades ligadas alcançam o território dos 400B. Preço honesto: foi lançado a US$ 3.999 em outubro de 2025 e desde então teve um aumento para cerca de US$ 4.699 com a escassez de memória (Tom's Hardware). Ao lado da caixa Strix Halo no Degrau 7, custa aproximadamente o dobro pelos mesmos 128GB. Você está pagando pela maturidade do CUDA e pelo rendimento, não por mais memória.

RetroChainer - inline image

A matemática honesta

text
1Gasto mensal típico com IA:
2ChatGPT Plus $20
3Claude Pro $20
4Cursor Pro $20
5Custos de API $50-200
6Total $110-260 / mês
7
8IA local mensal:
9Hardware $0 (já comprado)
10Eletricidade $2-15
11API $0
12Total $2-15 / mês

A US$ 100/mês em assinaturas, um Jetson de US$ 249 se paga em dez semanas, um Mac mini de US$ 599 em seis meses, uma build com 3090 usada em menos de um ano, uma caixa Strix Halo de US$ 2.000 em cerca de dezoito meses, e os degraus acima de US$ 4.000 só se você já estivesse queimando aluguel de GPU em nuvem na casa dos quatro dígitos por mês.

Agora a parte que o hype sempre pula. A caixa é um custo irrecuperável, e só "se paga" se você realmente continuaria pagando a assinatura. Comprar uma máquina de US$ 2.000 para economizar US$ 20 por mês é um negócio pior do que a assinatura, não melhor. O degrau certo é aquele que corresponde ao seu uso real, não à versão fantasiosa dele.

Qual é o seu degrau

Uso diário leve e curiosidade: comece no Degrau 1, depois compre o Jetson. Um assistente silencioso sempre ligado para uma casa ou pequena empresa: o Mac mini. O caminho mais barato para 24GB reais e modelos 32B: uma 3090 usada, ou a RX 7900 XTX se você quiser nova com garantia e não se importar com ROCm. A melhor experiência 70B sem dinheiro de datacenter: a caixa Strix Halo. Velocidade máxima de consumo: a RTX 5090. Uma estação de trabalho silenciosa com muita memória onde você também vive: o Mac Studio. Fine-tuning e pipelines de produção: o DGX Spark.

A configuração que leva uma tarde

O processo é idêntico em todos os degraus.

1. Instale o Ollama. Código aberto, transforma qualquer modelo em uma API local que fala a linguagem do OpenAI.

bash
1curl -fsSL https://ollama.com/install.sh | sh

2. Baixe um modelo dimensionado para a memória da sua caixa.

bash
1# Jetson 8GB ou Mac mini 16GB:
2ollama pull llama3.2
3
4# 24GB 3090 / 7900 XTX:
5ollama pull qwen2.5:32b
6
7# 128GB Strix Halo / DGX Spark:
8ollama pull llama3.3:70b

3. Mude uma linha no código que você já tem.

python
1# Antes, pagando por requisição:
2client = OpenAI(api_key="sk-...")
3
4# Depois, local e gratuito:
5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

Seu código roda igual. Nada sai da máquina, nada custa dinheiro por requisição.

4. (Opcional) Adicione uma interface de navegador com Open WebUI, e você terá um ChatGPT privado em localhost:3000.

bash
1docker run -d -p 3000:8080 \
2 --add-host=host.docker.internal:host-gateway \
3 -v open-webui:/app/backend/data \
4 ghcr.io/open-webui/open-webui:main

O que realmente rodar nele

O hardware é metade da decisão. O modelo é a outra metade. Um mapa aproximado para 2026:

Pequeno e rápido (cabe em 8-16GB): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B. Ótimo para rascunhos, classificação e perguntas e respostas sobre suas próprias anotações. O nível de trabalho (cabe em 24GB): Qwen 2.5 32B e Llama quantizado, forte o suficiente para ajuda real em programação e trabalho com documentos. O nível pesado (precisa de 64-128GB): Llama 3.3 70B e as variantes grandes do Qwen e Mixtral, onde a saída local começa a parecer próxima de um modelo de nuvem para tarefas do dia a dia.

A quantização é a alavanca silenciosa por trás de tudo isso. Um modelo 70B em uma quantização de 4 bits cabe onde a versão em precisão total nunca caberia, com um custo de qualidade pequeno e geralmente aceitável. Q4 a Q6 é a faixa sensata para a maioria das pessoas. Abaixo disso, a qualidade cai mais rápido do que a economia de memória vale.

O que você constrói depois que está rodando

Para uso pessoal, cobre as coisas diárias por alguns dólares por mês. A parte interessante é a automação de negócios, onde você conecta o modelo local ao n8n, a ferramenta de código aberto que o conecta ao Telegram, e-mail, calendário, CRM e centenas de serviços. Cada um desses roda sem que nada saia do seu prédio e sem custo por token:

text
1Recepcionista de IA:
2mensagens do cliente no Telegram -> n8n recebe -> modelo local lê a intenção
3-> calendário verifica disponibilidade -> reserva confirmada
4
5Análise de documentos:
6jogue 50 PDFs -> modelo local lê todos -> extrai fatos principais
7-> escreve um relatório estruturado
8
9Resumo diário:
10gatilho às 7h -> modelo lê suas anotações e tarefas -> resume o que importa
11-> envia para seu celular
12
13Enriquecimento de leads:
14nova linha em uma planilha -> modelo pesquisa a empresa -> redige uma abertura personalizada
15-> coloca na fila para sua revisão
16
17Reaproveitamento de conteúdo:
18uma gravação longa -> modelo transcreve e edita -> escreve os posts
19-> salva rascunhos para você aprovar
20
21Triagem de inbox:
22novo e-mail -> modelo classifica, etiqueta e redige uma resposta -> você pressiona enviar ou edita

Para trabalho com dados sensíveis, deixa de ser uma decisão de custo e se torna a única opção. Documentos legais, registros médicos, dados financeiros, qualquer coisa sob NDA não tem lugar em uma API de terceiros. A IA local processa na sua máquina e nunca sai.

O que realmente dá errado

Os 20% são reais. Modelos de ponta ainda vencem em raciocínio difícil, programação de última geração e pesquisa onde a melhor resposta única importa. A IA local é o cavalo de batalha confiável, privado e sempre ligado para os outros 80%, não um substituto para tudo. Mantenha uma assinatura de nuvem para os 20% difíceis e execute o resto em casa, e você tem ambos.

Memória é o teto, não TOPS. Compre para o tamanho do modelo que você quer executar, e lembre-se de que caixas com memória unificada vão mais longe do que um PC com especificações equivalentes e VRAM separada.

Uma GPU não é um computador. Os degraus 3090, 7900 XTX e 5090 todos precisam de uma máquina hospedeira ao redor deles. O preço da placa não é o preço do sistema, então adicione US$ 400 a US$ 600 antes de comparar com um mini PC pronto.

Os preços estão subindo. A escassez de DRAM já empurrou o DGX Spark para cima 18% e fez a Apple retirar seu Mac Studio de 512GB. O bom negócio de hoje pode custar mais no próximo trimestre.

A AMD economiza dinheiro e custa tempo. Strix Halo e a 7900 XTX oferecem a maior quantidade de memória por dólar, mas o ROCm ainda fica atrás do CUDA em ferramentas prontas para uso. Bom para Ollama hoje, mais paciência necessária para treinamento pesado.

Calor, ruído e quantização são as letras miúdas. Builds com GPUs grandes são barulhentas e quentes. Quantização agressiva economiza memória, mas come qualidade se você for longe demais. Nenhum é um impeditivo, mas ninguém menciona isso no discurso de vendas.

Duas coisas para fazer agora

Teste grátis primeiro. Instale o Ollama no computador que você já possui e execute um modelo 7B neste fim de semana. Qualquer máquina com 8GB faz isso. Prove o fluxo de trabalho antes de gastar um centavo em hardware.

Depois, compre um degrau acima das suas necessidades reais, não cinco. As pessoas que configuraram IA local silenciosamente em 2025 vão parecer muito à frente da curva em 2027, à medida que os preços da nuvem continuam subindo e o hardware local continua melhorando. A maioria das pessoas continuará pagando US$ 200 por mês por hábito. Alguns vão gastar uma tarde esta semana e nunca mais enviarão um único byte para o servidor de outra pessoa.

Eu analiso ferramentas de IA e o dinheiro que está sendo feito com elas regularmente assim. Siga para o próximo, e entre no meu Telegram: https://t.me/+lzSPoQ0svRU1ZWZi

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais