Şu anda bir yerde bir geliştirici, ayda 200 dolar ödeyip AI kullanıyor ve bunun hesabını hiç yapmamış. ChatGPT Plus. Claude Pro. Cursor. Her ay sessizce artan API maliyetleri. Bu gider sonsuza kadar yenilenir ve sonsuza kadar, sahip olabileceğin bir şeyi kiralamak için çok uzun bir süredir.
Bunu düşünmenin başka bir yolu daha var. Evinizde duran, AI'yı yerel olarak çalıştıran, ayda birkaç dolarlık elektrik tüketen, verilerinizi kendi makinenizde tutan ve başka birinin sunucusuna tek bir bayt bile göndermeyen bir kutu.
2026'da yerel AI, iki yıl önceki üzücü uzlaşma değil. Daha iyi niceleme, daha yalın model mimarileri ve birleşik bellek yongaları sayesinde, masanızdaki bir makine artık günlük AI işlerinin belki de %80'ini halledebiliyor: yazma, kodlama yardımı, belge analizi, özetleme, sınıflandırma, otomasyonlar, kendi dosyalarınız üzerinde soru cevaplama. Diğer %20'lik kısım, yani ileri düzey akıl yürütme ve son teknoloji kodlama, hâlâ buluta ait. Ancak bu %20'lik kısım, geri kalanını karşılayan tek seferlik bir kutu varken 200 dolarlık bir faturayı haklı çıkarmaz.
İşte merdiven bu. Zaten sahip olduğunuz makineden bir masaüstü süper bilgisayarına kadar on basamak ve her adımdaki dürüst ödünleşimler.
Her şeyi değiştiren tek fikir
Hız satın almıyorsunuz. Bellek satın alıyorsunuz.
Her "çalışmıyor" hikayesi aynı duvara dayanır: kutunun belleğine sığmayan bir model. Bir model ya yüklenir ya da yüklenmez. Hız yalnızca çalışırken nasıl hissettirdiğini belirler; bellek ise çalışıp çalışmayacağını belirler.
Bu nedenle tüm merdiven aslında bir bellek merdivenidir. 8GB, 7B modeli çalıştırır. 24GB, 32B modelini rahatça çalıştırır. 128GB, 70B modelini çalıştırır ve gerçekten büyük olanlarla flört etmeye başlar. Aşağıdaki her basamağı bu mercekten okuyun ve şu kalıbı not edin: en uzağa ulaşan kutular, CPU ve GPU'nun küçük, duvarla çevrili bir VRAM parçası için savaşmak yerine büyük bir havuzu paylaştığı birleşik belleğe sahip olanlardır.
Özelliklerden önce bir uyarı, listenin tamamı için geçerli: küresel bir DRAM kıtlığı, bellek fiyatlarını 2026 boyunca aşağı değil yukarı itiyor. Buradaki her sayı yaklaşıktır ve yukarı doğru kaymaktadır; bu da, gelmeyebilecek bir düşüşü beklemek yerine gerçekten kullanacağınız kutuyu satın almanız için bir argümandır.
Merdiven
Basamak 1. Zaten sahip olduğunuz makine (0 $)
Herhangi bir şey harcamadan önce, iş akışını masanızda zaten olanla test edin. 8GB RAM'e sahip herhangi bir dizüstü bilgisayar, Ollama aracılığıyla 7B modelini çalıştırır. Hızlı olmayacak, ancak önemli olan tek soruyu yanıtlar: yerel AI, gerçekte yaptığınız işler için yeterince iyi mi? Başka bir yere bir kuruş harcamadan önce bir hafta sonunuzu burada geçirin.

Basamak 2. Raspberry Pi 5, 16GB (yaklaşık 120 $)
Meraklıların basamağı. 16GB'lık bir Pi 5, Ollama aracılığıyla 1B ila 3B modelleri yavaşça çalıştıracaktır. Bu günlük bir sürücü değil, bir çekmecede çalışır durumda bırakabileceğiniz bir konsept kanıtıdır: küçük, her zaman açık bir asistan, bir ev otomasyon beyni, bir hafta sonu projesi. Çalışmak için değil, öğrenmek için satın alın.

Basamak 3. NVIDIA Jetson Orin Nano Super (249 $)
En ucuz ciddi giriş noktası. Bir cüzdandan daha küçük bir kutuda gerçek bir NVIDIA GPU.
1AI performansı: 67 TOPS2GPU: 1024 çekirdekli Ampere3RAM: 8GB LPDDR5 (paylaşımlı)4Güç: 7-25W5İyi çalıştırdığı: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B
67 TOPS, 7B modelini özel ve sonsuza kadar çalıştırır. 7B sınıfı, anlık hissettirecek kadar hızlıdır ve çoğu günlük görev için yeterince iyidir. 7B'nin üzerindeki hiçbir şeye veya 8GB'ı aşan uzun bağlamlara dokunamaz, ancak aylık 100 $'lık aboneliklerde kendini on haftada amorti eder.

Basamak 4. Apple Mac mini M4 (599 $'dan başlayan)
Varsayılan sessiz ev AI sunucusu, çünkü birleşik belleğe sahip. Normal bir PC'de GPU'nun VRAM'i sert bir duvardır. Apple, CPU ve GPU arasında belleği paylaşır, bu nedenle Mac mini, teknik özellik sayfasının önerdiğinden daha büyük çalışır, neredeyse sessiz kalır ve az güç tüketir.
1Yonga: Apple M42Birleşik bellek: 16-32GB (paylaşımlı CPU + GPU)3Güç: Yük altında 10-30W47/24 elektrik maliyeti: yaklaşık 3-8 $/ay5İyi çalıştırdığı: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium
Jetson'ın yaptığı her şeyi artı daha büyük modelleri, daha uzun bağlamları ve aynı anda birkaç hizmeti yapar. Bu, insanların otomasyonlarının arka ucu olarak günün her saati açık bıraktığı kutudur. 599 $ taban fiyatıdır, ancak Apple bellek için yüksek ücret alır. Yerel AI için bellek önemlidir, bu nedenle ihtiyacınız olan yapılandırmayı fiyatlandırın, etiket fiyatını değil.

Basamak 5. Kullanılmış RTX 3090, 24GB (kart için yaklaşık 700 $)
Ölmeyi reddeden değer efsanesi. Altı yaşında ve hâlâ tüketici pazarında VRAM başına en iyi fiyat-performansı sunuyor. Kullanılmış bir 3090, size yaklaşık 700 $ karşılığında 24GB hızlı bellek verir, gerçek verimle 24B ila 32B modellerini çalıştırmak için yeterlidir ve tam CUDA desteği sayesinde her araç kutudan çıktığı gibi çalışır.
1VRAM: 24GB GDDR6X2Bant genişliği: ~936 GB/s3Kullanılmış fiyat: ~600-800 $ (sadece kart)4İyi çalıştırdığı: Qwen 32B, Llama 3.1 8B-70B (nicelenmiş), çoğu 32B sınıfı
Dürüst olmak gerekirse bir yıldız: GPU bir bilgisayar değildir. Etrafında bir ana bilgisayar PC'ye ihtiyacınız var, bu nedenle makinenin geri kalanı için 400 ila 600 dolar daha bütçe ayırın. Ancak halihazırda boş bir yuvası ve yeterince büyük bir güç kaynağı olan bir masaüstünüz varsa, bu merdivendeki başka hiçbir şey size bu kadar ucuza 24GB vermez.

Basamak 6. AMD Radeon RX 7900 XTX, 24GB (kart için yaklaşık 900 $)
3090 ile aynı 24GB, yeni, garantili ve AMD'nin yazılımı nihayet arayı kapattı. ROCm 7.x'te 7900 XTX, Llama 3.1 8B'yi saniyede yaklaşık 96 token ile çalıştırır, bu bir RTX 4090'ın kabaca dörtte üçü kadardır ve fiyatının çok altındadır. Yeni donanımda VRAM başına saf fiyat-performansta, tüketici seviyesinde NVIDIA'dan hiçbir şey ona yaklaşamaz.
1VRAM: 24GB GDDR62Yazılım: ROCm 7.x (birinci sınıf destek)3Yeni fiyat: ~899-1.400 $ (sadece kart)4İyi çalıştırdığı: Llama 3.1 8B (~96 tok/s), 32B sınıfı nicelenmiş
Buradaki püf nokta, AMD'yi her yerde takip edenle aynı: ROCm, CUDA ile arasındaki farkı büyük ölçüde kapattı, ancak bazı araçlar hâlâ varsayılan olarak NVIDIA'yı varsayıyor. Ollama ve Open WebUI için bugün iyi çalışıyor. Egzotik ince ayar yığınları için birkaç manuel adım daha bekleyin.

Basamak 7. AMD Ryzen AI Max+ 395 "Strix Halo," 128GB (yaklaşık 1.999 $)
2026'nın tatlı noktası ve bu listelerin çoğunun unuttuğu kutu. AMD'nin Strix Halo yongası, 16 çekirdekli bir Zen 5 CPU'yu büyük bir RDNA 3.5 iGPU ve küçük bir kutuda 128GB'a kadar birleşik bellek ile birleştirir ve bunu, NVIDIA masaüstünün bellek miktarının dörtte biriyle maliyetinin kabaca aynısına yapar.
1Yonga: Ryzen AI Max+ 395 (16 çekirdekli Zen 5)2GPU: Radeon 8060S (40 çekirdekli RDNA 3.5)3NPU: XDNA 2, 50 TOPS (sistem genelinde ~126 TOPS)4Birleşik bellek: 128GB'a kadar LPDDR5X (~96GB VRAM olarak kullanılabilir)5Fiyat: 128GB / 2TB için ~1.999 $6İyi çalıştırdığı: Llama 3.3 70B, Mixtral, çoğu 70B sınıfı model
Bunu iki şekilde satın alırsınız. GMKtec EVO-X2, yaklaşık 1.999 $'a tam bir 128GB mini bilgisayardır. Framework Desktop, onarılabilir, yükseltilebilir bir kasada aynı yongadır, kart için 1.999 $'dan başlar ve tam donanımlı olarak yaklaşık 2.850 $'dır. Her iki şekilde de, bu basamağın altındaki hiçbir şeyin yapamayacağı bir şekilde, konuşma hızında bir 70B modeli yüklersiniz. Ödünleşim, Basamak 6 ile aynı olan ROCm olgunluğudur.

Basamak 8. NVIDIA RTX 5090, 32GB (kart için yaklaşık 3.000 $)
Normal bir insanın normal bir kuleye koyabileceği en hızlı şey. Üretilmiş en hızlı tüketici belleğinden 32GB ve altındaki her şeyi geride bırakan saf hız. Bu basamak, öncü sınıfı yerel çıkarım ve ara sıra eğitim isteyen ve gigabayt başına dolardan çok saniye başına token'i önemseyen kişiler içindir.
1VRAM: 32GB GDDR72Yeni fiyat: ~3.000 $+ (sadece kart)3İyi çalıştırdığı: 32B hızla, 70B nicelenmiş, görüntü ve video modelleri
Ancak hesap acımasız. 8GB daha fazla bellek için kullanılmış bir 3090'ın üç ila dört katı maliyeti var, üstelik üstüne bir ana bilgisayar PC de ekleyin. Verimli olduğu için değil, hıza ve ek alana ihtiyacınız olduğu için satın alın. Verimli değil.

Basamak 9. Apple Mac Studio M3 Ultra, 96GB (3.999 $'dan başlayan)
Büyük, sessiz, birleşik bellekli iş istasyonu. Mac Studio, Metal hızlandırmasıyla 96GB'a kadar belleği CPU ve GPU arasında havuzlar, büyük modelleri neredeyse sessizce çalıştırır ve bunu jet motoru fan sesi olmayan, masaya sığan bir kutuda yapar.
1Yonga: M3 Ultra (32 çekirdekli CPU / 80 çekirdekli GPU'ya kadar)2Birleşik bellek: 96GB'a kadar3Fiyat: 3.999 $'dan başlayan4İyi çalıştırdığı: 70B sınıfı modeller, uzun bağlam, birden çok hizmet
Dürüstçe bilinmesi gereken: Apple, DRAM kıtlığı nedeniyle 2026'nın başlarında 512GB yapılandırmasını geri çekti, bu nedenle 96GB artık eskiden çok daha yükseğe ulaştığı yerdeki tavan. Yine de, büyük modelleri çalıştıran ve aynı zamanda gerçek bilgisayarınız olarak işlev gören sessiz, tüm günlük bir makine için, birlikte yaşaması bu kadar keyifli çok az şey vardır.

Basamak 10. NVIDIA DGX Spark, 128GB (3.999 $ ila 4.699 $)
Kendini bir veri merkezi sanan masaüstü. Açık modellerde ince ayar yapmak, 70B+ asistanları barındırmak ve gerçek verim gerektiren çıkarım boru hatlarını çalıştırmak için.
1Yonga: GB10 Grace Blackwell2AI verimi: 1 PFLOP3Birleşik bellek: 128GB LPDDR5x4Depolama: 4TB Gen5 NVMe5Güç: Yük altında 150-240W6En iyi: 70B-200B modeller, ince ayar, üretim çıkarımı
128GB birleşik bellek, bir tüketici GPU'sunun açamayacağı modelleri yükler ve birbirine bağlı iki birim 400B bölgesine ulaşır. Fiyat dürüstlüğü: Ekim 2025'te 3.999 $'dan piyasaya sürüldü ve o zamandan beri bellek kıtlığı nedeniyle yaklaşık 4.699 $'a yükseldi (Tom's Hardware). Basamak 7'deki Strix Halo kutusunun yanında, aynı 128GB için kabaca iki katı maliyeti var. Daha fazla bellek için değil, CUDA olgunluğu ve verim için ödüyorsunuz.

Dürüst hesap
1Tipik aylık AI harcaması:2ChatGPT Plus $203Claude Pro $204Cursor Pro $205API maliyetleri $50-2006Toplam $110-260 / ay78Yerel AI aylık:9Donanım $0 (zaten satın alındı)10Elektrik $2-1511API $012Toplam $2-15 / ay
Aylık 100 $'lık aboneliklerde, 249 $'lık bir Jetson on haftada, 599 $'lık bir Mac mini altı ayda, kullanılmış bir 3090 kurulumu bir yıldan kısa sürede, 2.000 $'lık bir Strix Halo kutusu yaklaşık on sekiz ayda ve 4.000 $+ basamaklar ise yalnızca zaten ayda dört haneli rakamlarla bulut GPU kiralama yakıyorsanız kendini amorti eder.
Şimdi heyecanın her zaman atladığı kısım. Kutu batık bir maliyettir ve yalnızca aboneliği gerçekten ödemeye devam edecek olsaydınız "kendini amorti eder". Ayda 20 $ tasarruf etmek için 2.000 $'lık bir makine satın almak, abonelikten daha kötü bir anlaşmadır, daha iyi değil. Doğru basamak, gerçek kullanımınıza uygun olandır, onun fantezi versiyonuna değil.
Hangi basamak sizin
Hafif günlük kullanım ve merak: Basamak 1'den başlayın, ardından Jetson'ı satın alın. Bir ev veya küçük işletme için sessiz, her zaman açık bir asistan: Mac mini. Gerçek 24GB ve 32B modellere giden en ucuz yol: kullanılmış bir 3090 veya yeni ve garantili istiyorsanız ve ROCm ile sorununuz yoksa RX 7900 XTX. Veri merkezi parası olmadan en iyi 70B deneyimi: Strix Halo kutusu. Maksimum tüketici hızı: RTX 5090. Aynı zamanda içinde yaşadığınız sessiz, büyük bellekli bir iş istasyonu: Mac Studio. İnce ayar ve üretim boru hatları: DGX Spark.
Bir öğleden sonra süren kurulum
Her basamakta işlem aynıdır.
1. Ollama'yı kurun. Açık kaynak, herhangi bir modeli OpenAI'nin dilini konuşan yerel bir API'ye dönüştürür.
1curl -fsSL https://ollama.com/install.sh | sh
2. Kutunuzun belleğine uygun boyutta bir model çekin.
1# 8GB Jetson veya 16GB Mac mini:2ollama pull llama3.234# 24GB 3090 / 7900 XTX:5ollama pull qwen2.5:32b67# 128GB Strix Halo / DGX Spark:8ollama pull llama3.3:70b
3. Zaten sahip olduğunuz kodda bir satırı değiştirin.
1# Önce, istek başına ödeme yapıyor:2client = OpenAI(api_key="sk-...")34# Sonra, yerel ve ücretsiz:5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
Kodunuz aynı şekilde çalışır. Makineden hiçbir şey çıkmaz, istek başına hiçbir şey para harcamaz.
4. (İsteğe bağlı) Open WebUI ile bir tarayıcı arayüzü ekleyin ve localhost:3000 adresinde özel bir ChatGPT'niz olsun.
1docker run -d -p 3000:8080 \2 --add-host=host.docker.internal:host-gateway \3 -v open-webui:/app/backend/data \4 ghcr.io/open-webui/open-webui:main
Üzerinde gerçekte ne çalıştırmalı
Donanım kararın yarısıdır. Model diğer yarısıdır. 2026 için kabaca bir harita:
Küçük ve hızlı (8-16GB sığar): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B. Taslak oluşturma, sınıflandırma ve kendi notlarınız üzerinde soru-cevap için harika. İş gücü kademesi (24GB sığar): Qwen 2.5 32B ve nicelenmiş Llama, gerçek kodlama yardımı ve belge işleri için yeterince güçlü. Ağır kademe (64-128GB gerektirir): Llama 3.3 70B ve büyük Qwen ile Mixtral varyantları, yerel çıktının günlük görevler için bir bulut modeline yakın hissetmeye başladığı yer.
Tüm bunların altında sessiz kaldıraç nicelemedir. 4 bitlik bir nicellemede 70B modeli, tam duyarlıklı sürümün asla sığmayacağı yere sığar ve küçük, genellikle kabul edilebilir bir kalite kaybıyla. Çoğu kişi için Q4 ila Q6 mantıklı aralıktır. Bunun altında, kalite, bellek tasarrufunun değeceğinden daha hızlı düşer.
Çalışırken ne inşa edersiniz
Kişisel kullanım için, ayda birkaç dolara günlük işleri karşılar. İlginç kısım, yerel modeli, onu Telegram, e-posta, takvim, CRM ve yüzlerce hizmete bağlayan açık kaynak araç olan n8n'e bağladığınız iş otomasyonudur. Bunların her biri, binanızdan hiçbir şey çıkmadan ve token başına maliyet olmadan çalışır:
1AI resepsiyonist:2müşteri Telegram'dan mesaj atar -> n8n alır -> yerel model niyeti okur3-> takvim uygunluğu kontrol eder -> rezervasyon onaylanır45Belge analizi:650 PDF bırakın -> yerel model hepsini okur -> önemli gerçekleri çıkarır7-> yapılandırılmış bir rapor yazar89Günlük brifing:10sabah 7'de tetikleyici -> model notlarınızı ve görevlerinizi okur -> önemli olanı özetler11-> telefonunuza gönderir1213Potansiyel müşteri zenginleştirme:14sayfada yeni satır -> model şirketi araştırır -> kişiselleştirilmiş bir açılış taslağı hazırlar15-> incelemeniz için sıraya koyar1617İçerik yeniden kullanımı:18uzun bir kayıt -> model yazıya döker ve keser -> gönderileri yazar19-> onaylamanız için taslakları kaydeder2021Gelen kutusu triyajı:22yeni e-posta -> model sıralar, etiketler ve bir yanıt taslağı hazırlar -> siz gönder veya düzenle dersiniz
Gizliliğe duyarlı işler için bu bir maliyet kararı olmaktan çıkar ve tek seçenek haline gelir. Yasal belgeler, tıbbi kayıtlar, finansal veriler, Gizlilik Sözleşmesi (NDA) kapsamındaki herhangi bir şeyin üçüncü taraf bir API'de işi yoktur. Yerel AI, onu makinenizde işler ve asla terk etmez.
Gerçekte ne ters gider
%20'lik kısım gerçektir. Öncü modeller hâlâ zorlu akıl yürütme, son teknoloji kodlama ve en iyi tek cevabın önemli olduğu araştırmalarda kazanır. Yerel AI, diğer %80'lik kısım için güvenilir, özel, her zaman açık iş gücüdür, her şeyin yerine geçmez. Zor %20'lik kısım için bir bulut aboneliğini saklayın ve gerisini evde çalıştırın, ikisine de sahip olursunuz.
Bellek tavandır, TOPS değil. Çalıştırmak istediğiniz model boyutu için satın alın ve birleşik bellekli kutuların, ayrı VRAM'e sahip teknik özellik olarak eşleşen bir PC'den daha uzağa uzandığını unutmayın.
Bir GPU bir bilgisayar değildir. 3090, 7900 XTX ve 5090 basamaklarının tümü, etraflarında bir ana bilgisayar makinesine ihtiyaç duyar. Kart fiyatı sistem fiyatı değildir, bu nedenle tam bir mini bilgisayarla karşılaştırmadan önce 400 ila 600 $ ekleyin.
Fiyatlar yukarı hareket ediyor. DRAM kıtlığı, DGX Spark'ı %18 artırdı ve Apple'ın 512GB Mac Studio'yu geri çekmesine neden oldu. Bugünkü iyi fırsat, gelecek çeyrekte daha pahalı olabilir.
AMD paradan tasarruf ettirir ve zamandan yer. Strix Halo ve 7900 XTX, size dolar başına en fazla belleği verir, ancak ROCm, anahtar teslim araçlarda hâlâ CUDA'nın gerisindedir. Bugün Ollama için iyi, ağır eğitim için daha fazla sabır gerekir.
Isı, gürültü ve niceleme küçük yazılardır. Büyük GPU kurulumları gürültülü ve sıcaktır. Agresif niceleme bellekten tasarruf sağlar ancak çok ileri götürürseniz kaliteyi yer. Hiçbiri anlaşma bozucu değildir, ancak satış konuşmasında kimse bunlardan bahsetmez.
Şimdi yapılacak iki şey
Önce ücretsiz deneyin. Zaten sahip olduğunuz bilgisayara Ollama'yı kurun ve bu hafta sonu 7B modelini çalıştırın. Herhangi bir 8GB makine bunu yapar. Donanıma bir kuruş harcamadan önce iş akışını test edin.
Ardından, gerçek ihtiyaçlarınızın bir basamak üstünü satın alın, beş basamak değil. 2025'te sessizce yerel AI kuran kişiler, 2027'ye gelindiğinde bulut fiyatları yükselmeye devam ederken ve yerel donanım iyileşirken eğrinin çok ilerisinde görünecekler. Çoğu insan alışkanlıktan ayda 200 $ ödemeye devam edecek. Birkaçı bu hafta bir öğleden sonra harcayacak ve asla başka birinin sunucusuna tek bir bayt daha göndermeyecek.
AI araçlarını ve bunlarla yapılan parayı düzenli olarak bu şekilde analiz ediyorum. Bir sonraki için takip edin ve Telegram grubuma katılın: https://t.me/+lzSPoQ0svRU1ZWZi





