YouMind
Oturum aç

DGX Spark El Kitabı

@exolabs
İNGILIZCE25 Eyl 2026
160K
560
80
26
1.2K

TL;DR

Donanım bağlantısı, model seçimi, kuantalama ve maliyet analizini kapsayan, yerel yapay zeka çıkarımı için NVIDIA DGX Spark ünitelerini dağıtmaya yönelik kapsamlı bir el kitabı.

Yazar: @0xSero

İnceleyenler: @alexocheema ve @alexzfunk

Özel teşekkürler: @MiaAI_lab

Çıkarımı (inference) yerel olarak çalıştırmayı düşünüyorsanız, şüphesiz bu ilginç altın tuğlayla tanışacaksınız. Yapay zekâyı yerel olarak sunmak için üretilmiş; küçük, şık, sessiz ve nispeten uygun fiyatlı bir makine (NVIDIA'nın DGX Spark sayfası).

DGX Spark'ı ilk duyduğumda pek ısınmamıştım. 128 GB belleğine rağmen 273 GB/s bellek bant genişliği bana çok düşük gelmişti. Kıyaslama yapmak gerekirse, bir RTX 5090 yalnızca 32 GB VRAM'e sahip olmasına rağmen yaklaşık 6,5 kat daha fazla bant genişliğine (1.792 GB/s) sahip.

EXO Labs - inline image

Spark ilk piyasaya sürüldüğünde, spekülatif kod çözme (speculative decoding) gibi çıkarım mühendisliği pratikleri henüz bu kadar yaygın değildi ve küçük modellerin çoğu da bugünkü kadar yetenekli değildi.

Yapay zekâ sektörü ilerleyip büyüdükçe zekâ giderek daha küçük boyutlara sıkıştırılıyor; bu da bu küçük kutuların tüm potansiyeliyle kullanılabilmesini sağlıyor.

  1. Çıkarım mühendisliğine olan talep artıyor.
  2. LLM'ler çıkarım mühendisliğinde giderek daha yetkin hale geliyor.
  3. Yüksek kaliteli çıkarım sistemi iyileştiriyor.

Artık DGX Spark, hız açısından bulut servisleriyle yarışan son derece akıllı modelleri evinizin veya ofisinizin rahatlığında çalıştırabiliyor. Kod yazmanıza, vergilerinizi düzenlemenize, ders çalışmanıza ya da sadece eğlenmenize yardımcı olacak bol miktarda yapay zekâ yazılımı mevcut.

Hız derken tek bir kişinin gördüğü saniyedeki token sayısını kastediyorum. Bulut donanımları çok daha hızlıdır ancak sağlayıcılar bunu birçok kullanıcı arasında paylaştırır ve token başına maliyeti optimize eder, bu yüzden her kullanıcıya daha az pay düşer. Evde ise kutu tamamen sizindir, dolayısıyla tüm güç size gider. Daha fazlası için ileri düzey notlara bakabilirsiniz.

Spark'lar birbirine bağlanmak için tasarlandı

DGX Spark'lar çok az güç tüketir. Genellikle bir model yüklüyken ve hizmet verirken 95 W civarında çalışırlar.

Bu nedenle fazla soğutmaya ihtiyaç duymazlar ve harici GPU'lara kıyasla oldukça sessizdirler. Bunlardan 2 ila 4 tanesini hiçbir endişe duymadan standart bir Amerikan elektrik devresine bağlayabilirsiniz. Asıl mesele saf verimlilik değil, budur: bellek hızı birimi başına bir veri merkezi B300'ü joule başına kabaca iki kat daha fazla iş yapar (ileri düzey notlara bakın). Spark ise sıradan bir duvar prizine takılır.

Her Spark'ta 200 Gb/s, yani 25 GB/s hıza sahip iki QSFP portlu bir ConnectX-7 ağ kartı bulunur. Bu sayede belleği ve efektif bellek bant genişliğini artırmak için Spark'ları birbirine bağlayabilirsiniz.

EXO Labs - inline image

DGX Spark'ların bağlantı şekli

Tensör paralelliği (tensor parallelism) ile her ağırlık matrisi Spark'lar arasında bölünür ve her Spark diğerleriyle aynı anda yalnızca kendi belleğinden kendi payını okur. Böylece okuma hızları toplanır (NVIDIA'nın kendi ölçeklendirme testi):

  • İki Spark için 546 GB/s
  • Üç Spark için 819 GB/s
  • Dört Spark için 1.092 GB/s

Bu ölçeklendirme neredeyse doğrusal (lineer) ilerler. NVIDIA'nın kendi testinde yazma hızı iki Spark'ta 2 kat, dört Spark'ta 3,7 kat arttı (tablo 3). Bu kadar iyi çalışmasının nedeni, ConnectX-7 bağlantısının çok düşük gecikmeye sahip olması ve CUDA'nın GPU kodunun içinden Spark'lar arasında veri taşıyabilmesidir (nedeni hakkında daha fazla bilgi).

Bellek de aynı şekilde toplanır: Her biri 128 GB, dördü için 512 GB; Spark başına yaklaşık 120 GB'lık kısım yapay zekâ iş yükleri için fiilen kullanılabilir durumdadır.

Spark'ları üst üste ekleyebilme imkânı, cihazın en büyük sorunu olan düşük bellek bant genişliği sorununu hafifletir. Standart bir prizde düşük güç tüketimiyle çalışması, onu tek bir kullanıcı veya küçük bir ev için inanılmaz bir seçenek haline getiriyor.

EXO Labs - inline image

Gerçek hayatta bağlanmış DGX Spark'lar

Dense (Yoğun) vs MoE

Şu anda iki ana model mimarisi var: seyrek (sparse) ve yoğun (dense). Qwen3.6-35B gibi Mixture-of-Experts (MoE) modelleri, üretilen her token için yalnızca 3B parametreyi etkinleştirir; bu da Qwen3.8-27B'den 9 kat daha azdır.

Bu durum seyrek LLM'leri DGX Spark için özellikle uygun hale getirir. Düşük bellek bant genişliğiyle mükemmel bir uyum sağlarlar ve modelin toplam boyutuna rağmen kullanıcılara hızlı bir deneyim sunarlar.

MoE sadece DGX Spark için iyi değildir. Veri merkezlerinde de daha iyi bir mimaridir. Yerel kullanım için değişen şey bir eşik oldu: Belirli bir hız bekliyoruz ve yeterince akıllı olan yoğun modeller, evde o hızda çalışamayacak kadar büyüktü. MoE modelleri bu çizgiyi aştı, bu yüzden artık yerel donanımda hem kullanışlı hem de hızlılar. Yoğun modeller de er ya da geç bu seviyeye ulaşabilir.

EXO Labs - inline image

Dense LLM'ler vs MoE'ler

Spekülatif Kod Çözme (Speculative Decoding)

MTP, DSpark veya DFlash destekli herhangi bir LLM çok daha uygun olacaktır; çünkü taslak (draft) modeller genellikle çok küçüktür ve doğru bir token üretmek için fazla hesaplama gücü gerektirmezler.

Spark'ların sunabileceği verimi (throughput), Spark'ın bolca sahip olduğu 1 ila 2 GB bellek bedeliyle önemli ölçüde artırır.

Tıpkı MoE gibi, spekülatif kod çözme de sadece evde değil her yerde işe yarar. Ancak ikisinin birleşimi, yerel yapay zekâyı o eşiğin üzerine taşıyan şey oldu. Eskiden en iyi açık kaynaklı modeller ev donanımlarında acı verecek kadar yavaş çalışırdı.

EXO Labs - inline image

Spekülatif kod çözme verimi nasıl artırır?

Aynı anda birçok ajan

Tek bir Spark, her biri hâlâ sohbet hızında olmak üzere sekiz veya daha fazla isteği aynı anda karşılayabilir. Örneğin; temel kodlama, bilgisayar ve tarayıcı kullanımı, video ve görüntü düzenleme ile genel destek konularında yetenekli olan Qwen3.6-35B, her biri yaklaşık 40 tok/s hızında olmak üzere 8 eşzamanlı oturuma hizmet verebilir.

Kıyaslama yapmak gerekirse, ChatGPT Pro aboneliğinde GPT-6-Astra ortalama 37 tok/s hızında çalışır.

EXO Labs - inline image

Astra ortalama hızları

Bunun sebebi, Spark'ın bellek hızına oranla çok yüksek bir işlem gücüne sahip olmasıdır. Sekiz kişiye hizmet vermek, her adımda modeli yine bir kez okumak ama sekiz kat daha fazla matematiksel işlem yapmak anlamına gelir ve Spark'ın fazlasıyla işlem gücü vardır. 16-bit'te, 273 GB/s için yaklaşık 100 TFLOPS sunar; bu da okunan her bayt bellek için kabaca 370 işleme denk gelir. Bir M3 Ultra ise 819 GB/s için yaklaşık 26 TFLOPS sunar, yani bayt başına kabaca 32 işlem (EXO'nun verileri). Bu, Spark'ın Mac'lerde bulunmayan 4-bit donanımını saymadan önce bile bayt başına yaklaşık 11 kat daha fazla işlem gücü demektir.

Gerçek işler

Tek bir Spark üzerinde çalışan Qwen3.6-35B, bir gün içinde 80.000'den fazla izlenen bir video oluşturdu. Sadece 3 dakika sürdü: 3 videonun bulunduğu bir klasörü aldı, bunları birleştirdi ve kare hızını X'in sınırının altında tutarak videoyu 4 kat hızlandırdı.

https://x.com/0xSero/status/2072206209323802746

Maliyetler

DGX Spark başlangıçta 3.999 $ fiyat etiketiyle listelenmişti ve bu fiyat 4.699 $'a yükseltildi. 2026'da tüm donanımlarda fiyatlar arttı.

Gerçek fiyat ise daha yüksek. NVIDIA'nın kendi mağazası tükendi. Bulabildiğim en ucuz cihaz yaklaşık 5.000 $, ikinci el olanlar 6.000 $ civarına satılıyor ve 21 Eylül'de NVIDIA'nın sitesinin, beş hafta önce 4.699 $ ödediğim aynı kutu için 7.999 $ istediğini gördüm.

EXO Labs - inline image

GX10 fiyatlandırması

21 Eylül'de NVIDIA'nın pazar yeri. Gönderi

EXO Labs - inline image

4000$ - 4700%

Satın alma tavsiyeleri

  • Herhangi bir GB10 kutusu iş görür. ASUS, Dell, MSI ve diğerleri aynı çipin kendi versiyonlarını satıyor. Aynı yazılımı ve aynı kurulum tariflerini (recipe) çalıştırırlar. SSD boyutunu kontrol edin: Birkaç büyük modeli elinizde tutmaya başladığınızda 1 TB hızla dolar. Ben olsam 4 TB alırdım.
  • İkinci Spark ile birlikte kabloyu da satın alın, ikisini birbirine bağlamak için buna ihtiyacınız olacak.
  • Bazı OEM'ler daha iyi hava akışına sahip Spark'lar sunuyor

Güç, gürültü ve elektrik faturanız

Harici GPU'ların ürettiği gürültü ve ısı hafife alınacak gibi değildir; 4 adet 3090 ile beşte bir bellek için kolayca 1600-2000W harcayabilirsiniz. RTX Pro 6000 kule kasamı odamı düzenli olarak 35°C'ye çıkardığı için çalışma odamdan taşımak zorunda kaldım.

Standart bir ABD ev elektrik devresi, tüm gün boyunca güvenle yaklaşık 1.440 watt kaldırabilir (ABD elektrik yönetmeliği). Bunun üzeri, bir elektrikçi çağırmanız ve yeni bir hat çektirmeniz gerektiği anlamına gelir.

  • Model çalıştıran tek bir Spark yaklaşık 90-200 watt kullanır (ServeTheHome). 7/24 açık bırakırsanız bu ayda yaklaşık 12 $ demektir.
  • Dört Spark birlikte yaklaşık 500 watt ve bir switch yaklaşık 240W kullanır. Ayda yaklaşık 66-100 $ tutar ve hepsi tek bir prize sığar.
  • Benim dört GPU'lu sistemim 1.600 watt'a kadar çıkıyor. Bu, tek bir devrenin kaldırabileceğinden fazla ve ayda yaklaşık 300 $ demek.
EXO Labs - inline image

Bu rakamlar nereden geliyor. Her değer farklı türde bir okuma olduğu için yan yana şöyle sıralayabiliriz. Aylık maliyet, makinenin kWh başına 18 sentten günde 24 saat o tüketimle çalıştığı varsayılarak hesaplanmıştır:

EXO Labs - inline image

Testlerim

Dört Spark neden 90 W'ın dört katından fazla kullanıyor? 90 W rakamı, tek bir Spark'ın bir modeli kendi başına sunduğu durumdur. Büyük bir model dörde bölündüğünde, her Spark her kelime üzerinde çalışır ve ağ bağlantısını meşgul eder, bu yüzden her biri daha fazla güç çeker; benim okumalarımda ortalama yaklaşık 125 W. Yani ayda 12 $ ve 66 $, 7/24 tam kapasite çalıştırmanın maliyetidir. Boşta kalma süreleri olan gerçek kullanım daha az tutar.

Elektrik de ucuzlamıyor. ABD'deki ev fiyatları kısmen yeni veri merkezleri yüzünden bu yıl yaklaşık %5 artarak kWh başına 18 sent civarına çıktı. Ağustos ayında, GPU sistemi, iki Spark ve dört klima çalışırken kendi faturam iki katına çıkarak ayda 1.000 $'a ulaştı.

EXO Labs - inline image

DGX Spark sesleri

Peki ya gürültü? Benim GPU sistemim jet motoru gibi ses çıkarıyor. Dört Spark'ımın ulaştığı en yüksek ses seviyesi ise şu:

Birkaç pratik not:

EXO Labs - inline image

Gerçekten çalıştırdığım altı model

Düzinesini denedim. Sürekli geri döndüğüm altı model bunlar.

EXO Labs - inline image

Bir token kabaca bir kelimenin dörtte üçüdür ve 30'un üzerindeki her şey normal bir sohbet gibi hissettirir.

Her rakam neden bir görevi ifade ediyor? Bu kurulumların çoğu, küçük bir yardımcı modelin önceden tahmin yaptığı spekülatif kod çözmeyi kullanır. Kod ve JSON'u tahmin etmek kolaydır, düzyazıyı değil; bu yüzden aynı makinedeki aynı model, birinde diğerinin iki katı hızda çalışabilir. Daha uzun promptlar da işleri yavaşlatır. Bu yüzden buradaki her hız, neyin yazıldığını ve promptun ne kadar uzun olduğunu belirtir:

Bunu birçok görevde ölçmenin doğru yolu, 11 kategoriden gerçek promptlarda ve 1K ile 32K token arasındaki giriş uzunluklarında spekülatif kod çözmeyi test eden NVIDIA'nın SPEED-Bench testidir. Henüz Spark'larda çalıştırmadım.

EXO Labs - inline image

İki Spark üzerinde animasyonlar ve küçük bir oyun oluşturan Qwen3.8-Flash-Next. (21 Eylül) Gönderi

Nereden indirilir? Her modelin resmi bir sayfası var ve 6. bölümde her biri için test edilmiş bir Spark kurulum tarifi bulunuyor:

Büyük modeller nasıl sığıyor?

Cevap: kuantizasyon (quantization). Kuantizasyon, bir modelin ağırlıklarını sıkıştırır ve kayıplı bir işlemdir: her ağırlık daha az bitle (diyelim ki 16 yerine 4) saklanır, böylece model dörtte bir boyuta küçülür ancak bazı detaylar kaybolur. Amaç, ağırlıkları sıkıştırırken orijinal modelin davranışına mümkün olduğunca yakın kalmaktır.

Ne kadar çok sıkıştırırsanız, kalite o kadar düşer. Turboderp bunu Qwen3.8-27B için ölçtü. Her nokta sıkıştırılmış bir versiyonu temsil eder. Sola doğru gittikçe boyut küçülür, aşağı indikçe orijinale yaklaşılır:

EXO Labs - inline image

Farklı sağlayıcılardan elde edilen Qwen3.6-35B-A3B'nin sıkıştırılmış versiyonları için disk boyutuna karşı ortalama KL sapması. Logaritmik ölçek. Grafik: https://huggingface.co/turboderp/Qwen3.8-27B-exl3

Spark'ta iki format önem taşıyor:

  • NVFP4, NVIDIA'nın 4-bit formatıdır ve Spark'ın çipi bunu doğrudan okur. Qwen3.6-35B 72 GB'tan 24 GB'a düşer ve tek bir Spark'a fazlasıyla sığar.
  • EXL3 tam olarak kaç bit kullanacağınızı seçmenizi sağlar. 4 bit'te GLM-5.3-Flash 176 GB'tır ve iki Spark'a sığar. 2 bit'te 85 GB olur ve biraz keskinliğini kaybetse de tek bir Spark'a sığar.
EXO Labs - inline image

İpucu:

Küçük modeller için 4 bit ideal noktadır, büyük modeller için 3 bit.

Sıkıştırılmış bir modelin hâlâ iyi olup olmadığını nasıl anlarsınız? İyi model kartları, küçük versiyonun orijinale ne kadar yakın kaldığını raporlar. Bakmanız gereken iki rakam:

  • Top-1 uyumu: Küçük modelin, orijinal modelle aynı sonraki kelimeyi seçme sıklığı. Yüksek olması iyidir. Benim tek Spark'lık GLM-5.3-Flash modelim zamanın yaklaşık %80'inde uyuşuyor.
  • KL sapması: Tahminlerinin orijinalden ne kadar saptığı. Düşük olması iyidir. Benim budanmamış 3-bit GLM-5.3 modelim 0.089 puan alıyor. Budanmış 197 GB'lık versiyon ise 0.511 puan alıyor. Daha az Spark'a sığdırmanın bedeli bu.

6. Tek Spark'tan dört Spark'a: Adım adım yol haritası

En çok sorulan kısım burası. Adım adım ilerleyin. Her adım kendi başına çalışır, bu yüzden nerede memnun kalırsanız orada durabilirsiniz.

EXO Labs - inline image

Aşağıdaki kurulum tariflerinin çoğu, en iyi Spark yapılandırmalarını tek bir komut dosyasıyla klonlayıp başlayabileceğiniz repolar halinde paketleyen MiaAI Lab'dan geliyor. Birkaçı bana ait. Her biri ne üzerinde test edildiğini ve ne kadar hızlı çalıştığını listeliyor.

Bunları her Spark'ta bir kez yapın:

  1. Güncelleyin. DGX Dashboard üzerinden güncellemeleri çalıştırın ve yeniden başlatın.
  2. Dizüstü bilgisayarınızdan erişin. NVIDIA Sync veya düz SSH kullanın. Evinizin dışından erişmek için NVIDIA'nın bir Tailscale playbook'u var.
  3. Bir Hugging Face hesabı ve tokeni oluşturun. Çoğu tarif modelleri bununla indirir. Bunu asla repo'nun içine değil, bir .env dosyasına koyun.
  4. Diskinizi kontrol edin. Modeller büyüktür. Tek Spark'lık bir tarif yaklaşık 25 ila 130 GB boş alan gerektirir. Dört Spark'lık DeepSeek tarifi, ilk Spark'ta yaklaşık 476 GB ister.
  5. Docker zaten kurulu. DGX OS onunla birlikte gelir ve hemen hemen her tarif onun içinde çalışır, böylece Python paketlerini elle kurmazsınız.

Adım 1: Tek Spark

LM Studio ile başlayın. NVIDIA'nın adım adım rehberini takip edin, Qwen3.6-35B'yi indirin ve sohbet etmeye başlayın. Yaklaşık bir saat sürer. Bu, daha zor şeylere geçmeden önce kutunun çalıştığını size gösterir.

Sonra bir tarife geçin. Tarifler, LM Studio'dan daha hızlı olan ve aynı anda birçok ajana hizmet verebilen vLLM veya SGLang kullanır. Birini seçin:

  1. Qwen3.6-35B (4-bit NVFP4) MiaAI Lab tek kullanıcı için 95 tok/s, sekiz kullanıcı için toplam 317 ~50 GB
  2. Qwen3.8-27B (4-bit NVFP4) MiaAI Lab DSpark yardımcısıyla kodda ~51 tok/s, sohbette ~23 ~24 GB
  3. Qwen3.8-Flash-Next (4-bit NVFP4) MiaAI Lab tek kullanıcı için 48,7 tok/s, sekiz kullanıcı için toplam 162,9 ~130 GB
  4. GLM-5.3-Flash (2-bit EXL3) benim tarifim veya Mia'nın tarifinin tek Spark'lık versiyonu 10 ila 25 tok/s, 262K bağlam, vizyon ~85 GB

İlki en kolayı. Sadece üç satır:

bash
1git clone <https://github.com/MiaAI-Lab/Unsloth-Qwen3.6-35b-NVFP4-DGX-Spark.git>
2cd Unsloth-Qwen3.6-35b-NVFP4-DGX-Spark
3./start.sh

Çalışmaya başladığında, Spark üzerinde OpenAI tarzı bir adresiniz olur. Pi, opencode, Open WebUI veya kullandığınız her hangi bir aracı ona yönlendirin.

İpucu:

Bir model başlamıyorsa, sorun neredeyse her zaman bellektir. Önce diğer modelleri kapatın. Tek bir Spark, aynı anda tek bir büyük model çalıştırır.

Adım 2: İki Spark

En çok tavsiye ettiğim kurulum bu. Ağustos ayında dediğim gibi: "2 DGX Spark ve işiniz halloldu."

EXO Labs - inline image

2 dgx spark

Kablo. İki QSFP portu arasına kısa bir QSFP kablosuna ihtiyacınız var. Bunlardan herhangi biri iş görür (kablo rehberi):

  • NVIDIA'nın kendi kablosu: DGX Spark için QSFP Kablo 0,4 m, 99,99 $. Genelde stokta olmuyor.
  • NVIDIA'nın dokümanlarında geçenler: Amphenol NJAAKK-N911 veya Luxshare LMTQF022-SD-R, 0,5 m, yaklaşık 159 $ ile 187 $ arası.
  • Daha ucuz bir 200G seçeneği: NVIDIA MCP1650-V00AE30, yaklaşık 84 $.

Hangisini alırsanız alın bağlantı 200 Gb/s hızında çalışır. Bunun için USB-C veya 10 GbE portunu kullanmayın. Çok yavaş kalırlar.

Bağlantıyı kurun. NVIDIA'nın iki Spark'ı bağlama playbook'unu takip edin. Bu, her porta bir adres verir ve hızı kontrol eder. Ardından ilk Spark'tan ("head") ikinci Spark'a ("worker") şifresiz SSH kurun. İki Spark'lı her tarif buna ihtiyaç duyar.

Bunu sizin için claude veya gpt'ye kurdurmanızı tavsiye ederim, çok daha kolay oluyor.

Bir tarif seçin:

  1. Qwen3.8-Flash-Next (4-bit NVFP4) MiaAI Lab MTP ile tek kullanıcı için 52,1 tok/s, 1M'ye kadar bağlam
  2. GLM-5.3-Flash (4-bit EXL3) MiaAI Lab tek kullanıcı için 62,9 tok/s, dört kullanıcı için toplam 146,5, 850K bağlam
  3. DeepSeek-V4.1-Flash (2,9-bit EXL3) MiaAI Lab kodda 38,8 ila 43,0 tok/s, 600K bağlam
  4. GLM-5.3 (3-bit EXL3, 197 GB'a budanmış) model kartım sığıyor; hız henüz ölçülmedi

İki Spark'lı tariflerin çoğu birbirine benzer: örnek ayarları kopyalayın, her iki Spark'ın adresini girin, indirin ve başlatın. İşte GLM-5.3-Flash için olanı:

bash
1cp .env.example .env # HEAD_IP ve WORKER_IP değerlerini ayarlayın
2./download.sh
3./start.sh

Dikkat:

Spark'ları bağlamak işe yarıyor ama yazılımın en cilasız olduğu yer burası. Test edilmiş bir tarifi takip edin ve ilk seferinde bir öğleden sonrayı gözden çıkarın.

Adım 3: Üç Spark

Üç Spark için switch gerekmez. Her Spark'ın iki QSFP portu vardır, bu yüzden onları bir üçgen şeklinde kablolayabilirsiniz: A'dan B'ye, B'den C'ye, C'den A'ya. Bu üç kablo demektir. NVIDIA bunu switch'siz halka (switchless ring) olarak destekliyor.

Üç Spark size yaklaşık 384 GB verir. Bu, ikisinin alamayacağı şeyler için yeterlidir:

  • DeepSeek-V4.1-Flash'ın doğal hassasiyetiyle çalışması. MiaAI Lab'ın tarifi onu üç Spark'lı üçgende, tek kullanıcı için 51,0 tok/s hızında ve 256K bağlamla çalıştırır. Başlamadan önce SSH, Docker ve ağ bağlantılarını kontrol eden bir "doctor" komutu vardır.
  • Daha fazla alanla GLM-5.3-Flash. İki Spark'lı EXL3 tarifinin üç Spark için bir start-tp3.sh dosyası var.
  • Budanmamış GLM-5.3. Benim 293 GB'lık derlemem yaklaşık üç Spark'lık belleğe ihtiyaç duyuyor.

DeepSeek tarifi, daha büyük olanların nasıl çalıştığına dair iyi bir örnektir. Tek değil, birkaç adımdan oluşur:

bash
1./start.sh doctor # ssh, docker, bağlantıları ve diski kontrol eder
2./start.sh share # model klasörünü diğer Spark'larla paylaşır
3./start.sh serve # worker'ları, ardından head'i başlatır

İpucu:

Bazı modeller yalnızca 2 veya 4'e eşit şekilde bölünür. Üçüncüsünü satın almadan önce tarifin "3x" dediğinden emin olun.

Adım 4: Dört Spark

Dört Spark size yaklaşık 512 GB verir. Bunları bağlamanın iki yolu var.

Seçenek A: Switch (benim kullandığım). Her Spark, 200 GbE bir switch'e bir kabloyla bağlanır, böylece her biri diğerine tek atlama (hop) mesafesinde olur. NVIDIA'nın bunun için bir playbook'u var. İnsanların kullandığı switch'ler:

Eylül ayında söylediğim gibi: "Piyasada MikroTik switch'li 4x Spark'tan daha iyi bir fırsat olduğunu düşünmüyorum."

EXO Labs - inline image

Seçenek B: Switch yok. Dördünü bir halka şeklinde bağlayın, her Spark iki komşusuna kablolanır. Komşu olmayan Spark'lar aralarındaki üzerinden haberleşir. Switch masrafından kurtarır ama kurulumu daha zordur:

  • SparkRing, anahtarsız (switchless) ikili ve dörtlü Spark halkaları için eksiksiz bir yazılım yığınıdır. Alfa aşamasında bir yazılım olduğu için sürüm sabitlemeyi unutmayın.
  • Bu GLM-5.3-Flash tarifi, dört kısa 100G kablo ve yamalanmış bir NCCL ile dörtlü Spark halkasında çalışır. Genellikle saniyede yaklaşık 45 token, ısındığında ise 100'e kadar çıkar.

Bir tarif seçin:

  • DeepSeek-V4.1-Flash (yerel) MiaAI Lab, start-tp4.sh tek kullanıcı için 45,4 tok/s, on altı kullanıcı için toplam 134,2 tok/s, 1M bağlam
  • GLM-5.3-Flash (4-bit NVFP4) anahtarsız halka genellikle ~45 tok/s, ısındığında ~100 tok/s

Dörtlü kurulumda elde ettiğim en iyi sonuçlar; DFlash2 yardımcı modeliyle GLM-5.3-Flash için 118 tok/s ve kısa promptlarda DeepSeek-V4.1-Flash için 83,8 ila 95,3 tok/s oldu (gönderi).

EXO Labs - inline image

Her adımda işinize yarayacak araçlar

  • \\sparkDash:\\ tüm Spark'larınızı tek pencerede görebileceğiniz bir web paneli. GPU, bellek, ağ ve canlı saniye başına token değerleri. Bu rehberdeki hızların birçoğu bu araçla ölçüldü.
  • \\NVIDIA'nın Spark playbook'ları:\\ LM Studio, Ollama, vLLM, Spark'ları birbirine bağlama ve daha fazlası için resmi rehberler.
  • \\local-ai-registry:\\ benim tariflerim ve yaptığım tüm hız testleri.
  • \\b12x:\\ birçok Spark tarifinin temelindeki hızlı matematik kütüphanesi. Bunu kendiniz kurmuyorsunuz; tarifler sizin yerinize kuruyor. Aşağıdaki gelişmiş notlara göz atın.
EXO Labs - inline image

Sonuç

Spark tam anlamıyla bir bellek kutusu. Devasa modelleri barındırıyor, ev elektriğiyle sessizce çalıştırıyor ve yanına her yeni bir tane eklediğinizde performansı artıyor.

Bugün başlıyorsanız:

  1. Bir tane alın ve ilk günden itibaren LM Studio üzerinden Qwen3.6-35B çalıştırın.
  2. Hız veya çoklu ajan ihtiyacınız olduğunda bir tarife geçin.
  3. GLM-5.3-Flash veya DeepSeek-V4.1-Flash istediğinizde ikinci Spark'ı ve kabloyu alın. Çoğu kişi için durulması gereken nokta burasıdır.
  4. Üçe veya dörde ancak en büyük modelleri istiyorsanız ya da aynı anda birkaç model çalıştırmak istiyorsanız çıkın.

Tekrar alır mıydım? Kesinlikle. Baştan başlıyor olsaydım, ilk gün iki tane alırdım.

Gelişmiş: Spark'ları bağlamak ölçeklenmeyi nasıl etkiler?

Bir Spark kullanmak için bunları bilmenize gerek yok. Rakamların neden böyle göründüğünü merak edenler için hazırladım.

Yazma işlemlerinde neredeyse doğrusal bir artış

Modelin ürettiği her kelime, modelin aktif ağırlıklarının bellekten okunması anlamına gelir. Modeli Spark'lara böldüğünüzde her biri kendi payını aynı anda okur, dolayısıyla okuma hızları toplanır.

NVIDIA bunu ölçtü. Bir, iki ve dört Spark'a geçildiğinde her kelimenin yazılma süresi 269 ms'den 133 ms'ye, oradan da 72 ms'ye düştü. Yani iki cihazla 2,0x, dört cihazla 3,7x hızlanma sağlandı (NVIDIA'nın blogu, tablo 3).

EXO Labs - inline image

Bu kadar yaklaşmasının sebebi, ConnectX-7 bağlantısının çok düşük gecikme süresine sahip olması ve Spark'lar arasındaki veri alışverişinin doğrudan GPU kodunun içinde gerçekleşebilmesi. Mac'ler için hazırlanan bu açıklama aynı mantığı daha detaylı anlatıyor.

Her katmandan sonra, bir sonraki katman başlamadan önce Spark'lar kısmi sonuçlarını takas eder. Takas edilen veri küçüktür ama bu işlem her katman ve her kelime için tekrarlanır. Her biri, Spark ekledikçe azalmayan küçük bir zaman maliyeti yaratır.

  • Bağlantı 200 Gb/s, yani yaklaşık 25 GB/s. Bu, Spark'ın kendi bellek hızının onda biri. Ancak takaslar küçük olduğu için sorun olmuyor.
  • RDMA kullanıyor. Veri, CPU tarafından kopyalanmadan doğrudan bir Spark'ın belleğinden diğerine aktarılıyor. Her QSFP portu iki adet 100 Gb/s'lik parça olarak görünür ve tam 200 hıza ulaşmak için yazılımın ikisini de kullanması gerekir (detaylar). NVIDIA'nın bunun için geliştirdiği NCCL kütüphanesi bu işi hallediyor.
  • Okuma, yazma kadar iyi ölçeklenmiyor. Aynı NVIDIA testinde, 32K token uzunluğundaki bir promptu okumak iki Spark ile 1,6x, dört Spark ile 2,1x hızlandı. Okuma işlemi, her adımda Spark'lar arasında çok daha fazla veri taşır.
  • Halkalar ekstra atlama (hop) ekler. Üçlü Spark üçgeninde her Spark diğer ikisine kablolu bağlıdır. Dörtlü Spark halkasında bazı çiftler komşu üzerinden haberleşir. Bir anahtar (switch) ise herkesi tek atlama mesafesine getirir. SparkRing, halkaları hızlandırmak için kendi takas kodunu (SIRCL) yazar.
  • Mixture-of-experts modelleri ikinci bir bölünme ekler. Tarifler genellikle tensor parallel'i, farklı Spark'ların farklı uzmanları tuttuğu "expert parallel" ile birleştirir.

Hızlanmanın diğer iki yolu

  • Aynı anda çok sayıda kullanıcı. Spark, modeli her adımda yalnızca bir kez okur ve herkese bu tek okumadan yanıt verir. Bu yüzden toplam hız, tek kullanıcı hızından çok daha hızlı artar.
  • İleriye dönük tahmin yapan spekülatif bir çözücü modeli. MTP, DSpark ve DFlash2'nin hepsi bunu yapar. Küçük ve hızlı bir yardımcı model birkaç kelime taslağı oluşturur, büyük model ise hepsini tek seferde kontrol eder. Tahminler doğru çıktığında, bir kelimenin bedeline birkaç kelime alırsınız. GLM-5.3-Flash'in aynı tarifte düz metinde 27 tok/s'den yapılandırılmış çıktıda 65 tok/s'ye çıkmasının sırrı budur.
EXO Labs - inline image

Tek bir Spark üzerinde 4 bit ile çalışan Qwen3.6-35B-A3B, hızlandırıcı yardımcı model açık durumda. Kaynak: local-ai-registry hız testi, Ağustos 2026.

Bulut Yapay Zeka ile Yerel Yapay Zeka Farklı Dünyalar

Buluttaki bir GPU, Spark'tan çok daha hızlıdır. Ancak bulut sağlayıcıları her GPU'yu birçok kullanıcıyla paylaşır ve token başına maliyet ile kullanıcı başına hız arasındaki dengeyi kendileri belirler. Çoğu maliyeti seçtiği için, her kullanıcı donanımın tek bir kişiye verebileceğinden daha az token alır. InferenceX, Qwen3.8-Flash-Next için bu dengeyi grafiklere döküyor.

Evde ise böyle bir ödünleşim yoktur. Kutu sizindir, dolayısıyla tüm gücünü tek bir kişi için harcayabilirsiniz. Donanımı bulut kadar güçlü olmasa bile bir Spark'ın bulut hizmeti kadar hızlı hissettirmesinin nedeni budur.

sm_121: Spark yazılımları neden kendi dünyasını oluşturuyor?

Her NVIDIA GPU'nun, yazılımlara hangi talimat setlerine sahip olduğunu bildiren bir "hesaplama yeteneği" (compute capability) numarası vardır. Spark'ın GPU'su 12.1, yani sm_121'dir (Simon Willison'ın ilk incelemesi). RTX 5090 ve RTX PRO 6000, yakın akrabası olan sm_120'dir. NVIDIA'nın veri merkezi çipleri B200 ve B300 ise sm_100 ve sm_103'tür, yani farklı bir ailedendir.

Bu önemlidir çünkü en hızlı yapay zeka kodları her seferinde tek bir aile için yazılır. Spark piyasaya çıktığında birçok kod ya hiç çalışmıyor ya da yavaş çalışıyordu (NVIDIA forumu, vLLM sorunu).

Çözüm, insanların Spark'a özel kodlar yazmasıyla geldi:

  • Local Inference Lab tarafından geliştirilen b12x, sm_120 ve sm_121 için bir çekirdek (kernel) kütüphanesidir: DGX Spark, RTX Spark, RTX 5090 ve RTX PRO 6000. 4-bit matris matematiğini (NVFP4, MXFP4), DeepSeek tarzı modeller için attention mekanizmasını, mixture-of-experts katmanlarını ve hızlı bir model yükleyiciyi kapsar. pip install b12x komutuyla kurulur ve vLLM tarifleri flashinfer_b12x gibi bayraklarla devreye sokar. Qwen3.6-35B tarifi bunu kullanıyor.
  • SparkInfer, b12x'in eski adıdır. Eski bağlantı artık b12x'e yönlendiriliyor. Benim tek Spark'lı DeepSeek tarifim, hem okuma hem yazma için onun attention kodunu kullanıyor. Bunu, RTX kartlar için ayrı bir çalışma zamanı olan gittensor'ın sparkinfer projesiyle karıştırmayın (yalnızca sm_120).
  • ExLlamaV3, EXL3 modellerini çalıştıran altyapıdır. MiaAI Lab, Arm (GB10) portu ve yardımcı model desteği içeren bir fork sürdürüyor.
  • lil, Local Inference Lab'in başlatıcısıdır. Makinenin düzenini okur ve tek bir Spark veya bağlı bir grup için uygun vLLM komutunu oluşturur.

Gelişmiş: Araştırma makinesi olarak Spark

Beklemediğim kısım burasıydı. Spark yazma konusunda yavaş olsa da okuma konusunda gerçekten çok başarılı. Modeller üzerindeki araştırma işlerinin çoğu zaten okumadan ibaret.

Spark'ın en iyi yaptığı şey: prefill

Bir model iki farklı iş yapar:

  • Prefill, promptunuzu okuma aşamasıdır. Promptun tamamı tek seferde işlendiği için sınırı saf hesaplama gücü belirler. GB10'da bundan bolca var: 4-bit matematikte 1 petaflop'a kadar güç sunuyor.
  • Decode, yanıtı kelime kelime yazma aşamasıdır. Her kelime modelin bellekten yeniden okunması anlamına geldiği için sınırı bellek hızı belirler. İşte Spark'ın zayıf karnı burası.

Bu yüzden bir Spark, promptları yazdığından 13 ila 41 kat daha hızlı okur:

EXO Labs - inline image

Dört Spark üzerinde DeepSeek-V4.1-Flash: 32K token uzunluğundaki bir promptu okurken 3.360 tok/s, 131K'da 3.273 tok/s; yazma hızı ise 70-95 civarında kalıyor. (20 Eylül) Gönderi

Araştırmacıların buna neden ihtiyacı var?

Modelleri küçültmek için yaptığım hemen her şey yazma değil, okuma işlemidir:

  • Kuantizasyon (daha az bit). EXL3 ve NVFP4 derlemeleri, örnek metni modelden geçirip her katmanın her bit genişliğinde ne kadar kayıp yaşadığını ölçerek oluşturulur. Bu tamamen okumadır.
  • Budama (daha az uzman). REAP, örnek metni bir mixture-of-experts modelinden geçirir ve her uzmanın ne kadar kullanıldığını kaydeder. En az işe yarayan uzmanlar budanır. Benim 197 GB'lık GLM-5.3 modelim 256 uzmandan 168'ini koruyor. Bu da okuma gerektirir.
  • Kalite kontrolü. Top-1 uyumu ve KL divergence, aynı metnin hem orijinal hem de küçük modelden okunup tahminlerinin karşılaştırılmasıyla elde edilir. Yine okuma.
  • Uzun bağlam testleri. Bir modelin 262.000 token içinde tek bir gerçeği bulup bulamadığını kontrol etmek, çoğunlukla tek bir çok uzun okuma işlemidir.

Benim iş akışım da tam olarak bu yüzden değişti. "Artık tüm budama/exl3/kıyaslama işlerimi DGX Spark'larda yapıyorum, 6000'leri çıkarım (inference) için saklıyorum. Daha yavaş ama 12 saat yerine 2-3 gün sürmesi sorun değil." 100.000 indirmeyi geçen tek Spark'lık DeepSeek modelim, REAP ile budanmış ve EXL3 ile sıkıştırılmış bir modeldir.

Bunun araştırma hedefleriyle bağlantısı

Amacınız bir model hakkında bir şeyler öğrenmekse Spark harika bir uyum sağlar:

  • Büyük modeli barındırabilir. Bir küme kiralamak yerine 300B'lik bir modeli bir veya iki kutuda ölçebilirsiniz.
  • Ev elektriğiyle günlerce çalışabilir. Uzun kalibrasyon işleri ve değerlendirmeler, yüksek bir fatura gelmeden gözetimsiz çalıştırılabilir.
  • Hızlı donanımınızı serbest bırakır. Benim GPU'larım modellere hizmet verirken, Spark'lar yavaş ve titiz işleri hallediyor.
  • Kendi verilerinizle kalibre edebilirsiniz. Modelleri, gizli kalan ve masamdan çıkmayan kendi ajan oturumlarım ve yazılarımla budamışlığım var.
  • Araştırma ajanları için iyi bir ev sahipliği yapar. Spark'larda aynı anda, her biri yaklaşık 120 tok/s hızında çalışan dört araştırma ajanım olmuştu.
  • Eğitim, Spark'lar arasında iyi ölçeklenir. NVIDIA'nın testinde ince ayar (fine-tuning), iki Spark'ta 2x, dört Spark'ta 4x daha hızlı çalıştı; çünkü Spark'lar her adımda yalnızca bir kez senkronize oluyor (tablo 5). NVIDIA'nın playbook'ları PyTorch ile ince ayar konusunu da kapsıyor. Eğitimi kendim süre tutarak test etmedim.

Gelişmiş: GB10, GB300 ve ek bellek olarak Spark

"GB", Grace Blackwell anlamına gelir: Tek bir pakette bir Arm CPU ve bir Blackwell GPU bulunur ve NVLink-C2C adlı hızlı bir bağlantı üzerinden belleği paylaşırlar. Spark'taki GB10, bu fikrin MediaTek ile birlikte geliştirilmiş 20 çekirdekli bir Arm CPU'ya sahip en küçük versiyonudur.

GB300 ise veri merkezi versiyonudur: Blackwell Ultra (B300) GPU'lara sahip bir Grace CPU. NVIDIA'nın GB300 NVL72 raflarında yer alır ve tek bir GB300, DGX Station'a güç verir. GB10, GB300'den kesilmiş bir parça değildir. Aynı tasarımın küçültülmüş halidir; aynı yazılımın her ikisinde de çalışmasının nedeni budur.

EXO Labs - inline image

Sonuç

DGX Spark, evimde kendine sağlam bir yer edindi ve destek, kullanışlılık ile kapasite açısından her geçen gün büyüyor.

Kaynaklar ve ileri okuma

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet