Autor: @0xSero
Reviewer: @alexocheema und @alexzfunk
Besonderer Dank an: @MiaAI_lab
Wenn du darüber nachdenkst, Inferenz lokal auszuführen, wirst du unweigerlich auf diesen interessanten Goldesel stoßen. Es ist eine Maschine, die dafür gebaut wurde, KI lokal bereitzustellen – klein, sauber, leise und relativ günstig (NVIDIAs DGX Spark Seite).
Als ich zum ersten Mal vom DGX Spark hörte, war ich kein Fan. Trotz der 128 GB Speicher schien die Speicherbandbreite von 273 GB/s zu gering. Zum Vergleich: Eine RTX 5090 bietet etwa die 6,5-fache Bandbreite (1.792 GB/s), obwohl sie nur über 32 GB VRAM verfügt.

Als der Spark auf den Markt kam, waren Inferenz-Engineering-Praktiken wie Speculative Decoding noch nicht so weit verbreitet, und die meisten kleinen Modelle waren noch nicht ganz so leistungsfähig.
Mit dem Fortschritt und Wachstum der KI-Branche wird Intelligenz in immer kleinere Formate komprimiert, was es ermöglicht, diese kleinen Boxen voll auszuschöpfen.
- Inferenz-Engineering ist zunehmend gefragt.
- LLMs werden kompetenter im Inferenz-Engineering.
- Hochwertige Inferenz verbessert das System.
Heute ist der DGX Spark in der Lage, hochintelligente Modelle mit einer Geschwindigkeit auszuführen, die Cloud-Diensten ebenbürtig ist – und das bequem von zu Hause oder aus dem Büro. Es gibt eine Fülle an KI-Software, die dir beim Programmieren, bei der Steuererklärung, beim Lernen hilft oder dich einfach unterhält.
Mit Geschwindigkeit meine ich die Tokens pro Sekunde, die eine einzelne Person sieht. Die Cloud-Hardware ist viel schneller, aber Anbieter teilen sie zwischen vielen Nutzern auf und optimieren auf die Kosten pro Token, sodass jeder Nutzer weniger davon abbekommt. Zu Hause gehört die Box dir, also fließt alles zu dir. Mehr dazu in den fortgeschrittenen Anmerkungen.
Sparks sind dafür gemacht, verbunden zu werden
Die DGX Sparks verbrauchen sehr wenig Strom. Sie liegen oft bei rund 95 W, wenn ein Modell geladen ist und Anfragen bedient.
Deshalb benötigen sie kaum Kühlung und sind im Vergleich zu dedizierten GPUs recht leise. Du kannst problemlos 2 bis 4 davon an einem üblichen amerikanischen Stromkreis betreiben. Genau das – und nicht die reine Effizienz – ist der Punkt: Pro Einheit Speicherbandbreite leistet ein B300 im Rechenzentrum ungefähr doppelt so viel Arbeit pro Joule (siehe fortgeschrittene Anmerkungen). Der Spark wird einfach an eine normale Steckdose angeschlossen.
Jeder Spark hat eine ConnectX-7 Netzwerkkarte mit zwei QSFP-Ports, ausgelegt auf 200 Gb/s bzw. 25 GB/s. Damit kannst du Sparks miteinander verkabeln, um Speicher und effektive Speicherbandbreite zu erhöhen.

So werden DGX Sparks verbunden
Bei Tensor Parallelism wird jede Gewichtsmatrix auf die Sparks aufgeteilt, und jeder Spark liest gleichzeitig mit den anderen nur seinen eigenen Anteil aus seinem eigenen Speicher. Dadurch addiert sich die Lesegeschwindigkeit (NVIDIAs eigener Skalierungstest):
- 546 GB/s für zwei Sparks
- 819 GB/s für drei
- 1.092 GB/s für vier
Das skaliert nahezu linear. In NVIDIAs eigenem Test war das Schreiben bei zwei Sparks doppelt so schnell und bei vier Sparks 3,7-mal so schnell (Tabelle 3). Das funktioniert so gut, weil die ConnectX-7-Verbindung eine sehr niedrige Latenz hat und CUDA Daten direkt aus dem GPU-Code zwischen den Sparks verschieben kann (mehr dazu, warum).
Der Speicher addiert sich genauso: 128 GB pro Stück, 512 GB für vier, wobei pro Spark effektiv etwa 120 GB für KI-Workloads nutzbar sind.
Die Möglichkeit, Sparks zu stapeln, entschärft das größte Problem des Geräts: die geringere Speicherbandbreite. Sein niedriger Stromverbrauch an einer normalen Steckdose macht ihn unglaublich attraktiv für einen einzelnen Nutzer oder einen kleinen Haushalt.

DGX Spark in echt verbunden
Dense vs. MoE
Aktuell gibt es zwei Hauptarchitekturen für Modelle: Sparse und Dense. Mixture-of-Experts-Modelle wie Qwen3.6-35B aktivieren nur 3B Parameter pro generiertem Token – 9-mal weniger als Qwen3.8-27B.
Das macht Sparse-LLMs besonders geeignet für den DGX Spark. Sie harmonieren perfekt mit seiner geringeren Speicherbandbreite und bieten Nutzern ein schnelles Erlebnis trotz der Gesamtgröße des Modells.
MoE ist nicht nur gut für den DGX Spark. Es ist auch in Rechenzentren die bessere Architektur. Was sich für den lokalen Einsatz geändert hat, ist ein Schwellenwert: Wir erwarten eine bestimmte Geschwindigkeit, und die Dense-Modelle, die intelligent genug waren, waren zu groß, um zu Hause so schnell zu laufen. MoE-Modelle haben diese Grenze überschritten, weshalb sie jetzt auf lokaler Hardware sowohl nützlich als auch schnell sind. Dense-Modelle könnten irgendwann ebenfalls so weit sein.

Dense-LLMs vs. MoEs
Speculative Decoding
Jedes LLM mit MTP, DSpark oder DFlash passt besser, da die Draft-Modelle typischerweise winzig sind und nicht viel Rechenleistung benötigen, um ein korrektes Token zu generieren.
Es erhöht den Durchsatz, den die Sparks leisten können, erheblich – auf Kosten von 1 bis 2 GB Speicher, wovon der Spark reichlich hat.
Wie MoE hilft Speculative Decoding überall, nicht nur zu Hause. Aber zusammen haben sie lokale KI über die Schwelle gehoben. Früher liefen die besten offenen Modelle quälend langsam auf Heim-Hardware.

Wie Speculative Decoding den Durchsatz verbessert
Viele Agents gleichzeitig
Ein Spark kann acht oder mehr Anfragen gleichzeitig bedienen, jede davon noch in Konversationsgeschwindigkeit. Zum Beispiel kann Qwen3.6-35B, das grundlegende Programmierung, Computer- und Browsernutzung, Video- und Bildbearbeitung sowie allgemeinen Support beherrscht, bis zu 8 gleichzeitige Sitzungen mit jeweils etwa 40 tok/s bedienen.
Zum Vergleich: Mit dem ChatGPT Pro-Abo läuft GPT-6-Astra mit einer Durchschnittsgeschwindigkeit von 37 tok/s.

Astra Durchschnittsgeschwindigkeiten
Das funktioniert, weil der Spark im Verhältnis zu seiner Speichergeschwindigkeit enorm viel Rechenleistung hat. Acht Personen zu bedienen bedeutet immer noch, das Modell einmal pro Schritt zu lesen, aber achtmal so viele Berechnungen durchzuführen – und davon hat der Spark mehr als genug. Bei 16 Bit liefert er etwa 100 TFLOPS für 273 GB/s, grob 370 Operationen pro gelesenem Byte Speicher. Ein M3 Ultra hat etwa 26 TFLOPS für 819 GB/s, grob 32 (EXOs Zahlen). Das ist etwa 11-mal mehr Rechenleistung pro Byte, ohne die 4-Bit-Hardware des Sparks mitzuzählen, die Macs nicht haben.
Echte Arbeit
Qwen3.6-35B auf einem Spark hat ein Video erstellt, das innerhalb eines Tages über 80.000 Aufrufe bekam. Es dauerte nur 3 Minuten: Er nahm einen Ordner mit 3 Videos, fügte sie zusammen und beschleunigte das Video um das 4-Fache, während die Framerate unter dem Limit von X blieb.
https://x.com/0xSero/status/2072206209323802746
Kosten
Der DGX Spark hatte ursprünglich eine UVP von 3.999 $, die dann auf 4.699 $ angehoben wurde. 2026 sind die Preise für sämtliche Hardware gestiegen.
Der tatsächliche Preis liegt höher. NVIDIAs eigener Store ist ausverkauft. Das günstigste Gerät, das ich finden kann, kostet etwa 5.000 $, gebrauchte gehen für rund 6.000 $ weg, und am 21. September sah ich, dass NVIDIAs Seite 7.999 $ verlangte für dieselbe Box, für die ich fünf Wochen zuvor 4.699 $ bezahlt hatte.

GX10 Preise
NVIDIAs Marktplatz am 21. September. Post

4000$ - 4700%
Kaufberatung
- Jede GB10-Box funktioniert. ASUS, Dell, MSI und andere verkaufen ihre eigenen Versionen desselben Chips. Sie nutzen dieselbe Software und dieselben Recipes. Achte auf die SSD-Größe: 1 TB ist schnell voll, wenn man ein paar große Modelle vorhält. Ich würde 4 TB nehmen.
- Kauf das Kabel zusammen mit dem zweiten Spark, du brauchst es, um die beiden zu verbinden.
- Einige OEMs bieten Sparks mit besserem Luftstrom an
Strom, Lärm und deine Stromrechnung
Lärm und Hitze, die dedizierte GPUs erzeugen, sind nicht zu unterschätzen. Mit 4x 3090 verbrauchst du locker 1600–2000 W für ein Fünftel des Speichers. Ich musste meinen RTX Pro 6000 Tower aus meinem Büro verbannen, da er den Raum regelmäßig auf 35 °C aufheizte.
Ein normaler US-Hausstromkreis kann dauerhaft sicher etwa 1.440 Watt liefern (US-Elektrocode). Alles darüber hinaus erfordert einen neuen Stromkreis, was einen Elektriker bedeutet.
- Ein Spark, der ein Modell ausführt, verbraucht etwa 90–200 Watt (ServeTheHome). Das sind etwa 12 $ im Monat, wenn du ihn rund um die Uhr laufen lässt.
- Vier Sparks verbrauchen zusammen etwa 500 Watt, plus ein Switch mit etwa 240 W. Rund 66–100 $ im Monat, und alle passen an eine einzige Steckdose.
- Mein Vier-GPU-Rig erreicht Spitzenwerte von 1.600 Watt. Das ist mehr, als ein Stromkreis verkraftet, und kostet etwa 300 $ im Monat.

Woher diese Zahlen kommen. Jeder Wert ist eine andere Art von Messung, daher hier im direkten Vergleich. Die monatlichen Kosten gehen davon aus, dass die Maschine 24 Stunden am Tag bei dieser Leistung läuft, zu 18 Cent pro kWh:

Meine Tests
Warum vier Sparks mehr verbrauchen als viermal 90 W. Die 90 W gelten für einen Spark, der ein Modell alleine bedient. Wenn ein großes Modell auf vier aufgeteilt wird, arbeitet jeder Spark an jedem Wort und hält seine Netzwerkverbindung beschäftigt, sodass jeder mehr zieht – in meiner Messung durchschnittlich etwa 125 W. Die 12 $ und 66 $ pro Monat sind also die Kosten für Dauerbetrieb unter Volllast. Die reale Nutzung mit Leerlaufzeiten kostet weniger.
Strom wird auch nicht billiger. Die US-Haushaltspreise sind dieses Jahr um etwa 5 % gestiegen, auf rund 18 Cent pro kWh, teilweise wegen all der neuen Rechenzentren. Im August hat sich meine eigene Rechnung auf 1.000 $ im Monat verdoppelt, mit laufendem GPU-Rig, zwei Sparks und vier Klimaanlagen.

DGX Spark Geräusche
Und der Lärm? Mein GPU-Rig klingt wie ein Düsentriebwerk. So laut werden meine vier Sparks maximal:
Ein paar praktische Hinweise:
- Nutze sie mit allen Arten von KI-Modellen, Weltmodellen, Bildgenerierung usw.
- Stell sie auf die Seite. Meine laufen so kühler, mit Platz rund um das Mesh-Gitter.
- Tritt Discord-/Reddit-/X-Communities bei, um Hilfe beim Debuggen zu bekommen
- Richte Tailscale über deinen gesamten Fuhrpark ein

Die sechs Modelle, die ich tatsächlich nutze
Ich habe Dutzende ausprobiert. Das sind die sechs, zu denen ich immer wieder zurückkehre.

Ein Token entspricht ungefähr drei Vierteln eines Wortes, und alles über 30 fühlt sich an wie eine normale Unterhaltung.
Warum jede Zahl eine Aufgabe benennt. Die meisten dieser Recipes nutzen Speculative Decoding, bei dem ein kleiner Helfer vorausschaut. Code und JSON sind leicht zu erraten, Fließtext nicht, daher kann dasselbe Modell auf derselben Box bei einer Aufgabe doppelt so schnell laufen wie bei der anderen. Auch längere Prompts bremsen ab. Deshalb gibt jede Geschwindigkeit hier an, was geschrieben wurde und wie lang der Prompt war:
Eine ordentliche Methode, dies über viele Aufgaben hinweg zu messen, ist NVIDIAs SPEED-Bench, der Speculative Decoding mit echten Prompts aus 11 Kategorien und Eingabelängen von 1K bis 32K Tokens testet. Ich habe ihn auf den Sparks noch nicht laufen lassen.
- Ein Spark: Qwen3.6-35B, Qwen3.8-Flash-Next, Qwen3.8-27B
- Zwei Sparks: GLM-5.3-Flash.
- Vier Sparks: DeepSeek-V4.1-Flash.

Qwen3.8-Flash-Next auf zwei Sparks baut Animationen und ein kleines Spiel. (21. September) Post
Wo man sie bekommt. Jedes Modell hat eine offizielle Seite, und Abschnitt 6 enthält ein getestetes Spark-Recipe für jedes davon:
- Qwen3.6-35B oder NVIDIAs 4-Bit-Version
- Qwen3.8-27B
- Qwen3.8-Flash-Next
- GLM-5.3-Flash oder mein Ein-Spark-Build
- DeepSeek-V4.1-Flash
- GLM-5.3 oder mein 3-Bit-Build
Wie große Modelle überhaupt passen
Die Antwort lautet Quantisierung. Quantisierung komprimiert die Gewichte eines Modells, und sie ist verlustbehaftet: Jedes Gewicht wird mit weniger Bits gespeichert (sagen wir 4 statt 16), wodurch das Modell auf ein Viertel seiner Größe schrumpft, aber einige Details verloren gehen. Das Ziel ist es, dem Verhalten des Originalmodells so nah wie möglich zu kommen, während die Gewichte komprimiert werden.
Je stärker du komprimierst, desto schlechter wird die Qualität. Turboderp hat das für Qwen3.8-27B gemessen. Jeder Punkt ist eine komprimierte Version. Weiter links bedeutet kleiner, weiter unten bedeutet näher am Original:

Mittlere KL-Divergenz gegenüber Dateigröße für komprimierte Versionen von Qwen3.6-35B-A3B, von verschiedenen Anbietern. Logarithmische Skala. Grafik: https://huggingface.co/turboderp/Qwen3.8-27B-exl3
Auf dem Spark sind zwei Formate relevant:
- NVFP4 ist NVIDIAs 4-Bit-Format, und der Chip des Sparks liest es direkt. Qwen3.6-35B schrumpft von 72 GB auf 24 GB und passt mit reichlich Platz auf einen Spark.
- EXL3 lässt dich exakt wählen, wie viele Bits genutzt werden sollen. GLM-5.3-Flash mit 4 Bit ist 176 GB groß und passt auf zwei Sparks. Mit 2 Bit sind es 85 GB und es passt auf einen, wird allerdings etwas unschärfer.

Tipp:
4 Bit sind der Sweet Spot für kleinere Modelle, 3 Bit für größere Modelle
Woran du erkennst, ob ein komprimiertes Modell noch gut ist. Gute Model Cards geben an, wie nah die kleine Version am Original bleibt. Zwei Werte, auf die du achten solltest:
- Top-1-Übereinstimmung: Wie oft das kleine Modell dasselbe nächste Wort wählt wie das Original. Höher ist besser. Mein Ein-Spark GLM-5.3-Flash stimmt in etwa 80 % der Fälle überein.
- KL-Divergenz: Wie stark seine Vorhersagen vom Original abweichen. Niedriger ist besser. Mein ungepruntes GLM-5.3 mit 3 Bit erreicht 0,089. Die geprunte 197-GB-Version kommt auf 0,511. Das ist der Preis dafür, auf weniger Sparks zu passen.
6. Von einem Spark zu vieren: ein Schritt-für-Schritt-Weg
Das ist der Teil, nach dem ich am häufigsten gefragt werde. Geh es Schritt für Schritt an. Jeder Schritt funktioniert für sich allein, also hör auf, wo du zufrieden bist.

Die meisten Recipes unten stammen vom MiaAI Lab, das die besten Spark-Setups in Repos verpackt, die du klonen und mit einem einzigen Skript starten kannst. Ein paar sind von mir. Jedes listet auf, womit es getestet wurde und wie schnell es lief.
Erledige diese Dinge einmalig auf jedem Spark:
- Aktualisiere ihn. Führe die Updates im DGX Dashboard aus und starte dann neu.
- Erreiche ihn von deinem Laptop aus. Nutze NVIDIA Sync oder einfaches SSH. Um ihn von außerhalb deines Hauses zu erreichen, hat NVIDIA ein Tailscale Playbook.
- Erstelle einen Hugging Face Account und Token. Die meisten Recipes laden Modelle damit herunter. Pack ihn in eine .env-Datei, niemals ins Repo.
- Prüfe deine Festplatte. Modelle sind groß. Ein Ein-Spark-Recipe braucht etwa 25 bis 130 GB freien Speicher. Das Vier-Spark-DeepSeek-Recipe benötigt etwa 476 GB auf dem ersten Spark.
- Docker ist bereits da. DGX OS wird damit ausgeliefert, und fast jedes Recipe läuft darin, sodass du Python-Pakete nicht manuell installieren musst.
Schritt 1: ein Spark
Starte mit LM Studio. Folge NVIDIAs Schritt-für-Schritt-Anleitung, lade Qwen3.6-35B herunter und beginne zu chatten. Das dauert etwa eine Stunde. So weißt du, dass die Box funktioniert, bevor du dich an Schwierigeres wagst.
Wechsle dann zu einem Recipe. Recipes nutzen vLLM oder SGLang, die schneller als LM Studio sind und viele Agents gleichzeitig bedienen. Wähl eins aus:
- Qwen3.6-35B (4-Bit NVFP4) MiaAI Lab 95 tok/s für einen Nutzer, 317 gesamt für acht ~50 GB
- Qwen3.8-27B (4-Bit NVFP4) MiaAI Lab ~51 tok/s bei Code mit dem DSpark-Helfer, ~23 im Chat ~24 GB
- Qwen3.8-Flash-Next (4-Bit NVFP4) MiaAI Lab 48,7 tok/s für einen Nutzer, 162,9 gesamt für acht ~130 GB
- GLM-5.3-Flash (2-Bit EXL3) meins oder die Ein-Spark-Version von Mias Recipe 10 bis 25 tok/s, 262K Kontext, Vision ~85 GB
Das erste ist am einfachsten. Es sind drei Zeilen:
1git clone <https://github.com/MiaAI-Lab/Unsloth-Qwen3.6-35b-NVFP4-DGX-Spark.git>2cd Unsloth-Qwen3.6-35b-NVFP4-DGX-Spark3./start.sh
Wenn es läuft, hast du eine Adresse im OpenAI-Stil auf dem Spark. Richte Pi, opencode, Open WebUI oder welches Tool du auch nutzt darauf aus.
Tipp:
Wenn ein Modell nicht startet, liegt es fast immer am Speicher. Schließe zuerst andere Modelle. Ein Spark führt jeweils ein großes Modell aus.
Schritt 2: zwei Sparks
Das ist das Setup, das ich am meisten empfehle. Wie ich es im August formulierte: "2 DGX Sparks und du bist versorgt."

2 dgx sparks
Das Kabel. Du brauchst ein kurzes QSFP-Kabel zwischen den beiden QSFP-Ports. Alle diese funktionieren (Kabel-Guide):
- NVIDIAs eigenes: QSFP-Kabel 0,4 m für DGX Spark, 99,99 $. Oft ausverkauft.
- Die, die NVIDIAs Doku nennt: Amphenol NJAAKK-N911 oder Luxshare LMTQF022-SD-R, 0,5 m, etwa 159 $ bis 187 $.
- Eine günstigere 200G-Option: NVIDIA MCP1650-V00AE30, etwa 84 $.
Die Verbindung läuft mit 200 Gb/s, egal welche du kaufst. Nutze dafür kein USB-C oder den 10-GbE-Port. Die sind viel zu langsam.
Richte die Verbindung ein. Folge NVIDIAs Playbook zum Verbinden zweier Sparks. Es weist jedem Port eine Adresse zu und prüft die Geschwindigkeit. Richte danach passwortloses SSH vom ersten Spark (dem "Head") zum zweiten (dem "Worker") ein. Jedes Zwei-Spark-Recipe benötigt das.
Ich empfehle, claude oder gpt zu bitten, das für dich einzurichten, das ist einfacher.
Wähle ein Recipe:
- Qwen3.8-Flash-Next (4-Bit NVFP4) MiaAI Lab 52,1 tok/s für einen Nutzer mit MTP, bis zu 1M Kontext
- GLM-5.3-Flash (4-Bit EXL3) MiaAI Lab 62,9 tok/s für einen Nutzer, 146,5 gesamt für vier, 850K Kontext
- DeepSeek-V4.1-Flash (2,9-Bit EXL3) MiaAI Lab 38,8 bis 43,0 tok/s bei Code, 600K Kontext
- GLM-5.3 (3-Bit EXL3, geprunt auf 197 GB) meine Model Card passt; Geschwindigkeit noch nicht gemessen
Die meisten Zwei-Spark-Recipes sehen gleich aus: Beispieldatei kopieren, Adressen beider Sparks eintragen, herunterladen, starten. Hier ist das für GLM-5.3-Flash:
1cp .env.example .env # HEAD_IP und WORKER_IP setzen2./download.sh3./start.sh
Achtung:
Das Verbinden von Sparks funktioniert, aber hier ist die Software am wenigsten ausgereift. Folge einem getesteten Recipe und plane beim ersten Mal einen Nachmittag ein.
Schritt 3: drei Sparks
Drei Sparks brauchen keinen Switch. Jeder Spark hat zwei QSFP-Ports, also verkabelst du sie in einem Dreieck: A mit B, B mit C, C mit A. Das sind drei Kabel. NVIDIA unterstützt dies als switchlosen Ring.
Drei Sparks geben dir etwa 384 GB. Das reicht für Dinge, die zwei nicht fassen können:
- DeepSeek-V4.1-Flash in seiner nativen Präzision. MiaAI Labs Recipe lässt es in einem Drei-Spark-Dreieck mit 51,0 tok/s für einen Nutzer und 256K Kontext laufen. Es hat einen Doctor-Befehl, der SSH, Docker und die Netzwerkverbindungen prüft, bevor du startest.
- GLM-5.3-Flash mit mehr Platz. Das Zwei-Spark-EXL3-Recipe hat eine start-tp3.sh für drei.
- GLM-5.3, ungeprunt. Mein 293-GB-Build braucht etwa den Speicher von drei Sparks.
Das DeepSeek-Recipe ist ein gutes Beispiel dafür, wie die größeren laufen. Es sind mehrere Schritte, nicht nur einer:
1./start.sh doctor # prüft ssh, docker, verbindungen, festplatte2./start.sh share # teilt den modellordner mit den anderen sparks3./start.sh serve # startet die worker, dann den head
Tipp:
Manche Modelle lassen sich nur glatt durch 2 oder 4 teilen. Prüfe, ob im Recipe "3x" steht, bevor du den dritten kaufst.
Schritt 4: vier Sparks
Vier Sparks geben dir etwa 512 GB. Es gibt zwei Möglichkeiten, sie zu verbinden.
Option A: ein Switch (was ich nutze). Jeder Spark bekommt ein Kabel zu einem 200-GbE-Switch, sodass jeder genau einen Hop von jedem anderen entfernt ist. NVIDIA hat ein Playbook dafür. Diese Switches nutzen die Leute:
- MikroTik CRS812-8DS-2DQ-2DDQ-RM. Seine 400G-Ports lassen sich jeweils in zwei 200G-Links aufteilen.
- MikroTik CRS804-4DDQ-hRM. Eine kleinere Option (Build-Notizen für vier Sparks).
- Exxact hat eine gute Einkaufsliste für einen Vier-Spark-Cluster: Switch, Kabel und Strom.
Wie ich im September sagte: "Ich glaube nicht, dass es ein besseres Angebot auf dem Markt gibt als 4x Sparks mit einem MikroTik-Switch."

Option B: kein Switch. Verkabele die vier in einem Ring, wobei jeder Spark mit seinen beiden Nachbarn verbunden ist. Sparks, die keine Nachbarn sind, kommunizieren über den dazwischenliegenden. Das spart den Switch, ist aber schwieriger einzurichten:
- SparkRing ist ein vollständiger Software-Stack für switchlose Paare und Vier-Spark-Ringe. Es handelt sich um Alpha-Software, also fixiere unbedingt eine bestimmte Version.
- Dieses GLM-5.3-Flash-Rezept läuft auf einem Vier-Spark-Ring mit vier kurzen 100G-Kabeln und einem gepatchten NCCL. Typisch sind etwa 45 tok/s, im eingeschwungenen Zustand bis zu rund 100.
Wähle ein Rezept:
- DeepSeek-V4.1-Flash (nativ) MiaAI Lab, start-tp4.sh 45,4 tok/s für einen Nutzer, insgesamt 134,2 bei sechzehn, 1M Kontext
- GLM-5.3-Flash (4-Bit NVFP4) switchloser Ring ~45 tok/s typisch, ~100 eingeschwungen
Meine eigenen besten Ergebnisse auf vier Sparks sind 118 tok/s für GLM-5.3-Flash mit einem DFlash2-Helfer sowie 83,8 bis 95,3 tok/s für DeepSeek-V4.1-Flash bei kurzen Prompts (Post).

Tools, die in jedem Schritt helfen
- \\sparkDash:\\ ein Web-Dashboard für alle deine Sparks in einem einzigen Fenster. GPU, Speicher, Netzwerk und Live-Tokens pro Sekunde. Mehrere der Geschwindigkeiten in diesem Guide wurden damit gemessen.
- \\NVIDIAs Spark-Playbooks:\\ offizielle Anleitungen für LM Studio, Ollama, vLLM, das Verbinden von Sparks und mehr.
- \\local-ai-registry:\\ meine Rezepte und jeder Speedtest, den ich durchgeführt habe.
- \\b12x:\\ die schnelle Mathematik hinter vielen Spark-Rezepten. Du installierst es nicht selbst; das übernehmen die Rezepte. Siehe dazu die fortgeschrittenen Hinweise weiter unten.

Fazit
Der Spark ist eine Speicherbox. Er beherbergt große Modelle, lässt sie leise mit normalem Hausstrom laufen und wird jedes Mal besser, wenn du einen weiteren hinzufügst.
Wenn du heute startest:
- Kauf dir einen und lass am ersten Tag Qwen3.6-35B über LM Studio laufen.
- Wechsle zu einem Rezept, sobald du mehr Geschwindigkeit oder viele Agenten brauchst.
- Kauf den zweiten Spark und das Kabel, wenn du GLM-5.3-Flash oder DeepSeek-V4.1-Flash nutzen möchtest. Für die meisten ist hier Endstation.
- Geh nur auf drei oder vier, wenn du die größten Modelle willst oder mehrere gleichzeitig betreiben möchtest.
Ob ich sie wieder kaufen würde? Ja. Und wenn ich noch einmal von vorn anfangen würde, hätte ich am ersten Tag direkt zwei gekauft.
Für Fortgeschrittene: Wie das Verbinden von Sparks skaliert
Du brauchst das hier nicht, um einen Spark zu nutzen. Es ist für den Fall gedacht, dass du verstehen willst, warum die Zahlen so aussehen, wie sie aussehen.
Fast linear – beim Schreiben
Jedes Wort, das das Modell schreibt, bedeutet, die aktiven Gewichte des Modells aus dem Speicher zu lesen. Verteilst du das Modell auf mehrere Sparks, liest jeder gleichzeitig seinen Anteil, sodass sich die Lesegeschwindigkeiten addieren.
NVIDIA hat das gemessen. Beim Wechsel von einem auf zwei und dann auf vier Sparks sank die Zeit pro geschriebenem Wort von 269 ms auf 133 ms und weiter auf 72 ms. Das ist Faktor 2,0 bei zweien und 3,7 bei vieren (NVIDIAs Blog, Tabelle 3).

Dass es so nah herankommt, liegt daran, dass die ConnectX-7-Verbindung extrem niedrige Latenz hat und der Datenaustausch zwischen den Sparks direkt im GPU-Code stattfinden kann. Diese Erklärung für Macs beleuchtet denselben Gedanken ausführlicher.
Nach jeder Ebene tauschen die Sparks ihre Zwischenergebnisse aus, bevor die nächste Ebene starten kann. Der Austausch ist klein, passiert aber bei jeder Ebene und jedem Wort. Jeder kostet ein wenig Zeit, die sich durch weitere Sparks nicht verkürzen lässt.
- Die Verbindung hat 200 Gb/s, also etwa 25 GB/s. Das ist ein Zehntel der Speichergeschwindigkeit des Sparks selbst. Das passt, weil die auszutauschenden Datenmengen gering sind.
- Es nutzt RDMA. Die Daten gehen direkt vom Speicher des einen Sparks in den des anderen, ohne dass die CPU sie kopiert. Jeder QSFP-Port erscheint als zwei Hälften à 100 Gb/s, und die Software muss beide nutzen, um die vollen 200 zu erreichen (Details). NCCL, NVIDIAs Bibliothek dafür, übernimmt das.
- Lesen skaliert schlechter als Schreiben. Im selben NVIDIA-Test wurde das Lesen eines 32K-Token-Prompts mit zwei Sparks 1,6-mal schneller und mit vieren 2,1-mal. Beim Lesen werden pro Schritt deutlich mehr Daten zwischen den Sparks bewegt.
- Ringe bedeuten zusätzliche Hops. In einem Drei-Spark-Dreieck ist jeder Spark mit beiden anderen verkabelt. In einem Vier-Spark-Ring kommunizieren manche Paare über einen Nachbarn. Ein Switch bringt alle auf einen Hop Abstand. SparkRing schreibt seinen eigenen Austauschcode (SIRCL), um Ringe schneller zu machen.
- Mixture-of-Experts-Modelle bringen eine zweite Aufteilung ins Spiel. Rezepte kombinieren Tensor Parallelism oft mit „Expert Parallel", bei dem verschiedene Sparks unterschiedliche Experten halten.
Die zwei anderen Wege zu mehr Tempo
- Viele Nutzer gleichzeitig. Der Spark liest das Modell einmal pro Schritt und bedient alle aus diesem einen Lesevorgang. Deshalb steigt die Gesamtgeschwindigkeit viel schneller als die für einzelne Nutzer.
- Ein spekulatives Decoder-Modell, das vorausschauend rät. MTP, DSpark und DFlash2 tun genau das. Ein kleiner, schneller Helfer entwirft mehrere Wörter, und das große Modell prüft sie alle in einem Durchgang. Wenn die Vermutungen stimmen, bekommst du mehrere Wörter zum Preis von einem. So springt GLM-5.3-Flash im selben Rezept von 27 tok/s bei Fließtext auf 65 bei strukturierten Ausgaben.

Qwen3.6-35B-A3B mit 4 Bit auf einem Spark, mit aktiviertem Beschleunigungs-Helfer. Quelle: local-ai-registry-Speedtest, August 2026.
Cloud-KI und lokale KI sind zwei Paar Schuhe
Eine Cloud-GPU ist deutlich schneller als ein Spark. Aber Cloud-Anbieter teilen jede GPU unter vielen Nutzern auf und wählen einen Punkt im Kompromiss zwischen Kosten pro Token und Geschwindigkeit pro Nutzer. Die meisten entscheiden sich für die Kosten, weshalb jeder Nutzer weniger Tokens pro Sekunde bekommt, als die Hardware für eine einzelne Person liefern könnte. InferenceX visualisiert diesen Trade-off für Qwen3.8-Flash-Next.
Zu Hause existiert dieser Kompromiss nicht. Die Kiste gehört dir, also kannst du ihre gesamte Leistung einer einzigen Person widmen. Deshalb kann sich ein Spark genauso schnell anfühlen wie ein Cloud-Dienst, obwohl die Hardware es objektiv nicht ist.
sm_121: Warum Spark-Software eine eigene Welt ist
Jede NVIDIA-GPU hat eine Nummer für die „Compute Capability", die der Software verrät, welche Befehle sie unterstützt. Die GPU des Sparks hat 12.1, also sm_121 (Simon Willisons erster Blick darauf). Die RTX 5090 und RTX PRO 6000 sind sm_120, ein enger Verwandter. NVIDIAs Rechenzentrums-Chips B200 und B300 sind sm_100 und sm_103, also eine andere Familie.
Das ist wichtig, weil der schnellste KI-Code immer für jeweils eine Familie geschrieben wird. Als der Spark auf den Markt kam, lief vieles davon entweder gar nicht oder nur langsam (NVIDIA-Forum, vLLM-Issue).
Die Lösung war, dass Leute spark-spezifischen Code geschrieben haben:
- b12x vom Local Inference Lab ist eine Kernel-Bibliothek für sm_120 und sm_121: den DGX Spark, den RTX Spark, die RTX 5090 und die RTX PRO 6000. Sie deckt 4-Bit-Matrixmathematik (NVFP4, MXFP4), Attention für DeepSeek-artige Modelle, Mixture-of-Experts-Ebenen und einen schnellen Modell-Lader ab. Installiert wird sie mit pip install b12x, und vLLM-Rezepte aktivieren sie über Flags wie flashinfer_b12x. Das Qwen3.6-35B-Rezept nutzt sie.
- SparkInfer ist der alte Name von b12x. Der alte Link leitet jetzt auf b12x um. Mein Ein-Spark-DeepSeek-Rezept verwendet dessen Attention-Code sowohl fürs Lesen als auch fürs Schreiben. Verwechsle es nicht mit gittensors sparkinfer, einer separaten Runtime für RTX-Karten (nur sm_120).
- ExLlamaV3 ist das, was EXL3-Modelle antreibt. MiaAI Lab pflegt einen Fork mit dem Arm-Port (GB10) und Unterstützung für Helfer-Modelle.
- lil ist der Launcher des Local Inference Lab. Er liest das Layout einer Maschine aus und baut den passenden vLLM-Befehl für einen einzelnen Spark oder eine verbundene Gruppe.
Für Fortgeschrittene: Der Spark als Forschungsmaschine
Das ist der Teil, den ich nicht erwartet hatte. Der Spark ist beim Schreiben langsam, aber sehr gut im Lesen. Und die meiste Forschungsarbeit an Modellen besteht aus Lesen.
Was der Spark am besten kann: Prefill
Ein Modell erledigt zwei völlig verschiedene Aufgaben:
- Prefill ist das Lesen deines Prompts. Der gesamte Prompt geht auf einmal durch, daher ist die rohe Rechenleistung das Limit. Davon hat der GB10 reichlich: bis zu 1 Petaflop an 4-Bit-Mathematik.
- Decode ist das Schreiben der Antwort, Wort für Wort. Jedes Wort bedeutet, das Modell erneut aus dem Speicher zu lesen, daher ist die Speichergeschwindigkeit das Limit. Das ist die Schwachstelle des Sparks.
Ein Spark liest Prompts also 13- bis 41-mal schneller, als er schreibt:

DeepSeek-V4.1-Flash auf vier Sparks: 3.360 tok/s beim Lesen eines 32K-Token-Prompts, 3.273 bei 131K, während das Schreiben bei rund 70 bis 95 bleibt. (20. September) Post
Warum genau das die Forschung braucht
Fast alles, was ich tue, um Modelle kleiner zu machen, ist Lesen, nicht Schreiben:
- Quantisierung (weniger Bits). EXL3- und NVFP4-Builds entstehen, indem man Beispieltexte durch das Modell schickt und misst, wie viel jede Ebene bei welcher Bitbreite verliert. Das ist Lesen.
- Pruning (weniger Experten). REAP schickt Beispieltexte durch ein Mixture-of-Experts-Modell und protokolliert, wie stark jeder Experte genutzt wird. Die nutzlosesten fliegen raus. Mein 197 GB großes GLM-5.3 behält 168 von 256 Experten. Auch das ist Lesen.
- Qualität prüfen. Top-1-Übereinstimmung und KL-Divergenz ergeben sich daraus, denselben Text durch das Original- und das kleine Modell zu schicken und ihre Vorhersagen zu vergleichen. Wieder Lesen.
- Langkontext-Tests. Zu prüfen, ob ein Modell eine einzige Tatsache in 262.000 Tokens findet, ist im Grunde ein einziger, sehr langer Lesevorgang.
Genau aus diesem Grund hat sich mein eigener Workflow verschoben. „Ich lasse mein gesamtes Pruning/EXL3/Benchmarking jetzt auf den DGX Sparks laufen, die 6000er behalte ich für die Inferenz. Es ist langsamer, aber 2–3 Tage statt 12 Stunden sind okay." Der Ein-Spark-DeepSeek, der die 100.000 Downloads geknackt hat, ist ein REAP-gepruntes, EXL3-komprimiertes Modell.
Wie das zu Forschungszielen passt
Wenn dein Ziel ist, etwas über ein Modell herauszufinden, passt der Spark hervorragend:
- Er fasst das große Modell. Du kannst ein 300B-Modell auf einer oder zwei Kisten vermessen, statt einen Cluster zu mieten.
- Er läuft tagelang mit Hausstrom. Lange Kalibrierungs- und Evaluierungsjobs können unbeaufsichtigt durchlaufen, ohne eine dicke Rechnung zu verursachen.
- Er entlastet deine schnelle Hardware. Meine GPUs bedienen Modelle, während die Sparks die langsame, sorgfältige Arbeit erledigen.
- Du kannst mit deinen eigenen Daten kalibrieren. Ich habe Modelle anhand meiner eigenen Agenten-Sessions und Texte geprünt – privat und sicher auf meinem Schreibtisch.
- Er ist ein guter Host für Forschungsagenten. Ich hatte vier Agenten gleichzeitig auf den Sparks an Forschungszielen arbeiten lassen, jeden mit etwa 120 tok/s.
- Training skaliert gut über mehrere Sparks. In NVIDIAs Test lief Fine-Tuning auf zwei Sparks doppelt so schnell und auf vieren viermal so schnell, weil die Sparks nur einmal pro Schritt synchronisieren müssen (Tabelle 5). NVIDIAs Playbooks behandeln Fine-Tuning mit PyTorch. Selbst gestoppt habe ich Training allerdings noch nicht.
Für Fortgeschrittene: GB10, GB300 und der Spark als Zusatzspeicher
„GB" steht für Grace Blackwell: eine Arm-CPU und eine Blackwell-GPU in einem Package, die sich den Speicher über eine schnelle Verbindung namens NVLink-C2C teilen. Der GB10 im Spark ist die kleinste Ausprägung dieser Idee, mit einer 20-Kern-Arm-CPU, die zusammen mit MediaTek entwickelt wurde.
Der GB300 ist die Rechenzentrumsversion: eine Grace-CPU mit Blackwell-Ultra-GPUs (B300). Er steckt in NVIDIAs GB300-NVL72-Racks, und ein einzelner GB300 treibt die DGX Station an. Der GB10 ist kein abgeschnittenes Stück eines GB300. Es ist dasselbe Design, nur klein gemacht – deshalb läuft auf beiden dieselbe Software.

Fazit
Der DGX Spark hat sich bei mir zu Hause seinen festen Platz erkämpft und gewinnt täglich an Support, Nutzen und Leistungsfähigkeit.
Quellen und weiterführende Links
- Meine Posts: Alles oben Datierte findest du auf meinem X-Profil. Die Geschwindigkeitsangaben stammen aus meinen eigenen Tests, veröffentlicht in der local-ai-registry.
- Rezepte: MiaAI Lab auf GitHub, meine Hugging-Face-Modelle.
- Hardware und Preis: NVIDIAs DGX-Spark-Seite, NVIDIAs Hardware-Doku, VideoCardz zur Preiserhöhung, VideoCardz zu den September-Preisen, pi3g-Preis-Tracker.
- Sparks verbinden: NVIDIAs Clustering-Doku, NVIDIAs Scaling-Blog, Switch-Playbook, Kabel-Guide, NVIDIas Benchmarking-Guide für zwei Sparks.
- Stromverbrauch: ServeTheHome-Review, Tom's Hardware zum Idle-Verbrauch, US-Strompreise (EIA via Utility Dive), US-Elektrocode zu Dauerlasten.
- Formate und Software: NVIDIA zu NVFP4, ExLlamaV3, b12x, REAP, Compute Capabilities.
- Cloud-Geschwindigkeit: InferenceX von SemiAnalysis.
- GB300: GB300-NVL72-Specs, DGX-Station-Specs, EXO zu Spark plus Mac Studio.
- Erste Schritte: NVIDIAs Spark-Playbooks.
- Das große Ganze: State of Local AI: 2026.





