Ich verfolge jeden Dollar, den ich fĂŒr KI-Infrastruktur ausgebe. Letztes Jahr ist ein Posten stĂ€ndig gewachsen: die Miete von Cloud-GPUs. Im dritten Quartal hatte ich 1.900 $ pro Monat erreicht â und ich war derjenige, der den Kunden die Arbeit in Rechnung stellte, die das generierte.
Diese Rechnung geht nicht auf. Du baust kein Unternehmen auf, indem du 40 % deiner Betriebskosten an ein fremdes Rechenzentrum abgibst.
Dann habe ich einen DGX Spark gekauft. Hier ist die AufschlĂŒsselung.
1 / Was der DGX Spark eigentlich ist
NVIDIA hat 2025 damit verbracht, Datencenter-Hardware auf einen Schreibtisch zu komprimieren. Sie kĂŒndigten ihn im Januar auf der CES als Project DIGITS an, benannten ihn im MĂ€rz auf der GTC in DGX Spark um und begannen im Oktober mit der Auslieferung. Das Ergebnis ist ein 150Ă150Ă50 mm groĂer Kasten, der 1,2 kg wiegt und an einer normalen Steckdose betrieben wird.
Die Spezifikationen:
Komponente | Detail |
|---|---|
Chip | GB10 Grace Blackwell Superchip |
KI-Rechenleistung | 1 PFLOP (FP4) |
CPU | 20-Kern ARM (Grace) |
Speicher | 128 GB LPDDR5x, unified |
Speicherplatz | 4 TB Gen5 NVMe |
Netzwerk | ConnectX-7 (Kopplung von zwei Einheiten) |
Leistungsaufnahme | ~150â240 W unter Last |
Preis | 2.999 $ |
Die Petaflop-Zahl ist ein Marketingwert. Die Zahl, die wirklich zÀhlt, sind 128 GB unified Memory.
Consumer-GPUs haben eine harte Grenze. Eine 4090 bietet 24 GB VRAM â sobald ein Modell gröĂer ist, wird es nicht geladen. Eine 5090 hebt die Grenze auf 32 GB. Der Spark setzt sie auf 128 GB, was bedeutet, dass er Modelle ausfĂŒhren kann, die eine Consumer-Karte fĂŒr 2.000 $ nicht einmal öffnen kann.
2 / Die Speichergrenze, erklÀrt
Hier ist, was 128 GB unified Memory tatsÀchlich freischaltet:
- Llama 3.3 70B â volle BF16-PrĂ€zision, keine Quantisierungs-Tricks nötig
- Qwen 3 (30Bâ110B Bereich) â passt problemlos
- DeepSeek-Ă€hnliche Modelle bis zu 200B â quantisiert, lĂ€uft stabil
- FLUX.1 Bildgenerierung â ja
- 405B Parameter â zwei Sparks ĂŒber ConnectX-7 gekoppelt
Eine Consumer-GPU gibt bei etwa einem gequetschten 30B auf. Der Spark beginnt genau dort, wo diese Grenze endet. Diese LĂŒcke ist die gesamte Rechtfertigung fĂŒr den Kauf.
3 / Die Rechnung: Woher die 22.000 $ kommen
Cloud-GPU-Kosten fĂŒr ernsthafte KI-Workloads:
Aufgabe | Monatliche Kosten |
|---|---|
A100 80 GB, Teilzeit | 600â1.200 $ |
H100 fĂŒr Fine-Tuning-DurchlĂ€ufe | 1.000â2.500 $ |
Gehostete 70B-Inferenz | 300â900 $ |
Instanz, die du vergessen hast auszuschalten | Ăberraschung |
Realistische Summe fĂŒr einen KI-Entwickler
1.500â3.000 $
DGX Spark bei denselben Workloads:
Posten | Kosten |
|---|---|
Hardware | 2.999 $ (einmalig) |
Strom bei ~200 W | 8â15 $/Monat |
Cloud-Miete | 0 $ |
Monatlich nach dem Kauf
~10 $
Bei 1.900 $/Monat an Cloud-Kosten amortisiert sich der Spark in unter 7 Wochen.
Danach: 1.890 $ pro Monat, die frĂŒher dein Unternehmen verlieĂen, bleiben darin. Bei identischer Kundenarbeit. Mit identischen Rechnungen, die rausgehen.
Insgesamt in Jahr eins zurĂŒck in dein Unternehmen: 22.680 $.
4 / Die Software-Ebene ist kein Problem
Der Spark lĂ€uft mit DGX OS â NVIDIAs Ubuntu-Build mit dem vollstĂ€ndigen KI-Stack vorinstalliert: CUDA, NIM, NeMo. Ollama, vLLM, PyTorch, Hugging Face und llama.cpp laufen ab Tag eins ohne Ănderungen.
Wenn du bereits einen Cloud-Endpunkt angesteuert hast, ist die Migration eine einzige ZeilenÀnderung:
1# Vorher: StĂŒndliche Bezahlung2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# Nachher: Eigener Schreibtisch, ZĂ€hler aus5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
Gleicher Codepfad. Gleiche JSON-Ausgabe. Gleiches Verhalten. Nichts wird abgerechnet. Nichts verlÀsst das GebÀude.
5 / Der Business Case jenseits von Kosteneinsparungen
Der Spark ist nicht nur ein Kostenkiller. Er beseitigt die wirtschaftliche HĂŒrde fĂŒr Arbeiten, die zuvor zu teuer waren, um sie frei durchzufĂŒhren.
Wenn du KI-Arbeit fĂŒr Kunden machst:
Fine-Tuning-DurchlĂ€ufe, die frĂŒher 400 $ Cloud-Kosten verursacht haben, sind jetzt kostenlos. Lass sie ĂŒber Nacht laufen. FĂŒhre drei Varianten mit unterschiedlichen Hyperparametern aus. Am Morgen kommt keine Rechnung. Du kannst einen privaten Coding-Agenten ĂŒber die gesamte proprietĂ€re Codebasis eines Kunden bereitstellen oder einen Always-On-Assistenten, den das ganze Team nutzt â und deine StĂŒckkosten sind Strom, nicht API-Tokens. Jeder Kunde nach dem ersten ist reine Marge.
Wenn du mit sensiblen Daten arbeitest:
Das ist der Aspekt, den die meisten unterschĂ€tzen. VertrĂ€ge. Rechtsdokumente. Patientenakten. Finanzdaten. Alles, was einer NDA unterliegt und was du niemals ĂŒber eine öffentliche API schicken wĂŒrdest. Auf dem Spark verlassen diese Daten niemals dein Netzwerk. Keine Nutzungsbedingungen regeln eine Maschine, die dir vollstĂ€ndig gehört.
âDeine Daten verlassen nie das GebĂ€udeâ schlieĂt Deals in regulierten Branchen ab, die Cloud-Anbieter schlichtweg nicht anfassen können. Anwaltskanzleien, Kliniken, Finanzberater â diese Kunden zahlen eine ordentliche PrĂ€mie fĂŒr diese Garantie.
Der Mindset-Wechsel, den niemand erwÀhnt:
Cloud-Preise trainieren dich, Rechenleistung zu rationieren. Du zögerst, bevor du einen Agenten loopst, bevor du ein ganzes Archiv neu laufen lÀsst, bevor du an einer Idee feinst, die vielleicht nicht funktioniert. Jeder Durchlauf hat einen Dollarpreis, also machst du weniger davon.
Besitzt du die Box, verschwindet dieses Zögern. Meistens steckte die beste Arbeit hinter diesem Zögern.
6 / Was der Spark nicht ist
Seien wir direkt mit den EinschrÀnkungen:
- Rohe Geschwindigkeit â eine 5090 ist schneller bei allem, was in ihre 32 GB VRAM passt
- Skalierung â tausende gleichzeitige Benutzer zu bedienen, bleibt Arbeit fĂŒrs Rechenzentrum
- Frontier-Modelle ĂŒber 405B â zwei gekoppelte Sparks schaffen 405B; darĂŒber hinaus brauchst du andere Hardware
- Geringe Nutzer mit niedrigem Volumen â wenn du 20 $/Monat fĂŒr API-Aufrufe ausgibst, ist dies nicht das richtige Werkzeug
Die ehrliche Schwelle: 1.000 $+/Monat an Cloud-GPU-Ausgaben ist der Punkt, an dem der Spark eine offensichtliche Entscheidung wird. Unter 500 $/Monat ist eine Consumer-Karte oder der API-Zugang der klĂŒgere Weg. Die Box ist auf ernsthafte Workloads ausgelegt, nicht auf gelegentliche Nutzung.
7 / Die Amortisation bei verschiedenen Ausgabenniveaus
Monatliche Cloud-Gewohnheit | Amortisationszeit |
|---|---|
1.900 $/Monat | ~6 Wochen |
1.000 $/Monat | ~3 Monate |
500 $/Monat | ~6 Monate |
200 $/Monat | Bleib in der Cloud |
8 / Das groĂe Ganze
2024 erforderte der Betrieb eines 70B-Modells entweder ein Rechenzentrum oder eine Cloud-Rechnung von 1.900 $/Monat. 2026 braucht es eine 2.999 $ teure Box in der GröĂe eines Taschenbuchs und eine Steckdose.
NVIDIA hat den DGX Spark bewusst auf 2.999 $ festgesetzt â sie wollen, dass die nĂ€chste Generation von KI-Produkten auf ihrem Silizium gebaut wird, lokal, in groĂem MaĂstab. Jensen hat persönlich frĂŒhe Einheiten an Musk und Altman geliefert. Dell, HP, ASUS und Lenovo bauen alle ihre eigenen GB10-Maschinen. Der Software-Stack wird praktisch wöchentlich fĂŒr diesen Chip optimiert.
Cloud-GPU-Preise fallen nicht. Datenschutzanforderungen werden strenger. Kunden fragen immer hÀufiger, wohin ihre Daten physisch gehen, bevor sie etwas unterschreiben.
Die Leute, die 2026 Frontier-Klasse-Modelle auf einem Schreibtisch betreiben, werden 2028 weitsichtig erscheinen.
Die Rechnung ist einfach: 2.999 $ einmalig gegenĂŒber 1.900 $ jeden Monat. Die Box amortisiert sich vor Ende des ersten Quartals und lĂ€uft dann fĂŒr 10 $/Monat, solange du sie brauchst.
Das ist der Trade. HĂ€tte ich ihn schon vor einem Jahr gemacht.
Falls das nĂŒtzlich war, folge @cryptowluha
Setze ein Lesezeichen, bevor dieser Beitrag untergeht. Falls das nĂŒtzlich war, teile ihn mit einer Person, die ihn braucht.





