私は AI インフラに使う 1 ドル 1 ドルをすべて記録している。昨年、ある項目が増え続けていた。クラウド GPU レンタルだ。第 3 四半期には月額 1,900 ドルに達していた。そして、その作業を生み出したクライアントへの請求書を私自身が発行していたのだ。
その計算は成り立たない。営業費用の 40% を他人のデータセンターに渡してビジネスを築くことはできない。
そこで、私は DGX Spark を購入した。以下がその内訳だ。
1 / DGX Spark の正体
NVIDIA は 2025 年、データセンター向けハードウェアをデスクトップに凝縮することに注力した。1 月の CES で Project DIGITS として発表され、3 月の GTC で DGX Spark に名称変更され、10 月に出荷が開始された。その結果は、150×150×50mm の箱で、重さは 1.2kg、標準的な壁コンセントで動作する。
スペックは以下の通り。
コンポーネント
詳細
チップ
GB10 Grace Blackwell Superchip
AI 演算性能
1 PFLOPS (FP4)
CPU
20 コア ARM (Grace)
メモリ
128GB LPDDR5x、ユニファイド
ストレージ
4TB Gen5 NVMe
ネットワーク
ConnectX-7 (2 台連結可能)
消費電力
負荷時約 150~240W
価格
2,999 ドル
ペタフロップスという数字はマーケティング上の数値だ。実際に重要な数字は 128GB のユニファイドメモリ である。
コンシューマー向け GPU には上限がある。4090 は 24GB の VRAM を提供するが、モデルがそれを超えるとロードできない。5090 は上限を 32GB に引き上げる。Spark はそれを 128GB に設定しており、2,000 ドルのコンシューマーカードでは開くことさえできないモデルを実行できる。
2 / メモリの壁、解説
128GB のユニファイドメモリが実際に解放するものは以下の通り。
- Llama 3.3 70B - 完全な BF16 精度、量子化のトリックは不要
- Qwen 3 (30B~110B 範囲) - 問題なく収まる
- DeepSeek クラスのモデル (最大 200B) - 量子化すれば、安定して動作
- FLUX.1 画像生成 - 可能
- 405B パラメータ - ConnectX-7 で 2 台の Spark を連結
コンシューマー GPU は、絞り出しても約 30B で限界に達する。Spark は、その上限が終わるところから始まる。このギャップこそが、購入する正当な理由のすべてだ。
3 / 計算: 22,000 ドルの内訳
本格的な AI ワークロードにおけるクラウド GPU コスト:
タスク
月額費用
A100 80GB、パートタイム
600~1,200 ドル
ファインチューニング実行用 H100
1,000~2,500 ドル
ホスト型 70B 推論
300~900 ドル
シャットダウンを忘れたインスタンス
サプライズ
AI 開発者にとって現実的な合計
1,500~3,000 ドル
同じワークロードにおける DGX Spark:
項目
コスト
ハードウェア
2,999 ドル (一度きり)
約 200W での電力
月額 8~15 ドル
クラウドレンタル
0 ドル
購入後の月額費用
約 10 ドル
月額 1,900 ドルのクラウド費用で、Spark は 7 週間未満 で元が取れる。
その後: 以前はビジネスから流出していた月額 1,890 ドルが、ビジネス内に留まる。同じクライアント作業で。同じ請求書が発行されながら。
1 年目にビジネスに還元される総額: 22,680 ドル。
4 / ソフトウェアレイヤーは問題にならない
Spark は DGX OS を実行する。これは NVIDIA の Ubuntu ビルドで、CUDA、NIM、NeMo など、AI スタック全体がプリロードされている。Ollama、vLLM、PyTorch、Hugging Face、llama.cpp はすべて、初日から変更なしで動作する。
すでにクラウドエンドポイントを使用していた場合、移行は 1 行の変更で済む。
1# 以前: 時間単位で支払い2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# 以後: 自分の机、メーターオフ5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
同じコードパス。同じ JSON 出力。同じ動作。何も課金されない。何も建物の外に出ない。
5 / コスト削減を超えたビジネスケース
Spark は単なるコスト削減ツールではない。以前は自由に実行するには高すぎた作業に対する経済的障壁を取り除く。
クライアント向けに AI 作業を行う場合:
以前は 400 ドルのクラウド請求書だったファインチューニング実行が、今では無料になる。一晩中実行する。異なるハイパーパラメータで 3 つのバリエーションを実行する。朝になっても請求書は届かない。クライアントの全プロプライエタリコードベースにわたってプライベートコーディングエージェントをデプロイしたり、チーム全体が使用する常時稼働アシスタントを展開したりできる。そして、ユニットコストは電気代であり、API トークンではない。2 番目以降のクライアントはすべて純利益となる。
機密データを扱う場合:
これはほとんどの人が過小評価している角度だ。契約書。法的文書。患者記録。財務データ。公開 API には決して通さない NDA の対象となるものすべて。Spark 上では、そのデータはネットワークを越えることはない。完全に所有するマシンには、利用規約は適用されない。
「データが建物の外に出ることはありません」という言葉は、クラウドベンダーがまったく手を出せない規制産業の取引を成立させる。法律事務所、クリニック、金融アドバイザー - これらのクライアントは、その保証に対して有意義なプレミアムを支払うだろう。
誰も言及しない考え方のシフト:
クラウドの価格設定は、計算リソースを節約するように訓練する。エージェントをループさせたり、アーカイブ全体を再実行したり、うまくいかないかもしれないアイデアを調整したりする前にためらう。すべての実行にはドル単位のコストが伴うため、実行回数が減る。
ボックスを所有すれば、そのためらいは消える。ほとんどの場合、最高の仕事はそのためらいの向こう側にあった。
6 / Spark がそうでないもの
制限について正直に述べる。
- 生の速度 - 5090 は、32GB の VRAM に収まるものではより高速
- スケール - 数千の同時ユーザーにサービスを提供するのは、依然としてデータセンターの仕事
- 405B を超えるフロンティアモデル - 2 台の連結 Spark は 405B を処理可能。それを超えると、別のハードウェアが必要
- 低ボリュームユーザー - API 呼び出しに月額 20 ドルしか使っていない場合、これは適切なツールではない
正直な閾値: 月額 1,000 ドル以上のクラウド GPU 支出 が、Spark が明白な選択となるラインだ。月額 500 ドル未満であれば、コンシューマーカードまたは API アクセスがより賢明な選択だ。このボックスは、カジュアルな使用ではなく、本格的なワークロードに適したサイズである。
7 / さまざまな支出レベルでの回収期間
月額クラウド習慣
回収期間
1,900 ドル/月
約 6 週間
1,000 ドル/月
約 3 ヶ月
500 ドル/月
約 6 ヶ月
200 ドル/月
クラウドに留まる
8 / より広い視点
2024 年、70B モデルを実行するには、データセンターか月額 1,900 ドルのクラウド請求書のいずれかが必要だった。2026 年には、文庫本サイズの 2,999 ドルのボックスと壁コンセントがあれば済む。
NVIDIA は DGX Spark を意図的に 2,999 ドルに価格設定した。彼らは、次世代の AI 製品が自社のシリコン上で、ローカルに、大規模に構築されることを望んでいる。ジェンスンは初期ユニットをマスクとアルトマンに直接手渡した。Dell、HP、ASUS、Lenovo はすべて、独自の GB10 マシンを構築している。ソフトウェアスタックは、ほぼ毎週このチップ向けに調整されている。
クラウド GPU レートは低下していない。データプライバシー要件は厳格化している。クライアントは、何かに署名する前に、データが物理的にどこに行くのかをますます尋ねるようになっている。
2026 年に机の上でフロンティアクラスのモデルを実行している人々は、2028 年には先見の明があるように見えるだろう。
計算は簡単だ。2,999 ドルを一度支払うか、毎月 1,900 ドルを支払うか。このボックスは第 1 四半期が終わる前に元が取れ、その後は必要な限り月額 10 ドルで動作する。
それがトレードオフだ。もっと早くこの選択をしていればよかった。
これが役に立ったなら、@cryptowluha をフォローしてください。
埋もれてしまう前にブックマークしてください。これが役に立ったなら、必要としている人に共有してください。





