我追蹤每一筆花在 AI 基礎設施上的錢。去年,有一個項目持續增長:雲端 GPU 租用。到了第三季,它已經達到每月 1,900 美元——而我正是那個為產生這筆費用的工作開立發票給客戶的人。
這個數字根本說不通。你不可能靠把 40% 的營運成本交給別人的資料中心來建立一門生意。
然後我買了一台 DGX Spark。以下是詳細分析。
1 / DGX Spark 到底是什麼
NVIDIA 在 2025 年致力於將資料中心硬體壓縮到桌機上。他們在 1 月的 CES 上以 Project DIGITS 的名義發表,3 月在 GTC 上更名為 DGX Spark,並在 10 月開始出貨。最終產品是一個 150×150×50mm 的盒子,重 1.2 公斤,使用標準的牆壁插座供電。
規格如下:
組件 | 詳細資訊 |
|---|---|
晶片 | GB10 Grace Blackwell Superchip |
AI 算力 | 1 PFLOP (FP4) |
CPU | 20 核心 ARM (Grace) |
記憶體 | 128GB LPDDR5x,統一架構 |
儲存空間 | 4TB Gen5 NVMe |
網路 | ConnectX-7 (可串聯兩台) |
功耗 | 負載下約 150–240W |
價格 | $2,999 美元 |
Petaflop 數字只是行銷話術。真正重要的數字是 128GB 的統一記憶體。
消費級 GPU 有硬性上限。4090 給你 24GB 的 VRAM——一旦模型超過這個大小,就無法載入。5090 將上限提高到 32GB。而 Spark 將其提升到 128GB,這意味著它可以運行那些價值 2,000 美元的消費級顯卡甚至無法打開的模型。
2 / 記憶體牆,解釋給你聽
以下是 128GB 統一記憶體實際解鎖的能力:
- Llama 3.3 70B - 完整 BF16 精度,無需任何量化技巧
- Qwen 3 (30B–110B 範圍) - 完美容納
- DeepSeek 等級模型,最高 200B - 量化後,運行穩定
- FLUX.1 圖像生成 - 可以
- 405B 參數 - 兩台 Spark 透過 ConnectX-7 串聯
消費級 GPU 大約在勉強塞入 30B 模型時就到頂了。Spark 的起點正好是那個天花板結束的地方。這個差距就是購買它的全部理由。
3 / 數學計算:22,000 美元從哪裡來
嚴肅 AI 工作負載的雲端 GPU 成本:
任務 | 每月成本 |
|---|---|
A100 80GB,非全時使用 | $600–$1,200 美元 |
H100 用於微調運行 | $1,000–$2,500 美元 |
託管 70B 推理 | $300–$900 美元 |
忘記關閉的實例 | 驚喜 |
AI 開發者的實際總計 | $1,500–$3,000 美元 |
相同工作負載下的 DGX Spark:
項目 | 成本 |
|---|---|
硬體 | $2,999 美元 (一次性) |
約 200W 的電費 | 每月 $8–15 美元 |
雲端租用費 | $0 美元 |
購買後每月成本 | 約 $10 美元 |
以每月 1,900 美元的雲端成本計算,Spark 在 不到 7 週內 就能回本。
在那之後:每個月原本會離開你業務的 1,890 美元,現在留在你這裡。用於相同的客戶工作。開出相同的發票。
第一年重新導回你業務的總金額:22,680 美元。
4 / 軟體層不是問題
Spark 運行 DGX OS——NVIDIA 的 Ubuntu 版本,預載了完整的 AI 軟體堆疊:CUDA、NIM、NeMo。Ollama、vLLM、PyTorch、Hugging Face 和 llama.cpp 在第一天就能直接運行,無需修改。
如果你之前已經在使用雲端端點,遷移只需要修改一行程式碼:
1# 之前:按小時付費2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# 之後:你的桌上,計費器關閉5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
相同的程式碼路徑。相同的 JSON 輸出。相同的行為。沒有任何東西會產生帳單。沒有任何東西離開你的建築物。
5 / 超越成本節省的商業價值
Spark 不僅僅是成本削減工具。它消除了過去因成本過高而無法自由運行的經濟障礙。
如果你為客戶做 AI 工作:
過去需要花費 400 美元雲端費用的微調運行,現在是免費的。讓它跑一整晚。用不同的超參數運行三個變體。早上醒來不會有帳單。你可以為客戶的整個專有程式碼庫部署一個私有編碼 Agent,或者一個整個團隊都能使用的全天候助手——而你的單位成本是電費,而不是 API Token。第一個客戶之後的每個客戶都是純利潤。
如果你處理敏感資料:
這是大多數人低估的角度。合約。法律文件。病患記錄。財務資料。任何受 NDA 約束、你絕不會透過公共 API 傳輸的資料。在 Spark 上,這些資料永遠不會離開你的網路。沒有任何服務條款能管轄一台你完全擁有的機器。
「你的資料永遠不會離開建築物」這句話能讓你在受監管的行業中,拿下雲端供應商根本無法觸及的合約。律師事務所、診所、財務顧問——這些客戶願意為這項保證支付可觀的溢價。
沒有人提到的思維轉變:
雲端定價讓你習慣於配給算力。你在讓 Agent 循環、重新運行整個檔案庫、或針對一個可能行不通的想法進行調優之前會猶豫。每次運行都附帶一個美元成本,所以你運行得更少。
擁有這台機器後,那種猶豫就消失了。大多數時候,最好的工作成果就藏在猶豫的背後。
6 / Spark 不是什麼
直接說明其限制:
- 原始速度 - 對於任何能放進 32GB VRAM 的工作,5090 更快
- 規模 - 服務數千名並發用戶仍然是資料中心的工作
- 超越 405B 的前沿模型 - 兩台串聯的 Spark 可以處理 405B;超過這個規模,你需要不同的硬體
- 低用量用戶 - 如果你每月在 API 呼叫上花費 20 美元,這不是適合你的工具
誠實的門檻是:每月雲端 GPU 花費超過 1,000 美元,這時 Spark 就成了一個顯而易見的選擇。低於每月 500 美元,消費級顯卡或 API 存取是更明智的做法。這台機器適合嚴肅的工作負載,而非休閒使用。
7 / 不同花費水準的回本時間
每月雲端習慣 | 回本期 |
|---|---|
$1,900/月 | 約 6 週 |
$1,000/月 | 約 3 個月 |
$500/月 | 約 6 個月 |
$200/月 | 繼續用雲端 |
8 / 更宏觀的圖景
在 2024 年,運行一個 70B 模型需要一個資料中心或每月 1,900 美元的雲端帳單。到了 2026 年,只需要一個 2,999 美元、平裝書大小的盒子和一個牆壁插座。
NVIDIA 刻意將 DGX Spark 定價在 2,999 美元——他們希望下一代 AI 產品能建立在他們的晶片上,本地化、大規模地運行。黃仁勳親自將早期設備交到馬斯克和奧特曼手中。戴爾、惠普、華碩和聯想都在打造自己的 GB10 機器。軟體堆疊幾乎每週都在為這款晶片進行調優。
雲端 GPU 的費率並未下降。資料隱私要求正在收緊。客戶在簽署任何文件前,越來越常詢問他們的資料實際上去到哪裡。
那些在 2026 年於辦公桌上運行前沿等級模型的人,在 2028 年看來將極具遠見。
算術很簡單:一次性支付 2,999 美元,對比每月支付 1,900 美元。這台機器在第一季結束前就能回本,之後以每月 10 美元的成本運行,想用多久就用多久。
這就是取捨。真希望我一年前就做了這個決定。
如果這篇文章對你有幫助,請追蹤 @cryptowluha
在它被淹沒之前收藏起來。如果這篇文章對你有幫助,請分享給一個需要它的人。





