我追踪自己在 AI 基础设施上的每一笔开销。去年,有一项支出持续增长:云端 GPU 租赁。到第三季度,它已经达到了每月 1,900 美元——而我正是那个为产生这笔费用的工作向客户开具发票的人。
这笔账怎么算都不对。你不可能通过把 40% 的运营成本交给别人的数据中心来建立自己的业务。
然后我买了一台 DGX Spark。以下是详细分析。
1 / DGX Spark 到底是什么
2025 年,NVIDIA 一直在将数据中心级别的硬件压缩到桌面上。他们在 1 月的 CES 上以 Project DIGITS 的名义宣布了它,3 月在 GTC 上将其更名为 DGX Spark,并于 10 月开始发货。最终产品是一个 150×150×50mm 的盒子,重 1.2 公斤,使用标准墙壁插座供电。
规格如下:
组件
详情
芯片
GB10 Grace Blackwell 超级芯片
AI 算力
1 PFLOP (FP4)
CPU
20 核 ARM (Grace)
内存
128GB LPDDR5x,统一架构
存储
4TB Gen5 NVMe
网络
ConnectX-7(可串联两台设备)
功耗
负载下约 150–240W
价格
$2,999
千万亿次浮点运算的数字是营销数据。真正重要的数字是 128GB 的统一内存。
消费级 GPU 有硬性天花板。4090 给你 24GB 的显存——一旦模型超过这个大小,就无法加载。5090 将天花板提高到 32GB。Spark 将其提升到 128GB,这意味着它可以运行那些价值 2,000 美元的消费级显卡甚至无法打开的模型。
2 / 内存墙,解释一下
以下是 128GB 统一内存实际解锁的能力:
- Llama 3.3 70B - 完整的 BF16 精度,无需任何量化技巧
- Qwen 3(30B–110B 范围) - 完美适配
- 最高达 200B 的 DeepSeek 类模型 - 量化后运行稳定
- FLUX.1 图像生成 - 可以运行
- 405B 参数 - 通过 ConnectX-7 串联两台 Spark
消费级 GPU 大约在勉强运行 30B 模型时达到极限。Spark 正好从这个天花板结束的地方开始。这个差距就是购买它的全部理由。
3 / 算笔账:22,000 美元从何而来
严肃 AI 工作负载的云端 GPU 成本:
任务
月成本
A100 80GB,非全天使用
$600–$1,200
用于微调运行的 H100
$1,000–$2,500
托管的 70B 推理
$300–$900
忘记关闭的实例
惊喜价
AI 构建者的实际总成本
$1,500–$3,000
相同工作负载下的 DGX Spark:
项目
成本
硬件
$2,999(一次性)
约 200W 功耗的电费
$8–15/月
云租赁费用
$0
购买后每月成本
~$10
以每月 1,900 美元的云成本计算,Spark 在 不到 7 周 内即可收回成本。
之后:以前每月从你业务中流出的 1,890 美元现在留在了业务里。在相同的客户工作和相同的发票金额下。
第一年重新回到你业务中的总金额:$22,680。
4 / 软件层不是问题
Spark 运行 DGX OS——NVIDIA 的 Ubuntu 构建版本,预装了完整的 AI 软件栈:CUDA、NIM、NeMo。Ollama、vLLM、PyTorch、Hugging Face 和 llama.cpp 在第一天就能无需修改直接运行。
如果你已经在使用云端端点,迁移只需要更改一行代码:
1# 之前:按小时付费2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# 之后:你的桌面,计费停止5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
相同的代码路径。相同的 JSON 输出。相同的行为。没有任何计费。数据不会离开你的设备。
5 / 超越成本节约的商业价值
Spark 不仅仅是削减成本。它消除了以前因成本过高而无法自由运行工作的经济障碍。
如果你为客户做 AI 工作:
以前需要 400 美元云账单的微调运行现在免费了。通宵运行它们。用不同的超参数运行三个变体。早上不会有发票出现。你可以为客户整个专有代码库部署一个私有的编码 Agent,或者部署一个整个团队都能使用的始终在线的助手——而你的单位成本是电费,而不是 API 令牌。第一个客户之后的每个客户都是纯利润。
如果你处理敏感数据:
这是大多数人低估的角度。合同。法律文件。病人记录。财务数据。任何受保密协议约束、你绝不会通过公共 API 传输的数据。在 Spark 上,这些数据永远不会穿过你的网络。没有服务条款约束你完全拥有的机器。
"你的数据永远不会离开你的设备" 这句话能帮你拿下受监管行业的交易,而云供应商根本无法触及这些领域。律师事务所、诊所、财务顾问——这些客户愿意为这种保证支付可观的溢价。
没人提到的思维转变:
云定价让你学会了限制算力使用。你在让 Agent 循环运行、重新处理整个存档、或者为一个可能行不通的想法进行调优之前会犹豫不决。每次运行都有美元成本,所以你运行得更少。
拥有这台机器后,这种犹豫就消失了。大多数时候,最好的工作成果恰恰就在这种犹豫的背后。
6 / Spark 不是什么
直接说明其局限性:
- 原始速度 - 对于任何能装进其 32GB 显存的任务,5090 更快
- 规模 - 服务数千名并发用户仍然是数据中心的工作
- 超过 405B 的前沿模型 - 两台串联的 Spark 可以处理 405B;再往上,你需要不同的硬件
- 低用量用户 - 如果你每月在 API 调用上花费 20 美元,这不是合适的工具
诚实的门槛是:每月云端 GPU 支出超过 1,000 美元 时,Spark 才是一个显而易见的选择。低于每月 500 美元,消费级显卡或 API 访问是更明智的选择。这台机器适合严肃的工作负载,而不是日常使用。
7 / 不同支出水平下的回本周期
每月云支出习惯
回本周期
$1,900/月
约 6 周
$1,000/月
约 3 个月
$500/月
约 6 个月
$200/月
继续使用云服务
8 / 更广阔的图景
在 2024 年,运行一个 70B 模型要么需要数据中心,要么需要每月 1,900 美元的云账单。到 2026 年,它只需要一个 2,999 美元、平装书大小的盒子和一个墙壁插座。
NVIDIA 故意将 DGX Spark 定价为 2,999 美元——他们希望下一代 AI 产品能大规模地、本地化地构建在他们的芯片上。黄仁勋亲自将早期设备送到了马斯克和奥特曼手中。戴尔、惠普、华硕和联想都在制造自己的 GB10 机器。软件栈几乎每周都在为这款芯片进行优化。
云端 GPU 价格没有下降。数据隐私要求越来越严格。客户在签署任何东西之前,越来越多地询问他们的数据物理上去了哪里。
那些在 2026 年就在桌面上运行前沿模型的人,在 2028 年看来会很有先见之明。
算术很简单:一次性支付 2,999 美元,对比每月支付 1,900 美元。这台机器在第一季度结束前就能收回成本,然后在你需要的时间内以每月 10 美元的成本运行。
这就是权衡。真希望我一年前就做出了这个选择。
如果觉得有用,请关注 @cryptowluha
在它被淹没之前收藏起来。如果觉得有用,请分享给一个需要它的人。





