YouMind
登录

一台 2,999 美元的 NVIDIA 设备如何每年节省 22,000 美元

@Asteri_eth
英语2026年6月02日
249K
69
3
15
63

TL;DR

NVIDIA DGX Spark 以 2,999 美元的价格提供 128GB 统一内存,支持在本地运行 Llama 3.3 70B 等大型 AI 模型。这种从云端租赁转向本地硬件的模式,可为 AI 自由职业者每年节省高达 22,000 美元的成本。

问题是没人告诉过你。也没人告诉过我。我为此白白浪费了一年的利润才发现真相。

上个季度我的云 GPU 账单是每月 1900 美元。微调开源模型、托管一个 70B 的 AI 助手、批量处理文档——这些工作,一台普通的 2000 美元显卡根本做不了,因为模型内存装不下。所以我只能按小时租用算力。这周用 A100,下周换 H100。然后有天晚上,盯着账单时我突然醒悟了:我一直在向客户收取这些工作的费用,却把几乎两千美元直接转给了租赁公司。这根本不是支出。这是利润在白白流失。

解决方案来自 Discord 上的一张照片:一个精装小说大小的东西放在桌子上。标题写着:消灭了我的云账单,在桌面上运行 120B 模型,两个月就回本了。

那是一台 DGX Spark。NVIDIA 出品。以前 DGX 这个标志意味着服务器机房里价值 25 万美元的机架,现在被缩小到了桌面上。

它到底是什么

1/ 它到底是什么。

大多数人听到"AI 超级计算机"都会想到服务器机房。而 NVIDIA 在 2025 年证明了这种想法早已过时。一月:推出 Project DIGITS。三月:发布 DGX Spark。十月:正式上桌。黄仁勋在台上的那句总结说明了一切:

text
1NVIDIA · @nvidia · 2025 年 1 月 6 日
2Grace Blackwell,走进每一张办公桌。Project DIGITS 被誉为地球上最小的 AI 超级计算机,仅靠一个普通墙壁插座就能运行多达 2000 亿参数的模型。最打动我的一句话是:"AI 将成为每个行业、每个应用的主流。"
3nvidianews.nvidia.com/news

抛开营销辞令,来看看具体的芯片规格:

text
1DGX Spark - 开箱配置:
2芯片: NVIDIA GB10 Grace Blackwell 超级芯片
3AI 吞吐量: 1 PFLOP(每秒千万亿次 FP4 运算)
4CPU: 20 核 ARM(Grace)
5GPU: Blackwell,约 RTX 5070 级别核心
6内存: 128GB LPDDR5x,CPU + GPU 统一共享
7存储: 4TB Gen5 NVMe,自加密
8网络: ConnectX-7 - 可将两台设备串联为一台
9功耗: 负载下约 150-240W
10尺寸: 150 x 150 x 50mm,1.2kg - 约一本厚平装书大小
11价格: $2,999(首发价格)

别管那些千万亿次运算了。真正改变你生活的参数是 128GB 的统一内存。一张 RTX 4090 只有 24GB 显存,5090 也只有 32GB。一旦模型大小超过了你的显存容量,它就根本加载不了——CUDA 会直接报错,你只能回去继续租用。而 DGX Spark 给了你 128GB,所以它能加载那些价值 2000 美元的显卡连碰都碰不了的模型。单台设备就能覆盖高达 2000 亿参数。通过内置的 ConnectX-7 链接将两台设备串联起来,你就能在自己的桌面上运行 4050 亿参数的模型了。

它不是市面上最快的设备。但它是真正能装得下那些值得运行的模型的设备。

2/ 钱都花在了哪里

这是你在云端运行真正的本地 AI 工作时,每个月实实在在花出去的冤枉钱:

text
1┌─────────────────────────────────────┬──────────────────┐
2│ 你租用的服务 │ 每月花费 │
3├─────────────────────────────────────┼──────────────────┤
4│ A100 80GB(兼职开发) │ $600-1,200 │
5│ H100(微调运行) │ $1,000-2,500 │
6│ 托管 70B 推理服务 │ $300-900 │
7│ 忘记关闭的实例 │ 一笔意外的巨款 │
8├─────────────────────────────────────┼──────────────────┤
9│ 普通的 AI 自由开发者/创业者 │ $1,500-3,000 │
10└─────────────────────────────────────┴──────────────────┘

而同样的工作量,用 DGX Spark 的成本是这样的:

text
1┌─────────────────────────────────────┬──────────────────┐
2│ 费用项目 │ 成本 │
3├─────────────────────────────────────┼──────────────────┤
4│ 设备本身(你拥有它) │ $2,999(一次性) │
5│ 约 200W 功耗下的电费(工作时间) │ 约 $8-15/月 │
6│ 云租赁费用 │ $0 │
7├─────────────────────────────────────┼──────────────────┤
8│ 月度稳定运营成本 │ 约 $10 │
9└─────────────────────────────────────┴──────────────────┘

以我每月 1900 美元的云服务开销来算,它大约 1.6 个月就能回本。

在那之后,我过去每月交给租赁公司的约 1890 美元,就变成了我从同样的客户工作中直接赚到的纯利润。第一年,这台设备就为我节省了大约 22,000 美元,这笔钱原本都流向了别人的数据中心,现在则回到了我的生意里。而且它永不间断,从不卡顿,也绝不会把任何字节数据传出你的桌面。

3/ 它能跑什么

DGX Spark 预装了 DGX OS——NVIDIA 自家的 Ubuntu 定制版,集成了完整的 AI 软件栈:CUDA,以及运行在数据中心 DGX 系统上的相同库。因为是原生的 CUDA,所以开放的生态系统基本都能开箱即用:Ollama、vLLM、PyTorch、Hugging Face、llama.cpp 全都支持。

如果你之前用的是云端接口,迁移只需要改动一行代码:

text
1# 之前 - 按小时付费给租赁公司:
2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")
3
4# 之后 - 设备就在你桌上,计费表已关闭:
5client = OpenAI(
6 base_url="http://localhost:11434/v1",
7 api_key="local" # 实际上用不上
8)

同样的代码路径,同样的 JSON,同样的行为。唯一的区别是:没有账单,数据也不会离开你的设备。

单台 128GB 设备的模型覆盖范围:

text
1┌────────────────┬────────────┬───────────┬──────────────────────────┐
2│ 模型 │ 大小 │ 能装下? │ 擅长领域 │
3├────────────────┼────────────┼───────────┼──────────────────────────┤
4│ Llama 3.3 70B │ 70B │ 完整 BF16 │ 繁重的 AI 助手工作 │
5│ Qwen 3(大) │ 30-110B │ 可以 │ 多语言、编码 │
6│ DeepSeek 系列 │ 高达 200B │ 量化运行 │ 推理、Agent 循环 │
7│ FLUX.1 │ - │ 可以 │ 本地图像生成 │
8│ 405B(双机) │ 405B │ 链接运行 │ 前沿级,本地部署 │
9└────────────────┴────────────┴───────────┴──────────────────────────┘

消费级 GPU 的极限大约是勉强运行一个压紧的 30B 模型。而 DGX Spark 能以完整精度运行 70B 模型,并向 200B 延伸。这个差距就是你值得拥有它的全部理由。

4/ 部署起来简单到让人尴尬

text
1# 1. 在 Spark 上安装 Ollama
2curl -fsSL https://ollama.com/install.sh | sh
3
4# 2. 拉取一个任何消费级显卡都装不下的模型
5ollama pull llama3.3:70b
6
7# 3. 提供服务
8ollama serve
9# 你的私有 70B 模型已上线,访问地址为 http://localhost:11434

想要一个在你的硬件上完全运行、像 ChatGPT 那样的浏览器窗口?一个容器就够了:

text
1docker run -d -p 3000:8080 \
2 --add-host=host.docker.internal:host-gateway \
3 -v open-webui:/app/backend/data \
4 ghcr.io/open-webui/open-webui:main

打开 localhost:3000,你就拥有了一台前沿级模型的私密聊天服务——无需密钥、无需订阅、数据也不会离开你的房间。

5/ 钱到底是怎么省出来的

诀窍不在于纸面上的节省。而在于,当一个 70B 模型每次调用都几乎零成本时,你就不再需要犹豫了。

NVIDIA 早期将设备提供给 Ollama、OpenAI、SpaceX 和大学实验室——但对做生意的人来说,真正的价值更简单:

如果你靠 AI 工作赚钱:在客户的整个私有代码库上运行一个私有的编程 Agent。一个整个团队都能依赖、永远在线的内部助手。一个你的单位成本是电费、而不是 API 代币的产品,这样每个客户都是纯利润。过去每次花费 400 美元云账单的隔夜微调任务,现在完全免费。

如果你处理任何敏感信息(这才是真正低调的杀手锏):合同与法律审查、病人记录、财务账簿,任何受保密协议约束、你绝不可能粘贴到公共模型中的数据。在 DGX Spark 上,这些数据永远不会离开你的网络,也完全不受制于任何服务条款——因为这台机器完全属于你自己。

思维方式上的转变:云服务的定价方式让你学会了精打细算。在让 Agent 循环、重新处理整个存档、或者凭直觉进行调整之前,你总会再三思量。而拥有了这台设备,这种犹豫就消失了——而这恰恰就是真正的利润所在。

6/ 我会对你坦诚相待

这东西不是奇迹,任何声称它能取代数据中心的人,都是在向你推销东西。

优势:能加载 70B-200B 这类消费级 GPU 无法容纳的模型。无需租用 H100 就能进行微调和原型开发。基本上以零边际成本实现始终在线的私密推理服务。可以无缝替代云服务接口,因为它原生支持 CUDA。

劣势:对于一些能在显存里装下的小模型,RTX 5090 的速度更快。仅仅一台 DGX Spark 在超过 405B 参数后会显得吃力(需要两台设备协作)。为成千上万的实时用户提供服务仍然是数据中心的领域。$2,999 的初始投入是一笔真实的开销,尽管回本很快。

说实话:如果你已经在为运行大型开源模型而每月支付超过 1000 美元的 GPU 租赁费,那么这可能是目前 AI 领域回本最快的硬件投资之一。如果你只是偶尔用用 7B 小模型聊天,那么一个便宜的边缘设备或者你现有的 GPU 才是更明智的选择。根据工作需求选择设备,而不是追逐炒作。

7/ 一整套配置,全在这里

text
1硬件: NVIDIA DGX Spark - $2,999(一次性购买)
2 nvidia.com/en-us/products/workstations/dgx-spark
3 原厂品牌:ASUS, Dell, HP, Lenovo, Acer, MSI, GIGABYTE
4
5操作系统: NVIDIA DGX OS(基于 Ubuntu),已预装
6 完整的 NVIDIA AI 软件栈,包括 CUDA、NIM、NeMo
7
8运行时环境: Ollama / vLLM / llama.cpp - 免费、开源
9 ollama.com
10
11用户界面: Open WebUI - 本地化的类 ChatGPT 前端
12 github.com/open-webui/open-webui
13
14模型支持: Llama 3.3 70B, Qwen 3, DeepSeek, FLUX.1
15 全部可通过 Hugging Face / Ollama 免费获取
16
17扩展性: 通过 ConnectX-7 连接两台设备可运行 405B 参数模型
18
19功耗: 电费大约 $8-15/月
20隐私性: 数据绝不离开你的网络,毋庸置疑

之后呢?每个月仅仅几美元的电费。这就是全部开销了。

为什么是现在,而不是以后

NVIDIA 缩小一台价值 25 万美元的机架,可不是出于慷慨。他们希望下一波 AI 应用能建立在他们的本地芯片上。他们把入门价格定在 $2,999,让黄仁勋亲自把设备交到了马斯克和奥特曼手中。现在,Dell、HP、ASUS、Lenovo 都在出货 GB10 设备。Ollama、vLLM、CUDA 团队每周都在为这款芯片进行优化。

云 GPU 的价格不会变得更便宜。使用限制也会越来越紧。以及,我们的数据物理上存放在哪里——这已经成为客户签约前问的第一个问题。

那些在 2026 年就将工作负载迁移到桌面设备上的人,到了 2028 年,他们将会遥遥领先。

一台平装书大小的机器。完整的千万亿次算力。完完全全属于你一个人的 70B 模型。运行成本每月约 10 美元——而你每月 1900 美元的源源不断流出你生意的开销,就停止了。

这就是这笔交易的真相。真希望我一年前就明白了。

如果这篇文章对你有用,请关注 @Asteri_eth

更多关于 AI 工具、AI 机构以及真正值得构建的内容

https://x.com/nvidia/status/1978911318842171859

https://x.com/nvidia/status/1977902801671127202

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章