问题是没人告诉过你。也没人告诉过我。我为此白白浪费了一年的利润才发现真相。
上个季度我的云 GPU 账单是每月 1900 美元。微调开源模型、托管一个 70B 的 AI 助手、批量处理文档——这些工作,一台普通的 2000 美元显卡根本做不了,因为模型内存装不下。所以我只能按小时租用算力。这周用 A100,下周换 H100。然后有天晚上,盯着账单时我突然醒悟了:我一直在向客户收取这些工作的费用,却把几乎两千美元直接转给了租赁公司。这根本不是支出。这是利润在白白流失。
解决方案来自 Discord 上的一张照片:一个精装小说大小的东西放在桌子上。标题写着:消灭了我的云账单,在桌面上运行 120B 模型,两个月就回本了。
那是一台 DGX Spark。NVIDIA 出品。以前 DGX 这个标志意味着服务器机房里价值 25 万美元的机架,现在被缩小到了桌面上。
它到底是什么
1/ 它到底是什么。
大多数人听到"AI 超级计算机"都会想到服务器机房。而 NVIDIA 在 2025 年证明了这种想法早已过时。一月:推出 Project DIGITS。三月:发布 DGX Spark。十月:正式上桌。黄仁勋在台上的那句总结说明了一切:
1NVIDIA · @nvidia · 2025 年 1 月 6 日2Grace Blackwell,走进每一张办公桌。Project DIGITS 被誉为地球上最小的 AI 超级计算机,仅靠一个普通墙壁插座就能运行多达 2000 亿参数的模型。最打动我的一句话是:"AI 将成为每个行业、每个应用的主流。"3nvidianews.nvidia.com/news
抛开营销辞令,来看看具体的芯片规格:
1DGX Spark - 开箱配置:2芯片: NVIDIA GB10 Grace Blackwell 超级芯片3AI 吞吐量: 1 PFLOP(每秒千万亿次 FP4 运算)4CPU: 20 核 ARM(Grace)5GPU: Blackwell,约 RTX 5070 级别核心6内存: 128GB LPDDR5x,CPU + GPU 统一共享7存储: 4TB Gen5 NVMe,自加密8网络: ConnectX-7 - 可将两台设备串联为一台9功耗: 负载下约 150-240W10尺寸: 150 x 150 x 50mm,1.2kg - 约一本厚平装书大小11价格: $2,999(首发价格)
别管那些千万亿次运算了。真正改变你生活的参数是 128GB 的统一内存。一张 RTX 4090 只有 24GB 显存,5090 也只有 32GB。一旦模型大小超过了你的显存容量,它就根本加载不了——CUDA 会直接报错,你只能回去继续租用。而 DGX Spark 给了你 128GB,所以它能加载那些价值 2000 美元的显卡连碰都碰不了的模型。单台设备就能覆盖高达 2000 亿参数。通过内置的 ConnectX-7 链接将两台设备串联起来,你就能在自己的桌面上运行 4050 亿参数的模型了。
它不是市面上最快的设备。但它是真正能装得下那些值得运行的模型的设备。
2/ 钱都花在了哪里
这是你在云端运行真正的本地 AI 工作时,每个月实实在在花出去的冤枉钱:
1┌─────────────────────────────────────┬──────────────────┐2│ 你租用的服务 │ 每月花费 │3├─────────────────────────────────────┼──────────────────┤4│ A100 80GB(兼职开发) │ $600-1,200 │5│ H100(微调运行) │ $1,000-2,500 │6│ 托管 70B 推理服务 │ $300-900 │7│ 忘记关闭的实例 │ 一笔意外的巨款 │8├─────────────────────────────────────┼──────────────────┤9│ 普通的 AI 自由开发者/创业者 │ $1,500-3,000 │10└─────────────────────────────────────┴──────────────────┘
而同样的工作量,用 DGX Spark 的成本是这样的:
1┌─────────────────────────────────────┬──────────────────┐2│ 费用项目 │ 成本 │3├─────────────────────────────────────┼──────────────────┤4│ 设备本身(你拥有它) │ $2,999(一次性) │5│ 约 200W 功耗下的电费(工作时间) │ 约 $8-15/月 │6│ 云租赁费用 │ $0 │7├─────────────────────────────────────┼──────────────────┤8│ 月度稳定运营成本 │ 约 $10 │9└─────────────────────────────────────┴──────────────────┘
以我每月 1900 美元的云服务开销来算,它大约 1.6 个月就能回本。
在那之后,我过去每月交给租赁公司的约 1890 美元,就变成了我从同样的客户工作中直接赚到的纯利润。第一年,这台设备就为我节省了大约 22,000 美元,这笔钱原本都流向了别人的数据中心,现在则回到了我的生意里。而且它永不间断,从不卡顿,也绝不会把任何字节数据传出你的桌面。
3/ 它能跑什么
DGX Spark 预装了 DGX OS——NVIDIA 自家的 Ubuntu 定制版,集成了完整的 AI 软件栈:CUDA,以及运行在数据中心 DGX 系统上的相同库。因为是原生的 CUDA,所以开放的生态系统基本都能开箱即用:Ollama、vLLM、PyTorch、Hugging Face、llama.cpp 全都支持。
如果你之前用的是云端接口,迁移只需要改动一行代码:
1# 之前 - 按小时付费给租赁公司:2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# 之后 - 设备就在你桌上,计费表已关闭:5client = OpenAI(6 base_url="http://localhost:11434/v1",7 api_key="local" # 实际上用不上8)
同样的代码路径,同样的 JSON,同样的行为。唯一的区别是:没有账单,数据也不会离开你的设备。
单台 128GB 设备的模型覆盖范围:
1┌────────────────┬────────────┬───────────┬──────────────────────────┐2│ 模型 │ 大小 │ 能装下? │ 擅长领域 │3├────────────────┼────────────┼───────────┼──────────────────────────┤4│ Llama 3.3 70B │ 70B │ 完整 BF16 │ 繁重的 AI 助手工作 │5│ Qwen 3(大) │ 30-110B │ 可以 │ 多语言、编码 │6│ DeepSeek 系列 │ 高达 200B │ 量化运行 │ 推理、Agent 循环 │7│ FLUX.1 │ - │ 可以 │ 本地图像生成 │8│ 405B(双机) │ 405B │ 链接运行 │ 前沿级,本地部署 │9└────────────────┴────────────┴───────────┴──────────────────────────┘
消费级 GPU 的极限大约是勉强运行一个压紧的 30B 模型。而 DGX Spark 能以完整精度运行 70B 模型,并向 200B 延伸。这个差距就是你值得拥有它的全部理由。
4/ 部署起来简单到让人尴尬
1# 1. 在 Spark 上安装 Ollama2curl -fsSL https://ollama.com/install.sh | sh34# 2. 拉取一个任何消费级显卡都装不下的模型5ollama pull llama3.3:70b67# 3. 提供服务8ollama serve9# 你的私有 70B 模型已上线,访问地址为 http://localhost:11434
想要一个在你的硬件上完全运行、像 ChatGPT 那样的浏览器窗口?一个容器就够了:
1docker run -d -p 3000:8080 \2 --add-host=host.docker.internal:host-gateway \3 -v open-webui:/app/backend/data \4 ghcr.io/open-webui/open-webui:main
打开 localhost:3000,你就拥有了一台前沿级模型的私密聊天服务——无需密钥、无需订阅、数据也不会离开你的房间。
5/ 钱到底是怎么省出来的
诀窍不在于纸面上的节省。而在于,当一个 70B 模型每次调用都几乎零成本时,你就不再需要犹豫了。
NVIDIA 早期将设备提供给 Ollama、OpenAI、SpaceX 和大学实验室——但对做生意的人来说,真正的价值更简单:
如果你靠 AI 工作赚钱:在客户的整个私有代码库上运行一个私有的编程 Agent。一个整个团队都能依赖、永远在线的内部助手。一个你的单位成本是电费、而不是 API 代币的产品,这样每个客户都是纯利润。过去每次花费 400 美元云账单的隔夜微调任务,现在完全免费。
如果你处理任何敏感信息(这才是真正低调的杀手锏):合同与法律审查、病人记录、财务账簿,任何受保密协议约束、你绝不可能粘贴到公共模型中的数据。在 DGX Spark 上,这些数据永远不会离开你的网络,也完全不受制于任何服务条款——因为这台机器完全属于你自己。
思维方式上的转变:云服务的定价方式让你学会了精打细算。在让 Agent 循环、重新处理整个存档、或者凭直觉进行调整之前,你总会再三思量。而拥有了这台设备,这种犹豫就消失了——而这恰恰就是真正的利润所在。
6/ 我会对你坦诚相待
这东西不是奇迹,任何声称它能取代数据中心的人,都是在向你推销东西。
优势:能加载 70B-200B 这类消费级 GPU 无法容纳的模型。无需租用 H100 就能进行微调和原型开发。基本上以零边际成本实现始终在线的私密推理服务。可以无缝替代云服务接口,因为它原生支持 CUDA。
劣势:对于一些能在显存里装下的小模型,RTX 5090 的速度更快。仅仅一台 DGX Spark 在超过 405B 参数后会显得吃力(需要两台设备协作)。为成千上万的实时用户提供服务仍然是数据中心的领域。$2,999 的初始投入是一笔真实的开销,尽管回本很快。
说实话:如果你已经在为运行大型开源模型而每月支付超过 1000 美元的 GPU 租赁费,那么这可能是目前 AI 领域回本最快的硬件投资之一。如果你只是偶尔用用 7B 小模型聊天,那么一个便宜的边缘设备或者你现有的 GPU 才是更明智的选择。根据工作需求选择设备,而不是追逐炒作。
7/ 一整套配置,全在这里
1硬件: NVIDIA DGX Spark - $2,999(一次性购买)2 nvidia.com/en-us/products/workstations/dgx-spark3 原厂品牌:ASUS, Dell, HP, Lenovo, Acer, MSI, GIGABYTE45操作系统: NVIDIA DGX OS(基于 Ubuntu),已预装6 完整的 NVIDIA AI 软件栈,包括 CUDA、NIM、NeMo78运行时环境: Ollama / vLLM / llama.cpp - 免费、开源9 ollama.com1011用户界面: Open WebUI - 本地化的类 ChatGPT 前端12 github.com/open-webui/open-webui1314模型支持: Llama 3.3 70B, Qwen 3, DeepSeek, FLUX.115 全部可通过 Hugging Face / Ollama 免费获取1617扩展性: 通过 ConnectX-7 连接两台设备可运行 405B 参数模型1819功耗: 电费大约 $8-15/月20隐私性: 数据绝不离开你的网络,毋庸置疑
之后呢?每个月仅仅几美元的电费。这就是全部开销了。
为什么是现在,而不是以后
NVIDIA 缩小一台价值 25 万美元的机架,可不是出于慷慨。他们希望下一波 AI 应用能建立在他们的本地芯片上。他们把入门价格定在 $2,999,让黄仁勋亲自把设备交到了马斯克和奥特曼手中。现在,Dell、HP、ASUS、Lenovo 都在出货 GB10 设备。Ollama、vLLM、CUDA 团队每周都在为这款芯片进行优化。
云 GPU 的价格不会变得更便宜。使用限制也会越来越紧。以及,我们的数据物理上存放在哪里——这已经成为客户签约前问的第一个问题。
那些在 2026 年就将工作负载迁移到桌面设备上的人,到了 2028 年,他们将会遥遥领先。
一台平装书大小的机器。完整的千万亿次算力。完完全全属于你一个人的 70B 模型。运行成本每月约 10 美元——而你每月 1900 美元的源源不断流出你生意的开销,就停止了。
这就是这笔交易的真相。真希望我一年前就明白了。
如果这篇文章对你有用,请关注 @Asteri_eth
更多关于 AI 工具、AI 机构以及真正值得构建的内容





