在地化 AI 階梯:10 種讓你省下 200 美元 AI 帳單的方案(從 0 美元到 4,700 美元)

@RetroChainer
英語2 天前 · 2026年7月19日
106K
50
5
8
82

TL;DR

這是一份關於在地化 AI 硬體的綜合指南,根據記憶體與效能將 10 種選項分為從 0 美元到 4,700 美元不等的等級。內容說明了如何利用 Ollama 等工具,以私有的在地化設置取代昂貴的雲端訂閱服務。

此刻,某個開發者正為 AI 每月支付 200 美元,卻從未仔細算過這筆帳。ChatGPT Plus、Claude Pro、Cursor,還有每月悄悄增加的 API 費用。這筆錢會一直付下去,而「一直」是很長的時間,尤其當你租用的東西其實可以自己擁有。

還有另一種思考方式。一台放在你家的盒子,在本機運行 AI,每月電費只需幾美元,資料留在你自己的機器上,絕不傳送任何一個位元組到別人的伺服器。

2026 年的本地 AI 不再是兩年前那個令人沮喪的妥協方案。更好的量化技術、更精簡的模型架構,以及統一記憶體晶片,代表你桌上的機器現在能處理大約 80% 的日常 AI 工作:寫作、程式碼輔助、文件分析、摘要、分類、自動化、針對你自有文件的問答。另外 20%,也就是前沿推理和尖端程式碼,仍然屬於雲端。但為了那 20% 而支付 200 美元的帳單,實在說不過去,尤其當一台一次性購買的盒子就能涵蓋其餘部分。

以下是階梯圖。十個階層,從你已經擁有的機器,到桌上型超級電腦,以及每一步的誠實取捨。

一個改變一切的關鍵概念

你買的不是速度。你買的是記憶體。

所有「跑不動」的故事,最終都歸咎於同一道牆:模型裝不進機器的記憶體。模型要嘛載得進去,要嘛不行。速度只決定它跑起來的感覺;記憶體則決定它到底能不能跑。

所以,整個階梯圖其實是記憶體的階梯。8GB 能跑 7B 模型。24GB 能順暢跑 32B 模型。128GB 能跑 70B 模型,並開始觸及真正的大型模型。用這個角度來看待下面每一階,你會注意到一個模式:那些最具擴展性的盒子,都配備了統一記憶體,讓 CPU 和 GPU 共享一個大池子,而不是爭搶一小塊被隔離的 VRAM。

在進入規格前,有一個適用於整個清單的備註:全球 DRAM 短缺正推動記憶體價格在 2026 年持續上漲,而非下跌。這裡的每個數字都是近似值,且持續攀升,這意味著你應該購買你真的會用到的盒子,而不是等待可能不會出現的降價。

階梯圖

第 1 階:你已經擁有的機器(0 美元)

在你花任何錢之前,先用你桌上的現有設備驗證工作流程。任何配備 8GB RAM 的筆電,都能透過 Ollama 運行 7B 模型。速度不會很快,但它能回答唯一重要的問題:本地 AI 對你實際要做的事情來說夠不夠好?在花錢到其他地方之前,先用一個週末來測試。

RetroChainer - inline image

第 2 階:Raspberry Pi 5,16GB(約 120 美元)

愛好者的階層。一台配備 16GB 的 Pi 5 可以透過 Ollama 運行 1B 到 3B 模型,速度緩慢。這不是日常主力機,而是你可以放在抽屜裡持續運行的概念驗證:一個微型的永遠在線助手、一個家庭自動化的大腦、一個週末專案。買它是為了學習,而不是為了工作。

RetroChainer - inline image

第 3 階:NVIDIA Jetson Orin Nano Super(249 美元)

最便宜的認真入門點。一個比錢包還小的盒子裡,裝著真正的 NVIDIA GPU。

text
1AI 效能: 67 TOPS
2GPU: 1024 核 Ampere
3RAM: 8GB LPDDR5(共享)
4功耗: 7-25W
5運行良好: Llama 3.2 3B、Mistral 7B、Gemma 2、DeepSeek 1.5B

67 TOPS 能私密且永久地運行 7B 模型。7B 等級的速度夠快,感覺即時,且對大多數日常任務來說足夠好。它無法觸及任何超過 7B 的模型,或任何會超出 8GB 的長上下文,但以每月 100 美元的訂閱費計算,它能在十週內回本。

RetroChainer - inline image

第 4 階:Apple Mac mini M4(從 599 美元起)

預設的靜音家庭 AI 伺服器,因為它配備了統一記憶體。在一般 PC 上,GPU 的 VRAM 是一道硬牆。Apple 在 CPU 和 GPU 之間共享記憶體,因此 Mac mini 能運行比其規格表上所寫更大的模型,保持近乎無聲,且功耗極低。

text
1晶片: Apple M4
2統一記憶體: 16-32GB(CPU + GPU 共享)
3功耗: 10-30W(負載下)
424/7 電費: 約每月 3-8 美元
5運行良好: Llama 3.2、Mistral 7B、Qwen 2.5、Phi-3 Medium

它能做到 Jetson 能做的所有事情,還能運行更大的模型、更長的上下文,以及同時運行多項服務。這是人們會全天候開著,作為自動化後端的那種盒子。不過,599 美元是基本款,而 Apple 對記憶體的收費很硬。對於本地 AI 來說,記憶體是關鍵,所以請為你實際需要的配置定價,而不是只看標價。

RetroChainer - inline image

第 5 階:二手 RTX 3090,24GB(約 700 美元,僅卡)

歷久不衰的性價比傳奇。問世六年,依然是消費市場上 VRAM 性價比最高的產品。一張二手 3090 以約 700 美元的價格提供 24GB 的快速記憶體,足以用真正的吞吐量運行 24B 到 32B 模型,並擁有完整的 CUDA 支援,讓所有工具都能開箱即用。

text
1VRAM: 24GB GDDR6X
2頻寬: ~936 GB/s
3二手價格: ~600-800 美元(僅卡)
4運行良好: Qwen 32B、Llama 3.1 8B-70B(量化)、大多數 32B 等級

誠實的附註:GPU 不是一台電腦。你需要一台主機 PC 來搭配它,所以預算要再增加 400 到 600 美元來購買其餘零件。但如果你已經有一台桌上型電腦,且有閒置插槽和足夠大的電源供應器,那麼這個階梯圖上沒有其他東西能像這樣以如此低廉的價格提供 24GB。

RetroChainer - inline image

第 6 階:AMD Radeon RX 7900 XTX,24GB(約 900 美元,僅卡)

與 3090 相同的 24GB,全新,有保固,而且 AMD 的軟體終於趕上來了。在 ROCm 7.x 上,7900 XTX 運行 Llama 3.1 8B 約每秒 96 個 token,大約是 RTX 4090 的四分之三,價格卻低得多。就全新硬體的純 VRAM 性價比而言,消費級市場上沒有 NVIDIA 產品能與之匹敵。

text
1VRAM: 24GB GDDR6
2軟體: ROCm 7.x(一級支援)
3全新價格: ~899-1,400 美元(僅卡)
4運行良好: Llama 3.1 8B(~96 tok/s)、32B 等級量化模型

缺點與 AMD 一直以來的問題相同:ROCm 已經縮小了與 CUDA 之間的大部分差距,但有些工具仍然預設使用 NVIDIA。對於 Ollama 和 Open WebUI,它現在運作良好。對於特殊的微調堆疊,則可能需要更多手動步驟。

RetroChainer - inline image

第 7 階:AMD Ryzen AI Max+ 395「Strix Halo」,128GB(約 1,999 美元)

2026 年的甜蜜點,也是大多數這類清單會忽略的盒子。AMD 的 Strix Halo 晶片將 16 核 Zen 5 CPU 與大型 RDNA 3.5 iGPU 以及高達 128GB 的統一記憶體整合在一個小盒子中,價格與記憶體只有其四分之一的 NVIDIA 桌上型電腦差不多。

text
1晶片: Ryzen AI Max+ 395(16 核 Zen 5)
2GPU: Radeon 8060S(40 核 RDNA 3.5)
3NPU: XDNA 2,50 TOPS(系統總計約 126 TOPS)
4統一記憶體: 高達 128GB LPDDR5X(約 96GB 可作為 VRAM 使用)
5價格: ~1,999 美元(128GB / 2TB 版本)
6運行良好: Llama 3.3 70B、Mixtral、大多數 70B 等級模型

你可以透過兩種方式購買。 GMKtec EVO-X2 是一台完整的 128GB 迷你 PC,售價約 1,999 美元。 Framework Desktop 則是採用相同晶片,但採用可維修、可升級的機箱,主機板起價 1,999 美元,完整組裝約 2,850 美元。無論哪種方式,你都能以對話速度載入 70B 模型,這是此階層以下任何設備都無法做到的。ROCm 的成熟度是取捨,與第 6 階相同。

RetroChainer - inline image

第 8 階:NVIDIA RTX 5090,32GB(約 3,000 美元,僅卡)

一般人能裝進一般機殼裡最快的東西。32GB 最快的消費級記憶體,以及將所有低階產品遠遠甩在後頭的原始速度。這個階層是為那些想要頂尖等級本地推理和偶爾訓練的人準備的,他們更在乎每秒 token 數,而不是每 GB 成本。

text
1VRAM: 32GB GDDR7
2全新價格: ~3,000+ 美元(僅卡)
3運行良好: 32B 高速運行、70B 量化模型、影像與影片模型

不過,這筆帳很殘酷。它的價格是一張二手 3090 的三到四倍,只多了 8GB 記憶體,而且還需要一台主機。只有在你需要速度和多餘的餘裕空間時才買它,而不是因為它划算。它並不划算。

RetroChainer - inline image

第 9 階:Apple Mac Studio M3 Ultra,96GB(從 3,999 美元起)

大型、靜音、統一記憶體的工作站。Mac Studio 透過 Metal 加速,將最多 96GB 的記憶體在 CPU 和 GPU 之間共享,近乎無聲地運行大型模型,而且裝在一個能放在桌上、沒有噴射引擎風扇聲的盒子裡。

text
1晶片: M3 Ultra(最高 32 核 CPU / 80 核 GPU)
2統一記憶體: 最高 96GB
3價格: 從 3,999 美元起
4運行良好: 70B 等級模型、長上下文、多項服務

誠實地說,值得了解的是:Apple 在 2026 年初,因為 DRAM 短缺,取消了 512GB 的配置,所以 96GB 現在是上限,而過去它可以達到更高。儘管如此,對於一台安靜、能全天運行、可運行大型模型,同時又能作為你實際電腦的機器來說,很少有東西能像它這樣令人愉悅。

RetroChainer - inline image

第 10 階:NVIDIA DGX Spark,128GB(3,999 至 4,699 美元)

這台桌上型電腦自以為是資料中心。適合微調開放模型、託管 70B 以上的助手,以及運行需要真正吞吐量的推理管道。

text
1晶片: GB10 Grace Blackwell
2AI 吞吐量: 1 PFLOP
3統一記憶體: 128GB LPDDR5x
4儲存空間: 4TB Gen5 NVMe
5功耗: 150-240W(負載下)
6最佳用途: 70B-200B 模型、微調、生產級推理

128GB 的統一記憶體可以載入消費級 GPU 甚至無法打開的模型,而兩台設備串聯則可以觸及 400B 領域。價格誠實來說:它在 2025 年 10 月發佈時售價為 3,999 美元,但由於記憶體短缺,現已漲價至約 4,699 美元(Tom's Hardware)。與第 7 階的 Strix Halo 盒子相比,它的價格大約是後者的兩倍,卻只有相同的 128GB。你支付的是 CUDA 的成熟度和吞吐量,而不是更多的記憶體。

RetroChainer - inline image

誠實的計算

text
1典型每月 AI 花費:
2ChatGPT Plus $20
3Claude Pro $20
4Cursor Pro $20
5API 費用 $50-200
6總計 $110-260 / 月
7
8本地 AI 每月花費:
9硬體 $0(已購買)
10電費 $2-15
11API $0
12總計 $2-15 / 月

以每月 100 美元的訂閱費計算,一台 249 美元的 Jetson 在十週內回本,一台 599 美元的 Mac mini 在六個月內回本,一台二手 3090 的組裝機在一年內回本,一台 2,000 美元的 Strix Halo 盒子約在十八個月內回本,而 4,000 美元以上的階層,則只在你原本每月就燒掉數千美元雲端 GPU 租賃費時才划算。

現在,來談談那些炒作總會略過的部分。盒子是沉沒成本,它只有在你真的會持續支付訂閱費的情況下才能「回本」。花 2,000 美元買一台機器來省每月 20 美元,這筆交易比訂閱制更糟,而不是更好。正確的階層是符合你實際使用情況的,而不是你幻想中的使用情況。

你的階層是哪一階

輕度日常使用和好奇心:從第 1 階開始,然後購買 Jetson。家庭或小型企業的靜音永遠在線助手:Mac mini。獲得真正 24GB 和 32B 模型的最便宜路徑:二手 3090,或者如果你想要全新有保固且不介意 ROCm,則選 RX 7900 XTX。無需資料中心資金就能獲得的最佳 70B 體驗:Strix Halo 盒子。最高的消費級速度:RTX 5090。一台安靜、大記憶體、你也會用它來生活的工作站:Mac Studio。微調和生產級管道:DGX Spark。

一個下午就能完成的設定

每個階層的設定流程都相同。

1. 安裝 Ollama。 開源,將任何模型轉換為一個講 OpenAI 語言的本地 API。

bash
1curl -fsSL https://ollama.com/install.sh | sh

2. 拉取一個模型,大小要符合你機器的記憶體。

bash
1# 8GB Jetson 或 16GB Mac mini:
2ollama pull llama3.2
3
4# 24GB 3090 / 7900 XTX:
5ollama pull qwen2.5:32b
6
7# 128GB Strix Halo / DGX Spark:
8ollama pull llama3.3:70b

3. 在你現有的程式碼中,更改一行。

python
1# 之前,按次付費:
2client = OpenAI(api_key="sk-...")
3
4# 之後,本地且免費:
5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

你的程式碼以相同方式運行。沒有任何東西離開機器,每次請求也不花錢。

4.(可選)使用 Open WebUI 添加一個瀏覽器介面,你就能在 localhost:3000 擁有一個私有的 ChatGPT。

bash
1docker run -d -p 3000:8080 \
2 --add-host=host.docker.internal:host-gateway \
3 -v open-webui:/app/backend/data \
4 ghcr.io/open-webui/open-webui:main

實際上要跑什麼

硬體是決定的一半。模型是另一半。以下是 2026 年的大致地圖:

小而快(適合 8-16GB):Llama 3.2 3B、Gemma 2、Phi-3、Mistral 7B。非常適合草稿、分類和針對你個人筆記的問答。主力級(適合 24GB):Qwen 2.5 32B 和量化後的 Llama,對於真正的程式碼輔助和文件工作來說足夠強大。重量級(需要 64-128GB):Llama 3.3 70B 以及大型的 Qwen 和 Mixtral 變體,在這些模型上,本地輸出的感覺在處理日常任務時開始接近雲端模型。

量化是所有這些背後安靜的槓桿。一個 70B 模型以 4-bit 量化,可以裝進全精度版本永遠無法裝進的記憶體中,而品質損失很小且通常可以接受。Q4 到 Q6 對大多數人來說是合理的範圍。低於這個範圍,品質下降的速度會超過記憶體節省的價值。

一旦跑起來,你可以建立什麼

個人使用方面,它每個月花費幾美元就能涵蓋日常事務。有趣的部分是商業自動化,你將本地模型連接到 n8n,這個開源工具可以將它連接到 Telegram、電子郵件、日曆、CRM 和數百種服務。以下每一個流程,都在你的建築物內運行,沒有任何資訊外洩,也沒有每次 token 的費用:

text
1AI 接待員:
2客戶在 Telegram 發訊息 -> n8n 接收 -> 本地模型解讀意圖
3-> 日曆檢查空檔 -> 預約確認
4
5文件分析:
6丟入 50 個 PDF -> 本地模型全部讀取 -> 提取關鍵事實
7-> 撰寫結構化報告
8
9每日簡報:
10早上 7 點觸發 -> 模型讀取你的筆記和任務 -> 摘要重要事項
11-> 發送到你的手機
12
13潛在客戶資料補充:
14試算表中新增一行 -> 模型研究該公司 -> 草擬客製化開場白
15-> 排入佇列供你審閱
16
17內容再利用:
18一段長錄音 -> 模型轉錄並剪輯 -> 撰寫貼文
19-> 儲存草稿供你批准
20
21收件匣分類:
22新郵件 -> 模型分類、貼標籤並草擬回覆 -> 你按下發送或編輯

對於注重隱私的工作,這不再是一個成本決策,而是唯一的選擇。法律文件、醫療記錄、財務資料、任何受 NDA 約束的資料,都不應該出現在第三方 API 上。本地 AI 在你的機器上處理這些資料,資料永遠不會離開。

實際上會出什麼問題

那 20% 是真實存在的。前沿模型在困難推理、尖端程式碼撰寫,以及需要單一最佳答案的研究方面仍然勝出。本地 AI 是其他 80% 工作的可靠、私密、永遠在線的主力,而不是所有事情的替代品。保留一個雲端訂閱來處理那困難的 20%,其餘的在家裡運行,這樣你就能兩者兼得。

記憶體是天花板,而不是 TOPS。根據你想運行的模型大小來購買,並記住,統一記憶體盒子的擴展性,遠超過規格相當但使用獨立 VRAM 的 PC。

GPU 不是一台電腦。第 5、6、8 階(3090、7900 XTX 和 5090)都需要一台主機機器來搭配。卡的價格不是系統的價格,所以在與一台完整的迷你 PC 比較之前,要加上 400 到 600 美元。

價格正在上漲。DRAM 短缺已經讓 DGX Spark 漲價 18%,並迫使 Apple 取消其 512GB 的 Mac Studio。今天的好交易,下個季度可能更貴。

AMD 省錢但費時。Strix Halo 和 7900 XTX 給了你每美元最多的記憶體,但 ROCm 在開箱即用的工具支援方面仍然落後於 CUDA。今天對 Ollama 來說沒問題,但對於重度訓練則需要更多耐心。

散熱、噪音和量化是細則。大型 GPU 組裝機又吵又熱。激進的量化可以節省記憶體,但如果用力過猛,就會侵蝕品質。這些都不是致命問題,但在銷售宣傳中沒有人會提到它們。

現在要做兩件事

先免費試用。在你已有的電腦上安裝 Ollama,並在這個週末運行一個 7B 模型。任何 8GB 的機器都可以。在你花任何錢在硬體上之前,先驗證工作流程。

然後,購買比你實際需求高一階的產品,而不是五階。那些在 2025 年悄悄建立本地 AI 的人,到了 2027 年,當雲端價格持續攀升、本地硬體持續進步時,他們將會遠遠領先。大多數人會因為習慣而繼續每月支付 200 美元。少數人會在本週花一個下午來設定,從此不再傳送任何一個位元組到別人的伺服器。

我定期像這樣分析 AI 工具以及它們所創造的商機。追蹤我以獲取下一篇文章,並加入我的 Telegram:https://t.me/+lzSPoQ0svRU1ZWZi

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章