两年前,“在本地运行 LLM”还是一个以失望告终的周末实验。你下载一个 13B 模型,听着笔记本风扇咆哮,每秒只能得到一个 token 的平庸输出。
今天,2026 年 6 月,这个话题已经结束了。一块 Raspberry Pi 5 就能运行一个连贯的聊天机器人。一台 MacBook Air 在大多数任务上可以媲美 GPT-3.5 的质量。一张二手的 RTX 3090 花 700 美元就能给你接近 GPT-4 的水平。
硬件跟上了。模型变小了。工具链成熟了。
所以现在的问题不是 能不能 运行本地 LLM,而是 用哪个工具 来运行它。至少有十二个正经的选择,各有重叠的优势,令人困惑的名称,以及截然不同的理念。
本指南将帮你理清这一切。
为什么要在本地运行 LLM?
在进入工具之前,先说说本地的真实理由:
- 隐私。 你的提示和数据永远不会离开你的机器。对于律师、医生、金融分析师以及任何处理敏感信息的人来说,这不是可选项。
- 成本。 如果你大量使用 AI,本地模型几个月就能回本。没有按 token 计费,没有速率限制。
- 离线。 飞机、地下室、安全设施、网络差的地区——本地 LLM 在云端无法工作的地方也能运行。
- 无审查。 开源权重模型不会因为过度谨慎的 RLHF 而拒绝良性任务。
- 学习。 如果你想真正理解这些系统是如何工作的,自己运行它们是最快的路径。
反对的真实理由:
- 质量上限。 截至 2026 年 6 月,即使是最好的本地模型在最难的推理任务上也落后于 GPT-5.1 和 Claude Opus 4.8。你是在用隐私和成本换取顶尖智能。
- 硬件限制。 你受限于你所拥有的设备。笔记本上的 7B 模型永远无法与数据中心里的 405B 模型匹敌。
- 设置成本。 即使是最简单的工具也有一次性的学习曲线。
对于 80% 的日常任务——起草、总结、编码辅助、研究——本地模型现在已经真正足够好了。对于最难的 20%,你仍然可以保留一个云订阅。
整体格局
在比较工具之前,先了解层次结构。大多数本地 LLM 工具都构建在 一个引擎 llama.cpp 之上。它是使一切成为可能的 C/C++ 推理引擎。Ollama、LM Studio、GPT4All、Jan 等许多工具底层都使用 llama.cpp(或其分支)。
工具之间的差异不在于原始推理速度,而在于包装层:用户体验、API、模型管理、平台支持、理念。
工具大致分为四类:
类别 | 它们是什么 | 示例 |
|---|---|---|
推理引擎 | 加载和执行模型的原始运行时 | llama.cpp, MLX, vLLM |
命令行运行器 | 引擎 + 模型管理 + API,以终端为主 | Ollama |
桌面应用 | 用于浏览、下载和与模型聊天的 GUI | LM Studio, Jan, GPT4All |
生产服务器 | 高吞吐量推理,支持多个并发用户 | vLLM, LocalAI, SGLang |
根据你想要做的事情选择你的层次。
按用例排名的 8 个重要工具
1. Ollama——大多数人的默认起点
它是什么: 一个以 CLI 为主的本地 LLM 运行器,带有内置 REST API。安装,运行一个命令,你就在 localhost 上有了一个兼容 OpenAI 的端点。
为什么它占主导地位: 每个主要的 LLM 工具链——LangChain、LlamaIndex、Aider、Continue、Cursor、Zed、Open WebUI——都有对 Ollama 的一流支持,或者通过 OpenAI 兼容层开箱即用。如果你在自动化任何事情,Ollama 是阻力最小的路径。
硬件: 支持 Mac(Metal)、Windows(CUDA/Vulkan)、Linux(CUDA/ROCm),甚至 Raspberry Pi。在支持的情况下自动启用 GPU 加速。
优点:
- 最简单的设置:
ollama pull llama3.2然后就可以运行了 - 无头模式开箱即用,可在服务器和 Docker 上运行
- 巨大的生态系统支持——几乎所有 IDE 和 AI 工具都集成了它
- MIT 许可证,无遥测
缺点:
- 没有 GUI。默认只有终端(Web UI 作为独立项目存在)
- 默认的 Vulkan 支持尚未完善——在 Windows 上的 AMD 需要自定义编译
- 如果你收集模型,磁盘使用量可能会膨胀(自身占用约 4.6 GB,外加模型)
最适合: 开发者、在本地 LLM 之上构建应用的任何人、服务器部署、自动化工作流。
如果不是: 你想要一个精致的 GUI 体验用于随意聊天。
2. LM Studio——精致的桌面体验
它是什么: 一个完整的桌面应用,用于发现、下载和运行模型。漂亮的界面,实时 token 流可视化,内置聊天 UI,可切换的 OpenAI 兼容服务器。
为什么人们喜欢它: 它是从“我听说过本地 LLM”到“我正在和它聊天”的最简单路径。应用内的 Hugging Face 浏览器让你可以按文件大小和量化进行筛选,查看模型卡,并带有进度条下载。
硬件: Mac(在 Apple Silicon 上具有原生 MLX 加速——一个真正的优势)、Windows、Linux。开箱即用支持 Vulkan,这对 AMD 用户很重要。
优点:
- 一流的 GUI,用于模型发现和聊天
- 在 Apple Silicon 上原生 MLX 支持,给 Mac 带来真正的性能优势
- 内置 API 服务器(兼容 OpenAI),当你想要编写代码与之交互时
- 最新版本(0.3.5+)增加了无头“本地 LLM 服务”模式和 JIT 模型加载
- 0.4.0 版本增加了 MCP 支持——将 Claude 风格的工具连接到你的本地模型
缺点:
- 闭源。默认开启匿名分析(可在设置中关闭)
- 比 CLI 工具占用更多磁盘和 RAM(Electron 应用)
- 服务器模式需要选择加入,并且需要应用运行——不适合真正的无头服务器部署
- CLI(lms)功能可用但不如 Ollama 的丰富
最适合: 想要视觉化探索本地 LLM 的人、Mac 用户(MLX 是关键特性)、在系统提示上迭代的提示工程师。
如果不是: 你需要在无头服务器上部署,或者开源是硬性要求。
3. llama.cpp——其他所有人使用的引擎
它是什么: 为大多数本地 LLM 生态系统提供动力的 C/C++ 推理库。最初是为了在消费级 CPU 上运行 LLaMA 模型而创建,现在已成为行业标准。
为什么它重要: 直接运行 llama.cpp 避免了包装层的开销。它是最精简的选择——最近的对比显示它在 Windows 上不到 90 MB,而 Ollama 加上所有捆绑依赖约 4.6 GB。
硬件: 在 所有 平台上运行:x86、ARM、Apple Silicon、NVIDIA CUDA、AMD ROCm、Intel oneAPI、Vulkan、OpenCL。包括 Raspberry Pi、Android 手机(通过 Termux)和旧笔记本。
优点:
- 占用空间小,零不必要的依赖
- 最大性能和自定义能力
- Vulkan 后端跨 GPU 供应商工作——Windows 上 AMD 的最佳路径
- 包含 CLI(llama-cli)、服务器(llama-server)和基本 Web UI
- 最宽松的许可证
缺点:
- 学习曲线较陡——各种标志、量化格式、构建选项
- 没有友好的模型注册表——你需要自己查找和下载 GGUF 文件(通常从 Hugging Face)
- 没有“开箱即用的魔力”——你需要配置一切
最适合: 高级用户、Windows 上的 AMD 用户、部署到嵌入式或非标准硬件的人、想要最小开销的开发者。
如果不是: 你想要一个快速聊天的路径,不喜欢阅读文档。
4. GPT4All——低端硬件专家
它是什么: 来自 Nomic AI 的桌面应用,专门针对没有 GPU 加速的机器进行了优化。
为什么存在: 大多数本地 LLM 工具假设你至少有一个不错的 GPU。GPT4All 反其道而行之——它专为旧笔记本、工作配发机器以及任何没有 CUDA 的计算机设计。
硬件: 在 CPU 上运行,无需 GPU 加速,并针对 8 GB RAM 或更少的机器进行了优化。硬件要求:最低 4 GB RAM,推荐 8 GB。任何过去 5 年的 CPU。
优点:
- 本指南中所有工具中硬件门槛最低
- 精美的 GUI,非技术用户容易上手
- 强大的隐私保护(仅可选遥测)
- 跨平台(Mac、Windows、Linux)
缺点:
- 模型库比 Ollama 或 LM Studio 小
- API 不如竞争对手成熟
- 性能上限低——如果你升级硬件,会很快超出它
最适合: 使用旧硬件的用户、没有管理员权限安装驱动的工作配发机器、学校、在预算受限情况下需要可用本地 AI 的组织。
如果不是: 你有一块现代 GPU——你在浪费性能。
5. Jan AI——开源 ChatGPT 替代品
它是什么: 一个桌面应用,旨在成为完全本地、完全开源的 ChatGPT 替代品。干净的 UI,多模型支持,如果你想要混合使用,还有可选的云集成。
为什么它脱颖而出: 它是最明确以隐私优先的选项。Jan AI 和 Ollama 不收集任何遥测数据(MIT 开源)。专为那些想要保证(而不仅仅是声称)没有任何东西离开他们机器的用户而构建。
硬件: Mac、Windows、Linux。比 LM Studio 轻,但比 GPT4All 重。
优点:
- 完全开源,完全可审计
- 默认零遥测
- 简洁的聊天应用感觉——最接近“本地版 ChatGPT”
- 支持模型提供商(本地 + 可选云),如果你想要混合使用
- 内置 API 服务器
缺点:
- 生态系统比 Ollama 或 LM Studio 小
- 一些高级功能(MCP、高级代理流程)落后于领先者
- 模型库不如 LM Studio 的 Hugging Face 浏览器全面
最适合: 注重隐私的用户、在 GDPR 下工作的欧盟专业人士、任何想要类似 ChatGPT 体验且具有严格可审计性的人。
如果不是: 你今天就需要 MCP 集成等尖端功能,或者想要最大可能的模型选择。
6. vLLM——生产吞吐量之王
它是什么: 一个高性能推理服务器,专为从一个 GPU 盒子服务许多并发用户而设计。由加州大学伯克利分校创建,现在已成为自托管生产 LLM API 的事实标准。
为什么它重要: 大多数本地工具针对单用户延迟进行了优化。vLLM 针对吞吐量进行了优化。其 PagedAttention 技术将内存碎片减少了 50% 以上,并且在相同硬件上比替代方案提供 2-4 倍的并发请求。
硬件: 主要是 Linux + NVIDIA。对于严肃部署来说,A100/H100 领域,尽管它也可以在消费级 GPU 上用于开发。
优点:
- 在相同 GPU 上比简单服务高出 2-4 倍的吞吐量
- 兼容 Kubernetes,内置指标,兼容 OpenAI 的 API
- 跨多个 GPU 的张量并行
- 支持多模态模型(LLaVA、Qwen-VL)
- 如果你正在向用户提供 LLM 服务,这是正确的选择
缺点:
- 仅限 Linux + NVIDIA。如果你使用 Mac 或 Windows,这不适合你
- 设置较重,以配置为导向
- 对于单用户工作流来说杀鸡用牛刀
最适合: 自托管 LLM API 的公司、向多个用户提供本地 AI 的任何人、基础设施团队。
如果不是: 你是笔记本上的单个用户。使用 Ollama 代替。
7. LocalAI——通用 API 中心
它是什么: 一个兼容 OpenAI 的编排层,可以将请求路由到多个推理后端,处理文本/图像/音频/视频模型,并作为你的应用和实际使用的推理引擎之间的中间件。
为什么它有用: 如果你想要一个统一 API 表面来抽象你正在运行的任何后端(今天用 llama.cpp,明天用 vLLM,明年用 MLX 服务器),LocalAI 就是那个包装层。
硬件: Linux 优先,适合 Docker。
优点:
- 无论后端如何,单一的兼容 OpenAI 端点
- 多模态(文本、图像生成、音频、嵌入、重排序、视频)
- 在现有应用中可以替代 OpenAI 的 API
- 在企业中间件场景中表现强劲
缺点:
- 对于单用户设置,比 Ollama 复杂得多
- 文档可能比较稀疏
- 社区比 Ollama 或 LM Studio 小
最适合: 企业部署、构建需要跨变化后端稳定本地 API 产品的团队、任何在本地提供多模态 AI 服务的人。
如果不是: 你只是想要和模型聊天。
8. MLX(Apple Silicon 原生)——Mac 高级用户的选择
它是什么: Apple 的机器学习框架,针对 Apple Silicon 的统一内存架构进行了优化。LM Studio 原生使用它;你也可以通过 Python 直接使用。
为什么 Mac 悄然领先: 统一内存意味着一台配备 128 GB 内存的 MacBook Pro M4 Max 可以运行 70B 参数模型,而在 PC 上这需要一张 5000 美元的专用 GPU。2026 年最好的本地 LLM 体验在 Apple Silicon 上,句号。统一内存意味着在 PC 上需要专用 GPU 的模型可以在 Mac 上使用共享 RAM+GPU 内存运行。
硬件: 仅限 Apple Silicon(M1 及以后)。
优点:
- 在 Mac 硬件上每美元性能最佳
- 原生平台支持——没有笨拙的转换层
- MLX + LM Studio 的组合给 Mac 用户带来真正优势
- 统一内存架构使得大型模型无需企业级 GPU 即可访问
缺点:
- 仅限 Mac
- 生态系统比 llama.cpp 小
- 需要 LM Studio 或一定的 Python 熟练度才能使用
最适合: 任何在 Mac 上认真对待本地 LLM 的人。
如果不是: 你不是在用 Apple Silicon。
硬件与工具匹配
这里大多数文章回避的实际问题是:根据我拥有的硬件,我到底应该安装什么?
如果你有 Raspberry Pi 5(8GB 或 16GB)
使用: Ollama(Raspberry Pi OS 原生支持它)
尝试的模型: TinyLlama 1.1B、Phi-3 Mini 3.8B、Gemma 3 1B
实际预期: 每秒 2-8 个 token,取决于模型大小。可用于聊天机器人、家庭自动化、简单问答。不适合严肃编码或长推理。
如果你有一台旧笔记本(Intel i5,无 GPU,8GB RAM)
使用: GPT4All
尝试的模型: Phi-3 Mini、Llama 3.2 1B、TinyLlama
实际预期: 慢但可用。更适合短查询而非长生成。
如果你有一台现代笔记本,带集成显卡(16GB RAM,无独立 GPU)
使用: LM Studio(CPU 模式)或 Ollama
尝试的模型: Llama 3.2 3B、Gemma 3 4B、Qwen 3 7B(需耐心)
实际预期: 适合聊天、起草、总结。小模型上每秒 5-15 个 token。
如果你有 MacBook Air M2/M3/M4
使用: LM Studio 配 MLX 后端
尝试的模型: Llama 3.2 8B、Qwen 3 14B、Mistral Nemo
实际预期: 出奇地快——Apple Silicon 的统一内存和 Neural Engine 超常发挥。中规模模型上每秒 20-40 个 token。
如果你有 MacBook Pro M3/M4 Max(36GB+ 内存)
使用: LM Studio + MLX,或 Ollama
尝试的模型: Llama 3.3 70B(需 64GB+)、Qwen 3 32B、DeepSeek-V3 蒸馏版
实际预期: 真正可用于严肃工作。Mac Studio M4 Max(128 GB 统一内存):在保持其他应用打开的同时,以约 20 t/s 运行 Llama 3.3 70B。
如果你有带 NVIDIA GPU 的 Windows/Linux 桌面(RTX 3060–4070)
使用: Ollama(最简单)或 llama.cpp(性能最高)
尝试的模型: Llama 3.2 8B、Qwen 3 14B、Mistral 7B
实际预期: 推理速度快,适合 VRAM 的量化模型上每秒 30-80 个 token。
如果你在 Windows 上使用 AMD GPU
使用: llama.cpp 配 Vulkan 后端(最可靠)或 LM Studio(开箱即用 Vulkan)
原因: Windows 上 AMD 的 ROCm 支持基本上不存在。Vulkan 是救命稻草。
实际预期: 性能远落后于 NVIDIA,但远好于纯 CPU。
如果你有一台严肃的工作站(RTX 4090、RTX 5090、多 GPU)
使用: vLLM 用于服务,Ollama 或 llama.cpp 用于个人使用
尝试的模型: Llama 3.3 70B、Qwen 3 72B、DeepSeek-V3
实际预期: 大多数任务接近云质量。这是本地 AI 不再是一种妥协的地方。
如果你在为一个团队运行生产环境(多用户)
使用: vLLM 或 LocalAI
硬件: A100/H100 理想,小型团队最低 RTX 4090
实际预期: 单个 A100 上根据模型大小可服务 10-50 个并发用户。
快速对比矩阵

诚实总结——到底应该安装哪个
如果你希望我直接给出结论:
对大多数人:同时安装 Ollama 和 LM Studio。 用 LM Studio 的 GUI 发现和测试模型。用 Ollama 作为你的脚本、IDE 和应用连接的实际运行时。两者互补,不是竞争关系。在你的笔记本上用 LM Studio 进行发现和提示迭代,在服务器上——或者在你的工作站上用 Docker——运行 Ollama 用于一切与自动化相关的任务。
对于旧硬件: GPT4All。其他选项都不合理。
对于 Raspberry Pi 或边缘设备: Ollama。配备 16GB 内存和良好量化 3B 模型的 Pi 5 真正可用。
对于 AMD GPU 用户: llama.cpp 配 Vulkan,或者如果想要 GUI 则用 LM Studio。暂时跳过 Windows 上的 Ollama。
对于 Apple Silicon Mac 用户: LM Studio 配 MLX。MLX 后端是关键特性,只有 LM Studio 能干净地呈现它。
对于隐私至上者: Jan AI。完全开源,零遥测,符合 GDPR。
用于服务多用户: Linux 上带 NVIDIA 的 vLLM。吞吐量上无与伦比。
用于深度定制或嵌入式部署: 直接使用 llama.cpp。学习曲线值得。
未来趋势
2026 年下半年值得关注的三个趋势:
- MCP 成为标准。 模型上下文协议(MCP)——用于将工具连接到 LLM 的标准——已经在 LM Studio 中。Ollama 也将跟进。到第四季度,每个严肃的本地工具都将原生支持它,使本地模型在代理工作流中可以直接替代 Claude。
- 移动端兴起。 Apple 的设备端模型、通过 Termux 在 Android 上运行的 llama.cpp,以及量化改进,意味着严肃的本地推理将进入手机。不仅仅是“总结这封邮件”——而是实际的代理工作流。
- 与云端的差距缩小但未消失。 像 Llama 4 和 Qwen 4 这样的开放权重模型将继续缩小质量差距。但绝对前沿(Claude Opus 4.7、GPT-5.1、Gemini 3)在可预见的未来仍将仅限于云端,因为规模优势是结构性的。
核心结论
本地 LLM 不再是一个科学研究项目。它们是一个真实、实用的选项,补充而不是取代云 AI。对于隐私敏感的工作、离线场景、大量日常使用以及学习,本地是正确的答案。对于绝对最难的推理任务,云端仍然胜出。
好消息是,工具终于成熟到了你不需要博士学位就能设置的程度。从上面的列表中选择与你的硬件和用例匹配的工具。今晚就安装它。到周末,你将拥有一个在你自己的机器上运行的私人 AI 助手。
这是没有人告诉你的部分:在 2026 年,问题不是 你是否能 在本地运行一个有用的 LLM,而是 你应该把哪个工作流 交给它。
如果这篇文章有用——请关注我的 Telegram 频道:
【[https://t.me/+ygATQAt9sUM1N2U6https://t.me/+ygATQAt9sUM1N2U6)](https://t.me/+ygATQAt9sUM1N2U6**](https://t.me/+ygATQAt9sUM1N2U6))





