作者: Jakub Rusinowski · 最后更新: 2026年7月12日
本地 LLM 的最佳 Mac,就是你预算内统一内存最大的那一台:16GB 能跑 8B 模型,48GB 从容应对 32B,而 70B 级别的模型需要 64GB 以上。本指南将每个内存档位对应到真正跑得好的模型,解释为何是内存带宽(而非 CPU 速度)决定了你的 token/秒,并给出从 599 到 4000 美元的具体购买建议。
本地 LLM 的最佳 Mac,就是你预算内统一内存最大的那一台:16GB 能跑 8B 模型,48GB 从容应对 32B,而 70B 级别的模型需要 64GB 以上。本指南将每个内存档位对应到真正跑得好的模型,解释为何是内存带宽(而非 CPU 速度)决定了你的 token/秒,并给出从 599 到 4000 美元的具体购买建议。
最后更新:2026 年 7 月
在 PC 上,你的模型必须装进 GPU 显存——而消费级显卡除非花上数千美元,否则上限只有 24–32GB。苹果芯片使用统一内存:GPU 共享整个系统内存池。一台配 48GB 的 2000 美元 MacBook Pro,能加载在 PC 端需要 5000 美元以上多 GPU 平台才能跑的模型。
购买本地 AI 用的 Mac 时,两个数字决定一切:
1. 多少内存——决定你到底能加载*哪些*模型。 2. 内存带宽(GB/s)——决定它们生成*多快*。LLM 推理每生成一个 token 都要从内存读取整个模型,因此 token/秒几乎与带宽成线性关系。
CPU 核心数和神经引擎规格对 LLM 推理几乎无关紧要——别为它们花钱。
macOS 会为系统保留一部分统一内存;默认情况下 GPU 大约可使用总内存的 65–75%。一台"16GB 的 Mac"实际上只有约 11GB 的模型预算,"48GB 的 Mac"约为 34GB。下表已计入这一点。
| 内存 | 可用于模型 | 跑得好的(Q4_K_M) | 结论 |
|---|---|---|---|
| 16GB | ~11 GB | 7–8B 流畅;12–14B 是上限 | 入门级——聊天和邮件够用 |
| 24GB | ~17 GB | 14B 从容;Gemma 3 27B 刚好装下 | 最佳预算甜点 |
| 32GB | ~22 GB | 27B 级别,还有上下文余量 | 舒适的日常主力 |
| 36GB | ~25 GB | 32B(Qwen、DeepSeek R1 蒸馏版) | 扎实的开发机 |
| 48GB | ~34 GB | 32B 配大上下文;70B Q3(慢) | 发烧友甜点 |
| 64GB | ~45 GB | Llama 3.3 70B Q4 以可用速度运行 | 认真的本地 AI |
| 128GB | ~90 GB | 70B Q8、MoE 巨型模型(量化版)、同时多个模型 | 工作站级 |
两条实用说明:是量化让这些模型装得下(见量化详解),而长上下文会在权重之外额外吃掉数 GB——如果你做 RAG 或长文档,请按高于模型体量一档来买。你可以在硬件分析器中对任意具体模型和任意 Mac 做一次核对。
在同一代芯片内,档位(基础/Pro/Max)远比代际本身更重要:
| 芯片 | 内存带宽 | 现实中的 8B Q4 速度 |
|---|---|---|
| M4(基础) | 120 GB/s | ~20–25 t/s |
| M3 Pro | 150 GB/s | ~25–28 t/s |
| M2 Pro | 200 GB/s | ~30–35 t/s |
| M4 Pro | 273 GB/s | ~45–55 t/s |
| M2 Max / M3 Max(40 核) | 400 GB/s | ~60–70 t/s |
| M4 Max(40 核) | 546 GB/s | ~80–95 t/s |
| M2 Ultra | 800 GB/s | ~110–130 t/s |
注意苹果产品线里的陷阱:M3 Pro(150 GB/s)跑 LLM 比更老的 M2 Pro(200 GB/s)还慢——苹果那一代削减了内存总线。而基础 M4 的 120 GB/s 意味着满配的基础芯片永远不是好的 LLM 选择:对本地 AI 而言,二手 M2 Max 每次都胜过全新基础 M4。
那些估算背后的公式是:token/秒 ≈ 带宽 × ~0.7 ÷ 模型大小(GB)。一个 4.9GB 的 8B Q4 模型在 M4 Pro 上:273 × 0.7 ÷ 4.9 ≈ 39 t/s(保守值),配合 MLX 或 llama.cpp Metal 等优化运行时,实测为 45–55。
16GB 基础版 Mini 也能用,但 24GB 配置是当今本地 AI 中性价比最高的单一选择:它开启了 14–27B 这一档,模型自此不再像玩具。除非预算实在紧张,否则跳过 16GB。
{{affiliate-box:mac-mini-m4}}
M4 Pro 的 273 GB/s 是基础芯片带宽的两倍,48GB 则解锁了配全上下文的 32B 模型。这是推荐给想要一台认真、常开的本地 AI 主机的开发者的配置——搭配我们的个人 AI 家庭服务器指南,它还能为你的手机和笔记本提供服务。如果你需要笔记本,32GB 的 MacBook Pro M4 是 14–27B 这一档的便携等价物。
{{affiliate-box:macbook-pro-m4}}
546 GB/s 带宽和 64GB 以上内存,让 Llama 3.3 70B Q4 达到真正可用的速度(~12–18 t/s),而 128GB 则能以 Q8 运行它,或同时托管数个模型。对于固定放在桌面的机器,Mac Studio M4 Max 用更少的钱提供了与 MacBook Pro 相同的芯片。
{{affiliate-box:mac-studio-m4-max}}
一台二手 M1 Max Mac Studio 64GB(400 GB/s)常以 1100–1400 美元售出,能跑 70B Q4——这是你能买到的最便宜的正经 70B 机器。苹果芯片没有被矿机滥用的历史,统一内存也不会像 GPU 的风扇和导热垫那样老化,这使得二手 Mac 的风险远低于二手 GPU(可对比我们的二手 GPU 指南)。
一台配 RTX 4090(24GB,~1000 GB/s)的 PC,*对能装进 24GB 的模型而言*,生成速度比任何 Mac 快 2–3 倍。Mac 的优势恰恰从显存耗尽之处开始:到了 32B 以上的模型,PC 需要第二块 GPU(见多 GPU 推理),而 Mac 只需要它本就拥有的内存——安静地,在 40–65W 下完成。每美元速度:PC。每美元和每瓦特的模型体量:Mac。完整对比见 GPU 选购指南。
16GB 是可用的最低门槛(8B 模型),24–32GB 是性价比甜点(14–27B),48GB 覆盖 32B 这一档,而 64GB 以上是 70B 模型变得实用的地方。请按你打算运行的最大模型高一档来买,让上下文和多任务有余地。
它能以可接受的速度运行 7–8B 模型(~20–25 t/s),涵盖聊天和写作。但它 120 GB/s 的带宽让更大的模型无论多少内存都显得慢,所以永远不要为了"搞 AI"而买一颗配大内存的基础芯片——升级到 Pro。
能——一台 64GB 的 M4 Max 以大约 12–18 token/秒运行 Llama 3.3 70B Q4,这是舒适的阅读速度。在 48GB 上它技术上能以 Q3 装下,但几乎不留上下文余地;64GB 才是做 70B 工作的诚实最低配。
驱动 LLM 速度的是带宽,而非代际——而高带宽 M 系列 Mac(M2 Max、M1 Max)的二手/翻新价格已经非常优秀。如果一个当前配置符合你的模型档位和预算,等待很少划算。