如何使用硬件分析器
GPU 与显存兼容性检测器是一个免费的、基于浏览器的工具,能准确告诉你的电脑可以运行哪些本地 LLM。选择你的 GPU 或使用自动检测,输入显存和系统内存,它会立即列出每个兼容模型,并显示显存占用、每秒 token 数估算、电费估算,以及一键 Ollama 安装命令——无需注册,数据不会离开你的设备。
使用方法
- 选择你的 GPU——从下拉菜单中选择,或点击自动检测以从浏览器读取你的硬件。
- 设置显存和系统内存——Apple Silicon 用户请输入统一内存总量。
- 选择你的用途——每日使用时长和工作负载会调整速度与电费估算。
- 查看匹配结果——模型会被分为流畅运行、可运行和无法容纳三类,每个都附带可复制粘贴的 Ollama 命令。
显存速查指南
| 4 GB VRAM | Llama 3.2 3B, Phi-3.5 Mini, Gemma 3 4B (Q4), SmolLM2 |
| 6–8 GB VRAM | Llama 3.1 8B, DeepSeek R1 8B, Qwen 3 8B, Phi-4 Mini |
| 12–16 GB VRAM | Llama 4 Scout (Q4), Qwen 3 14B, Mistral NeMo 12B |
| 24 GB VRAM | Llama 3.3 70B (Q4), DeepSeek R1 32B, Mistral Small 3.1 |
常见问题
运行本地 LLM 需要什么硬件?
最低配置需要一块拥有 4–6 GB 显存的 GPU,或一台拥有 8 GB 以上统一内存的 Apple Silicon Mac,即可流畅运行 3B–8B 的小模型。中等规模的 13B–34B 模型需要 16–24 GB 显存,而 70B 模型在独立 GPU 上大约需要 24 GB 以上(或 Mac 上 48–64 GB 统一内存)。你还需要足够的系统内存——最低 16 GB,推荐 32 GB——因为操作系统和从 GPU 卸载的层都存放在这里。上方的检测器会将你的 GPU 和内存与 75+ 模型逐一匹配,让你无需猜测。
7B、13B 或 70B 模型需要多少显存?
以 Q4_K_M 量化为经验法则,7B 模型约需 5–6 GB 显存,13B 模型约需 9–10 GB,70B 模型约需 40–48 GB。升到 Q8 大约会使这些数字翻倍,而完整的 FP16 大约会翻两番(70B 在 FP16 下需要约 140 GB 和多块 GPU)。此外还要预留 1–2 GB 用于上下文/KV 缓存,若使用长上下文窗口则需更多。在 Apple Silicon 上,模型使用统一内存而非独立显存,因此一台 64 GB 的 Mac 可以在 Q4 下运行 70B 模型。
量化模型与全精度模型有什么区别?
全精度模型将每个权重保存为 16 位浮点数(FP16/BF16)——这是它们训练时的格式,质量最高。量化模型将这些权重压缩为 8 位、4 位或更低,将显存占用减少 2–4 倍,而质量下降通常很小且难以察觉。例如,一个 7B 模型会从 FP16 下的约 14 GB 缩小到 Q4_K_M 下的约 4.5 GB。除非你在做微调或研究评测,否则 4 位或 5 位量化都是本地推理的正确选择。
LLM 的最佳温度设置是多少?
温度控制随机性:数值越低,输出越聚焦、越可复现;数值越高,输出越多样、越有创意。事实性问答、编程和数据提取使用 0.0–0.3;一般聊天和助手使用 0.6–0.8;头脑风暴或创意写作使用 0.9–1.2。大多数工具默认约为 0.7–0.8,这是一个合理的起点。如果你想要更多样性,通常调整 top_p(核采样)比把温度调得很高更好。
运行本地 LLM 是免费的吗?
软件是免费且开源的——Ollama、LM Studio、llama.cpp 以及开放权重模型本身,下载和运行都不收费。你唯一真正的成本是硬件(一块 GPU 或一台够强的 Mac)以及为其供电的电费,通常每 1,000 个 token 只需不到一美分。与云端 API 不同,这里没有按 token 计费、没有速率限制,你的数据也永远不会离开你的机器。对于每天稳定使用的人来说,本地方案通常几个月内就能回本——本站的成本计算器可以估算你的确切回本时间。
如何在 Ollama、LM Studio 和 llama.cpp 之间选择?
llama.cpp 是大多数本地工具所基于的底层推理引擎——如果你想要最大的控制力、脚本能力以及最新的命令行功能,就选它。Ollama 将 llama.cpp 封装成简单的命令行工具,外加一个带有 OpenAI 兼容 API 的后台服务,是希望从代码中调用模型的开发者的最简单选择。LM Studio 是一款精致的桌面图形界面应用,带有模型浏览器和聊天界面,非常适合初学者或喜欢点击胜过打字的人。三者都免费、运行相同的 GGUF 模型文件,并且可以在同一台机器上共存。
没有 GPU(仅用 CPU)能运行本地 LLM 吗?
可以——Ollama 和 llama.cpp 都支持仅 CPU 推理,对小模型效果不错。在现代多核 CPU 上,速度大约为每秒 1–8 个 token,而独立 GPU 则为 30–100+,因此它适合短提示,但生成长文本会较慢。由于整个模型加载到系统内存而非显存中,7B 模型请预留至少 16 GB 内存,13B 模型请预留 32 GB。为获得最佳的纯 CPU 体验,请坚持使用 Q4 量化的 3B–8B 模型。
应该选择哪种量化——Q4、Q8 还是 FP16?
Q4_K_M 是最佳的全能默认选择:它将显存占用比 FP16 减少约 4 倍,而质量损失在日常使用中难以察觉。如果你有富余的显存并想要更高一点的准确度,可升到 Q5_K_M 或 Q6_K;若追求近乎无损的输出,可选 Q8_0,其体积约为 Q4 的两倍。将完整的 FP16/BF16 留给微调、评测或对每一位精度都很看重的研究。低于 Q4(Q3、Q2)时文件会继续缩小,但模型开始明显出更多错误,因此只有在模型否则装不下时才使用。