按显存档位划分的最佳本地 LLM(2026):4GB / 8GB / 16GB / 24GB+ 指南

作者: Jakub Rusinowski · 最后更新: 2026年7月21日

不确定该跑哪个模型?本指南帮你拨开迷雾。我们为每个显存档位只推荐单一最佳模型——大多数用户应该从它开始的那一个。

本指南内容

不确定该跑哪个模型?本指南帮你拨开迷雾。我们为每个显存档位只推荐单一最佳模型——大多数用户应该从它开始的那一个。

4 GB 显存(入门 GPU / 核显)

最佳选择:Phi-4 Mini(3.8B,Q4_K_M)

亚军: Gemma 3 4B(ollama run gemma3:4b)——更擅长创意写作,3.5 GB。

预期表现: 胜任日常聊天、编程帮助和写作的助手。别指望 70B 级别的推理,但对 4 GB 而言,这已经了不起。

8 GB 显存(RTX 4060、RX 7600、笔记本 GPU)

最佳选择:Llama 3.1 8B(Q4_K_M)

编程亚军: Qwen 2.5 Coder 7B(ollama run qwen2.5-coder:7b)——最佳纯编程 8B 模型。

推理亚军: DeepSeek R1 8B Distill(ollama run deepseek-r1:8b)——在 8B 中达到近 GPT-4 级别的推理。

12 GB 显存(RTX 4070、RTX 3060 12GB、RX 7700 XT)

最佳选择:Qwen 3 8B(Q8_0)——既然有余量,就以更高质量运行

或试试: Gemma 3 12B Q4(ollama run gemma3:12b)——谷歌最好的中等体量模型。

16 GB 显存(RTX 4060 Ti 16GB、RTX 4070 Ti、RX 7800 XT)

最佳选择:Qwen 3 14B(Q4_K_M)

编程亚军: Qwen 2.5 Coder 14B(ollama run qwen2.5-coder:14b

长文档最佳: Mistral Small 3.1(ollama run mistral-small)——128K 上下文窗口。

24 GB 显存(RTX 4090、RTX 3090、RX 7900 XTX)

最佳选择:DeepSeek R1 32B(Q4_K_M)

替代方案: Qwen 3 32B(ollama run qwen3:32b)——同样装得下,通用任务更强。

32 GB+ 显存(RTX 5090、Apple M4 Max、专业 GPU)

最佳选择:Llama 4 Scout(Q4_K_M)

对于 70B 模型: Llama 3.3 70B Q4_K_M 需要 42 GB——可在 Apple M2/M4 Ultra(128–192 GB 统一内存)或双 RTX 4090/5090 配置上运行。

快速参考表

显存最佳模型Ollama 命令速度
4 GBPhi-4 Miniollama run phi4-mini~40 t/s
8 GBLlama 3.1 8Bollama run llama3.1:8b~70 t/s
12 GBQwen 3 8B Q8ollama run qwen3:8b~80 t/s
16 GBQwen 3 14Bollama run qwen3:14b~85 t/s
24 GBDeepSeek R1 32Bollama run deepseek-r1:32b~50 t/s
32 GB+Llama 4 Scoutollama run llama4:scout175 t/s

→ 检查你确切的 GPU 兼容性 | → 浏览所有模型

← 所有指南 | 检查 GPU 兼容性