作者: Jakub Rusinowski · 最后更新: 2026年7月21日
不确定该跑哪个模型?本指南帮你拨开迷雾。我们为每个显存档位只推荐单一最佳模型——大多数用户应该从它开始的那一个。
不确定该跑哪个模型?本指南帮你拨开迷雾。我们为每个显存档位只推荐单一最佳模型——大多数用户应该从它开始的那一个。
最佳选择:Phi-4 Mini(3.8B,Q4_K_M)
ollama run phi4-mini亚军: Gemma 3 4B(ollama run gemma3:4b)——更擅长创意写作,3.5 GB。
预期表现: 胜任日常聊天、编程帮助和写作的助手。别指望 70B 级别的推理,但对 4 GB 而言,这已经了不起。
最佳选择:Llama 3.1 8B(Q4_K_M)
ollama run llama3.1:8b编程亚军: Qwen 2.5 Coder 7B(ollama run qwen2.5-coder:7b)——最佳纯编程 8B 模型。
推理亚军: DeepSeek R1 8B Distill(ollama run deepseek-r1:8b)——在 8B 中达到近 GPT-4 级别的推理。
最佳选择:Qwen 3 8B(Q8_0)——既然有余量,就以更高质量运行
ollama run qwen3:8b或试试: Gemma 3 12B Q4(ollama run gemma3:12b)——谷歌最好的中等体量模型。
最佳选择:Qwen 3 14B(Q4_K_M)
ollama run qwen3:14b编程亚军: Qwen 2.5 Coder 14B(ollama run qwen2.5-coder:14b)
长文档最佳: Mistral Small 3.1(ollama run mistral-small)——128K 上下文窗口。
最佳选择:DeepSeek R1 32B(Q4_K_M)
ollama run deepseek-r1:32b替代方案: Qwen 3 32B(ollama run qwen3:32b)——同样装得下,通用任务更强。
最佳选择:Llama 4 Scout(Q4_K_M)
ollama run llama4:scout对于 70B 模型: Llama 3.3 70B Q4_K_M 需要 42 GB——可在 Apple M2/M4 Ultra(128–192 GB 统一内存)或双 RTX 4090/5090 配置上运行。
| 显存 | 最佳模型 | Ollama 命令 | 速度 |
|---|---|---|---|
| 4 GB | Phi-4 Mini | ollama run phi4-mini | ~40 t/s |
| 8 GB | Llama 3.1 8B | ollama run llama3.1:8b | ~70 t/s |
| 12 GB | Qwen 3 8B Q8 | ollama run qwen3:8b | ~80 t/s |
| 16 GB | Qwen 3 14B | ollama run qwen3:14b | ~85 t/s |
| 24 GB | DeepSeek R1 32B | ollama run deepseek-r1:32b | ~50 t/s |
| 32 GB+ | Llama 4 Scout | ollama run llama4:scout | 175 t/s |