作者: Jakub Rusinowski · 最后更新: 2026年7月12日
最后更新:2026 年 5 月 —— MoE(混合专家)架构是 2026 年一些最激动人心模型的幕后功臣:Llama 4、DeepSeek V3、Qwen 3 MoE 以及 Gemma 4。理解 MoE 有助于你选对模型并更有效地管理显存。
最后更新:2026 年 5 月 —— MoE(混合专家)架构是 2026 年一些最激动人心模型的幕后功臣:Llama 4、DeepSeek V3、Qwen 3 MoE 以及 Gemma 4。理解 MoE 有助于你选对模型并更有效地管理显存。
在传统的"密集(dense)"LLM 中,每个 token 都会激活全部参数。而在混合专家模型中,架构被拆分为许多专门的子网络(即"专家"),每个 token 只激活其中一小部分:
密集模型(如 Llama 3.1 8B):
MoE 模型(如 Qwen 3.5 35B-A3B):
关键洞察:你存储更多知识(更多总参数),但只支付更小模型的计算成本。
| 属性 | 密集 7B | MoE 35B-A3B |
|---|---|---|
| 总参数 | 7B | 35B |
| 每 token 激活参数 | 7B | ~3B |
| 所需显存(Q4) | ~5 GB | ~20 GB |
| 推理速度(token/秒) | 60 t/s(RTX 4090) | 25–35 t/s(RTX 4090) |
| 知识/能力 | 7B 水平 | 约等于 25–30B |
| 推理质量 | 良好 | 明显更好 |
你以大约 7B 模型的推理成本,获得了 35B 模型的知识——代价是更多显存。
ollama run llama4:scout
ollama run llama4:maverick
最早被广泛采用的 MoE 模型:
MoE 模型有着不寻常的显存特征:
密集 Llama 3.1 70B Q4:
显存:40 GB(必须装下全部权重)
每 token 计算:70B 次运算
典型速度:RTX 4090 上 5-8 t/s
MoE Llama 4 Scout Q4:
显存:10.5 GB(所有专家仍被加载)
每 token 计算:17B 次运算
典型速度:RTX 4090 上 25-35 t/s
MoE Llama 4 Maverick Q4:
显存:24 GB(所有专家仍被加载)
每 token 计算:17B 次运算
典型速度:RTX 4090 上 15-25 t/s
关键洞察: MoE 降低的是计算量(速度),而不是显存——即使每个 token 只用 2–4 个专家,所有专家也都必须加载进内存。一个 685B 的 MoE 模型仍需约 370GB 显存,尽管每 token 只运行 37B 参数。
在以下情况选 MoE:
在以下情况选密集模型:
Ollama 会自动处理 MoE 模型。一些提示:
# Check available VRAM before loading large MoE
ollama list
# For Llama 4 Scout (10.5GB) on an 8GB card - it will CPU offload
# Force full GPU offload if you have enough VRAM
OLLAMA_NUM_GPU=99 ollama run llama4:scout
# For Qwen 3.5 35B-A3B on RTX 4090 24GB:
ollama run qwen3.5:35b-a3b-q4_K_M
MoE 模型往往拥有非常大的上下文窗口(因为该架构扩展性良好):
| 模型 | 上下文窗口 |
|---|---|
| Llama 4 Scout | 128k token |
| Llama 4 Maverick | 128k token |
| DeepSeek V3.2 | 128k token |
| Qwen 3.5 35B-A3B | 32k token |
| Gemma 4 26B-A4B | 128k token |
大上下文 + MoE 高效 = 非常适合 RAG、文档分析和长文本任务。
Ollama 会自动支持 MoE 模型吗? 会——Ollama 通过 llama.cpp 透明地处理 MoE 模型。你不需要任何特殊配置。
MoE 对我的用例比密集模型更好吗? 对于大多数交互式聊天任务,密集 8B 模型更快。对于你能等待每次响应 2–3 秒的复杂推理,同等显存预算下的 MoE 模型会给出更好的答案。
我能微调 MoE 模型吗? 技术上可以,用 LLaMA-Factory 之类的框架,但更复杂。LoRA 微调可行,但需要谨慎处理专家路由。大多数用户还是选择微调密集模型。
如果 685B 模型只激活 37B,为什么还需要 370GB 显存? 所有专家权重矩阵都必须在显存中,路由器才能从中选择。你无法预先知道会选中哪些专家,所以必须全部加载。这是 MoE 根本性的内存约束。