混合专家(MoE)模型详解:本地 AI 2026

作者: Jakub Rusinowski · 最后更新: 2026年7月12日

最后更新:2026 年 5 月 —— MoE(混合专家)架构是 2026 年一些最激动人心模型的幕后功臣:Llama 4、DeepSeek V3、Qwen 3 MoE 以及 Gemma 4。理解 MoE 有助于你选对模型并更有效地管理显存。

本指南内容

最后更新:2026 年 5 月 —— MoE(混合专家)架构是 2026 年一些最激动人心模型的幕后功臣:Llama 4、DeepSeek V3、Qwen 3 MoE 以及 Gemma 4。理解 MoE 有助于你选对模型并更有效地管理显存。

什么是混合专家?

在传统的"密集(dense)"LLM 中,每个 token 都会激活全部参数。而在混合专家模型中,架构被拆分为许多专门的子网络(即"专家"),每个 token 只激活其中一小部分:

密集模型(如 Llama 3.1 8B):

MoE 模型(如 Qwen 3.5 35B-A3B):

MoE 模型为何令人兴奋

关键洞察:你存储更多知识(更多总参数),但只支付更小模型的计算成本。

属性密集 7BMoE 35B-A3B
总参数7B35B
每 token 激活参数7B~3B
所需显存(Q4)~5 GB~20 GB
推理速度(token/秒)60 t/s(RTX 4090)25–35 t/s(RTX 4090)
知识/能力7B 水平约等于 25–30B
推理质量良好明显更好

你以大约 7B 模型的推理成本,获得了 35B 模型的知识——代价是更多显存。

2026 年的主要 MoE 模型

Llama 4 Scout(17B 激活 / 109B 总)

ollama run llama4:scout

Llama 4 Maverick(17B 激活 / 400B 总)

ollama run llama4:maverick

Qwen 3.5 35B-A3B

DeepSeek V3.2(685B 总,37B 激活)

Gemma 4 26B-A4B

Mixtral 8x7B(经典)

最早被广泛采用的 MoE 模型:

显存 vs 计算:MoE 的权衡

MoE 模型有着不寻常的显存特征:

密集 Llama 3.1 70B Q4:
  显存:40 GB(必须装下全部权重)
  每 token 计算:70B 次运算
  典型速度:RTX 4090 上 5-8 t/s

MoE Llama 4 Scout Q4:
  显存:10.5 GB(所有专家仍被加载)
  每 token 计算:17B 次运算
  典型速度:RTX 4090 上 25-35 t/s

MoE Llama 4 Maverick Q4:
  显存:24 GB(所有专家仍被加载)
  每 token 计算:17B 次运算
  典型速度:RTX 4090 上 15-25 t/s

关键洞察: MoE 降低的是计算量(速度),而不是显存——即使每个 token 只用 2–4 个专家,所有专家也都必须加载进内存。一个 685B 的 MoE 模型仍需约 370GB 显存,尽管每 token 只运行 37B 参数。

何时选 MoE 而非密集模型

在以下情况选 MoE:

在以下情况选密集模型:

高效运行 MoE 模型

Ollama 会自动处理 MoE 模型。一些提示:

# Check available VRAM before loading large MoE
ollama list

# For Llama 4 Scout (10.5GB) on an 8GB card - it will CPU offload
# Force full GPU offload if you have enough VRAM
OLLAMA_NUM_GPU=99 ollama run llama4:scout

# For Qwen 3.5 35B-A3B on RTX 4090 24GB:
ollama run qwen3.5:35b-a3b-q4_K_M

MoE 与上下文长度

MoE 模型往往拥有非常大的上下文窗口(因为该架构扩展性良好):

模型上下文窗口
Llama 4 Scout128k token
Llama 4 Maverick128k token
DeepSeek V3.2128k token
Qwen 3.5 35B-A3B32k token
Gemma 4 26B-A4B128k token

大上下文 + MoE 高效 = 非常适合 RAG、文档分析和长文本任务。

常见问答

Ollama 会自动支持 MoE 模型吗? 会——Ollama 通过 llama.cpp 透明地处理 MoE 模型。你不需要任何特殊配置。

MoE 对我的用例比密集模型更好吗? 对于大多数交互式聊天任务,密集 8B 模型更快。对于你能等待每次响应 2–3 秒的复杂推理,同等显存预算下的 MoE 模型会给出更好的答案。

我能微调 MoE 模型吗? 技术上可以,用 LLaMA-Factory 之类的框架,但更复杂。LoRA 微调可行,但需要谨慎处理专家路由。大多数用户还是选择微调密集模型。

如果 685B 模型只激活 37B,为什么还需要 370GB 显存? 所有专家权重矩阵都必须在显存中,路由器才能从中选择。你无法预先知道会选中哪些专家,所以必须全部加载。这是 MoE 根本性的内存约束。

相关指南

← 所有指南 | 检查 GPU 兼容性