Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026
Ostatnia aktualizacja: maj 2026 — Architektura MoE (Mixture of Experts) stoi za niektórymi z najbardziej ekscytujących modeli 2026 roku: Llama 4, DeepSeek V3, Qwen 3 MoE i Gemma 4. Zrozumienie MoE pom
Ostatnia aktualizacja: maj 2026 — Architektura MoE (Mixture of Experts) stoi za niektórymi z najbardziej ekscytujących modeli 2026 roku: Llama 4, DeepSeek V3, Qwen 3 MoE i Gemma 4. Zrozumienie MoE pomaga wybrać właściwy model i skuteczniej zarządzać VRAM.
W tradycyjnym „gęstym” (dense) modelu LLM każdy parametr jest aktywny dla każdego tokena. W modelu Mixture of Experts architektura jest podzielona na wiele wyspecjalizowanych podsieci („ekspertów”), a na jeden token aktywuje się tylko niewielka ich część:
Model gęsty (np. Llama 3.1 8B):
Model MoE (np. Qwen 3.5 35B-A3B):
Kluczowy wniosek: przechowujesz więcej wiedzy (więcej łącznych parametrów), ale płacisz tylko koszt obliczeń mniejszego modelu.
| Właściwość | Gęsty 7B | MoE 35B-A3B |
|---|---|---|
| Łączne parametry | 7B | 35B |
| Aktywne parametry/token | 7B | ~3B |
| Potrzebny VRAM (Q4) | ~5 GB | ~20 GB |
| Szybkość wnioskowania (tokeny/s) | 60 t/s (RTX 4090) | 25–35 t/s (RTX 4090) |
| Wiedza/możliwości | Poziom 7B | Odpowiednik ~25–30B |
| Jakość rozumowania | Dobra | Znacznie lepsza |
Otrzymujesz wiedzę modelu 35B mniej więcej za koszt wnioskowania modelu 7B — kosztem większej ilości VRAM.
ollama run llama4:scout
ollama run llama4:maverick
Oryginalny, szeroko przyjęty model MoE:
Modele MoE mają nietypowy profil VRAM:
Gęsty Llama 3.1 70B Q4:
VRAM: 40 GB (muszą zmieścić się wszystkie wagi)
Obliczenia/token: 70B operacji
Typowa szybkość: 5-8 t/s na RTX 4090
MoE Llama 4 Scout Q4:
VRAM: 10.5 GB (wszyscy eksperci wciąż załadowani)
Obliczenia/token: 17B operacji
Typowa szybkość: 25-35 t/s na RTX 4090
MoE Llama 4 Maverick Q4:
VRAM: 24 GB (wszyscy eksperci wciąż załadowani)
Obliczenia/token: 17B operacji
Typowa szybkość: 15-25 t/s na RTX 4090
Kluczowy wniosek: MoE redukuje obliczenia (szybkość), ale nie VRAM — wszyscy eksperci muszą być załadowani do pamięci, nawet jeśli na token używa się tylko 2–4. Model MoE 685B wciąż potrzebuje ~370GB VRAM, mimo że na token działa tylko 37B parametrów.
Wybierz MoE, gdy:
Wybierz model gęsty, gdy:
Ollama obsługuje modele MoE automatycznie. Kilka wskazówek:
# Check available VRAM before loading large MoE
ollama list
# For Llama 4 Scout (10.5GB) on an 8GB card - it will CPU offload
# Force full GPU offload if you have enough VRAM
OLLAMA_NUM_GPU=99 ollama run llama4:scout
# For Qwen 3.5 35B-A3B on RTX 4090 24GB:
ollama run qwen3.5:35b-a3b-q4_K_M
Modele MoE często mają bardzo duże okna kontekstu (bo architektura dobrze się skaluje):
| Model | Okno kontekstu |
|---|---|
| Llama 4 Scout | 128k tokenów |
| Llama 4 Maverick | 128k tokenów |
| DeepSeek V3.2 | 128k tokenów |
| Qwen 3.5 35B-A3B | 32k tokenów |
| Gemma 4 26B-A4B | 128k tokenów |
Duży kontekst + wydajność MoE = znakomite do RAG, analizy dokumentów i zadań długiej formy.
Czy Ollama obsługuje modele MoE automatycznie? Tak — Ollama obsługuje modele MoE przezroczyście przez llama.cpp. Nie potrzebujesz żadnej specjalnej konfiguracji.
Czy MoE jest lepszy niż model gęsty do mojego zastosowania? W większości zadań czatu interaktywnego gęsty model 8B jest szybszy. Przy złożonym rozumowaniu, gdzie możesz poczekać 2–3 sekundy na odpowiedź, model MoE o tym samym budżecie VRAM da lepsze odpowiedzi.
Czy mogę dostrajać modele MoE? Technicznie tak, za pomocą frameworków takich jak LLaMA-Factory, ale jest to bardziej złożone. Fine-tuning LoRA działa, ale wymaga starannego routingu ekspertów. Większość użytkowników dostraja zamiast tego modele gęste.
Dlaczego model 685B potrzebuje 370GB VRAM, skoro aktywnych jest tylko 37B? Wszystkie macierze wag ekspertów muszą być w VRAM, aby router mógł spośród nich wybierać. Nie da się z góry wiedzieć, którzy eksperci zostaną wybrani, więc wszyscy muszą być załadowani. To fundamentalne ograniczenie pamięciowe MoE.