Modele Mixture of Experts (MoE): lokalna AI 2026

Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026

Ostatnia aktualizacja: maj 2026 — Architektura MoE (Mixture of Experts) stoi za niektórymi z najbardziej ekscytujących modeli 2026 roku: Llama 4, DeepSeek V3, Qwen 3 MoE i Gemma 4. Zrozumienie MoE pom

W tym przewodniku

Ostatnia aktualizacja: maj 2026 — Architektura MoE (Mixture of Experts) stoi za niektórymi z najbardziej ekscytujących modeli 2026 roku: Llama 4, DeepSeek V3, Qwen 3 MoE i Gemma 4. Zrozumienie MoE pomaga wybrać właściwy model i skuteczniej zarządzać VRAM.

Czym jest Mixture of Experts?

W tradycyjnym „gęstym” (dense) modelu LLM każdy parametr jest aktywny dla każdego tokena. W modelu Mixture of Experts architektura jest podzielona na wiele wyspecjalizowanych podsieci („ekspertów”), a na jeden token aktywuje się tylko niewielka ich część:

Model gęsty (np. Llama 3.1 8B):

Model MoE (np. Qwen 3.5 35B-A3B):

Dlaczego modele MoE są ekscytujące

Kluczowy wniosek: przechowujesz więcej wiedzy (więcej łącznych parametrów), ale płacisz tylko koszt obliczeń mniejszego modelu.

WłaściwośćGęsty 7BMoE 35B-A3B
Łączne parametry7B35B
Aktywne parametry/token7B~3B
Potrzebny VRAM (Q4)~5 GB~20 GB
Szybkość wnioskowania (tokeny/s)60 t/s (RTX 4090)25–35 t/s (RTX 4090)
Wiedza/możliwościPoziom 7BOdpowiednik ~25–30B
Jakość rozumowaniaDobraZnacznie lepsza

Otrzymujesz wiedzę modelu 35B mniej więcej za koszt wnioskowania modelu 7B — kosztem większej ilości VRAM.

Główne modele MoE w 2026

Llama 4 Scout (17B aktywnych / 109B łącznie)

ollama run llama4:scout

Llama 4 Maverick (17B aktywnych / 400B łącznie)

ollama run llama4:maverick

Qwen 3.5 35B-A3B

DeepSeek V3.2 (685B łącznie, 37B aktywnych)

Gemma 4 26B-A4B

Mixtral 8x7B (klasyczny)

Oryginalny, szeroko przyjęty model MoE:

VRAM vs obliczenia: kompromis MoE

Modele MoE mają nietypowy profil VRAM:

Gęsty Llama 3.1 70B Q4:
  VRAM: 40 GB (muszą zmieścić się wszystkie wagi)
  Obliczenia/token: 70B operacji
  Typowa szybkość: 5-8 t/s na RTX 4090

MoE Llama 4 Scout Q4:
  VRAM: 10.5 GB (wszyscy eksperci wciąż załadowani)
  Obliczenia/token: 17B operacji
  Typowa szybkość: 25-35 t/s na RTX 4090

MoE Llama 4 Maverick Q4:
  VRAM: 24 GB (wszyscy eksperci wciąż załadowani)
  Obliczenia/token: 17B operacji
  Typowa szybkość: 15-25 t/s na RTX 4090

Kluczowy wniosek: MoE redukuje obliczenia (szybkość), ale nie VRAM — wszyscy eksperci muszą być załadowani do pamięci, nawet jeśli na token używa się tylko 2–4. Model MoE 685B wciąż potrzebuje ~370GB VRAM, mimo że na token działa tylko 37B parametrów.

Kiedy wybrać MoE, a kiedy model gęsty

Wybierz MoE, gdy:

Wybierz model gęsty, gdy:

Wydajne uruchamianie modeli MoE

Ollama obsługuje modele MoE automatycznie. Kilka wskazówek:

# Check available VRAM before loading large MoE
ollama list

# For Llama 4 Scout (10.5GB) on an 8GB card - it will CPU offload
# Force full GPU offload if you have enough VRAM
OLLAMA_NUM_GPU=99 ollama run llama4:scout

# For Qwen 3.5 35B-A3B on RTX 4090 24GB:
ollama run qwen3.5:35b-a3b-q4_K_M

MoE a długość kontekstu

Modele MoE często mają bardzo duże okna kontekstu (bo architektura dobrze się skaluje):

ModelOkno kontekstu
Llama 4 Scout128k tokenów
Llama 4 Maverick128k tokenów
DeepSeek V3.2128k tokenów
Qwen 3.5 35B-A3B32k tokenów
Gemma 4 26B-A4B128k tokenów

Duży kontekst + wydajność MoE = znakomite do RAG, analizy dokumentów i zadań długiej formy.

Najczęściej zadawane pytania

Czy Ollama obsługuje modele MoE automatycznie? Tak — Ollama obsługuje modele MoE przezroczyście przez llama.cpp. Nie potrzebujesz żadnej specjalnej konfiguracji.

Czy MoE jest lepszy niż model gęsty do mojego zastosowania? W większości zadań czatu interaktywnego gęsty model 8B jest szybszy. Przy złożonym rozumowaniu, gdzie możesz poczekać 2–3 sekundy na odpowiedź, model MoE o tym samym budżecie VRAM da lepsze odpowiedzi.

Czy mogę dostrajać modele MoE? Technicznie tak, za pomocą frameworków takich jak LLaMA-Factory, ale jest to bardziej złożone. Fine-tuning LoRA działa, ale wymaga starannego routingu ekspertów. Większość użytkowników dostraja zamiast tego modele gęste.

Dlaczego model 685B potrzebuje 370GB VRAM, skoro aktywnych jest tylko 37B? Wszystkie macierze wag ekspertów muszą być w VRAM, aby router mógł spośród nich wybierać. Nie da się z góry wiedzieć, którzy eksperci zostaną wybrani, więc wszyscy muszą być załadowani. To fundamentalne ograniczenie pamięciowe MoE.

Powiązane przewodniki

← Wszystkie przewodniki | Sprawdź zgodność GPU