Przewodnik po oknie kontekstu 2026: 4K vs 32K vs 128K tokenów

Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026

Ostatnia aktualizacja: maj 2026 — Okno kontekstu to jedna z najbardziej niezrozumianych specyfikacji w lokalnej AI. Ten przewodnik wyjaśnia, co oznacza, jak wpływa na VRAM i jakiego rozmiaru kontekstu

W tym przewodniku

Ostatnia aktualizacja: maj 2026 — Okno kontekstu to jedna z najbardziej niezrozumianych specyfikacji w lokalnej AI. Ten przewodnik wyjaśnia, co oznacza, jak wpływa na VRAM i jakiego rozmiaru kontekstu faktycznie potrzebujesz do różnych zadań.

Czym jest okno kontekstu?

Okno kontekstu to maksymalna ilość tekstu, którą model może „widzieć” naraz — łącznie z całą historią rozmowy, promptami systemowymi, dokumentami, które wkleiłeś, oraz własnymi odpowiedziami modelu.

Pomyśl o nim jak o pamięci krótkotrwałej: wszystko poza oknem kontekstu zostaje zapomniane.

Przewodnik przeliczania tokenów:

Rozmiar kontekstuOk. słówCo się mieści
4 096 tokenów~3 000 słówKrótka rozmowa, proste pytania i odpowiedzi
8 192 tokeny~6 000 słówŚrednia rozmowa, krótki artykuł
32 768 tokenów~24 000 słówDługi dokument, rozdział książki
128 000 tokenów~96 000 słówCała książka, duża baza kodu
1 000 000 tokenów~750 000 słówKilka książek (tylko Gemini Ultra)

Okno kontekstu popularnych modeli lokalnych (2026)

ModelOkno kontekstuVRAM (Q4)
Phi-3.5 Mini128k3 GB
Llama 3.1 8B128k6 GB
Qwen 2.5 14B128k9,5 GB
Gemma 3 27B128k16,5 GB
DeepSeek R1 32B64k20 GB
Llama 3.3 70B128k40 GB
Llama 4 Scout128k10,5 GB
Llama 4 Maverick128k24 GB
Mistral NeMo 12B128k8 GB

Większość nowoczesnych modeli obsługuje kontekst 128k — ale wykorzystanie całego tego kontekstu kosztuje VRAM i spowalnia wnioskowanie.

Jak długość kontekstu wpływa na VRAM

Na Macu ta arytmetyka schodzi z tej samej puli co wszystko inne, więc dłuższe okno wpycha maszynę w swap, zamiast zgłosić błąd. Na telefonie sufit jest jeszcze niższy, a aplikacja zostaje ubita od razu po jego przekroczeniu.

Pamięć KV (key-value cache) przechowuje informacje kontekstowe i rośnie wraz z długością kontekstu. Dochodzi to do bazowego VRAM modelu:

Dla Llama 3.1 8B (Q4_K_M, baza 6GB):
- 4k kontekstu:   +0,3 GB → ~6,3 GB łącznie
- 8k kontekstu:   +0,6 GB → ~6,6 GB łącznie
- 32k kontekstu:  +2,5 GB → ~8,5 GB łącznie
- 128k kontekstu: +10 GB  → ~16 GB łącznie (!)

Uruchomienie modelu 7B przy kontekście 128k wymaga tyle VRAM, co model 13B przy kontekście 8k.

Praktyczny wniosek: nie ustawiaj kontekstu na 128k „na wszelki wypadek” — ustaw go na to, czego faktycznie potrzebujesz. Domyślna wartość Ollama (2k–4k) jest odpowiednia dla większości czatów.

Ustawianie długości kontekstu w Ollama

# Set context length for a session
ollama run llama3.1 --context-length 32768

# Or in a Modelfile for permanent configuration
FROM llama3.1:8b
PARAMETER num_ctx 32768

# Build and use
ollama create my-llama -f Modelfile
ollama run my-llama

Zastosowania okna kontekstu

Kiedy 4k–8k wystarcza

Kiedy potrzebujesz 32k

Kiedy potrzebujesz 128k

Długość kontekstu a RAG: ważny niuans

Wielu użytkowników zakłada: „więcej kontekstu = mniejsza potrzeba RAG”. Jest to częściowo prawda, ale:

Dla większości zastosowań praktycznych kontekst 8k–32k + dobre wyszukiwanie bije sam kontekst 128k.

Okno kontekstu a jakość modelu: kompromis

Dłuższy kontekst zwykle wiąże się z wolniejszymi odpowiedziami:

Czas do pierwszego tokena (Llama 3.1 8B, RTX 4090):
- Długość promptu 500 tokenów:   0,3 sekundy
- Długość promptu 4 000 tokenów:  2,1 sekundy
- Długość promptu 32 000 tokenów: 18 sekund
- Długość promptu 128 000 tokenów: 70+ sekund

Do użytku interaktywnego utrzymuj prompty poniżej 8k tokenów. Do przetwarzania wsadowego (streszczenia, analizy) dłuższe konteksty są akceptowalne.

Praktyczna konfiguracja według zadania

ZadanieZalecany kontekstUzasadnienie
Codzienny asystent czatu4k–8kWydajny, większość rozmów się mieści
Asystent kodowania (na poziomie pliku)16k–32kJeden lub kilka plików
Streszczacz dokumentów32k–64kWiększość dokumentów się mieści
Asystent całej bazy kodu64k–128kWiele plików, kontekst projektu
Analiza książki128kCałe rozdziały książki
Przegląd pracy badawczej32kTypowa praca ≈ 8 000–15 000 tokenów

Najczęściej zadawane pytania

Co się dzieje po przekroczeniu kontekstu? Model ucina najstarszą treść (zwykle początek rozmowy). Zauważysz, że AI „zapomina” wczesne części rozmowy.

Czy okno kontekstu wpływa na jakość modelu? Nie bezpośrednio — ale modele dostrojone do dłuższych kontekstów zwykle lepiej radzą sobie z zależnościami dalekiego zasięgu. Model deklarujący kontekst 128k może i tak słabo działać przy 100k, jeśli nie był specjalnie do tego trenowany.

Czy mogę rozszerzyć okno kontekstu poza to, co obsługuje model? Nie w sposób niezawodny. Niektóre techniki (skalowanie RoPE, YaRN) potrafią nieco rozszerzyć kontekst, ale z degradacją jakości. Lepiej wybrać model zaprojektowany pod potrzebną długość kontekstu.

Dlaczego małe modele obsługują kontekst 128k? Wagi modelu i okno kontekstu są oddzielne. Model 4B może mieć kontekst 128k — oznacza to tylko, że będziesz potrzebować dodatkowego VRAM na pamięć KV. Jakość modelu przy 128k zależy od jego treningu, a nie tylko od liczby parametrów.

Powiązane przewodniki

← Wszystkie przewodniki | Sprawdź zgodność GPU