Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026
Ostatnia aktualizacja: maj 2026 — Okno kontekstu to jedna z najbardziej niezrozumianych specyfikacji w lokalnej AI. Ten przewodnik wyjaśnia, co oznacza, jak wpływa na VRAM i jakiego rozmiaru kontekstu
Ostatnia aktualizacja: maj 2026 — Okno kontekstu to jedna z najbardziej niezrozumianych specyfikacji w lokalnej AI. Ten przewodnik wyjaśnia, co oznacza, jak wpływa na VRAM i jakiego rozmiaru kontekstu faktycznie potrzebujesz do różnych zadań.
Okno kontekstu to maksymalna ilość tekstu, którą model może „widzieć” naraz — łącznie z całą historią rozmowy, promptami systemowymi, dokumentami, które wkleiłeś, oraz własnymi odpowiedziami modelu.
Pomyśl o nim jak o pamięci krótkotrwałej: wszystko poza oknem kontekstu zostaje zapomniane.
Przewodnik przeliczania tokenów:
| Rozmiar kontekstu | Ok. słów | Co się mieści |
|---|---|---|
| 4 096 tokenów | ~3 000 słów | Krótka rozmowa, proste pytania i odpowiedzi |
| 8 192 tokeny | ~6 000 słów | Średnia rozmowa, krótki artykuł |
| 32 768 tokenów | ~24 000 słów | Długi dokument, rozdział książki |
| 128 000 tokenów | ~96 000 słów | Cała książka, duża baza kodu |
| 1 000 000 tokenów | ~750 000 słów | Kilka książek (tylko Gemini Ultra) |
| Model | Okno kontekstu | VRAM (Q4) |
|---|---|---|
| Phi-3.5 Mini | 128k | 3 GB |
| Llama 3.1 8B | 128k | 6 GB |
| Qwen 2.5 14B | 128k | 9,5 GB |
| Gemma 3 27B | 128k | 16,5 GB |
| DeepSeek R1 32B | 64k | 20 GB |
| Llama 3.3 70B | 128k | 40 GB |
| Llama 4 Scout | 128k | 10,5 GB |
| Llama 4 Maverick | 128k | 24 GB |
| Mistral NeMo 12B | 128k | 8 GB |
Większość nowoczesnych modeli obsługuje kontekst 128k — ale wykorzystanie całego tego kontekstu kosztuje VRAM i spowalnia wnioskowanie.
Na Macu ta arytmetyka schodzi z tej samej puli co wszystko inne, więc dłuższe okno wpycha maszynę w swap, zamiast zgłosić błąd. Na telefonie sufit jest jeszcze niższy, a aplikacja zostaje ubita od razu po jego przekroczeniu.
Pamięć KV (key-value cache) przechowuje informacje kontekstowe i rośnie wraz z długością kontekstu. Dochodzi to do bazowego VRAM modelu:
Dla Llama 3.1 8B (Q4_K_M, baza 6GB):
- 4k kontekstu: +0,3 GB → ~6,3 GB łącznie
- 8k kontekstu: +0,6 GB → ~6,6 GB łącznie
- 32k kontekstu: +2,5 GB → ~8,5 GB łącznie
- 128k kontekstu: +10 GB → ~16 GB łącznie (!)
Uruchomienie modelu 7B przy kontekście 128k wymaga tyle VRAM, co model 13B przy kontekście 8k.
Praktyczny wniosek: nie ustawiaj kontekstu na 128k „na wszelki wypadek” — ustaw go na to, czego faktycznie potrzebujesz. Domyślna wartość Ollama (2k–4k) jest odpowiednia dla większości czatów.
# Set context length for a session
ollama run llama3.1 --context-length 32768
# Or in a Modelfile for permanent configuration
FROM llama3.1:8b
PARAMETER num_ctx 32768
# Build and use
ollama create my-llama -f Modelfile
ollama run my-llama
Wielu użytkowników zakłada: „więcej kontekstu = mniejsza potrzeba RAG”. Jest to częściowo prawda, ale:
Dla większości zastosowań praktycznych kontekst 8k–32k + dobre wyszukiwanie bije sam kontekst 128k.
Dłuższy kontekst zwykle wiąże się z wolniejszymi odpowiedziami:
Czas do pierwszego tokena (Llama 3.1 8B, RTX 4090):
- Długość promptu 500 tokenów: 0,3 sekundy
- Długość promptu 4 000 tokenów: 2,1 sekundy
- Długość promptu 32 000 tokenów: 18 sekund
- Długość promptu 128 000 tokenów: 70+ sekund
Do użytku interaktywnego utrzymuj prompty poniżej 8k tokenów. Do przetwarzania wsadowego (streszczenia, analizy) dłuższe konteksty są akceptowalne.
| Zadanie | Zalecany kontekst | Uzasadnienie |
|---|---|---|
| Codzienny asystent czatu | 4k–8k | Wydajny, większość rozmów się mieści |
| Asystent kodowania (na poziomie pliku) | 16k–32k | Jeden lub kilka plików |
| Streszczacz dokumentów | 32k–64k | Większość dokumentów się mieści |
| Asystent całej bazy kodu | 64k–128k | Wiele plików, kontekst projektu |
| Analiza książki | 128k | Całe rozdziały książki |
| Przegląd pracy badawczej | 32k | Typowa praca ≈ 8 000–15 000 tokenów |
Co się dzieje po przekroczeniu kontekstu? Model ucina najstarszą treść (zwykle początek rozmowy). Zauważysz, że AI „zapomina” wczesne części rozmowy.
Czy okno kontekstu wpływa na jakość modelu? Nie bezpośrednio — ale modele dostrojone do dłuższych kontekstów zwykle lepiej radzą sobie z zależnościami dalekiego zasięgu. Model deklarujący kontekst 128k może i tak słabo działać przy 100k, jeśli nie był specjalnie do tego trenowany.
Czy mogę rozszerzyć okno kontekstu poza to, co obsługuje model? Nie w sposób niezawodny. Niektóre techniki (skalowanie RoPE, YaRN) potrafią nieco rozszerzyć kontekst, ale z degradacją jakości. Lepiej wybrać model zaprojektowany pod potrzebną długość kontekstu.
Dlaczego małe modele obsługują kontekst 128k? Wagi modelu i okno kontekstu są oddzielne. Model 4B może mieć kontekst 128k — oznacza to tylko, że będziesz potrzebować dodatkowego VRAM na pamięć KV. Jakość modelu przy 128k zależy od jego treningu, a nie tylko od liczby parametrów.