Wymagania VRAM dla LLM-ów do kodowania: co naprawdę uciągnie każdy próg

Autor: Jakub Rusinowski · Ostatnia aktualizacja 2026-08-04 · Wartości sprzętowe wyliczone naszym silnikiem VRAM

8 GB VRAM uciągnie Qwen3-Coder 8B razem z modelem do autouzupełniania — to sensowny punkt wejścia. 16 GB uciągnie Devstral-2 22B, czyli pierwszy próg naprawdę zdatny do pracy agentowej. 24 GB uruchomi Qwen 3.6 27B albo Qwen 2.5 Coder 32B — złoty środek. Wyżej, około 49 GB (2×24 GB albo Mac z 96 GB i więcej) odblokowuje Qwen3-Coder 80B-A3B. Agenty kodujące potrzebują zapasu na kontekst ponad same wagi, więc planuj o oczko luźniej niż przy konfiguracji do samego czatu.

Kodowanie to najtrudniejsze obciążenie do wymiarowania VRAM-u, bo o tę samą pamięć biją się trzy rzeczy: wagi modelu, cache KV (rosnący razem z długością kontekstu — a narzędzia agentowe rutynowo pchają konteksty rzędu 16–32 tys. tokenów) i każdy drugi model, którego trzymasz do autouzupełniania. Ogólne tabelki w rodzaju „7B potrzebuje 5 GB” pomijają dwie ostatnie pozycje i tak właśnie kończy się agentem, który wysypuje się w chwili, gdy Cline wczyta duży plik.

Każda liczba poniżej to zapotrzebowanie przy Q4_K_M policzone tym samym silnikiem, co nasz kalkulator zgodności — wagi plus cache KV plus narzut, a nie przepisana wartość z karty katalogowej. Dla konkretnej pary GPU i modelu, razem z opcjami kwantyzacji i kontekstu, kalkulator poda dokładny werdykt.

8 GB VRAM — uczciwy punkt wejścia

Karty klasy RTX 3060/4060 i Maki z 16 GB. Jeden mały koder z bieżącej generacji albo koder plus autouzupełnianie, jeśli utrzymasz konteksty w ryzach.

ModelVRAM (Q4)Uruchomi się naKontekstLicencja
Qwen3-Coder 8B
Model na co dzień — Bieżąca generacja, dostrojony pod FIM, zostawia na karcie 8 GB jakieś 2 GB zapasu na rosnący kontekst.
ollama pull qwen3-coder:8b
5.6 GB8 GB GPU (RTX 3060/4060)
Mac: 16 GB pamięci zunifikowanej
125KApache-2.0
StarCoder 2 3B
Pomocnik do autouzupełniania — Na tyle mały, żeby chodzić obok modelu 8B — natychmiastowy ghost text, podczas gdy większy model zajmuje się czatem.
ollama pull starcoder2:3b
2.6 GB8 GB GPU (RTX 3060/4060)
Mac: 16 GB pamięci zunifikowanej
16KBigCode OpenRAIL-M

12–16 GB VRAM — pierwszy próg agentowy

RTX 3060 12GB, RTX 4060 Ti 16GB i 5060 Ti 16GB, karty klasy RX 7800 XT, Maki z 24 GB. Tutaj dedykowane agenty do kodowania robią się niezawodne.

ModelVRAM (Q4)Uruchomi się naKontekstLicencja
Devstral-2 22B
Najlepszy agent poniżej 24 GB — Zbudowany specjalnie pod pętle agentowe na wielu plikach; na karcie 16 GB mieści się z zapasem na kontekst.
ollama pull devstral:22b
14.1 GB16 GB GPU (RTX 4060 Ti 16GB / 5060 Ti)
Mac: 24 GB pamięci zunifikowanej
125KApache-2.0
Codestral 22B
Specjalista od FIM (bez zastosowań komercyjnych) — Świetne podpowiedzi, ale licencja MNPL — wyłącznie projekty prywatne.
ollama pull codestral:22b
14.2 GB16 GB GPU (RTX 4060 Ti 16GB / 5060 Ti)
Mac: 24 GB pamięci zunifikowanej
32KMNPL-0.1 (non-production)
StarCoder 2 15B
Opcja z poprzedniej generacji — Mieści się na karcie 12 GB; sięgaj po niego tylko wtedy, gdy nowsze 8B i 22B nie obsługują twojego języka.
ollama pull starcoder2:15b
10.2 GB12 GB GPU (RTX 3060 12GB / 4070)
Mac: 16 GB pamięci zunifikowanej
16KBigCode OpenRAIL-M

24 GB VRAM — złoty środek

RTX 3090/4090, RX 7900 XTX, Maki z 32 GB. To próg, w który ten dział radzi celować, jeśli kupujesz sprzęt pod kodowanie.

ModelVRAM (Q4)Uruchomi się naKontekstLicencja
Qwen 3.6 27B
Najlepszy ogółem — Na karcie 24 GB zostaje jakieś 6 GB zapasu — wystarczy na konteksty 32K albo na pomocnika do autouzupełniania.
ollama pull qwen3.6:27b
17.6 GB24 GB GPU (RTX 3090/4090)
Mac: 24 GB pamięci zunifikowanej
256KApache-2.0
Qwen 2.5 Coder 32B
Dedykowany koder — Ciaśniej (około 4 GB zapasu) — jakość znakomita, ale trzymaj konteksty w ryzach albo zrezygnuj z pomocnika.
ollama pull qwen2.5-coder:32b
20.1 GB24 GB GPU (RTX 3090/4090)
Mac: 32 GB pamięci zunifikowanej
128KApache-2.0
Qwen 3.6 35B-A3B
Szybka alternatywa MoE — Zaledwie 3B aktywnych parametrów — wyraźnie szybsze tokeny niż gęsty 27B przy zbliżonej jakości.
ollama pull qwen3.6:35b-a3b
21.9 GB24 GB GPU (RTX 3090/4090)
Mac: 32 GB pamięci zunifikowanej
256KApache-2.0

48 GB i więcej — teren stacji roboczych i Maców

Dwie karty po 24 GB, jedna karta 48 GB albo 64–128 GB pamięci zunifikowanej Apple (z czego dla modeli użyteczne jest jakieś 75%).

ModelVRAM (Q4)Uruchomi się naKontekstLicencja
Qwen3-Coder 80B-A3B (MoE)
Nagroda główna stacji roboczej — Około 96% jakości kodowania otwartego flagowca; 3B aktywnych parametrów trzyma go szybkim nawet przy tym rozmiarze.
ollama pull qwen3-coder:80b-a3b-q4
49.1 GB2×48 GB GPUs / big unified memory
Mac: 96 GB pamięci zunifikowanej
125KApache-2.0
Devstral-2 123B
Agentowy maksymalista — 71,6% na SWE-bench Verified — najmocniejszy otwarty agent, jakiego postawisz u siebie bez serwerowni.
ollama pull devstral:123b
75.1 GB2×48 GB GPUs / big unified memory
Mac: 128 GB pamięci zunifikowanej
125KApache-2.0

Dwie zasady VRAM specyficzne dla kodowania

Zasada 1 — zarezerwuj zapas na kontekst. Cache KV rośnie liniowo razem z długością kontekstu. Model, który „mieści się” przy kontekście 8K, potrafi przelać się przy 32K — a narzędzia agentowe w rodzaju Cline'a żyją w przedziale 16–32K. Jeśli twoja karta mieści model z zapasem mniejszym niż jakieś 15% VRAM-u, zejdź o jeden stopień kwantyzacji niżej albo wybierz model o oczko mniejszy. (Dokładnie to modeluje kalkulator, gdy przesuwasz suwak kontekstu.)

Zasada 2 — MoE przechyla matematykę na twoją korzyść. Modele mixture-of-experts muszą mieć w pamięci wszystkie wagi, ale na token strumieniują tylko aktywnych ekspertów — dlatego Qwen3-Coder 80B-A3B jest po załadowaniu *szybszy* niż gęsty 27B, a z offloadem ekspertów w llama.cpp degraduje się łagodnie na RAM systemowy, zamiast odmawiać wczytania. Jeśli stoisz między progami, MoE o małej liczbie aktywnych parametrów (35B-A3B, 80B-A3B) zwykle lepiej się opłaca niż większy model gęsty. Więcej w naszym przewodniku po modelach MoE.

Na Apple Silicon licz jakieś 75% pamięci zunifikowanej jako użyteczne dla modeli — Mac z 48 GB to na potrzeby planowania „karta 36 GB”.

Zmieniasz próg?

Jeśli ta strona przesunęła twój cel z 8 GB na 16 albo 24, to są karty, wokół których wyceniony jest każdy z progów — 4060 Ti 16GB jako wybór za rozsądne pieniądze, 3090 i 4090 na złoty środek.

Ujawnienie afiliacyjne: Niektóre odnośniki na tej stronie to linki afiliacyjne — jeśli dokonasz zakupu za ich pośrednictwem, LLM Configurator może otrzymać prowizję bez dodatkowych kosztów dla Ciebie. Jako uczestnik programu Amazon Associates, LLM Configurator zarabia na kwalifikujących się zakupach.
NVIDIA GeForce RTX 4060 Ti 16GB
16 GB VRAM · 165 W board power
Ceny w 2026 są niestabilne — sprawdź aktualną ofertę.
Sprawdź cenę na Amazon
NVIDIA GeForce RTX 3090 24GB
24 GB VRAM · 350 W board power
Ceny w 2026 są niestabilne — sprawdź aktualną ofertę.
Sprawdź cenę na Amazon
NVIDIA GeForce RTX 4090 24GB
24 GB VRAM · 450 W board power
Ceny w 2026 są niestabilne — sprawdź aktualną ofertę.
Sprawdź cenę na Amazon

Nie masz sprzętu? Najpierw wynajmij kartę

Albo daruj sobie zakup: wynajmij dokładnie ten próg VRAM na godzinę i podejrzyj faktyczne zużycie pamięci na swoim własnym obciążeniu, zanim wydasz choćby złotówkę.

Pełna lista w katalogu chmurowej AI.

Najczęstsze pytania

Ile VRAM potrzebuje lokalny LLM do kodowania?
Praktyczne minima przy Q4: 8 GB na Qwen3-Coder 8B (sensowny punkt wejścia), 16 GB na Devstral-2 22B (pierwszy próg niezawodnie agentowy), 24 GB na Qwen 3.6 27B albo Qwen 2.5 Coder 32B (złoty środek). Do wartości modelu doliczaj jakieś 15% zapasu na konteksty o długości agentowej.
Jaki LLM do kodowania jest najlepszy przy 16 GB VRAM?
Devstral-2 22B — jakieś 14 GB przy Q4_K_M, zbudowany specjalnie pod kodowanie agentowe, Apache 2.0. Jeśli potrzebujesz większego zapasu na kontekst albo drugiego modelu do autouzupełniania, elastyczną alternatywą jest Qwen3-Coder 8B przy około 6 GB.
Dlaczego przy długich plikach mojemu modelowi do kodowania kończy się VRAM?
Przez cache KV. Wartości z kart katalogowych zakładają krótkie konteksty, a cache rośnie z każdym tokenem kontekstu — agenty kodujące zaś upychają w nim pliki, diffy i plany. Model 20 GB na karcie 24 GB potrafi wysypać się z OOM przy kontekście 32K. Rozwiązania: niższa kwantyzacja, ograniczenie kontekstu albo kwantyzacja cache'u KV. Zajrzyj do naszego przewodnika po błędzie CUDA out of memory.
Czy 8 GB VRAM wystarczy do lokalnego asystenta kodowania?
Tak, przy właściwie ustawionych oczekiwaniach: Qwen3-Coder 8B plus StarCoder2 3B do autouzupełniania to naprawdę użyteczny zestaw na co dzień do podpowiedzi, wyjaśnień i drobnych edycji. Czego 8 GB nie obsłuży dobrze, to autonomiczna praca agentowa na wielu plikach — ta zaczyna być godna zaufania przy 16 GB, a wygodna przy 24 GB.
Ile pamięci zunifikowanej potrzebuje Mac do modeli kodujących?
Licz mniej więcej 75% pamięci zunifikowanej jako dostępne dla modeli. Mac 16 GB → Qwen3-Coder 8B; 24–32 GB → Devstral-2 22B; 32–48 GB → Qwen 3.6 27B; 96–128 GB → Qwen3-Coder 80B-A3B. Przepustowość pamięci układów serii M sprawia, że do kodowania są bardzo użyteczne, zwłaszcza z modelami MoE.

Co dalej