Autor: Jakub Rusinowski · Ostatnia aktualizacja 2026-08-04 · Wartości sprzętowe wyliczone naszym silnikiem VRAM
8 GB VRAM uciągnie Qwen3-Coder 8B razem z modelem do autouzupełniania — to sensowny punkt wejścia. 16 GB uciągnie Devstral-2 22B, czyli pierwszy próg naprawdę zdatny do pracy agentowej. 24 GB uruchomi Qwen 3.6 27B albo Qwen 2.5 Coder 32B — złoty środek. Wyżej, około 49 GB (2×24 GB albo Mac z 96 GB i więcej) odblokowuje Qwen3-Coder 80B-A3B. Agenty kodujące potrzebują zapasu na kontekst ponad same wagi, więc planuj o oczko luźniej niż przy konfiguracji do samego czatu.
Kodowanie to najtrudniejsze obciążenie do wymiarowania VRAM-u, bo o tę samą pamięć biją się trzy rzeczy: wagi modelu, cache KV (rosnący razem z długością kontekstu — a narzędzia agentowe rutynowo pchają konteksty rzędu 16–32 tys. tokenów) i każdy drugi model, którego trzymasz do autouzupełniania. Ogólne tabelki w rodzaju „7B potrzebuje 5 GB” pomijają dwie ostatnie pozycje i tak właśnie kończy się agentem, który wysypuje się w chwili, gdy Cline wczyta duży plik.
Każda liczba poniżej to zapotrzebowanie przy Q4_K_M policzone tym samym silnikiem, co nasz kalkulator zgodności — wagi plus cache KV plus narzut, a nie przepisana wartość z karty katalogowej. Dla konkretnej pary GPU i modelu, razem z opcjami kwantyzacji i kontekstu, kalkulator poda dokładny werdykt.
Karty klasy RTX 3060/4060 i Maki z 16 GB. Jeden mały koder z bieżącej generacji albo koder plus autouzupełnianie, jeśli utrzymasz konteksty w ryzach.
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Qwen3-Coder 8B Model na co dzień — Bieżąca generacja, dostrojony pod FIM, zostawia na karcie 8 GB jakieś 2 GB zapasu na rosnący kontekst. ollama pull qwen3-coder:8b | 5.6 GB | 8 GB GPU (RTX 3060/4060) Mac: 16 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| StarCoder 2 3B Pomocnik do autouzupełniania — Na tyle mały, żeby chodzić obok modelu 8B — natychmiastowy ghost text, podczas gdy większy model zajmuje się czatem. ollama pull starcoder2:3b | 2.6 GB | 8 GB GPU (RTX 3060/4060) Mac: 16 GB pamięci zunifikowanej | 16K | BigCode OpenRAIL-M |
RTX 3060 12GB, RTX 4060 Ti 16GB i 5060 Ti 16GB, karty klasy RX 7800 XT, Maki z 24 GB. Tutaj dedykowane agenty do kodowania robią się niezawodne.
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Devstral-2 22B Najlepszy agent poniżej 24 GB — Zbudowany specjalnie pod pętle agentowe na wielu plikach; na karcie 16 GB mieści się z zapasem na kontekst. ollama pull devstral:22b | 14.1 GB | 16 GB GPU (RTX 4060 Ti 16GB / 5060 Ti) Mac: 24 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| Codestral 22B Specjalista od FIM (bez zastosowań komercyjnych) — Świetne podpowiedzi, ale licencja MNPL — wyłącznie projekty prywatne. ollama pull codestral:22b | 14.2 GB | 16 GB GPU (RTX 4060 Ti 16GB / 5060 Ti) Mac: 24 GB pamięci zunifikowanej | 32K | MNPL-0.1 (non-production) |
| StarCoder 2 15B Opcja z poprzedniej generacji — Mieści się na karcie 12 GB; sięgaj po niego tylko wtedy, gdy nowsze 8B i 22B nie obsługują twojego języka. ollama pull starcoder2:15b | 10.2 GB | 12 GB GPU (RTX 3060 12GB / 4070) Mac: 16 GB pamięci zunifikowanej | 16K | BigCode OpenRAIL-M |
RTX 3090/4090, RX 7900 XTX, Maki z 32 GB. To próg, w który ten dział radzi celować, jeśli kupujesz sprzęt pod kodowanie.
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Qwen 3.6 27B Najlepszy ogółem — Na karcie 24 GB zostaje jakieś 6 GB zapasu — wystarczy na konteksty 32K albo na pomocnika do autouzupełniania. ollama pull qwen3.6:27b | 17.6 GB | 24 GB GPU (RTX 3090/4090) Mac: 24 GB pamięci zunifikowanej | 256K | Apache-2.0 |
| Qwen 2.5 Coder 32B Dedykowany koder — Ciaśniej (około 4 GB zapasu) — jakość znakomita, ale trzymaj konteksty w ryzach albo zrezygnuj z pomocnika. ollama pull qwen2.5-coder:32b | 20.1 GB | 24 GB GPU (RTX 3090/4090) Mac: 32 GB pamięci zunifikowanej | 128K | Apache-2.0 |
| Qwen 3.6 35B-A3B Szybka alternatywa MoE — Zaledwie 3B aktywnych parametrów — wyraźnie szybsze tokeny niż gęsty 27B przy zbliżonej jakości. ollama pull qwen3.6:35b-a3b | 21.9 GB | 24 GB GPU (RTX 3090/4090) Mac: 32 GB pamięci zunifikowanej | 256K | Apache-2.0 |
Dwie karty po 24 GB, jedna karta 48 GB albo 64–128 GB pamięci zunifikowanej Apple (z czego dla modeli użyteczne jest jakieś 75%).
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Qwen3-Coder 80B-A3B (MoE) Nagroda główna stacji roboczej — Około 96% jakości kodowania otwartego flagowca; 3B aktywnych parametrów trzyma go szybkim nawet przy tym rozmiarze. ollama pull qwen3-coder:80b-a3b-q4 | 49.1 GB | 2×48 GB GPUs / big unified memory Mac: 96 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| Devstral-2 123B Agentowy maksymalista — 71,6% na SWE-bench Verified — najmocniejszy otwarty agent, jakiego postawisz u siebie bez serwerowni. ollama pull devstral:123b | 75.1 GB | 2×48 GB GPUs / big unified memory Mac: 128 GB pamięci zunifikowanej | 125K | Apache-2.0 |
Zasada 1 — zarezerwuj zapas na kontekst. Cache KV rośnie liniowo razem z długością kontekstu. Model, który „mieści się” przy kontekście 8K, potrafi przelać się przy 32K — a narzędzia agentowe w rodzaju Cline'a żyją w przedziale 16–32K. Jeśli twoja karta mieści model z zapasem mniejszym niż jakieś 15% VRAM-u, zejdź o jeden stopień kwantyzacji niżej albo wybierz model o oczko mniejszy. (Dokładnie to modeluje kalkulator, gdy przesuwasz suwak kontekstu.)
Zasada 2 — MoE przechyla matematykę na twoją korzyść. Modele mixture-of-experts muszą mieć w pamięci wszystkie wagi, ale na token strumieniują tylko aktywnych ekspertów — dlatego Qwen3-Coder 80B-A3B jest po załadowaniu *szybszy* niż gęsty 27B, a z offloadem ekspertów w llama.cpp degraduje się łagodnie na RAM systemowy, zamiast odmawiać wczytania. Jeśli stoisz między progami, MoE o małej liczbie aktywnych parametrów (35B-A3B, 80B-A3B) zwykle lepiej się opłaca niż większy model gęsty. Więcej w naszym przewodniku po modelach MoE.
Na Apple Silicon licz jakieś 75% pamięci zunifikowanej jako użyteczne dla modeli — Mac z 48 GB to na potrzeby planowania „karta 36 GB”.
Jeśli ta strona przesunęła twój cel z 8 GB na 16 albo 24, to są karty, wokół których wyceniony jest każdy z progów — 4060 Ti 16GB jako wybór za rozsądne pieniądze, 3090 i 4090 na złoty środek.
Albo daruj sobie zakup: wynajmij dokładnie ten próg VRAM na godzinę i podejrzyj faktyczne zużycie pamięci na swoim własnym obciążeniu, zanim wydasz choćby złotówkę.
Pełna lista w katalogu chmurowej AI.