Autor: Jakub Rusinowski · Ostatnia aktualizacja 2026-08-04 · Wartości sprzętowe wyliczone naszym silnikiem VRAM
Na karcie 24 GB (RTX 3090/4090) najlepsze lokalne modele do kodowania to Qwen 3.6 27B i Qwen 2.5 Coder 32B, a Devstral-2 22B jako specjalista od pracy agentowej. Najlepszy koder do pobrania w ogóle to Qwen3-Coder 80B-A3B — pod względem VRAM-u klasa stacji roboczej, ale 3B aktywnych parametrów trzyma go szybkim. Na 8 GB uruchom Qwen3-Coder 8B. Każda liczba poniżej pochodzi z naszego modułu obliczeniowego, nie ze stron marketingowych.
Większość zestawień „najlepszy LLM do kodowania” ustawia w kolejce modele, których nikt u siebie nie uruchomi. To jest posortowane odwrotnie: według progu sprzętowego, który faktycznie masz. Każda tabela pokazuje autentyczne zapotrzebowanie modelu na VRAM przy Q4_K_M — ta sama matematyka stoi za naszym kalkulatorem zgodności GPU — plus próg karty i najmniejszą konfigurację pamięci zunifikowanej Maca, w której model się mieści.
Dwie rzeczy przed tabelami. Po pierwsze, modele do kodowania dzielą się na kodery agentowe (zbudowane po to, żeby prowadzić pętlę edycji w Continue, Cline albo Aiderze — liczy się tu SWE-bench) i modele do autouzupełniania (małe, dostrojone pod fill-in-the-middle, oceniane po opóźnieniu). Poważne lokalne konfiguracje mają po jednym z każdej kategorii. Po drugie, czołówka zmienia się szybko: datowaną migawkę całego krajobrazu, do której da się odesłać, znajdziesz w naszym Raporcie o lokalnej AI #2: najlepsze otwarte modele do kodowania — ta strona pilnuje pytania wiecznie aktualnego: co uruchomić na danym progu.
Szczyt możliwości otwartych wag. Żeby zmieściły się w całości w VRAM-ie, potrzebują zestawu z kilkoma kartami albo dużej pamięci zunifikowanej — ale zerknij na sztuczkę z offloadem MoE pod tabelą.
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Qwen3-Coder 480B-A35B (MoE) Szczyt otwartych wag — Najlepszy dedykowany otwarty koder — 69,6% na SWE-bench Verified, co Qwen sytuuje w okolicach Claude Sonnet 4. Apache 2.0. W praktyce model do API albo do serwerowni. ollama pull qwen3-coder:480b-a35b | 290.6 GB | Multi-GPU server — or use an API Mac: 512 GB pamięci zunifikowanej | 256K | Apache-2.0 |
| Devstral-2 123B Specjalista od agentów — Agentowy flagowiec Mistrala: 71,6% na SWE-bench Verified, zbudowany pod edycje w wielu plikach i poruszanie się po repozytorium. Apache 2.0. Mieści się na stacji roboczej 2×48 GB albo na Macu ze 128 GB. ollama pull devstral:123b | 75.1 GB | 2×48 GB GPUs / big unified memory Mac: 128 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| Qwen3-Coder 80B-A3B (MoE) Najlepszy koder do postawienia u siebie — Około 96% jakości flagowego 480B przy zaledwie 3B aktywnych parametrów — szybkie tokeny, ślad mieszczący się na jednej stacji roboczej, Apache 2.0. ollama pull qwen3-coder:80b-a3b-q4 | 49.1 GB | 2×48 GB GPUs / big unified memory Mac: 96 GB pamięci zunifikowanej | 125K | Apache-2.0 |
Sztuczka z offloadem MoE. Modele MoE o niewielkiej liczbie aktywnych parametrów potrzebują w VRAM-ie tylko *aktywnych* ekspertów. Z offloadem ekspertów w llama.cpp Qwen3-Coder 80B-A3B ruszy już na jakichś 8 GB VRAM plus 32 GB RAM-u systemowego — wolniej niż w wariancie z tabeli, gdzie wszystko siedzi w VRAM-ie, ale zamienia to „model dla stacji roboczej” w coś, z czego dobrze doposażony w RAM pecet do gier naprawdę skorzysta. Tabela pokazuje wariant z całością w VRAM-ie, czyli ten najszybszy.
Złoty środek wśród kart konsumenckich — RTX 3090/4090, RX 7900 XTX albo Mac z 32 GB. Tu zaczyna się „postawione u siebie i naprawdę dobre w kodzie”.
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Qwen 3.6 27B Najlepszy na karcie 24 GB — Najmocniejszy wszechstronny koder, który wygodnie mieści się na RTX 3090/4090 przy Q4 — sensowny wybór na co dzień do lokalnej pracy agentowej. ollama pull qwen3.6:27b | 17.6 GB | 24 GB GPU (RTX 3090/4090) Mac: 24 GB pamięci zunifikowanej | 256K | Apache-2.0 |
| Qwen 2.5 Coder 32B Sprawdzony klasyk — Król benchmarków z 2024 wciąż trzyma poziom — dorównuje jakości kodowania z czasów GPT-4o na jednej karcie 24 GB, z dojrzałym wsparciem GGUF i Ollamy. ollama pull qwen2.5-coder:32b | 20.1 GB | 24 GB GPU (RTX 3090/4090) Mac: 32 GB pamięci zunifikowanej | 128K | Apache-2.0 |
| Devstral-2 22B Agentowy na 16 GB — 52,3% na SWE-bench Verified przy śladzie 16 GB — najlepszy dedykowany agent do kodowania poniżej 24 GB. Apache 2.0. ollama pull devstral:22b | 14.1 GB | 16 GB GPU (RTX 4060 Ti 16GB / 5060 Ti) Mac: 24 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| Codestral 22B Autouzupełnianie FIM (uwaga na licencję) — Świetna jakość fill-in-the-middle w ponad 80 językach — ale licencja MNPL zakazuje użytku komercyjnego i produkcyjnego. Wyłącznie projekty hobbystyczne. ollama pull codestral:22b | 14.2 GB | 16 GB GPU (RTX 4060 Ti 16GB / 5060 Ti) Mac: 24 GB pamięci zunifikowanej | 32K | MNPL-0.1 (non-production) |
Sprawdź licencję, zanim ustandaryzujesz się na jednym modelu. Qwen3-Coder, Qwen 3.6 i Devstral-2 są na Apache 2.0 — komercyjnie za darmo. Codestral 22B ma MNPL (bez produkcji): w domu możesz go spokojnie przetestować, w firmowym obiegu pracy już nie. StarCoder2 wychodzi na BigCode OpenRAIL-M, która dopuszcza użytek komercyjny z ograniczeniami co do zastosowań. Jeśli wybierasz model do pracy, ta kolumna waży tyle samo co wynik w benchmarku.
Przy podpowiedziach w linii opóźnienie wygrywa z rozmiarem — mały model dostrojony pod FIM tuż przy kursorze bije duży model czatowy, który odpowiada dwie sekundy.
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Qwen3-Coder 8B Najlepszy mały koder — Dostrojony pod FIM, z bieżącej generacji, wygodny na dowolnej karcie 8 GB — domyślny wybór i do autouzupełniania, i do lekkiego czatu na skromnym sprzęcie. ollama pull qwen3-coder:8b | 5.6 GB | 8 GB GPU (RTX 3060/4060) Mac: 16 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| StarCoder 2 15B Starszy średniak — Wciąż kompetentny model kodu obsługujący 600 języków, na karty 12 GB — choć Qwen3-Coder 8B bije go w większości zadań przy połowie rozmiaru. ollama pull starcoder2:15b | 10.2 GB | 12 GB GPU (RTX 3060 12GB / 4070) Mac: 16 GB pamięci zunifikowanej | 16K | BigCode OpenRAIL-M |
| StarCoder 2 3B Najszybsze autouzupełnianie — Koń pociągowy autouzupełniania: około 180 tok/s na kartach ze średniej półki oznacza podpowiedzi, które nadążają za twoim pisaniem. Sparuj go z większym modelem czatowym. ollama pull starcoder2:3b | 2.6 GB | 8 GB GPU (RTX 3060/4060) Mac: 16 GB pamięci zunifikowanej | 16K | BigCode OpenRAIL-M |
Absolutni liderzy otwartych wag — DeepSeek V4-Pro (około 80% na SWE-bench Verified), GLM-5.x i Kimi K2.x, wszystkie na licencji MIT — chcą sprzętu wielokartowego klasy 80 GB. Dla programisty pracującego w pojedynkę to modele do API, nie modele lokalne. Układ, który wygrywa w 2026: szybki lokalny koder do wewnętrznej pętli pracy (autouzupełnianie, drobne edycje, kod, który nie może wyjść na zewnątrz) plus model z czołówki przez API do najtrudniejszych pięciu procent problemów. Nasz katalog chmurowej AI pokazuje, gdzie każdy z tych modeli jest hostowany i ile kosztuje za token.
Jak wybierać z tych tabel. Wychodź od swojego VRAM-u, nie od rankingu: weź największy koder agentowy, który twój próg uciągnie bez zadyszki, dołóż StarCoder2 3B albo Qwen3-Coder 8B do autouzupełniania, jeśli karta ma jeszcze zapas, i sprawdź dokładne dopasowanie do swojego GPU — łącznie z opcjami kwantyzacji i zapasem na długość kontekstu — w kalkulatorze zgodności. Potem wepnij to w edytor według naszego przewodnika krok po kroku.
Na progu 24 GB lokalne kodowanie robi się naprawdę dobre, a rządzą tam dwie karty: RTX 4090 i używany RTX 3090 jako budżetowa droga do tej samej ilości VRAM-u. Przy budżecie na 16 GB RTX 4060 Ti 16GB uciągnie Devstral-2 22B i Qwen3-Coder 8B obok siebie.
Sprzęt nie dociąga do modelu, na który masz ochotę? Wynajmij kartę 24–48 GB na godziny za kilka dolarów i przetestuj dokładnie ten model, zanim cokolwiek kupisz.
Pełna lista w katalogu chmurowej AI.