Autor: Jakub Rusinowski · Ostatnia aktualizacja 2026-08-04 · Wartości sprzętowe wyliczone naszym silnikiem VRAM
Qwen3-Coder 8B ruszy na dowolnej karcie 8 GB (`ollama pull qwen3-coder:8b`). Wersja 80B-A3B — najlepszy koder, jakiego większość ludzi postawi u siebie — chce około 49 GB, żeby zmieścić się w całości w VRAM-ie (2×24 GB albo Mac od 96 GB), ale działa też na jakichś 8 GB VRAM plus 32 GB RAM-u dzięki offloadowi ekspertów w llama.cpp. Flagowy 480B-A35B potrzebuje około 290 GB: podziwiaj go przez API. Wszystkie trzy są na Apache 2.0.
Qwen3-Coder to rodzina, którą ten dział poleca częściej niż jakąkolwiek inną, z jednego powodu: to najmocniejsza *dedykowana* otwarta linia kodująca, jaką faktycznie da się pobrać — flagowy 480B ustanowił otwarty szczyt na SWE-bench Verified (69,6%), a mniejsze rozmiary dziedziczą po jego treningu. Apache 2.0 w całej linii, obsługa fill-in-the-middle pod autouzupełnianie i pierwszoklasowe tagi w Ollamie.\n\nRodzina rozpina się na 36-krotnej różnicy rozmiaru, więc „czy to uruchomię?” ma trzy bardzo różne odpowiedzi:
Wartości Q4_K_M z naszego silnika obliczeniowego. Wiersz 80B-A3B pokazuje wariant z całością w VRAM-ie, czyli ten najszybszy — zobacz sekcję o offloadzie poniżej.
| Model | VRAM (Q4) | Uruchomi się na | Kontekst | Licencja |
|---|---|---|---|---|
| Qwen3-Coder 8B Ten, którego uruchomi każdy — Jakość bieżącej generacji na karcie 8 GB; dostrojony pod FIM, więc służy zarazem za model do autouzupełniania. ollama pull qwen3-coder:8b | 5.6 GB | 8 GB GPU (RTX 3060/4060) Mac: 16 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| Qwen3-Coder 80B-A3B (MoE) Nagroda dla stawiających u siebie — Około 96% jakości flagowca; 3B aktywnych parametrów sprawia, że generuje szybciej niż gęste modele o połowę mniejsze. ollama pull qwen3-coder:80b-a3b-q4 | 49.1 GB | 2×48 GB GPUs / big unified memory Mac: 96 GB pamięci zunifikowanej | 125K | Apache-2.0 |
| Qwen3-Coder 480B-A35B (MoE) Model do API — Otwarty szczyt w chwili wydania — i około 290 GB przy Q4. Sprzęt serwerowy albo hostowany endpoint. ollama pull qwen3-coder:480b-a35b | 290.6 GB | Multi-GPU server — or use an API Mac: 512 GB pamięci zunifikowanej | 256K | Apache-2.0 |
Przy zainstalowanej Ollamie:
ollama pull qwen3-coder:8b
ollama run qwen3-coder:8b "refactor this to use a context manager: ..."
A dla 80B na odpowiednim sprzęcie:
ollama pull qwen3-coder:80b-a3b-q4
Potem wepnij go w VS Code przez Continue albo Cline — konfigurację opisuje przewodnik od zera do działania. Do pracy agentowej podnieś okno kontekstu (minimum 16K), tak jak tam napisano; Qwen3-Coder obsługuje długie konteksty, ale prawdziwym sufitem jest VRAM zajęty przez cache KV — dokładną parę karta plus kontekst policz w kalkulatorze.
Ponieważ na token aktywuje się tylko jakieś 3B parametrów, llama.cpp (a w nowszych wydaniach także Ollama) potrafi trzymać wspólne warstwy plus aktywnych ekspertów w VRAM-ie, a resztę stronicować z RAM-u systemowego. W praktyce: jakieś 8 GB VRAM plus 32 GB RAM-u systemowego uruchamia 80B-A3B z szybkością używalną, choć nie żwawą — parę tokenów na sekundę wolniej niż przy całości w VRAM-ie, ale w jakości dramatycznie lepiej niż wszystko inne, czego dotknie karta 8 GB.\n\nKiedy się opłaca: przy zadaniach zleconych, gdy odpalasz robotę w Aiderze albo Cline i przeglądasz wynik. Kiedy nie: przy interaktywnym autouzupełnianiu — do tego zostaw 8B. To obecnie najlepsza sztuczka „jakość za pieniądze” w lokalnym kodowaniu i dlatego RAM systemowy wpisujemy jako pełnoprawny parametr, a nie dodatek na doczepkę.
8B jest zadowolony niemal ze wszystkiego; to przez 80B-A3B w całości w VRAM-ie karty 24 GB kupuje się parami. Jeśli specyfikujesz maszynę wokół tej linii modeli:
Chcesz poczuć 80B-A3B, zanim zwiążesz się sprzętem? Wynajmij na godzinę instancję od 48 GB wzwyż i puść go z całością w VRAM-ie.
Pełna lista w katalogu chmurowej AI.