Qwen3-Coder lokalnie: 8B, 80B-A3B i pytanie o 480B

Autor: Jakub Rusinowski · Ostatnia aktualizacja 2026-08-04 · Wartości sprzętowe wyliczone naszym silnikiem VRAM

Qwen3-Coder 8B ruszy na dowolnej karcie 8 GB (`ollama pull qwen3-coder:8b`). Wersja 80B-A3B — najlepszy koder, jakiego większość ludzi postawi u siebie — chce około 49 GB, żeby zmieścić się w całości w VRAM-ie (2×24 GB albo Mac od 96 GB), ale działa też na jakichś 8 GB VRAM plus 32 GB RAM-u dzięki offloadowi ekspertów w llama.cpp. Flagowy 480B-A35B potrzebuje około 290 GB: podziwiaj go przez API. Wszystkie trzy są na Apache 2.0.

Qwen3-Coder to rodzina, którą ten dział poleca częściej niż jakąkolwiek inną, z jednego powodu: to najmocniejsza *dedykowana* otwarta linia kodująca, jaką faktycznie da się pobrać — flagowy 480B ustanowił otwarty szczyt na SWE-bench Verified (69,6%), a mniejsze rozmiary dziedziczą po jego treningu. Apache 2.0 w całej linii, obsługa fill-in-the-middle pod autouzupełnianie i pierwszoklasowe tagi w Ollamie.\n\nRodzina rozpina się na 36-krotnej różnicy rozmiaru, więc „czy to uruchomię?” ma trzy bardzo różne odpowiedzi:

Trzy rozmiary, uczciwie

Wartości Q4_K_M z naszego silnika obliczeniowego. Wiersz 80B-A3B pokazuje wariant z całością w VRAM-ie, czyli ten najszybszy — zobacz sekcję o offloadzie poniżej.

ModelVRAM (Q4)Uruchomi się naKontekstLicencja
Qwen3-Coder 8B
Ten, którego uruchomi każdy — Jakość bieżącej generacji na karcie 8 GB; dostrojony pod FIM, więc służy zarazem za model do autouzupełniania.
ollama pull qwen3-coder:8b
5.6 GB8 GB GPU (RTX 3060/4060)
Mac: 16 GB pamięci zunifikowanej
125KApache-2.0
Qwen3-Coder 80B-A3B (MoE)
Nagroda dla stawiających u siebie — Około 96% jakości flagowca; 3B aktywnych parametrów sprawia, że generuje szybciej niż gęste modele o połowę mniejsze.
ollama pull qwen3-coder:80b-a3b-q4
49.1 GB2×48 GB GPUs / big unified memory
Mac: 96 GB pamięci zunifikowanej
125KApache-2.0
Qwen3-Coder 480B-A35B (MoE)
Model do API — Otwarty szczyt w chwili wydania — i około 290 GB przy Q4. Sprzęt serwerowy albo hostowany endpoint.
ollama pull qwen3-coder:480b-a35b
290.6 GBMulti-GPU server — or use an API
Mac: 512 GB pamięci zunifikowanej
256KApache-2.0

Start w dwóch poleceniach

Przy zainstalowanej Ollamie:

ollama pull qwen3-coder:8b
ollama run qwen3-coder:8b "refactor this to use a context manager: ..."

A dla 80B na odpowiednim sprzęcie:

ollama pull qwen3-coder:80b-a3b-q4

Potem wepnij go w VS Code przez Continue albo Cline — konfigurację opisuje przewodnik od zera do działania. Do pracy agentowej podnieś okno kontekstu (minimum 16K), tak jak tam napisano; Qwen3-Coder obsługuje długie konteksty, ale prawdziwym sufitem jest VRAM zajęty przez cache KV — dokładną parę karta plus kontekst policz w kalkulatorze.

Sztuczka z offloadem ekspertów: 80B-A3B na pececie do gier

Ponieważ na token aktywuje się tylko jakieś 3B parametrów, llama.cpp (a w nowszych wydaniach także Ollama) potrafi trzymać wspólne warstwy plus aktywnych ekspertów w VRAM-ie, a resztę stronicować z RAM-u systemowego. W praktyce: jakieś 8 GB VRAM plus 32 GB RAM-u systemowego uruchamia 80B-A3B z szybkością używalną, choć nie żwawą — parę tokenów na sekundę wolniej niż przy całości w VRAM-ie, ale w jakości dramatycznie lepiej niż wszystko inne, czego dotknie karta 8 GB.\n\nKiedy się opłaca: przy zadaniach zleconych, gdy odpalasz robotę w Aiderze albo Cline i przeglądasz wynik. Kiedy nie: przy interaktywnym autouzupełnianiu — do tego zostaw 8B. To obecnie najlepsza sztuczka „jakość za pieniądze” w lokalnym kodowaniu i dlatego RAM systemowy wpisujemy jako pełnoprawny parametr, a nie dodatek na doczepkę.

Który rozmiar uruchomić?

Sprzęt pasujący do tej rodziny

8B jest zadowolony niemal ze wszystkiego; to przez 80B-A3B w całości w VRAM-ie karty 24 GB kupuje się parami. Jeśli specyfikujesz maszynę wokół tej linii modeli:

Ujawnienie afiliacyjne: Niektóre odnośniki na tej stronie to linki afiliacyjne — jeśli dokonasz zakupu za ich pośrednictwem, LLM Configurator może otrzymać prowizję bez dodatkowych kosztów dla Ciebie. Jako uczestnik programu Amazon Associates, LLM Configurator zarabia na kwalifikujących się zakupach.
NVIDIA GeForce RTX 4090 24GB
24 GB VRAM · 450 W board power
Ceny w 2026 są niestabilne — sprawdź aktualną ofertę.
Sprawdź cenę na Amazon
Apple Mac Studio M4 Max
128 GB VRAM · 35 W board power
Ceny w 2026 są niestabilne — sprawdź aktualną ofertę.
Sprawdź cenę na Amazon

Nie masz sprzętu? Najpierw wynajmij kartę

Chcesz poczuć 80B-A3B, zanim zwiążesz się sprzętem? Wynajmij na godzinę instancję od 48 GB wzwyż i puść go z całością w VRAM-ie.

Pełna lista w katalogu chmurowej AI.

Najczęstsze pytania

Jakiego sprzętu potrzebuję, żeby uruchomić Qwen3-Coder?
Wersja 8B: dowolna karta 8 GB albo Mac 16 GB (około 6 GB przy Q4). Wersja 80B-A3B: około 49 GB przy całości w VRAM-ie — dwie karty po 24 GB albo Mac od 96 GB — albo jakieś 8 GB VRAM plus 32 GB RAM-u systemowego z offloadem ekspertów. Wersja 480B-A35B: około 290 GB, czyli serwery wielokartowe albo hostowane API.
Czy Qwen3-Coder jest lepszy od Qwen 2.5 Coder 32B?
W przeliczeniu na parametr tak — jest o generację nowszy. Ale linie nie nakładają się czysto: na pojedynczej karcie 24 GB Qwen 2.5 Coder 32B (około 20 GB) wciąż jest największym dedykowanym koderem, jaki się zmieści, podczas gdy 8B z Qwen3-Coder wygrywa mały próg, a 80B-A3B wszystko powyżej 24 GB. Między progami przetestuj oba na własnym kodzie.
Czy Qwen3-Coder wolno stosować komercyjnie?
Tak — cała rodzina wychodzi na Apache 2.0, bez ograniczeń produkcyjnych (w odróżnieniu od MNPL Codestrala). Możesz go uruchamiać przy pracy dla klienta, wewnątrz firmy albo osadzonego w produkcie.
Czy Qwen3-Coder nadaje się do autouzupełniania (FIM)?
Tak — cała rodzina jest trenowana pod fill-in-the-middle, a 8B jest na karcie 8 GB dostatecznie szybki, żeby służyć w Continue wprost jako model do podpowiedzi. Przy ciaśniejszym VRAM-ie albo gdy zależy ci na najniższym opóźnieniu, dedykowanym pomocnikiem pozostaje StarCoder2 3B.

Co dalej