Lokalny agent kodujący od zera do działania: Ollama + Qwen3-Coder + VS Code

Autor: Jakub Rusinowski · Ostatnia aktualizacja 2026-08-04 · Wartości sprzętowe wyliczone naszym silnikiem VRAM

Kompletny lokalny agent kodujący to trzy elementy: Ollama serwująca model do kodowania (Qwen3-Coder 8B na 8 GB VRAM, Qwen 3.6 27B na 24 GB), rozszerzenie do edytora, które z nią rozmawia (Continue do czatu i autouzupełniania, Cline do autonomicznych zadań na wielu plikach) oraz mały model autouzupełniania działający obok. Konfiguracja zajmuje 30–45 minut razem z pobieraniem; nic nie opuszcza twojej maszyny.

Ten przewodnik spina cały stack od początku do końca, na Windowsie, macOS-ie albo Linuksie. Na koniec VS Code dostanie podpowiedzi ghost text w stylu Copilota, czat typu „zaznacz i zapytaj” oraz agenta, który potrafi zaplanować i wykonać zmiany w wielu plikach — wszystko serwowane z twojego własnego GPU, działające w samolocie i nie kosztujące ani grosza miesięcznie.

Jeśli nie masz jeszcze wybranego modelu, przejrzyj najpierw najlepsze lokalne modele do kodowania według progu VRAM albo po prostu weź domyślne propozycje poniżej — są dobrane pod progi sprzętowe, a model podmienisz później jedną linijką konfiguracji.

1. Sprawdź, co uciągnie twój sprzęt

Skonfrontuj swoje GPU albo Maca z kalkulatorem zgodności — liczy VRAM tą samą matematyką co ten przewodnik. Progi, pod które celuje ten tekst: 8 GB VRAM → Qwen3-Coder 8B; 16 GB → Devstral-2 22B; 24 GB → Qwen 3.6 27B albo Qwen 2.5 Coder 32B; Mac 96 GB+ / 2×24 GB → Qwen3-Coder 80B-A3B. Na każdym progu, gdzie zostają wolne jakieś 3 GB, dołóż StarCoder2 3B do autouzupełniania.

2. Zainstaluj Ollamę

Pobierz z ollama.com (instalatory dla macOS i Windowsa albo polecenie w jednej linii dla Linuksa) — pełny opis znajdziesz w naszym przewodniku instalacji Ollamy. Sprawdź, czy serwuje:

ollama --version
curl http://localhost:11434

Drugie polecenie powinno odpowiedzieć „Ollama is running”. Ten lokalny endpoint HTTP (port 11434) to właśnie adres, z którym będą rozmawiać rozszerzenia edytora.

3. Pobierz model czatowy/agentowy pod swój próg

Pobierz model odpowiadający progowi sprzętowemu z kroku 1:

# 8 GB VRAM
ollama pull qwen3-coder:8b
# 16 GB VRAM
ollama pull devstral:22b
# 24 GB VRAM
ollama pull qwen3.6:27b
# Mac 96GB+ unified / 2x24 GB
ollama pull qwen3-coder:80b-a3b-q4

Przetestuj go, zanim tkniesz edytor: ollama run qwen3-coder:8b "write a python function that merges two sorted lists". Jeśli tokeny lecą w tempie wygodnego czytania albo szybciej, jest dobrze.

4. Pobierz mały model do autouzupełniania

Podpowiedzi w linii to gra o opóźnienie, nie o jakość — model 3B odpowiadający w 150 ms bije model 27B, który potrzebuje dwóch sekund. Obok modelu czatowego uruchom dedykowany model fill-in-the-middle:

ollama pull starcoder2:3b

Pomiń ten krok tylko wtedy, gdy twoje GPU siedzi już na granicy VRAM-u — Continue awaryjnie użyje wtedy do podpowiedzi modelu czatowego (wolniej, ale działa).

5. Zainstaluj Continue w VS Code i wskaż mu Ollamę

Zainstaluj Continue z marketplace'u VS Code (jest też wersja dla JetBrains). Otwórz konfigurację (ikona koła zębatego → config.yaml) i zarejestruj oba modele:

models:
  - name: Qwen3-Coder (local)
    provider: ollama
    model: qwen3-coder:8b        # podmień na model ze swojego progu
    roles: [chat, edit, apply]
  - name: StarCoder2 autocomplete
    provider: ollama
    model: starcoder2:3b
    roles: [autocomplete]

I to cała integracja: podpowiedzi ghost text w trakcie pisania, Cmd/Ctrl+L do czatu o zaznaczonym kodzie, Cmd/Ctrl+I do edycji w miejscu.

6. Dołóż Cline do autonomicznych zadań na wielu plikach (opcjonalnie)

Continue asystuje; Cline jest agentem — dostaje zadanie, planuje, edytuje w wielu plikach, uruchamia polecenia i pokazuje ci diffy do zatwierdzenia. Zainstaluj Cline z marketplace'u, ustaw dostawcę API na Ollama i wybierz swój model czatowy. Jedno uczciwe zastrzeżenie: pętle agentowe błyskawicznie palą kontekst i mocno opierają się na możliwościach modelu. Na sprzęcie 8 GB trzymaj zadania małe i w obrębie jednego pliku; im większy model na twoim progu, tym więcej autonomii faktycznie działa. Który tool pasuje do jakiego trybu pracy, rozpisaliśmy w Continue kontra Cline kontra Aider.

7. Podnieś okno kontekstu

Ollama domyślnie ustawia małe okno kontekstu, a agenty kodujące pożerają kontekst (prompt systemowy + zawartość plików + diffy). Podnieś je dla danego modelu:

OLLAMA_CONTEXT_LENGTH=16384 ollama serve

albo ustaw num_ctx w Modelfile. 16K to sensowna dolna granica do pracy agentowej; wyżej idź tylko wtedy, gdy pozwala VRAM — cache KV rośnie razem z kontekstem, dlatego kalkulator zgodności pozwala jawnie wpisać długość kontekstu.

8. Sprawdź pętlę i ustaw sobie oczekiwania

Test na żywo: otwórz projekt, poproś Continue o wyjaśnienie funkcji, przyjmij kilka podpowiedzi, a potem daj Cline'owi małe zadanie („dodaj walidację wejścia do tego endpointu i zaktualizuj jego test”). Jeśli podpowiedzi wloką się w miejscu, zejdź na mniejszy model autouzupełniania albo niższą kwantyzację. Jeśli edycje agenta zaczynają się rozjeżdżać, zwykle znaczy to, że model jest za mały do zadania, a nie że narzędzia zawodzą — sprawdź na liście modeli według progu, co twój sprzęt sensownie uciągnie, albo wynajmij większą kartę na jedno popołudnie przez katalog chmurowy i poczuj różnicę, zanim zdecydujesz się na zakup.

Najczęstsze pytania

Czy do lokalnego asystenta kodowania potrzebne jest GPU?
Nie, ale zmienia ono wszystko. Wnioskowanie na samym procesorze uciągnie Qwen3-Coder 8B z prędkością kilku tokenów na sekundę — do czatu wystarczy, do autouzupełniania jest zdecydowanie za wolno. Dowolna karta 8 GB (albo Mac na Apple Silicon z 16 GB pamięci zunifikowanej) sprawia, że cały stack — podpowiedzi plus czat — reaguje natychmiast.
Które rozszerzenie do VS Code jest lepsze przy lokalnych modelach: Continue czy Cline?
Rozwiązują różne problemy i spokojnie chodzą obok siebie. Continue zastępuje Copilota (autouzupełnianie, czat, edycje w miejscu) i to jego instaluje się jako pierwszy. Cline to autonomiczny agent do zadań rozłożonych na wiele plików — lepszy przy większych modelach, przerost formy przy zwykłych podpowiedziach. Aider robi to samo co Cline, tylko z poziomu terminala.
Czy zamiast Ollamy mogę użyć LM Studio?
Tak — LM Studio wystawia lokalny serwer w tym samym stylu, zgodny z API OpenAI (domyślnie port 1234), a Continue i Cline obsługują go jako dostawcę. Ollama jest wygodniejsza jako usługa chodząca stale w tle; LM Studio jest przyjemniejsze do przeglądania i testowania modeli. Same modele to identyczne pliki GGUF.
Ile kosztuje utrzymanie lokalnego agenta kodującego?
Po stronie kosztów bieżących właściwie tylko prąd — karta 24 GB kodująca cały dzień to kilka dolarów miesięcznie, wobec 10 USD miesięcznie za Copilot Pro albo 20 USD miesięcznie za Cursor Pro, i tak bez końca. Jeśli GPU już masz, zwrot jest natychmiastowy; jeśli nie, rachunek progu opłacalności znajdziesz w naszym porównaniu kosztów.
Czy przy takiej konfiguracji jakikolwiek fragment mojego kodu opuszcza maszynę?
Nie. Ollama serwuje na localhoście, a gdy Continue i Cline są na nią wycelowane, prompty, kontekst kodu i podpowiedzi zostają na twoim sprzęcie. To główny argument za lokalnymi agentami kodującymi w bazach kodu wrażliwych na prywatność — pracy dla klienta objętej NDA, niewydanych produktów, branż regulowanych.

Co dalej