Autor: Jakub Rusinowski · Ostatnia aktualizacja 2026-08-04 · Wartości sprzętowe wyliczone naszym silnikiem VRAM
Cline działa w pełni lokalnie: ustaw dostawcę API na Ollamę, wybierz model i podnieś okno kontekstu do co najmniej 16K — domyślny kontekst to zdecydowanie najczęstsza przyczyna niepowodzeń lokalnego Cline'a. Rzeczowo o modelach: pętle agentowe to najtrudniejsze obciążenie, przed jakim stają lokalne modele. Qwen 3.6 27B na karcie 24 GB to próg, na którym autonomia staje się godna zaufania, Devstral-2 22B na 16 GB to podłoga, a poniżej trzymaj zadania małe i w obrębie jednego pliku.
Cline to najbardziej wymagająca rzecz, o jaką możesz poprosić lokalny model. Pojedyncze zadanie oznacza: zrozumieć plan, przeczytać wiele plików, wyprodukować dokładne wywołania narzędzi, zareagować na wyjście poleceń i utrzymać spójność przez 50–100 tys. tokenów narastającego kontekstu. Modele z czołówki dostępne przez API sprawiają, że wygląda to łatwo; lokalne zamieniają to w uczciwy test możliwości.\n\nTo nie powód, żeby odpuścić lokalnego Cline'a — to powód, żeby skonfigurować go świadomie. Zrobione dobrze (właściwy próg modelu, podniesiony kontekst, zakreślone zadania), lokalny Cline wykonuje prawdziwą pracę przy pełnej prywatności i zerowym koszcie krańcowym. Ta strona to konfiguracja specyficzna dla lokalnej pracy i uczciwa lista progów; kiedy Cline w ogóle jest właściwym narzędziem, opisuje macierz narzędzi.
Zainstaluj Cline z marketplace'u VS Code. W ustawieniach wybierz Ollama jako dostawcę API — bazowy adres URL http://localhost:11434 — i wskaż swój model z wykrytej listy. Bez klucza API, bez konta. (LM Studio działa identycznie przez swój serwer zgodny z OpenAI na porcie 1234.)
# 24 GB — autonomia godna zaufania
ollama pull qwen3.6:27b
# 16 GB — podłoga pracy agentowej
ollama pull devstral:22b
# Stacja robocza / Mac od 96 GB — najlepszy lokalny Cline, jaki jest
ollama pull qwen3-coder:80b-a3b-q4
Poniżej 16 GB Cline technicznie ruszy na Qwen3-Coder 8B — traktuj go wtedy jak asystenta do jednego pliku wyposażonego w narzędzia, a nie jak autonomicznego agenta. Uzasadnienie progów: najlepsze lokalne modele do kodowania.
Domyślny kontekst Ollamy po cichu ucina prompt systemowy Cline'a i kontekst plików, dając klasyczne objawy: zapomniane instrukcje, zmyśloną zawartość plików, wywołania narzędzi odnoszące się do niczego. Utwórz wariant z długim kontekstem i wybierz go w Cline:
cat > Modelfile <<'EOF'
FROM qwen3.6:27b
PARAMETER num_ctx 32768
EOF
ollama create qwen3.6:27b-32k -f Modelfile
Uważaj na VRAM: 32K cache'u KV przy modelu 27B zjada kilka dodatkowych gigabajtów — kalkulator policzy dokładny koszt dla każdego rozmiaru kontekstu. Na kartach 16 GB sufitem, który jeszcze się mieści, jest zwykle 16K.
Lokalny Cline wygrywa przy zadaniach o wyraźnych granicach i sprawdzalnym rezultacie: „dodaj paginację do tego endpointu i zaktualizuj test”, a nie „popraw warstwę API”. Zacznij od trybu planowania (tanie tokeny, wyłapuje nieporozumienia przed edycjami), zatwierdzaj punkty kontrolne zamiast włączać automatyczną zgodę i trzymaj sesje krótkie: kontekst narasta, a lokalne modele degradują się w miarę jego zapełniania szybciej niż te z czołówki.
Uczciwie o awariach: zadanie raz po raz wykoleja się na modelu z twojego progu. Opcje, w kolejności kosztu: podziel zadanie na mniejsze; wejdź o próg modelu wyżej (albo puść Qwen3-Coder 80B-A3B z offloadem ekspertów, jeśli masz 32 GB RAM-u); albo wyceluj Cline w rozliczane API na to jedno zadanie — hybrydowy układ z naszego porównania kosztów istnieje dokładnie na te najtrudniejsze pięć procent. Repozytoria o krytycznej prywatności po prostu wybierają dwie pierwsze opcje.