Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026
Ollama to najprostsze narzędzie do rozpoczęcia pracy z lokalnymi modelami LLM. Pakuje wagi modelu, konfigurację i silnik uruchomieniowy w jeden plik wykonywalny.
Ollama to najprostsze narzędzie do rozpoczęcia pracy z lokalnymi modelami LLM. Pakuje wagi modelu, konfigurację i silnik uruchomieniowy w jeden plik wykonywalny.
1. Pobierz Ollama dla Windows. 2. Uruchom instalator .exe. 3. Po instalacji Ollama działa w tle (sprawdź zasobnik systemowy).
1. Pobierz Ollama dla macOS. 2. Rozpakuj plik i przenieś Ollama do folderu Aplikacje. 3. Otwórz aplikację. Może być konieczne zatwierdzenie jej w ustawieniach „Ochrona i prywatność”, jeśli pojawi się monit.
Uruchom w terminalu następujące polecenie:
curl -fsSL https://ollama.com/install.sh | sh
Ollama działa z poziomu wiersza poleceń (Terminal na Mac/Linux, PowerShell/CMD na Windows).
Aby pobrać i uruchomić popularny model Llama 3.1 8B, po prostu wpisz:
ollama run llama3.1
Ollama wykona kolejno: 1. Pobranie manifestu modelu. 2. Pobranie warstw modelu (ok. 4,7 GB). 3. Weryfikację sumy kontrolnej (hash). 4. Przejście do znaku zachęty czatu >>>.
Możesz już rozmawiać! Wpisz „Dlaczego niebo jest niebieskie?” i naciśnij Enter.
| Polecenie | Opis |
|---|---|
ollama list | Pokazuje wszystkie modele zainstalowane na komputerze. |
ollama pull [model] | Pobiera model, ale nie uruchamia go od razu. |
ollama rm [model] | Usuwa model, aby zwolnić miejsce na dysku. |
ollama serve | Ręcznie uruchamia usługę Ollama działającą w tle. |
Ollama v0.32 to duża aktualizacja pod pracę agentową i Apple Silicon. Instalator aktualizuje wersję w miejscu, więc uruchom go ponownie i potwierdź numer:
curl -fsSL https://ollama.com/install.sh | sh # macOS / Linux — aktualizacja w miejscu
ollama --version # oczekuj 0.32 albo nowszej
v0.32 dodaje interaktywny tryb agenta: model obsługujący wywoływanie narzędzi może teraz planować, wywoływać narzędzia i łączyć kroki w pętlę wprost z wiersza poleceń — bez zewnętrznego frameworka agentowego. Uruchom model z obsługą tool callingu i daj mu zadanie:
ollama run qwen3-coder:8b
W trybie agenta model może sięgać po zarejestrowane narzędzia (polecenia powłoki, odczyt i zapis plików, pobieranie z sieci) i iterować, dopóki zadanie nie zostanie wykonane. Wszystko dzieje się na twojej maszynie, więc kod źródłowy i dokumenty nigdy jej nie opuszczają — czyli dokładnie po to uruchamia się agenta lokalnie, a nie w chmurze. Jak podpiąć własne narzędzia, opisuje Budowanie autonomicznych agentów na lokalnych LLM-ach.
Wywoływanie narzędzi (funkcji) jest w v0.32 dużo bardziej konsekwentne, a Ollama mówi formatem tools zgodnym z OpenAI na swoim endpoincie /v1/chat/completions — więc istniejący kod na SDK OpenAI zadziała po samym przestawieniu adresu bazowego na http://localhost:11434/v1. Modele z mocną obsługą narzędzi to dziś między innymi Qwen3-Coder, Devstral-2, GLM-5, Kimi K2.x i Llama 4. Ustrukturyzowane wyjście JSON (format ze schematem JSON) też jest stabilniejsze — szczegóły w Niezawodny JSON z lokalnych LLM-ów i Postawienie lokalnego serwera API.
Na Macach z układami serii M v0.32 potrafi uruchamiać obsługiwane modele przez backend MLX (framework tablicowy Apple) obok domyślnego silnika llama.cpp. MLX korzysta z architektury pamięci zunifikowanej bardziej bezpośrednio i daje zauważalnie szybsze przetwarzanie promptu oraz generowanie tokenów na sprzęcie M3 i M4. Włącza się automatycznie dla obsługiwanych modeli na Apple Silicon, a przy modelu jeszcze nieprzygotowanym pod MLX wraca do standardowego silnika — nie ma tu czego konfigurować. Na Macu pilnuj pamięci: duże modele wciąż potrzebują pamięci zunifikowanej, żeby pomieścić wagi.
sudo systemctl start ollama).Skoro Ollama już działa, zajrzyj do Biblioteki modeli, aby znaleźć modele do pobrania.