Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026
Domowy serwer z lokalnym LLM uruchamia Ollama na jednej stale włączonej maszynie i udostępnia ją Twojemu telefonowi lub laptopowi z dowolnego miejsca przez Tailscale — bez otwierania portów i bez kont
Domowy serwer z lokalnym LLM uruchamia Ollama na jednej stale włączonej maszynie i udostępnia ją Twojemu telefonowi lub laptopowi z dowolnego miejsca przez Tailscale — bez otwierania portów i bez kont w chmurze, które miałyby dostęp do Twoich promptów. Ten poradnik konfiguruje serwer, porządny interfejs czatu, serwowanie wielu modeli i bezpieczny dostęp zdalny w mniej więcej godzinę.
Ostatnia aktualizacja: lipiec 2026
Jedna maszyna w szafie uruchamia Twoje modele 24 godziny na dobę; każde Twoje urządzenie rozmawia z nią przez szyfrowaną sieć prywatną. Od naszego poradnika o konfiguracji lokalnego API różni się to zakresem: tamten wystawia endpoint na localhost dla Twoich własnych skryptów — ten zamienia maszynę w trwałą, wielomodelową usługę dla wszystkich Twoich urządzeń, wszędzie.
Rzecz nienegocjowalna: nigdy nie przekierowuj portu Ollama do internetu. API Ollama nie ma żadnego uwierzytelniania — każdy, kto znajdzie port, może uruchamiać Twoje modele, usuwać je albo pobrać na Twój dysk 100 GB nowych. Boty skanujące internet znajdują wystawiony port 11434 w ciągu godzin; dokładnie do tego służy sieć VPN typu mesh, taka jak Tailscale.
Zadziała każda maszyna, która uruchamia Twoje docelowe modele; praca non stop przesuwa priorytety w stronę poboru mocy na biegu jałowym i ciszy:
Dwie rzeczy potrafią tu ugryźć i każda ma własną stronę: magazyn modeli domyślnie ląduje na głównym systemie plików, a API na localhoście oraz — na maszynie z Windowsem — powiązanie z siecią LAN wymaga OLLAMA_HOST *i* zawężonej reguły zapory.
Zainstaluj Ollama, a potem spraw, by nasłuchiwała na wszystkich interfejsach, żeby inne urządzenia mogły się z nią połączyć (za granicę bezpieczeństwa odpowie Tailscale):
# Linux (systemd) - ustaw zmienną środowiskową dla usługi
sudo systemctl edit ollama
# dodaj:
# [Service]
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_KEEP_ALIVE=30m"
sudo systemctl restart ollama
# macOS - ustaw dla aplikacji i uruchom ją ponownie
launchctl setenv OLLAMA_HOST 0.0.0.0:11434
Pobierz raczej niewielką stajnię modeli niż jednego olbrzyma — domowy serwer błyszczy wtedy, gdy do każdego zadania ma załadowane właściwe narzędzie:
ollama pull llama3.1:8b # ogólna rozmowa
ollama pull qwen2.5-coder:7b # pytania o kod
ollama pull qwen2.5:14b # cięższe rozumowanie, jeśli pozwala RAM
Zachowaniem przy wielu modelach sterują dwie zmienne środowiskowe: OLLAMA_MAX_LOADED_MODELS (domyślnie tyle, ile pozwala VRAM; Ollama wymienia modele na żądanie) oraz OLLAMA_KEEP_ALIVE (jak długo model pozostaje rozgrzany — 30m to dobre ustawienie serwerowe; domyślne 5 minut powoduje zimne starty między sesjami).
Open WebUI daje każdemu urządzeniu interfejs klasy ChatGPT — historię czatu, przełącznik modeli, wgrywanie dokumentów z RAG i własną warstwę logowania:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data \
--name open-webui --restart always \
ghcr.io/open-webui/open-webui:main
Otwórz http://localhost:3000, załóż konto administratora i sprawdź, czy Twoje modele pojawiają się na liście rozwijanej.
Tailscale buduje sieć mesh opartą na WireGuardzie między Twoimi urządzeniami — każda maszyna dostaje stały prywatny adres 100.x.y.z, który działa z dowolnej sieci, bez ani jednego wystawionego portu. Darmowy plan pokrywa cały ten scenariusz.
# Na serwerze (Linux; Mac/Windows: zainstaluj aplikację)
curl -fsSL https://tailscale.com/install.sh | sh
sudo tailscale up
# Zanotuj adres serwera w tailnecie
tailscale ip -4 # np. 100.101.102.103
Zainstaluj aplikację Tailscale na telefonie i laptopie, zaloguj się na to samo konto i gotowe: z dowolnego miejsca na świecie adres http://100.101.102.103:3000 (albo nazwa MagicDNS, np. http://homeserver:3000) otwiera Twojego prywatnego ChatGPT.
Opcjonalne wykończenie — serwowanie przez HTTPS z zaufanym certyfikatem wewnątrz Twojego tailnetu:
tailscale serve --bg 3000
# teraz dostępne pod https://homeserver.your-tailnet.ts.net
http://twoj-serwer:11434, który jest teraz osiągalny przez tailnet.base_url=http://twoj-serwer:11434/v1 — schematy z poradnika o lokalnym API obowiązują bez zmian, tylko z nazwą hosta z tailnetu.ollama --version z wydaniami; Open WebUI aktualizujesz, pobierając nowy obraz. Ustaw przypomnienie w kalendarzu — samodzielny hosting oznacza samodzielne łatanie.ollama list i porządki co kwartał, bo inaczej odkryjesz pełny dysk w najgorszym momencie (rozwiązywanie problemów z miejscem na dysku).docker volume albo wbudowany eksport. Modele nie potrzebują kopii — pobierzesz je ponownie (albo zobacz przenoszenie modeli między maszynami).Umieść oba urządzenia w tailnecie Tailscale, uruchom na serwerze interfejs w rodzaju Open WebUI i otwórz z telefonu adres serwera w tailnecie. Dostajesz szyfrowany dostęp z dowolnej sieci bez wystawiania choćby jednego portu do internetu.
W domowym Wi-Fi zwykłe OLLAMA_HOST=0.0.0.0 plus adres LAN serwera działa bez zarzutu. Tailscale dokłada część „z dowolnego miejsca” — kawiarnia, biuro, transmisja komórkowa — zawsze pod tym samym adresem, plus szyfrowanie w niezaufanych sieciach. Ręcznie skonfigurowany WireGuard daje to samo, tylko większym nakładem pracy.
Tak. Open WebUI obsługuje wiele kont, a Ollama kolejkuje równoczesne żądania (ustaw OLLAMA_NUM_PARALLEL, by obsługiwać kilka naraz, jeśli pozwala na to VRAM). Dla gospodarstwa domowego jest to rozwiązanie idealne; powyżej mniej więcej 5 naprawdę równoczesnych, wymagających użytkowników sięgnij po serwowanie klasy vLLM.
Maszyna klasy Mac Mini: 1–3 USD miesięcznie na prąd. Wieża z dużym GPU: 8–17 USD miesięcznie, głównie z powodu poboru na biegu jałowym. Poradnik o kosztach prądu zawiera tabele dla poszczególnych klas sprzętu i ustawienia, które obniżają ten koszt.