Domowy serwer z lokalnym LLM: AI dostępne non stop przez Tailscale

Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026

Domowy serwer z lokalnym LLM uruchamia Ollama na jednej stale włączonej maszynie i udostępnia ją Twojemu telefonowi lub laptopowi z dowolnego miejsca przez Tailscale — bez otwierania portów i bez kont

W tym przewodniku

Domowy serwer z lokalnym LLM uruchamia Ollama na jednej stale włączonej maszynie i udostępnia ją Twojemu telefonowi lub laptopowi z dowolnego miejsca przez Tailscale — bez otwierania portów i bez kont w chmurze, które miałyby dostęp do Twoich promptów. Ten poradnik konfiguruje serwer, porządny interfejs czatu, serwowanie wielu modeli i bezpieczny dostęp zdalny w mniej więcej godzinę.

Ostatnia aktualizacja: lipiec 2026

Co budujesz (i dlaczego nie zwykłe przekierowanie portu)

Jedna maszyna w szafie uruchamia Twoje modele 24 godziny na dobę; każde Twoje urządzenie rozmawia z nią przez szyfrowaną sieć prywatną. Od naszego poradnika o konfiguracji lokalnego API różni się to zakresem: tamten wystawia endpoint na localhost dla Twoich własnych skryptów — ten zamienia maszynę w trwałą, wielomodelową usługę dla wszystkich Twoich urządzeń, wszędzie.

Rzecz nienegocjowalna: nigdy nie przekierowuj portu Ollama do internetu. API Ollama nie ma żadnego uwierzytelniania — każdy, kto znajdzie port, może uruchamiać Twoje modele, usuwać je albo pobrać na Twój dysk 100 GB nowych. Boty skanujące internet znajdują wystawiony port 11434 w ciągu godzin; dokładnie do tego służy sieć VPN typu mesh, taka jak Tailscale.

Krok 1 — Wybierz sprzęt serwerowy

Zadziała każda maszyna, która uruchamia Twoje docelowe modele; praca non stop przesuwa priorytety w stronę poboru mocy na biegu jałowym i ciszy:

Krok 2 — Ollama jako pełnoprawna usługa

Dwie rzeczy potrafią tu ugryźć i każda ma własną stronę: magazyn modeli domyślnie ląduje na głównym systemie plików, a API na localhoście oraz — na maszynie z Windowsem — powiązanie z siecią LAN wymaga OLLAMA_HOST *i* zawężonej reguły zapory.

Zainstaluj Ollama, a potem spraw, by nasłuchiwała na wszystkich interfejsach, żeby inne urządzenia mogły się z nią połączyć (za granicę bezpieczeństwa odpowie Tailscale):

# Linux (systemd) - ustaw zmienną środowiskową dla usługi
sudo systemctl edit ollama
# dodaj:
#   [Service]
#   Environment="OLLAMA_HOST=0.0.0.0:11434"
#   Environment="OLLAMA_KEEP_ALIVE=30m"
sudo systemctl restart ollama

# macOS - ustaw dla aplikacji i uruchom ją ponownie
launchctl setenv OLLAMA_HOST 0.0.0.0:11434

Pobierz raczej niewielką stajnię modeli niż jednego olbrzyma — domowy serwer błyszczy wtedy, gdy do każdego zadania ma załadowane właściwe narzędzie:

ollama pull llama3.1:8b        # ogólna rozmowa
ollama pull qwen2.5-coder:7b   # pytania o kod
ollama pull qwen2.5:14b        # cięższe rozumowanie, jeśli pozwala RAM

Zachowaniem przy wielu modelach sterują dwie zmienne środowiskowe: OLLAMA_MAX_LOADED_MODELS (domyślnie tyle, ile pozwala VRAM; Ollama wymienia modele na żądanie) oraz OLLAMA_KEEP_ALIVE (jak długo model pozostaje rozgrzany — 30m to dobre ustawienie serwerowe; domyślne 5 minut powoduje zimne starty między sesjami).

Krok 3 — Prawdziwy interfejs czatu: Open WebUI

Open WebUI daje każdemu urządzeniu interfejs klasy ChatGPT — historię czatu, przełącznik modeli, wgrywanie dokumentów z RAG i własną warstwę logowania:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Otwórz http://localhost:3000, załóż konto administratora i sprawdź, czy Twoje modele pojawiają się na liście rozwijanej.

Krok 4 — Tailscale: dostęp z dowolnego miejsca

Tailscale buduje sieć mesh opartą na WireGuardzie między Twoimi urządzeniami — każda maszyna dostaje stały prywatny adres 100.x.y.z, który działa z dowolnej sieci, bez ani jednego wystawionego portu. Darmowy plan pokrywa cały ten scenariusz.

# Na serwerze (Linux; Mac/Windows: zainstaluj aplikację)
curl -fsSL https://tailscale.com/install.sh | sh
sudo tailscale up

# Zanotuj adres serwera w tailnecie
tailscale ip -4     # np. 100.101.102.103

Zainstaluj aplikację Tailscale na telefonie i laptopie, zaloguj się na to samo konto i gotowe: z dowolnego miejsca na świecie adres http://100.101.102.103:3000 (albo nazwa MagicDNS, np. http://homeserver:3000) otwiera Twojego prywatnego ChatGPT.

Opcjonalne wykończenie — serwowanie przez HTTPS z zaufanym certyfikatem wewnątrz Twojego tailnetu:

tailscale serve --bg 3000
# teraz dostępne pod https://homeserver.your-tailnet.ts.net

Krok 5 — Podłącz swoje urządzenia

Eksploatacja: nudne, ale niezbędne

Najczęściej zadawane pytania

Jak uzyskać zdalny dostęp do Ollama z telefonu?

Umieść oba urządzenia w tailnecie Tailscale, uruchom na serwerze interfejs w rodzaju Open WebUI i otwórz z telefonu adres serwera w tailnecie. Dostajesz szyfrowany dostęp z dowolnej sieci bez wystawiania choćby jednego portu do internetu.

Czy Tailscale jest konieczny — nie wystarczy moja sieć LAN?

W domowym Wi-Fi zwykłe OLLAMA_HOST=0.0.0.0 plus adres LAN serwera działa bez zarzutu. Tailscale dokłada część „z dowolnego miejsca” — kawiarnia, biuro, transmisja komórkowa — zawsze pod tym samym adresem, plus szyfrowanie w niezaufanych sieciach. Ręcznie skonfigurowany WireGuard daje to samo, tylko większym nakładem pracy.

Czy z serwera może korzystać kilka osób naraz?

Tak. Open WebUI obsługuje wiele kont, a Ollama kolejkuje równoczesne żądania (ustaw OLLAMA_NUM_PARALLEL, by obsługiwać kilka naraz, jeśli pozwala na to VRAM). Dla gospodarstwa domowego jest to rozwiązanie idealne; powyżej mniej więcej 5 naprawdę równoczesnych, wymagających użytkowników sięgnij po serwowanie klasy vLLM.

Ile kosztuje utrzymanie serwera działającego non stop?

Maszyna klasy Mac Mini: 1–3 USD miesięcznie na prąd. Wieża z dużym GPU: 8–17 USD miesięcznie, głównie z powodu poboru na biegu jałowym. Poradnik o kosztach prądu zawiera tabele dla poszczególnych klas sprzętu i ustawienia, które obniżają ten koszt.

Powiązane poradniki

← Wszystkie przewodniki | Sprawdź zgodność GPU