Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026
Uruchamianie lokalnego LLM w trybie 24/7 kosztuje od 1 do 30 dolarów miesięcznie w prądzie, zależąc niemal wyłącznie od Twojego sprzętu: zawsze włączony Mac Mini kosztuje mniej niż lampka nocna, podcz
Uruchamianie lokalnego LLM w trybie 24/7 kosztuje od 1 do 30 dolarów miesięcznie w prądzie, zależąc niemal wyłącznie od Twojego sprzętu: zawsze włączony Mac Mini kosztuje mniej niż lampka nocna, podczas gdy wieża z dwoma GPU zbliża się do budżetu na serwis streamingowy. Ten przewodnik podaje realny pobór mocy na biegu jałowym i pod obciążeniem według poziomu GPU, wzór do wypełnienia własną stawką oraz dwa ustawienia, które najbardziej tną rachunek.
Ostatnia aktualizacja: lipiec 2026
Monthly cost = watts ÷ 1000 × hours per day × 30 × your rate per kWh
Przykład: PC, który na biegu jałowym pobiera 80W przez całą dobę, przy średniej amerykańskiej z 2026 roku ~0,17 USD/kWh: 80 ÷ 1000 × 24 × 30 × 0,17 = 9,79 USD/miesiąc — zanim GPU wykona jakąkolwiek rzeczywistą pracę.
Twoja stawka za prąd liczy się bardziej niż jakikolwiek wybór sprzętu w obrębie poziomu: średnia amerykańska to ~0,17 USD/kWh, Niemcy to mniej więcej dwa razy tyle, a taryfy strefowe potrafią wahać się 2x między południem a nocą. Sprawdź swój rachunek, a nie średnią krajową.
Wartości mierzone na gniazdku (cały system, nie samo GPU):
| System | Bieg jałowy | Wnioskowanie LLM | Uwagi |
|---|---|---|---|
| Mac Mini M4 | 4–7 W | 20–35 W | Mistrz wydajności 24/7 |
| Mac Studio M4 Max | 10–14 W | 55–90 W | Zdolny do 70B przy mocy laptopa |
| PC + RTX 3060 12GB | 45–60 W | 220–280 W | Typowa budżetowa wieża |
| PC + RTX 3090 | 60–85 W | 380–450 W | Wysoki bieg jałowy to ukryty koszt |
| PC + RTX 4090 | 55–75 W | 400–500 W | Szybkie zrywy, duże skoki przejściowe |
| PC + 2× RTX 3090 | 90–130 W | 700–850 W | Najpierw przeczytaj przewodnik multi-GPU |
Liczba, którą ludzie mylą: bieg jałowy. Osobisty serwer LLM spędza 95%+ dnia bezczynnie — model siedzi w pamięci, czekając. Bieg jałowy 70W wieży gamingowej kosztuje ~8,60 USD/miesiąc przy 0,17 USD/kWh, *nie robiąc nic*, podczas gdy bieg jałowy 5W Mac Mini kosztuje 0,61 USD. Zrywy wnioskowania ledwo się rejestrują w porównaniu: nawet dwie pełne godziny generowania dziennie na 4090 przy 450W dodają tylko ~4,60 USD/miesiąc.
Zakładając realistyczny cykl pracy osobistego asystenta (22h bieg jałowy + 2h aktywnego wnioskowania dziennie):
| System | @ $0,12/kWh | @ $0,17/kWh (śr. USA) | @ $0,30/kWh (mniej więcej UE) |
|---|---|---|---|
| Mac Mini M4 | $0,60 | $0,85 | $1,50 |
| Mac Studio M4 Max | $1,30 | $1,85 | $3,25 |
| PC + RTX 3060 | $3,90 | $5,50 | $9,70 |
| PC + RTX 3090 | $6,80 | $9,60 | $17,00 |
| PC + RTX 4090 | $6,40 | $9,10 | $16,00 |
| PC + 2× 3090 | $11,60 | $16,40 | $29,00 |
Przelicz liczby dla własnego modelu i GPU w kalkulatorze kosztów. Dwa uczciwe wnioski: do pracy zawsze-włączonej Apple Silicon lub mini PC jest dramatycznie tańszy niż jakakolwiek wieża; a nawet „drogi" box z 4090 kosztuje miesięcznie mniej niż pojedyncze miejsce ChatGPT Plus — analiza lokalnie vs chmura ma pełną matematykę progu opłacalności wraz z amortyzacją sprzętu.
Na laptopie te same dźwignie objawiają się ciepłem, nie kosztem: długotrwałe wnioskowanie to powód, dla którego MacBook jest szybki przez dwie minuty, a po dziesięciu o połowę wolniejszy.
Wnioskowanie LLM jest ograniczone przepustowością pamięci, nie mocą obliczeniową — najwyższe pasmo mocy GPU jest głównie marnowane. Ograniczenie RTX 4090 z 450W do 300W zwykle kosztuje tylko ~5–10% tokenów/s; 3090 ograniczony z 350W do 250W zachowuje się tak samo:
# Cap the GPU at 300W (resets at reboot; persist via a startup script)
sudo nvidia-smi -pl 300
# Verify under load
nvidia-smi --query-gpu=power.draw,power.limit --format=csv -l 5
Ta jedna komenda oszczędza intensywnemu użytkownikowi 24/7 3–8 USD/miesiąc i proporcjonalnie tnie ciepło oraz hałas wentylatorów.
Ollama domyślnie wyładowuje modele po 5 minutach (OLLAMA_KEEP_ALIVE), pozwalając GPU wpaść w głęboki bieg jałowy. Jeśli ustawisz OLLAMA_KEEP_ALIVE=-1 dla natychmiastowych odpowiedzi, poznaj cenę: 3090 trzymający model pobiera na biegu jałowym 20–30W więcej niż pusty. Trzymaj modele rezydentne na wydajnym sprzęcie; pozwól im się wyładowywać na dużych kartach NVIDIA.
Warto też sprawdzić na bezgłowych serwerach Linux: jeśli nvidia-smi pokazuje 40W+ na biegu jałowym bez niczego załadowanego, karta utknęła w wysokim P-state — poszukaj trybu persistence i poprawek P-state dla swojej wersji sterownika.
nvidia-smi --query-gpu=power.draw --format=csv -l 1 — dokładny dla trendów, choć pomija milisekundowe skoki przejściowe.Nowoczesne GPU pobierają ostre milisekundowe skoki znacznie powyżej mocy znamionowej — 4090 potrafi przejściowo ciągnąć 600W+. Za mały PSU produkuje klasyczną awarię „PC restartuje się w chwili załadowania modelu":
Jednostka 80+ Gold lub Platinum marnuje też mniej watów jako ciepło — przy pracy 24/7 premia za wydajność zwraca się w ciągu życia PSU.
{{affiliate-link:psu-1000w-platinum}}
Prawie nic. 4090 generujący odpowiedź 500-tokenową przez 15 sekund przy 450W zużywa około 1,9 watogodziny — trzy setne centa. Koszt na zapytanie to błąd zaokrąglenia; *godziny biegu jałowego* to cały rachunek maszyny 24/7.
Na Macu lub mini PC nie — 1–3 USD/miesiąc all-in. Na wieży gamingowej z dużym GPU własny pobór wieży na biegu jałowym kosztuje 8–17 USD/miesiąc w zależności od stawki. Jeśli maszyna jest głównie serwerem, wydajny sprzęt oszczędza więcej niż jakakolwiek programowa modyfikacja.
Każdy wat staje się ciepłem. Obciążenie wnioskowaniem 450W to grzejnik na niskim biegu; latem z klimatyzacją płacisz za te waty dwa razy — raz, by wytworzyć ciepło, raz, by je usunąć. Ograniczanie mocy GPU pomaga, tak samo jak darmowa wentylacja.
Przy stałym użyciu osobistym zwykle tak: nawet ~10 USD/miesiąc prądu skrzynki z 4090 podcina równoważne wydatki na API dla intensywnych użytkowników, a sprzęt amortyzuje się przez lata. Pełne porównanie — z kosztem sprzętu — jest w przewodniku Lokalna AI vs koszt chmury.