Jak korzystać z analizatora sprzętu

Sprawdzacz kompatybilności GPU i VRAM to darmowe narzędzie działające w przeglądarce, które dokładnie mówi, które lokalne LLM może uruchomić Twój komputer. Wybierz GPU lub użyj automatycznego wykrywania, wpisz ilość VRAM i pamięci RAM, a narzędzie natychmiast wyświetli każdy kompatybilny model wraz z zużyciem VRAM, szacunkową liczbą tokenów na sekundę, kosztami energii i poleceniami instalacji Ollama jednym kliknięciem — bez rejestracji, a Twoje dane nie opuszczają urządzenia.

Jak z tego korzystać

  1. Wybierz GPU — wybierz z listy rozwijanej lub kliknij Automatyczne wykrywanie, aby odczytać sprzęt z przeglądarki.
  2. Ustaw VRAM i pamięć RAM — użytkownicy Apple Silicon wpisują łączną pamięć zunifikowaną.
  3. Wybierz sposób użycia — dzienna liczba godzin i obciążenie dostosowują szacunki prędkości i kosztów energii.
  4. Przejrzyj dopasowania — modele są pogrupowane na działa świetnie, działa i nie zmieści się, każdy z gotowym do skopiowania poleceniem Ollama.

Szybki przewodnik po VRAM

4 GB VRAMLlama 3.2 3B, Phi-3.5 Mini, Gemma 3 4B (Q4), SmolLM2
6–8 GB VRAMLlama 3.1 8B, DeepSeek R1 8B, Qwen 3 8B, Phi-4 Mini
12–16 GB VRAMLlama 4 Scout (Q4), Qwen 3 14B, Mistral NeMo 12B
24 GB VRAMLlama 3.3 70B (Q4), DeepSeek R1 32B, Mistral Small 3.1

Najczęściej zadawane pytania

Jaki sprzęt jest potrzebny do uruchomienia lokalnego LLM?
Minimalnie potrzebujesz GPU z 4–6 GB VRAM lub Maca z Apple Silicon z co najmniej 8 GB pamięci zunifikowanej, aby płynnie uruchamiać małe modele 3B–8B. Średnie modele 13B–34B wymagają 16–24 GB VRAM, a modele 70B potrzebują około 24 GB lub więcej na dedykowanym GPU (albo 48–64 GB pamięci zunifikowanej na Macu). Potrzebujesz też wystarczającej ilości pamięci RAM — minimum 16 GB, zalecane 32 GB — ponieważ system operacyjny i warstwy przeniesione z GPU są tam przechowywane. Sprawdzacz powyżej dopasowuje Twoje dokładne GPU i RAM do ponad 75 modeli, więc nie musisz zgadywać.
Ile VRAM potrzebuję dla modelu 7B, 13B lub 70B?
Z grubsza, przy kwantyzacji Q4_K_M model 7B potrzebuje około 5–6 GB VRAM, model 13B około 9–10 GB, a model 70B mniej więcej 40–48 GB. Przejście na Q8 mniej więcej podwaja te wartości, a pełne FP16 mniej więcej je czterokrotnie zwiększa (70B w FP16 potrzebuje ~140 GB i wielu GPU). Zarezerwuj dodatkowe 1–2 GB na pamięć podręczną kontekstu/KV, więcej przy długich oknach kontekstu. Na Apple Silicon model korzysta z pamięci zunifikowanej zamiast dedykowanego VRAM, więc Mac z 64 GB może uruchomić model 70B w Q4.
Jaka jest różnica między modelami skwantyzowanymi a modelami pełnej precyzji?
Modele pełnej precyzji przechowują każdą wagę w 16-bitowej liczbie zmiennoprzecinkowej (FP16/BF16) — w formacie, w którym były trenowane, o najwyższej jakości. Modele skwantyzowane kompresują te wagi do 8, 4 lub mniej bitów, zmniejszając zużycie VRAM 2–4-krotnie przy niewielkim i zwykle niezauważalnym spadku jakości. Na przykład model 7B kurczy się z ~14 GB w FP16 do ~4,5 GB w Q4_K_M. O ile nie robisz fine-tuningu ani ewaluacji badawczych, kwantyzacja 4- lub 5-bitowa jest właściwym wyborem do lokalnego wnioskowania.
Jakie jest najlepsze ustawienie temperatury dla LLM?
Temperatura kontroluje losowość: niższe wartości sprawiają, że wynik jest bardziej skupiony i powtarzalny, wyższe — bardziej zróżnicowany i kreatywny. Używaj 0,0–0,3 do pytań faktograficznych, programowania i ekstrakcji danych; 0,6–0,8 do ogólnego czatu i asystentów; oraz 0,9–1,2 do burzy mózgów lub pisania kreatywnego. Większość narzędzi domyślnie ustawia około 0,7–0,8, co jest rozsądnym punktem wyjścia. Jeśli chcesz większej różnorodności, zwykle lepiej dostosować top_p (próbkowanie jądrowe) niż mocno podnosić temperaturę.
Czy uruchamianie lokalnego LLM jest darmowe?
Oprogramowanie jest darmowe i otwarte — Ollama, LM Studio, llama.cpp oraz same modele o otwartych wagach nic nie kosztują przy pobieraniu i uruchamianiu. Twoje jedyne realne koszty to sprzęt (GPU lub wydajny Mac) i energia elektryczna do jego zasilania, co zwykle wychodzi na ułamek centa za 1000 tokenów. W przeciwieństwie do API w chmurze nie ma opłat za tokeny, limitów zapytań, a Twoje dane nigdy nie opuszczają maszyny. Dla kogoś z regularnym codziennym użyciem lokalna konfiguracja zwykle zwraca się w ciągu kilku miesięcy — kalkulator kosztów na tej stronie oszacuje dokładny moment zwrotu.
Jak wybrać między Ollama, LM Studio a llama.cpp?
llama.cpp to podstawowy silnik wnioskowania, na którym zbudowana jest większość lokalnych narzędzi — wybierz go, jeśli chcesz maksymalnej kontroli, skryptowania i najnowszych funkcji z wiersza poleceń. Ollama opakowuje llama.cpp w prosty interfejs wiersza poleceń oraz serwer w tle z API zgodnym z OpenAI, co czyni ją najłatwiejszą opcją dla programistów, którzy chcą wywoływać modele z kodu. LM Studio to dopracowana aplikacja desktopowa z graficznym interfejsem, przeglądarką modeli i czatem, idealna dla początkujących lub osób, które wolą klikać niż pisać. Wszystkie trzy są darmowe, uruchamiają te same pliki modeli GGUF i mogą współistnieć na jednej maszynie.
Czy mogę uruchomić lokalny LLM bez GPU (tylko na CPU)?
Tak — Ollama i llama.cpp obsługują wnioskowanie tylko na CPU i działa ono dobrze dla małych modeli. Spodziewaj się mniej więcej 1–8 tokenów na sekundę na nowoczesnym wielordzeniowym CPU wobec 30–100+ na dedykowanym GPU, więc nadaje się do krótkich zapytań, ale jest wolne przy długich generacjach. Ponieważ cały model ładuje się do pamięci RAM zamiast VRAM, zaplanuj co najmniej 16 GB RAM dla modeli 7B i 32 GB dla modeli 13B. Aby uzyskać najlepsze działanie tylko na CPU, trzymaj się modeli 3B–8B w kwantyzacji Q4.
Którą kwantyzację wybrać — Q4, Q8 czy FP16?
Q4_K_M to najlepszy uniwersalny wybór domyślny: zmniejsza VRAM około 4-krotnie względem FP16, a spadek jakości jest trudny do zauważenia w codziennym użyciu. Przejdź na Q5_K_M lub Q6_K, jeśli masz zapas VRAM i chcesz nieco większej dokładności, albo na Q8_0 dla niemal bezstratnego wyniku o mniej więcej dwukrotnie większym rozmiarze niż Q4. Pełne FP16/BF16 zostaw na fine-tuning, ewaluację lub badania, gdzie liczy się każdy bit precyzji. Poniżej Q4 (Q3, Q2) plik nadal się kurczy, ale model zaczyna popełniać zauważalnie więcej błędów, więc schodź tam tylko po to, by zmieścić model, który inaczej się nie zmieści.