Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026
Najlepszy Mac do lokalnych LLM to ten z największą pamięcią zunifikowaną, na jaki Cię stać: 16GB uruchamia modele 8B, 48GB komfortowo obsługuje 32B, a modele klasy 70B wymagają 64GB+. Ten przewodnik p
Najlepszy Mac do lokalnych LLM to ten z największą pamięcią zunifikowaną, na jaki Cię stać: 16GB uruchamia modele 8B, 48GB komfortowo obsługuje 32B, a modele klasy 70B wymagają 64GB+. Ten przewodnik przypisuje każdy poziom RAM do tego, co naprawdę działa dobrze, wyjaśnia, dlaczego to przepustowość pamięci (a nie szybkość CPU) decyduje o Twoich tokenach/s, i podaje konkretne rekomendacje zakupowe od 599 do 4000 dolarów.
Ostatnia aktualizacja: lipiec 2026
Na PC Twój model musi zmieścić się w VRAM karty graficznej — a karty konsumenckie kończą się na 24–32GB, chyba że wydasz tysiące. Apple Silicon używa pamięci zunifikowanej: GPU dzieli całą pulę RAM systemu. MacBook Pro za 2000 dolarów z 48GB załaduje modele, które po stronie PC wymagałyby zestawu multi-GPU za 5000+ dolarów.
Dwie liczby decydują o wszystkim przy zakupie Maca do lokalnej AI:
1. Ile RAM — określa, *które* modele w ogóle załadujesz. 2. Przepustowość pamięci (GB/s) — określa, *jak szybko* generują. Wnioskowanie LLM odczytuje cały model z pamięci dla każdego tokena, więc tokeny/s skalują się niemal liniowo z przepustowością.
Liczba rdzeni CPU i specyfikacja Neural Engine są niemal nieistotne dla wnioskowania LLM — nie płać za nie.
To właśnie ta zasada sprawia, że Mac nie odmawia wprost zbyt dużego modelu: zamiast tego zrzuca go na dysk, co wygląda jak zawieszenie. Drugą pułapką jest kupno używanego Maca na Intelu — co Mac z Intelem uruchomi, a czego nie warto przeczytać, zanim zaoszczędzisz na takim egzemplarzu.
macOS rezerwuje część pamięci zunifikowanej dla systemu; domyślnie GPU może użyć mniej więcej 65–75% całego RAM. „Mac 16GB" to realnie budżet ~11GB na model, „Mac 48GB" to ~34GB. Poniższa tabela już to uwzględnia.
| RAM | Dostępne dla modeli | Co działa dobrze (Q4_K_M) | Werdykt |
|---|---|---|---|
| 16GB | ~11 GB | 7–8B szybko; 12–14B to sufit | Poziom wejścia — OK do czatu i maili |
| 24GB | ~17 GB | 14B komfortowo; Gemma 3 27B ledwo się mieści | Najlepszy budżetowy złoty środek |
| 32GB | ~22 GB | Klasa 27B z miejscem na kontekst | Komfortowa maszyna na co dzień |
| 36GB | ~25 GB | 32B (Qwen, DeepSeek R1 distill) | Solidna maszyna deweloperska |
| 48GB | ~34 GB | 32B z dużym kontekstem; 70B Q3 (wolno) | Złoty środek dla entuzjastów |
| 64GB | ~45 GB | Llama 3.3 70B Q4 z użyteczną szybkością | Poważna lokalna AI |
| 128GB | ~90 GB | 70B Q8, giganty MoE (skwantyzowane), kilka modeli naraz | Klasa stacji roboczej |
Dwie praktyczne uwagi: to kwantyzacja sprawia, że się mieszczą (zobacz Kwantyzacja wyjaśniona), a długi kontekst zjada dodatkowe gigabajty ponad same wagi — jeśli robisz RAG lub długie dokumenty, kup o jeden poziom wyżej niż rozmiar modelu. Możesz zweryfikować dowolny konkretny model względem dowolnego Maca w analizatorze sprzętu.
W obrębie jednej generacji chipów poziom (base/Pro/Max) liczy się znacznie bardziej niż sama generacja:
| Chip | Przepustowość pamięci | Realistyczna szybkość 8B Q4 |
|---|---|---|
| M4 (base) | 120 GB/s | ~20–25 t/s |
| M3 Pro | 150 GB/s | ~25–28 t/s |
| M2 Pro | 200 GB/s | ~30–35 t/s |
| M4 Pro | 273 GB/s | ~45–55 t/s |
| M2 Max / M3 Max (40-rdzeniowy) | 400 GB/s | ~60–70 t/s |
| M4 Max (40-rdzeniowy) | 546 GB/s | ~80–95 t/s |
| M2 Ultra | 800 GB/s | ~110–130 t/s |
Zwróć uwagę na pułapkę w ofercie Apple: M3 Pro (150 GB/s) jest wolniejszy dla LLM niż starszy M2 Pro (200 GB/s) — Apple obciął magistralę pamięci w tej generacji. A 120 GB/s podstawowego M4 oznacza, że maksymalnie doposażony podstawowy chip nigdy nie jest dobrym zakupem pod LLM: do lokalnej AI używany M2 Max za każdym razem bije nowego podstawowego M4.
Wzór stojący za tymi szacunkami: tokeny/s ≈ przepustowość × ~0,7 ÷ rozmiar modelu w GB. Model 8B Q4 o wielkości 4,9GB na M4 Pro: 273 × 0,7 ÷ 4,9 ≈ 39 t/s zachowawczo, 45–55 w praktyce ze zoptymalizowanymi runtime'ami jak MLX czy llama.cpp Metal.
Podstawowy Mini 16GB działa, ale konfiguracja 24GB to dziś pojedynczo najlepsza wartość w lokalnej AI: otwiera klasę 14–27B, gdzie modele przestają wydawać się zabawkami. Pomiń 16GB, chyba że budżet jest naprawdę sztywny.
{{affiliate-box:mac-mini-m4}}
273 GB/s M4 Pro podwaja przepustowość podstawowego chipa, a 48GB odblokowuje modele 32B z pełnym kontekstem. To rekomendowana konfiguracja dla deweloperów, którzy chcą poważnej, zawsze włączonej skrzynki lokalnej AI — połącz ją z naszym przewodnikiem po osobistym serwerze domowym AI, a obsłuży też Twój telefon i laptop. Jeśli potrzebujesz laptopa, MacBook Pro M4 z 32GB to przenośny odpowiednik dla klasy 14–27B.
{{affiliate-box:macbook-pro-m4}}
Przepustowość 546 GB/s i 64GB+ RAM stawiają Llamę 3.3 70B Q4 na naprawdę użytecznej szybkości (~12–18 t/s), a 128GB uruchamia ją w Q8 lub hostuje kilka modeli jednocześnie. Do maszyny stacjonarnej Mac Studio M4 Max daje ten sam krzem co MacBook Pro za mniejsze pieniądze.
{{affiliate-box:mac-studio-m4-max}}
Używany M1 Max Mac Studio 64GB (400 GB/s) regularnie sprzedaje się za 1100–1400 dolarów i uruchamia 70B Q4 — najtańsza legalna maszyna 70B, jaką kupisz. Apple Silicon nie ma historii nadużyć kopania kryptowalut, a pamięć zunifikowana nie degraduje się jak wentylatory i pady termiczne GPU, co czyni używane Maki znacznie mniej ryzykownymi niż używane karty (porównaj z naszym przewodnikiem po używanych GPU).
PC z RTX 4090 (24GB, ~1000 GB/s) generuje 2–3x szybciej niż jakikolwiek Mac *dla modeli mieszczących się w 24GB*. Przewaga Maca zaczyna się dokładnie tam, gdzie kończy się VRAM: przy modelach 32B+ PC potrzebuje drugiej karty (zobacz Wnioskowanie multi-GPU), a Mac potrzebuje tylko RAM-u, który już ma — po cichu, przy 40–65W. Szybkość na dolara: PC. Rozmiar modelu na dolara i na wat: Mac. Pełne porównanie w Przewodniku zakupowym GPU.
16GB to działające minimum (modele 8B), 24–32GB to złoty środek wartości (14–27B), 48GB pokrywa klasę 32B, a 64GB+ to poziom, gdzie modele 70B stają się praktyczne. Kup o jeden poziom powyżej największego modelu, który planujesz uruchamiać, aby kontekst i wielozadaniowość miały miejsce.
Uruchamia modele 7–8B akceptowalnie (~20–25 t/s), co pokrywa czat i pisanie. Ale jego przepustowość 120 GB/s sprawia, że większe modele wydają się wolne niezależnie od RAM-u, więc nigdy nie kupuj podstawowego chipa z dużym RAM „pod AI" — przejdź na Pro.
Tak — M4 Max z 64GB uruchamia Llamę 3.3 70B Q4 z prędkością mniej więcej 12–18 tokenów/s, co jest komfortową szybkością czytania. Na 48GB technicznie mieści się w Q3, ale zostawia mało miejsca na kontekst; 64GB to uczciwe minimum do pracy z 70B.
Szybkość LLM napędza przepustowość, nie generacja — a ceny używanych/odnowionych Maków serii M o wysokiej przepustowości (M2 Max, M1 Max) są już świetne. Jeśli obecna konfiguracja pasuje do Twojego poziomu modeli i budżetu, czekanie rzadko się opłaca.