Najlepszy Mac do lokalnych LLM: przewodnik po RAM i chipach 2026

Autor: Jakub Rusinowski · Ostatnia aktualizacja: 12 lipca 2026

Najlepszy Mac do lokalnych LLM to ten z największą pamięcią zunifikowaną, na jaki Cię stać: 16GB uruchamia modele 8B, 48GB komfortowo obsługuje 32B, a modele klasy 70B wymagają 64GB+. Ten przewodnik p

W tym przewodniku

Najlepszy Mac do lokalnych LLM to ten z największą pamięcią zunifikowaną, na jaki Cię stać: 16GB uruchamia modele 8B, 48GB komfortowo obsługuje 32B, a modele klasy 70B wymagają 64GB+. Ten przewodnik przypisuje każdy poziom RAM do tego, co naprawdę działa dobrze, wyjaśnia, dlaczego to przepustowość pamięci (a nie szybkość CPU) decyduje o Twoich tokenach/s, i podaje konkretne rekomendacje zakupowe od 599 do 4000 dolarów.

Ostatnia aktualizacja: lipiec 2026

Dlaczego Maki biją powyżej swojej wagi w lokalnej AI

Na PC Twój model musi zmieścić się w VRAM karty graficznej — a karty konsumenckie kończą się na 24–32GB, chyba że wydasz tysiące. Apple Silicon używa pamięci zunifikowanej: GPU dzieli całą pulę RAM systemu. MacBook Pro za 2000 dolarów z 48GB załaduje modele, które po stronie PC wymagałyby zestawu multi-GPU za 5000+ dolarów.

Dwie liczby decydują o wszystkim przy zakupie Maca do lokalnej AI:

1. Ile RAM — określa, *które* modele w ogóle załadujesz. 2. Przepustowość pamięci (GB/s) — określa, *jak szybko* generują. Wnioskowanie LLM odczytuje cały model z pamięci dla każdego tokena, więc tokeny/s skalują się niemal liniowo z przepustowością.

Liczba rdzeni CPU i specyfikacja Neural Engine są niemal nieistotne dla wnioskowania LLM — nie płać za nie.

Zasada: dostajesz ~70% swojego RAM na modele

To właśnie ta zasada sprawia, że Mac nie odmawia wprost zbyt dużego modelu: zamiast tego zrzuca go na dysk, co wygląda jak zawieszenie. Drugą pułapką jest kupno używanego Maca na Intelu — co Mac z Intelem uruchomi, a czego nie warto przeczytać, zanim zaoszczędzisz na takim egzemplarzu.

macOS rezerwuje część pamięci zunifikowanej dla systemu; domyślnie GPU może użyć mniej więcej 65–75% całego RAM. „Mac 16GB" to realnie budżet ~11GB na model, „Mac 48GB" to ~34GB. Poniższa tabela już to uwzględnia.

Ile RAM na lokalną AI na Macu? Tabela poziomów

RAMDostępne dla modeliCo działa dobrze (Q4_K_M)Werdykt
16GB~11 GB7–8B szybko; 12–14B to sufitPoziom wejścia — OK do czatu i maili
24GB~17 GB14B komfortowo; Gemma 3 27B ledwo się mieściNajlepszy budżetowy złoty środek
32GB~22 GBKlasa 27B z miejscem na kontekstKomfortowa maszyna na co dzień
36GB~25 GB32B (Qwen, DeepSeek R1 distill)Solidna maszyna deweloperska
48GB~34 GB32B z dużym kontekstem; 70B Q3 (wolno)Złoty środek dla entuzjastów
64GB~45 GBLlama 3.3 70B Q4 z użyteczną szybkościąPoważna lokalna AI
128GB~90 GB70B Q8, giganty MoE (skwantyzowane), kilka modeli narazKlasa stacji roboczej

Dwie praktyczne uwagi: to kwantyzacja sprawia, że się mieszczą (zobacz Kwantyzacja wyjaśniona), a długi kontekst zjada dodatkowe gigabajty ponad same wagi — jeśli robisz RAG lub długie dokumenty, kup o jeden poziom wyżej niż rozmiar modelu. Możesz zweryfikować dowolny konkretny model względem dowolnego Maca w analizatorze sprzętu.

M2 vs M3 vs M4: przepustowość to specyfikacja, która się liczy

W obrębie jednej generacji chipów poziom (base/Pro/Max) liczy się znacznie bardziej niż sama generacja:

ChipPrzepustowość pamięciRealistyczna szybkość 8B Q4
M4 (base)120 GB/s~20–25 t/s
M3 Pro150 GB/s~25–28 t/s
M2 Pro200 GB/s~30–35 t/s
M4 Pro273 GB/s~45–55 t/s
M2 Max / M3 Max (40-rdzeniowy)400 GB/s~60–70 t/s
M4 Max (40-rdzeniowy)546 GB/s~80–95 t/s
M2 Ultra800 GB/s~110–130 t/s

Zwróć uwagę na pułapkę w ofercie Apple: M3 Pro (150 GB/s) jest wolniejszy dla LLM niż starszy M2 Pro (200 GB/s) — Apple obciął magistralę pamięci w tej generacji. A 120 GB/s podstawowego M4 oznacza, że maksymalnie doposażony podstawowy chip nigdy nie jest dobrym zakupem pod LLM: do lokalnej AI używany M2 Max za każdym razem bije nowego podstawowego M4.

Wzór stojący za tymi szacunkami: tokeny/s ≈ przepustowość × ~0,7 ÷ rozmiar modelu w GB. Model 8B Q4 o wielkości 4,9GB na M4 Pro: 273 × 0,7 ÷ 4,9 ≈ 39 t/s zachowawczo, 45–55 w praktyce ze zoptymalizowanymi runtime'ami jak MLX czy llama.cpp Metal.

Rekomendacje zakupowe według budżetu

Poniżej 1000 dolarów — Mac Mini M4 (24GB)

Podstawowy Mini 16GB działa, ale konfiguracja 24GB to dziś pojedynczo najlepsza wartość w lokalnej AI: otwiera klasę 14–27B, gdzie modele przestają wydawać się zabawkami. Pomiń 16GB, chyba że budżet jest naprawdę sztywny.

{{affiliate-box:mac-mini-m4}}

1400–2000 dolarów — Mac Mini M4 Pro (48GB) lub MacBook Pro M4 (32GB)

273 GB/s M4 Pro podwaja przepustowość podstawowego chipa, a 48GB odblokowuje modele 32B z pełnym kontekstem. To rekomendowana konfiguracja dla deweloperów, którzy chcą poważnej, zawsze włączonej skrzynki lokalnej AI — połącz ją z naszym przewodnikiem po osobistym serwerze domowym AI, a obsłuży też Twój telefon i laptop. Jeśli potrzebujesz laptopa, MacBook Pro M4 z 32GB to przenośny odpowiednik dla klasy 14–27B.

{{affiliate-box:macbook-pro-m4}}

3000+ dolarów — MacBook Pro / Mac Studio M4 Max (64–128GB)

Przepustowość 546 GB/s i 64GB+ RAM stawiają Llamę 3.3 70B Q4 na naprawdę użytecznej szybkości (~12–18 t/s), a 128GB uruchamia ją w Q8 lub hostuje kilka modeli jednocześnie. Do maszyny stacjonarnej Mac Studio M4 Max daje ten sam krzem co MacBook Pro za mniejsze pieniądze.

{{affiliate-box:mac-studio-m4-max}}

Cichy faworyt z rynku wtórnego

Używany M1 Max Mac Studio 64GB (400 GB/s) regularnie sprzedaje się za 1100–1400 dolarów i uruchamia 70B Q4 — najtańsza legalna maszyna 70B, jaką kupisz. Apple Silicon nie ma historii nadużyć kopania kryptowalut, a pamięć zunifikowana nie degraduje się jak wentylatory i pady termiczne GPU, co czyni używane Maki znacznie mniej ryzykownymi niż używane karty (porównaj z naszym przewodnikiem po używanych GPU).

A może zamiast tego złożyć PC z Windows?

PC z RTX 4090 (24GB, ~1000 GB/s) generuje 2–3x szybciej niż jakikolwiek Mac *dla modeli mieszczących się w 24GB*. Przewaga Maca zaczyna się dokładnie tam, gdzie kończy się VRAM: przy modelach 32B+ PC potrzebuje drugiej karty (zobacz Wnioskowanie multi-GPU), a Mac potrzebuje tylko RAM-u, który już ma — po cichu, przy 40–65W. Szybkość na dolara: PC. Rozmiar modelu na dolara i na wat: Mac. Pełne porównanie w Przewodniku zakupowym GPU.

Najczęściej zadawane pytania

Ile RAM potrzebuję na lokalną AI na Macu?

16GB to działające minimum (modele 8B), 24–32GB to złoty środek wartości (14–27B), 48GB pokrywa klasę 32B, a 64GB+ to poziom, gdzie modele 70B stają się praktyczne. Kup o jeden poziom powyżej największego modelu, który planujesz uruchamiać, aby kontekst i wielozadaniowość miały miejsce.

Czy podstawowy chip M4 wystarcza do lokalnych LLM?

Uruchamia modele 7–8B akceptowalnie (~20–25 t/s), co pokrywa czat i pisanie. Ale jego przepustowość 120 GB/s sprawia, że większe modele wydają się wolne niezależnie od RAM-u, więc nigdy nie kupuj podstawowego chipa z dużym RAM „pod AI" — przejdź na Pro.

Czy Mac naprawdę uruchomi model 70B?

Tak — M4 Max z 64GB uruchamia Llamę 3.3 70B Q4 z prędkością mniej więcej 12–18 tokenów/s, co jest komfortową szybkością czytania. Na 48GB technicznie mieści się w Q3, ale zostawia mało miejsca na kontekst; 64GB to uczciwe minimum do pracy z 70B.

Czekać na kolejny chip czy kupić teraz?

Szybkość LLM napędza przepustowość, nie generacja — a ceny używanych/odnowionych Maków serii M o wysokiej przepustowości (M2 Max, M1 Max) są już świetne. Jeśli obecna konfiguracja pasuje do Twojego poziomu modeli i budżetu, czekanie rzadko się opłaca.

Powiązane przewodniki

← Wszystkie przewodniki | Sprawdź zgodność GPU