Whole machines built around one large pool of memory. Capacity decides which models load at all; bandwidth decides whether they are usable — and on these boxes the two often point in opposite directions.
Specs verified 2026-07-21 · Prices verified 2026-07-06
| Device | Memory | Bandwidth | Llama 3.1 8B Q4_K_M | Price | $/GB | TDP | Released | Runs with |
|---|---|---|---|---|---|---|---|---|
| Mac Studio (M3 Ultra, 256 GB) | 256 GB unified | 819 GB/s | 43–90 tok/s | — | — | 60 W | 2025 | metal |
| Mac Studio (M2 Ultra, 192 GB) | 192 GB unified | 800 GB/s | 43–89 tok/s | — | — | 60 W | 2023 | metal |
| Framework Desktop (Ryzen AI Max+ 395, 128 GB) | 128 GB unified | 256 GB/s | 18–38 tok/s | — | — | 120 W | 2025 | rocm, vulkan |
| NVIDIA DGX Spark | 128 GB unified | 273 GB/s | 26–53 tok/s | $4,699 | $36.71 | 150 W | 2025 | cuda, vulkan |
| AMD Ryzen AI Max+ 395 | 96 GB unified | 256 GB/s | 18–38 tok/s | $1,999 | $20.82 | 120 W | 2025 | rocm, vulkan |
| Mac mini (M4 Pro, 64 GB) | 64 GB unified | 273 GB/s | 17–35 tok/s | — | — | 30 W | 2024 | metal |
| Mac Studio (M4 Max, 64 GB) | 64 GB unified | 546 GB/s | 31–64 tok/s | — | — | 35 W | 2025 | metal |
| Beelink SER9 (Ryzen AI 9, 32 GB) | 32 GB unified | 256 GB/s | 18–38 tok/s | $859 | $26.84 | 120 W | 2025 | rocm, vulkan |
| RTX 5090 Desktop (32 GB VRAM, 64 GB RAM) | 32 GB | 1,792 GB/s | 113–234 tok/s | — | — | 575 W | 2025 | cuda, vulkan |
| RTX 3090 Desktop (24 GB VRAM, 64 GB RAM) | 24 GB | 936 GB/s | 60–115 tok/s | — | — | 350 W | 2020 | cuda, vulkan |
| RTX 4090 Desktop (24 GB VRAM, 64 GB RAM) | 24 GB | 1,008 GB/s | 86–165 tok/s | — | — | 450 W | 2022 | cuda, vulkan |
| Mac mini (M4, 16 GB) | 16 GB unified | 120 GB/s | 7.7–16 tok/s | $599 | $37.44 | 22 W | 2024 | metal |
| RTX 5060 Ti 16 GB Desktop (16 GB VRAM, 32 GB RAM) | 16 GB | 448 GB/s | 40–83 tok/s | — | — | 180 W | 2025 | cuda, vulkan |
| RTX 5080 Desktop (16 GB VRAM, 32 GB RAM) | 16 GB | 960 GB/s | 74–153 tok/s | — | — | 360 W | 2025 | cuda, vulkan |
| RTX 3060 12 GB Desktop (12 GB VRAM, 32 GB RAM) | 12 GB | 360 GB/s | 26–50 tok/s | — | — | 170 W | 2021 | cuda, vulkan |
Local AI Hardware — Every Device Compared · Best GPUs for Local AI — Full Comparison · Laptops for Local AI