Best local LLMs for your GPU
Search your card, laptop GPU or Mac. We rank everything that runs on it by quality and speed, and show what gets cut if you need more context.
Your hardware
RTX 3060 (12GB)RTX 4060 Ti 16GBRTX 3090RTX 4090RTX 5090M4 Max
Context length8K tokens
4K8K16K32K128K
Ranked for the RTX 4090 at 8K context. Pick your own card above once the page has loaded.
RTX 409024 GBusable · 1008 GB/s
Models that run1113 more with RAM offload
Best overall87DeepSeek R1 Distill Qwen 32B
Fastest good model~237 tok/sLFM2.5-8B-A1B
| # | Model | Memory · marker = 24 GB | VRAM | Speed (est.) | Fit |
|---|---|---|---|---|---|
| 1 | DeepSeek R1 Distill Qwen 32B DeepSeek R1 · 32B | 22.3 GB | ~34 tok/s | Tight | |
| 2 | DeepSeek R1 Distill Qwen 14B DeepSeek R1 · 14B | 10.6 GB | ~70 tok/s | Fits | |
| 3 | Qwen 3.5 27B Qwen 3.5 · 27B | 17.1 GB | ~40 tok/s | Fits | |
| 4 | Laguna XS 2.1 33B-A3B Poolside Laguna XS 2.1 · 33B (3B active) | 20.7 GB | ~171 tok/s | Fits | |
| 5 | Granite 4.0 Small-H 32B-A9B IBM Granite 4.0 · 32B (9B active) | 20.1 GB | ~94 tok/s | Fits | |
| 6 | Olmo 3 32B Olmo 3 · 32B | 20.1 GB | ~34 tok/s | Fits | |
| 7 | Nemotron-Cascade 2 30B-A3B Nemotron Cascade 2 · 31.6B (3.5B active) | 19.9 GB | ~160 tok/s | Fits | |
| 8 | Gemma 4 31B Gemma 4 · 31B | 19.5 GB | ~35 tok/s | Fits | |
| 9 | Qwen 3 30B-A3B (MoE) Qwen 3 · 30B (3B active) | 20 GB | ~185 tok/s | Fits | |
| 10 | Qwen3-Coder 30B-A3B (MoE) Qwen3-Coder · 30.5B (3.3B active) | 20 GB | ~185 tok/s | Fits | |
| 11 | GLM-4.7-Flash 30B-A3B GLM-4.7 / GLM-Z1 · 30B (3B active) | 18.9 GB | ~172 tok/s | Fits | |
| 12 | Granite 4.1 30B IBM Granite 4.1 · 30B | 18.9 GB | ~37 tok/s | Fits | |
| 13 | Nemotron 3 Nano Omni 30B-A3B Nemotron 3 Nano Omni · 30B/3B active | 18.9 GB | ~172 tok/s | Fits | |
| 14 | North Mini Code 1.0 30B-A3B North Mini Code · 30B (3B active) | 18.9 GB | ~172 tok/s | Fits | |
| 15 | Granite 4.2 30B IBM Granite 4.2 · 30B | 18.9 GB | ~37 tok/s | Fits | |
| 16 | Nemotron 3.5 Lightning 30B-A3B Nemotron 3.5 · 30B (3B active) | 18.9 GB | ~172 tok/s | Fits | |
| 17 | Muse Glimmer 30B Muse Glimmer · 29.6B | 18.7 GB | ~37 tok/s | Fits | |
| 18 | Qwen 3.6 27B Qwen 3.6 · 27.8B | 17.6 GB | ~39 tok/s | Fits | |
| 19 | Qwen3.8 27B Qwen3.8 · 27B | 18.1 GB | ~40 tok/s | Fits | |
| 20 | 1-bit Bonsai 27B Bonsai 27B · 27B | 17.1 GB | ~40 tok/s | Fits | |
| 21 | Ternary Bonsai 27B Bonsai 27B · 27B | 17.1 GB | ~40 tok/s | Fits | |
| 22 | Trinity Mini Trinity · 26B (3B active) | 16.9 GB | ~211 tok/s | Fits | |
| 23 | Gemma 4 26B-A4B Gemma 4 · 26B (4B active, MoE) | 16.5 GB | ~152 tok/s | Fits | |
| 24 | Devstral Small 2505 24B Devstral · 24B | 16.6 GB | ~45 tok/s | Fits | |
| 25 | Devstral Small 2 24B Devstral · 24B | 16.6 GB | ~45 tok/s | Fits |
Showing 25 of 111 · Q4_K_M, 8K context
A page for every card
The strongest models per workload, the largest model each card holds, and what it cannot run.
NVIDIA
NVIDIA GeForce RTX 5090 Laptop GPU (24 GB)NVIDIA GeForce RTX 3090 Ti (24 GB)NVIDIA GeForce RTX 3080 Ti (12 GB)NVIDIA GeForce RTX 3080 12GB (12 GB)NVIDIA GeForce RTX 4060 Ti 8GB (8 GB)NVIDIA GeForce RTX 4090 Laptop GPU (16 GB)NVIDIA GeForce RTX 4060 Laptop GPU (8 GB)NVIDIA GB10 Grace Blackwell (128 GB)NVIDIA GeForce RTX 5090 (32 GB)NVIDIA GeForce RTX 5080 (16 GB)NVIDIA GeForce RTX 5070 Ti (16 GB)NVIDIA GeForce RTX 5070 (12 GB)NVIDIA GeForce RTX 5060 Ti 16GB (16 GB)NVIDIA GeForce RTX 5060 Ti 8GB (8 GB)NVIDIA GeForce RTX 5060 (8 GB)NVIDIA GeForce RTX 4070 Ti (12 GB)NVIDIA GeForce RTX 4070 Super (12 GB)NVIDIA GeForce RTX 4090 (24 GB)NVIDIA GeForce RTX 4080 Super (16 GB)NVIDIA GeForce RTX 4080 (16 GB)NVIDIA GeForce RTX 4070 Ti Super (16 GB)NVIDIA GeForce RTX 4070 (12 GB)NVIDIA GeForce RTX 4060 Ti 16GB (16 GB)NVIDIA GeForce RTX 4060 (8 GB)NVIDIA GeForce RTX 3070 (8 GB)NVIDIA GeForce RTX 3070 Ti (8 GB)NVIDIA GeForce RTX 3090 (24 GB)NVIDIA GeForce RTX 3080 (10GB) (10 GB)NVIDIA GeForce RTX 3060 (12GB) (12 GB)NVIDIA DGX Spark (128 GB)NVIDIA RTX 6000 Ada Generation (48 GB)NVIDIA RTX PRO 6000 Blackwell (96 GB)NVIDIA L40S (48 GB)NVIDIA A100 80GB (PCIe) (80 GB)NVIDIA H100 80GB (PCIe) (80 GB)NVIDIA GeForce RTX 3060 Ti (8 GB)NVIDIA RTX PRO 4500 Blackwell (Workstation Edition) (32 GB)NVIDIA GeForce RTX 5050 (8 GB)NVIDIA RTX PRO 5000 Blackwell (48 GB) (48 GB)NVIDIA RTX PRO 5000 Blackwell (72 GB) (72 GB)NVIDIA RTX PRO 4000 Blackwell (24 GB)NVIDIA RTX PRO 2000 Blackwell (16 GB)NVIDIA RTX PRO 6000 Blackwell (Max-Q Edition) (96 GB)NVIDIA RTX 5000 Ada Generation (32 GB)NVIDIA RTX A6000 (48 GB)NVIDIA RTX A5000 (24 GB)NVIDIA L4 (24 GB)NVIDIA A10 (24 GB)NVIDIA L40 (48 GB)NVIDIA H100 80GB (SXM) (80 GB)NVIDIA GeForce RTX 5080 Laptop GPU (16 GB)NVIDIA GeForce RTX 5070 Ti Laptop GPU (12 GB)NVIDIA GeForce RTX 5070 Laptop GPU (8 GB)NVIDIA GeForce RTX 5060 Laptop GPU (8 GB)NVIDIA GeForce RTX 4080 Laptop GPU (12 GB)NVIDIA GeForce RTX 3080 Ti Laptop GPU (16 GB)NVIDIA RTX PRO 5000 Blackwell Laptop GPU (24 GB)NVIDIA GeForce RTX 2080 Ti (11 GB)NVIDIA GeForce GTX 1080 Ti (11 GB)NVIDIA Tesla P40 (24 GB)
Apple
Apple M5 Ultra (512 GB)Apple M3 Max (30-core GPU) (96 GB)Apple M6 (32 GB)Apple M5 Max (32-core GPU) (36 GB)Apple M4 Max (32-core GPU) (36 GB)Apple M1 Max (64 GB)Apple M2 Pro (32 GB)Apple M2 Max (96 GB)Apple M3 Pro (36 GB)Apple M4 Max (128 GB)Apple M4 Pro (24 GB)Apple M3 Max (128 GB)Apple M1 (16 GB)Apple M1 Pro (32 GB)Apple M1 Ultra (128 GB)Apple M2 (24 GB)Apple M2 Ultra (192 GB)Apple M3 (24 GB)Apple M3 Ultra (512 GB)Apple M4 (32 GB)Apple M5 (32 GB)Apple M5 Pro (64 GB)Apple M5 Max (128 GB)
Intel
AMD
AMD Radeon AI PRO R9700 (32 GB)AMD Radeon RX 7700 XT (12 GB)AMD Ryzen AI 9 HX 370 (32 GB)AMD Radeon RX 7900 XTX (24 GB)AMD Radeon RX 7900 XT (20 GB)AMD Radeon RX 7800 XT (16 GB)AMD Radeon RX 9070 XT (16 GB)AMD Radeon RX 9070 (16 GB)AMD Radeon RX 9060 XT 16GB (16 GB)AMD Radeon RX 9060 XT 8GB (8 GB)AMD Ryzen AI Max+ 395 (128 GB)AMD Radeon RX 7600 (8 GB)AMD Radeon RX 7600 XT (16 GB)AMD Radeon RX 7900 GRE (16 GB)AMD Radeon RX 9070 GRE (12 GB)AMD Radeon PRO W7900 (48 GB)AMD Radeon RX 6800 XT (16 GB)AMD Radeon RX 6900 XT (16 GB)AMD Radeon RX 6700 XT (12 GB)AMD Instinct MI50 32GB (32 GB)