Best local LLMs for your GPU

Search your card, laptop GPU or Mac. We rank everything that runs on it by quality and speed, and show what gets cut if you need more context.

Your hardware
RTX 3060 (12GB)RTX 4060 Ti 16GBRTX 3090RTX 4090RTX 5090M4 Max
Context length8K tokens
4K8K16K32K128K

Ranked for the RTX 4090 at 8K context. Pick your own card above once the page has loaded.

RTX 409024 GBusable · 1008 GB/s
Models that run1113 more with RAM offload
Best overall87DeepSeek R1 Distill Qwen 32B
Fastest good model~237 tok/sLFM2.5-8B-A1B
All tasksCodingChatReasoningAgentsVisionRuns on GPURAM offloadEverything
#ModelVRAMSpeed (est.)Fit
1DeepSeek R1 Distill Qwen 32B
DeepSeek R1 · 32B
22.3 GB~34 tok/sTight
2DeepSeek R1 Distill Qwen 14B
DeepSeek R1 · 14B
10.6 GB~70 tok/sFits
3Qwen 3.5 27B
Qwen 3.5 · 27B
17.1 GB~40 tok/sFits
4Laguna XS 2.1 33B-A3B
Poolside Laguna XS 2.1 · 33B (3B active)
20.7 GB~171 tok/sFits
5Granite 4.0 Small-H 32B-A9B
IBM Granite 4.0 · 32B (9B active)
20.1 GB~94 tok/sFits
6Olmo 3 32B
Olmo 3 · 32B
20.1 GB~34 tok/sFits
7Nemotron-Cascade 2 30B-A3B
Nemotron Cascade 2 · 31.6B (3.5B active)
19.9 GB~160 tok/sFits
8Gemma 4 31B
Gemma 4 · 31B
19.5 GB~35 tok/sFits
9Qwen 3 30B-A3B (MoE)
Qwen 3 · 30B (3B active)
20 GB~185 tok/sFits
10Qwen3-Coder 30B-A3B (MoE)
Qwen3-Coder · 30.5B (3.3B active)
20 GB~185 tok/sFits
11GLM-4.7-Flash 30B-A3B
GLM-4.7 / GLM-Z1 · 30B (3B active)
18.9 GB~172 tok/sFits
12Granite 4.1 30B
IBM Granite 4.1 · 30B
18.9 GB~37 tok/sFits
13Nemotron 3 Nano Omni 30B-A3B
Nemotron 3 Nano Omni · 30B/3B active
18.9 GB~172 tok/sFits
14North Mini Code 1.0 30B-A3B
North Mini Code · 30B (3B active)
18.9 GB~172 tok/sFits
15Granite 4.2 30B
IBM Granite 4.2 · 30B
18.9 GB~37 tok/sFits
16Nemotron 3.5 Lightning 30B-A3B
Nemotron 3.5 · 30B (3B active)
18.9 GB~172 tok/sFits
17Muse Glimmer 30B
Muse Glimmer · 29.6B
18.7 GB~37 tok/sFits
18Qwen 3.6 27B
Qwen 3.6 · 27.8B
17.6 GB~39 tok/sFits
19Qwen3.8 27B
Qwen3.8 · 27B
18.1 GB~40 tok/sFits
201-bit Bonsai 27B
Bonsai 27B · 27B
17.1 GB~40 tok/sFits
21Ternary Bonsai 27B
Bonsai 27B · 27B
17.1 GB~40 tok/sFits
22Trinity Mini
Trinity · 26B (3B active)
16.9 GB~211 tok/sFits
23Gemma 4 26B-A4B
Gemma 4 · 26B (4B active, MoE)
16.5 GB~152 tok/sFits
24Devstral Small 2505 24B
Devstral · 24B
16.6 GB~45 tok/sFits
25Devstral Small 2 24B
Devstral · 24B
16.6 GB~45 tok/sFits

Showing 25 of 111 · Q4_K_M, 8K context

A page for every card

The strongest models per workload, the largest model each card holds, and what it cannot run.

NVIDIA

NVIDIA GeForce RTX 5090 Laptop GPU (24 GB)NVIDIA GeForce RTX 3090 Ti (24 GB)NVIDIA GeForce RTX 3080 Ti (12 GB)NVIDIA GeForce RTX 3080 12GB (12 GB)NVIDIA GeForce RTX 4060 Ti 8GB (8 GB)NVIDIA GeForce RTX 4090 Laptop GPU (16 GB)NVIDIA GeForce RTX 4060 Laptop GPU (8 GB)NVIDIA GB10 Grace Blackwell (128 GB)NVIDIA GeForce RTX 5090 (32 GB)NVIDIA GeForce RTX 5080 (16 GB)NVIDIA GeForce RTX 5070 Ti (16 GB)NVIDIA GeForce RTX 5070 (12 GB)NVIDIA GeForce RTX 5060 Ti 16GB (16 GB)NVIDIA GeForce RTX 5060 Ti 8GB (8 GB)NVIDIA GeForce RTX 5060 (8 GB)NVIDIA GeForce RTX 4070 Ti (12 GB)NVIDIA GeForce RTX 4070 Super (12 GB)NVIDIA GeForce RTX 4090 (24 GB)NVIDIA GeForce RTX 4080 Super (16 GB)NVIDIA GeForce RTX 4080 (16 GB)NVIDIA GeForce RTX 4070 Ti Super (16 GB)NVIDIA GeForce RTX 4070 (12 GB)NVIDIA GeForce RTX 4060 Ti 16GB (16 GB)NVIDIA GeForce RTX 4060 (8 GB)NVIDIA GeForce RTX 3070 (8 GB)NVIDIA GeForce RTX 3070 Ti (8 GB)NVIDIA GeForce RTX 3090 (24 GB)NVIDIA GeForce RTX 3080 (10GB) (10 GB)NVIDIA GeForce RTX 3060 (12GB) (12 GB)NVIDIA DGX Spark (128 GB)NVIDIA RTX 6000 Ada Generation (48 GB)NVIDIA RTX PRO 6000 Blackwell (96 GB)NVIDIA L40S (48 GB)NVIDIA A100 80GB (PCIe) (80 GB)NVIDIA H100 80GB (PCIe) (80 GB)NVIDIA GeForce RTX 3060 Ti (8 GB)NVIDIA RTX PRO 4500 Blackwell (Workstation Edition) (32 GB)NVIDIA GeForce RTX 5050 (8 GB)NVIDIA RTX PRO 5000 Blackwell (48 GB) (48 GB)NVIDIA RTX PRO 5000 Blackwell (72 GB) (72 GB)NVIDIA RTX PRO 4000 Blackwell (24 GB)NVIDIA RTX PRO 2000 Blackwell (16 GB)NVIDIA RTX PRO 6000 Blackwell (Max-Q Edition) (96 GB)NVIDIA RTX 5000 Ada Generation (32 GB)NVIDIA RTX A6000 (48 GB)NVIDIA RTX A5000 (24 GB)NVIDIA L4 (24 GB)NVIDIA A10 (24 GB)NVIDIA L40 (48 GB)NVIDIA H100 80GB (SXM) (80 GB)NVIDIA GeForce RTX 5080 Laptop GPU (16 GB)NVIDIA GeForce RTX 5070 Ti Laptop GPU (12 GB)NVIDIA GeForce RTX 5070 Laptop GPU (8 GB)NVIDIA GeForce RTX 5060 Laptop GPU (8 GB)NVIDIA GeForce RTX 4080 Laptop GPU (12 GB)NVIDIA GeForce RTX 3080 Ti Laptop GPU (16 GB)NVIDIA RTX PRO 5000 Blackwell Laptop GPU (24 GB)NVIDIA GeForce RTX 2080 Ti (11 GB)NVIDIA GeForce GTX 1080 Ti (11 GB)NVIDIA Tesla P40 (24 GB)