Written by Jakub Rusinowski · Last updated July 21, 2026
Ranked for a general-purpose local assistant: Everyday questions, drafting, explanation and light analysis — the local replacement for a hosted chat assistant.
Best overall: AMD Radeon RX 7900 XTX
24 GB VRAM at 960 GB/s. It runs 79 of the models that qualify for this workload; the strongest is Gemma 4 27B ⭐ at an estimated 38.3 tokens/sec.
| GPU | VRAM | MSRP | Models that fit | Best model it runs | Est. speed | |
|---|---|---|---|---|---|---|
| Best overall | AMD Radeon RX 7900 XTX | 24 GB | $999 | 79 | Gemma 4 27B ⭐ | ~38.3 tok/s |
| Best value | Intel Arc B570 | 10 GB | $219 | 56 | Qwen 3 8B | ~46 tok/s |
| Budget pick | Intel Arc B570 | 10 GB | $219 | 56 | Qwen 3 8B | ~46 tok/s |
| Most memory | NVIDIA DGX Spark | 128 GB | $4,699 | 92 | GPT-oss 120B | ~2.8 tok/s |
| GPU | Score | VRAM | MSRP | Models fit | Est. speed | Tok/s per watt | Cost per model |
|---|---|---|---|---|---|---|---|
| AMD Radeon RX 7900 XTX | 71.4 | 24 GB | $999 | 79 | ~38.3 | 0.11 | $13 |
| NVIDIA GeForce RTX 4090 | 70.6 | 24 GB | $1,599 | 79 | ~40.1 | 0.09 | $20 |
| NVIDIA GeForce RTX 5090 | 69.7 | 32 GB | $1,999 | 79 | ~66.6 | 0.12 | $25 |
| NVIDIA GeForce RTX 3090 | 69.1 | 24 GB | $1,499 | 79 | ~37.4 | 0.11 | $19 |
| AMD Radeon RX 7900 XT | 67.1 | 20 GB | $899 | 69 | ~32.4 | 0.1 | $13 |
| NVIDIA GeForce RTX 5070 Ti | 61.6 | 16 GB | $749 | 64 | ~40.9 | 0.14 | $12 |
| NVIDIA GeForce RTX 5080 | 59.7 | 16 GB | $999 | 64 | ~43.5 | 0.12 | $16 |
| AMD Radeon RX 9070 XT | 58.2 | 16 GB | $599 | 64 | ~33.3 | 0.15 | $9 |
| NVIDIA RTX 6000 Ada Generation | 56.3 | 48 GB | $6,799 | 84 | ~15.8 | 0.05 | $81 |
| AMD Radeon RX 9070 | 56 | 16 GB | $549 | 64 | ~30 | 0.14 | $9 |
| AMD Radeon RX 7800 XT | 55.8 | 16 GB | $499 | 64 | ~29.3 | 0.11 | $8 |
| NVIDIA GeForce RTX 4080 Super | 54.9 | 16 GB | $999 | 64 | ~34.2 | 0.11 | $16 |
The AMD Radeon RX 7900 XTX — 24 GB of VRAM runs 79 qualifying models, the strongest being Gemma 4 (Legacy Listing — Unverified).
The Intel Arc B570 at $219, which runs 56 qualifying models.
8 GB is the entry point at which a model for this workload will run at all. More memory buys a stronger model, not just a faster one.