Best LLMs for 80 GB VRAM

作者: Jakub Rusinowski · 最后更新: 2026年4月16日

These are the strongest local models that fit entirely in 80 GB of VRAM, ranked by capability, with the quantization level and estimated tokens/sec needed to fit.

GPUs at This Tier

Ranked Models

Qwen 2.5 Family — Qwen 2.5 72B InstructQ4_K_M · 43.47 GB · ~25 tok/s on NVIDIA A100 80GB (PCIe)
Qwen 2.5 Family — Qwen 2.5 Coder 32BQ4_K_M · 19.32 GB · ~52 tok/s on NVIDIA A100 80GB (PCIe)
Llama 3.3 — Llama 3.3 70B InstructQ2_K_XS (Tight) · 20.212500000000002 GB · ~50 tok/s on NVIDIA A100 80GB (PCIe)
Qwen 3 — Qwen 3 32BQ4_K_M · 19.802999999999997 GB · ~51 tok/s on NVIDIA A100 80GB (PCIe)
DeepSeek R1 — DeepSeek R1 Distill Qwen 32BQ4_K_M · 19.32 GB · ~52 tok/s on NVIDIA A100 80GB (PCIe)
Qwen 2.5 Family — Qwen 2.5 14B InstructQ4_K_M · 8.4525 GB · ~101 tok/s on NVIDIA A100 80GB (PCIe)
Nemotron 70B — Nemotron 70B InstructQ4_K_M · 42.62475 GB · ~26 tok/s on NVIDIA A100 80GB (PCIe)
Qwen 3 — Qwen 3 14BQ4_K_M · 8.935500000000001 GB · ~98 tok/s on NVIDIA A100 80GB (PCIe)
Qwen 3.5 — Qwen 3.5 122B-A10BQ4_K_M · 73.6575 GB · ~118 tok/s on NVIDIA A100 80GB (PCIe)
Codestral — Codestral 22BQ4_K_M · 13.40325 GB · ~71 tok/s on NVIDIA A100 80GB (PCIe)
Qwen 3.6 — Qwen 3.6 35B-A3BQ4_K_M · 21.13125 GB · ~221 tok/s on NVIDIA A100 80GB (PCIe)
DeepSeek R1 — DeepSeek R1 Distill Qwen 14BQ4_K_M · 8.4525 GB · ~102 tok/s on NVIDIA A100 80GB (PCIe)
Phi-4 Family — Phi-4 (14B)Q4_K_M · 8.4525 GB · ~100 tok/s on NVIDIA A100 80GB (PCIe)
Gemma 4 — Gemma 4 31BQ4_K_M · 18.71625 GB · ~54 tok/s on NVIDIA A100 80GB (PCIe)
Qwen 2.5 VL — Qwen 2.5 VL 72B InstructQ4_K_M · 44.315250000000006 GB · ~25 tok/s on NVIDIA A100 80GB (PCIe)

FAQ

What LLMs run well with 80 GB VRAM?

Qwen 2.5 Family, Qwen 2.5 Family, Llama 3.3, Qwen 3, DeepSeek R1 all fit in 80 GB VRAM.

Which GPUs have 80 GB VRAM?

NVIDIA A100 80GB (PCIe), NVIDIA H100 80GB (PCIe), Apple M3 Max (30-core GPU), Apple M2 Max.

Can-I-Run Pages Near 80 GB

Adjacent VRAM Tiers

No discrete GPU?

Buying Guide

← All VRAM Tiers | Check Your Hardware