Best LLMs for 4 GB VRAM
作者: Jakub Rusinowski · 最后更新: 2026年9月6日
These are the strongest local models that fit entirely in 4 GB of VRAM, ranked by capability, with the quantization level and estimated tokens/sec needed to fit.
GPUs at This Tier
- NVIDIA GeForce RTX 4060 Laptop GPU
- NVIDIA GeForce RTX 5060
- NVIDIA GeForce RTX 4060
- AMD Radeon RX 9060 XT 8GB
Ranked Models
| Gemma 3 — Gemma 3 4B Instruct | Q4_K_M · 2.415 GB · ~67 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| Phi-4 Mini — Phi-4 Mini (3.8B) | Q4_K_M · 2.29425 GB · ~71 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| Qwen 3.5 — Qwen 3.5 4B | Q4_K_M · 2.415 GB · ~70 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| VibeThinker — VibeThinker 3B | Q4_K_M · 1.8655875 GB · ~84 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| Phi 3.5 Family — Phi 3.5 Mini | Q4_K_M · 2.29425 GB · ~73 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| BitNet b1.58 — BitNet b1.58 3B | 1.58-bit · 0.6557 GB · ~146 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| StarCoder 2 — StarCoder 2 3B | Q4_K_M · 1.81125 GB · ~96 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| EXAONE 3.5 — EXAONE 3.5 2.4B | Q4_K_M · 1.449 GB · ~103 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| Aya 3B (Tiny Aya) — Aya 3B | Q4_K_M · 1.81125 GB · ~86 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| Qwen 3.5 — Qwen 3.5 2B | Q4_K_M · 1.2075 GB · ~112 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| IBM Granite 4.1 — Granite 4.1 3B | Q4_K_M · 1.81125 GB · ~86 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| Ministral — Ministral 3B | Q4_K_M · 2.1735 GB · ~76 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| Falcon 3 — Falcon 3 3B Instruct | Q4_K_M · 1.9501125 GB · ~83 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| SmolLM3 — SmolLM3 3B | Q4_K_M · 1.85955 GB · ~84 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
| VibeThinker — VibeThinker 1.5B | Q4_K_M · 0.929775 GB · ~132 tok/s on NVIDIA GeForce RTX 4060 Laptop GPU |
购买此硬件 Intel Arc B570 10GB — 10 GB VRAM · 150 W board power立即云端部署 RunPod 上的 RTX 4090 — 低至 $0.34/小时 · 价格核实于 2026-07
或在 Vast.ai 比较,低至 $0.35/小时 (typical low · varies)
作为亚马逊联盟成员,我们从符合条件的购买中获得收入。云 GPU 链接为推荐链接——我们可能获得佣金,您无需额外付费。
FAQ
What LLMs run well with 4 GB VRAM?
Gemma 3, Phi-4 Mini, Qwen 3.5, VibeThinker, Phi 3.5 Family all fit in 4 GB VRAM.
Which GPUs have 4 GB VRAM?
NVIDIA GeForce RTX 4060 Laptop GPU, NVIDIA GeForce RTX 5060, NVIDIA GeForce RTX 4060, AMD Radeon RX 9060 XT 8GB.
Can-I-Run Pages Near 4 GB
- BitNet b1.58 on NVIDIA GeForce RTX 5060 Ti 8GB
- BitNet b1.58 on NVIDIA GeForce RTX 5060
- BitNet b1.58 on NVIDIA GeForce RTX 4060
- DeepSeek R1 on NVIDIA GeForce RTX 5060 Ti 8GB
- DeepSeek R1 on NVIDIA GeForce RTX 5060
- DeepSeek R1 on NVIDIA GeForce RTX 4060
- DeepSeek R1 on NVIDIA GeForce RTX 3070 Ti
- DeepSeek R1 on NVIDIA GeForce RTX 3070