作者: Jakub Rusinowski · 最后更新: 2026年7月21日
RTX 5090 和 RTX 4090 代表了 NVIDIA 两代最强消费级 GPU。如果你正在纠结要不要升级——或搭建一台新的 AI 工作站——本指南给你诚实的数字。
RTX 5090 和 RTX 4090 代表了 NVIDIA 两代最强消费级 GPU。如果你正在纠结要不要升级——或搭建一台新的 AI 工作站——本指南给你诚实的数字。
| RTX 4090 | RTX 5090 | |
|---|---|---|
| 显存 | 24 GB GDDR6X | 32 GB GDDR7 |
| 内存带宽 | 1,008 GB/s | 1,792 GB/s |
| TDP | 450W | 575W |
| 首发建议零售价 | $1,599 | $1,999 |
| Llama 3.1 8B Q8 | 165 t/s | 213 t/s |
| Qwen 3 32B Q4 | 45 t/s | 61 t/s |
| 单卡最大模型 | ~24B (Q4) | ~32B (Q4) |
RTX 5090 使用 GDDR7 内存,带宽 1,792 GB/s——比 RTX 4090 的 GDDR6X(1,008 GB/s)高 78%。对 LLM 推理而言,内存带宽是首要瓶颈,而非算力。这解释了为何 token/秒几乎与带宽成线性关系。
基准测试结果(Q4_K_M,Ollama,Windows 11):
RTX 4090 的 24 GB 显存无法从容装下 32B 模型——你需要激进的量化(IQ2–IQ3),而这会降低质量。RTX 5090 的 32 GB 显存能以 Q4_K_M 装下 32B 模型,还余 4+ GB 给上下文。
| 模型 | RTX 4090 | RTX 5090 |
|---|---|---|
| Llama 3.1 8B Q8 | ✅ 装得下 | ✅ 装得下 |
| Qwen 3 14B Q4 | ✅ 装得下 | ✅ 装得下 |
| DeepSeek R1 32B Q4 | ⚠️ 紧张(22GB,剩 2GB) | ✅ 从容 |
| Llama 4 Maverick | ❌ 太大 | ⚠️ 部分 |
| Llama 3.3 70B Q4 | ❌ 太大(需 42GB) | ❌ 太大 |
RTX 5090 峰值功耗 575W——比 RTX 4090 多 125W。按每天 8 小时算,电费每月多 5–8 美元(美国均值)。噪音相当——两者都需要大型三风扇散热器。
升级,如果:
不要升级,如果:
如果你从中端卡升级过来,可以考虑 RTX 3090(24 GB,二手 400–600 美元可得)。它以 RTX 4090 一小部分的价格提供了相同的 24 GB 显存,速度约为其推理速度的 70%。
RTX 5090 是 2026 年本地 AI 最好的单块消费级 GPU。但除非你确实需要 32 GB 显存或最大吞吐量,否则对 7–14B 模型工作负载而言,RTX 4090(AMD 用户则是 RX 7900 XTX)仍是更具性价比的选择。