免费工具 · 各量化级别的显存估算

显存计算器

一个模型需要多少 GPU 显存:量化后的权重、你设定上下文长度下的 KV 缓存、运行时开销以及智能体框架预留——覆盖从 Q2 到 FP16 的每个量化级别。

估算方法

权重

参数量 × 每权重位数 ÷ 8。在 Q4_K_M(4.83 位)下,32B 模型在加载其他内容前约占 19 GB。

KV 缓存

随上下文长度和并发用户数线性增长。量化到 Q8 可减半,质量损失很小;Q4 可再减半。

开销

运行时、CUDA 上下文和缓冲区约占 0.8 GB。在 Apple Silicon 上,GPU 默认只能使用约 75% 的统一内存。

智能体预留

工具定义、系统提示词和草稿区会额外占用一定比例。普通聊天请保持关闭。

每个链接都指向模型页面,附各量化级别的显存与速度。