显存计算器
一个模型需要多少 GPU 显存:量化后的权重、你设定上下文长度下的 KV 缓存、运行时开销以及智能体框架预留——覆盖从 Q2 到 FP16 的每个量化级别。
估算方法
权重
参数量 × 每权重位数 ÷ 8。在 Q4_K_M(4.83 位)下,32B 模型在加载其他内容前约占 19 GB。
KV 缓存
随上下文长度和并发用户数线性增长。量化到 Q8 可减半,质量损失很小;Q4 可再减半。
开销
运行时、CUDA 上下文和缓冲区约占 0.8 GB。在 Apple Silicon 上,GPU 默认只能使用约 75% 的统一内存。
智能体预留
工具定义、系统提示词和草稿区会额外占用一定比例。普通聊天请保持关闭。
热门模型
每个链接都指向模型页面,附各量化级别的显存与速度。
BitNet b1.58 3BMicrosoftDeepSeek R1 Distill Llama 8BDeepSeekDeepSeek R1 Distill Qwen 32BDeepSeekDeepSeek R1 Distill Qwen 14BDeepSeekDeepSeek R1 (671B)DeepSeekLlama 3.3 70B InstructMetaLlama 3.1 8B InstructMetaNemotron 70B InstructNVIDIACommand R (35B)CohereCommand R+ (104B)CoherePhi-4 (14B)MicrosoftPhi 3.5 MiniMicrosoftQwen 2.5 Coder 32BAlibaba CloudQwen 2.5 14B InstructAlibaba CloudQwen 2.5 7B InstructAlibaba CloudQwen 2.5 72B InstructAlibaba CloudGemma 2 9B ITGoogleMistral Small 3 (24B)Mistral AIMistral NeMo 12BMistral AIYi 1.5 34B Chat01.AIYi 1.5 9B Chat01.AIGranite 3.0 8B InstructIBMLlama 4 Scout 17BMetaLlama 4 Maverick 17BMeta