作者: Jakub Rusinowski · 最后更新: 2026年7月12日
24/7 运行一个本地 LLM,每月电费在 1 到 30 美元之间,几乎完全取决于你的硬件:一台常开的 Mac Mini 花的电比一盏夜灯还少,而一台双 GPU 主机则接近一份流媒体订阅的预算。本指南给出按 GPU 档位划分的真实空闲与负载功耗、一个可代入你自己电价的公式,以及最能压低账单的两项设置。
24/7 运行一个本地 LLM,每月电费在 1 到 30 美元之间,几乎完全取决于你的硬件:一台常开的 Mac Mini 花的电比一盏夜灯还少,而一台双 GPU 主机则接近一份流媒体订阅的预算。本指南给出按 GPU 档位划分的真实空闲与负载功耗、一个可代入你自己电价的公式,以及最能压低账单的两项设置。
最后更新:2026 年 7 月
Monthly cost = watts ÷ 1000 × hours per day × 30 × your rate per kWh
示例:一台全天以 80W 空闲的 PC,按 2026 年美国平均电价约 0.17 美元/kWh: 80 ÷ 1000 × 24 × 30 × 0.17 = 每月 9.79 美元——而这还没算上 GPU 做任何实际工作。
在同一档位内,你的电价比任何硬件选择都更重要:美国平均约 0.17 美元/kWh,德国大约是其两倍,而分时电价在正午和深夜之间可能相差 2 倍。看你自己的账单,而非全国平均。
墙上实测数据(整机,而非仅 GPU):
| 系统 | 空闲 | LLM 推理 | 说明 |
|---|---|---|---|
| Mac Mini M4 | 4–7 W | 20–35 W | 24/7 能效冠军 |
| Mac Studio M4 Max | 10–14 W | 55–90 W | 以笔记本功耗胜任 70B |
| PC + RTX 3060 12GB | 45–60 W | 220–280 W | 典型预算主机 |
| PC + RTX 3090 | 60–85 W | 380–450 W | 高空闲功耗是隐性成本 |
| PC + RTX 4090 | 55–75 W | 400–500 W | 快速爆发,大瞬态尖峰 |
| PC + 2× RTX 3090 | 90–130 W | 700–850 W | 先读多 GPU 指南 |
人们算错的那个数字:空闲。一台个人 LLM 服务器一天里 95% 以上的时间处于空闲——模型驻留在内存里等待。一台游戏主机 70W 的空闲,按 0.17 美元/kWh,*什么都不干*就要约每月 8.60 美元,而 Mac Mini 5W 的空闲只要 0.61 美元。相比之下推理爆发几乎不值一提:即便一台 4090 每天以 450W 满负荷生成整整两小时,也只增加约每月 4.60 美元。
假设一个现实的个人助理占空比(每天 22 小时空闲 + 2 小时活跃推理):
| 系统 | @ $0.12/kWh | @ $0.17/kWh(美国均值) | @ $0.30/kWh(近欧洲) |
|---|---|---|---|
| Mac Mini M4 | $0.60 | $0.85 | $1.50 |
| Mac Studio M4 Max | $1.30 | $1.85 | $3.25 |
| PC + RTX 3060 | $3.90 | $5.50 | $9.70 |
| PC + RTX 3090 | $6.80 | $9.60 | $17.00 |
| PC + RTX 4090 | $6.40 | $9.10 | $16.00 |
| PC + 2× 3090 | $11.60 | $16.40 | $29.00 |
在成本计算器里代入你自己的模型和 GPU 算一算。两条诚实的结论:对常开运行而言,苹果芯片或迷你 PC 比任何主机都便宜得多;而即便是"昂贵"的 4090 机器,每月成本也低于一个 ChatGPT Plus 席位——本地 vs 云对比有完整的盈亏平衡算账,含硬件摊销。
LLM 推理受内存带宽限制,而非算力限制——GPU 的最高功耗区间大多被浪费。将 RTX 4090 从 450W 限到 300W,通常只损失约 5–10% 的 token/秒;将 3090 从 350W 限到 250W,表现相同:
# Cap the GPU at 300W (resets at reboot; persist via a startup script)
sudo nvidia-smi -pl 300
# Verify under load
nvidia-smi --query-gpu=power.draw,power.limit --format=csv -l 5
这一条命令为重度 24/7 用户每月省下 3–8 美元,并按比例降低热量和风扇噪音。
Ollama 默认在 5 分钟后卸载模型(OLLAMA_KEEP_ALIVE),让 GPU 跌入深度空闲。如果你为了即时响应设置 OLLAMA_KEEP_ALIVE=-1,要知道代价:一块挂着模型的 3090,空闲功耗比空载时高 20–30W。在高效硬件上让模型常驻;在大号 NVIDIA 卡上让它们卸载。
在无头 Linux 服务器上还值得检查:如果 nvidia-smi 在什么都没加载时显示 40W 以上,说明卡卡在了高 P-state——查一下你驱动版本对应的持久化模式和 P-state 修复方法。
nvidia-smi --query-gpu=power.draw --format=csv -l 1——对趋势准确,尽管它会漏掉毫秒级瞬态。现代 GPU 会拉出远超额定功率的尖锐毫秒级尖峰——一块 4090 瞬时可拉 600W 以上。电源功率不足会产生经典的"模型一加载 PC 就重启"故障:
一个 80+ 金牌或白金单元还能以更少的瓦特化为热量浪费——在 24/7 运行下,这份能效溢价会在电源寿命内自行回本。
{{affiliate-link:psu-1000w-platinum}}
几乎没有。一块 4090 以 450W 花 15 秒生成一个 500-token 的回答,约用 1.9 瓦时——三百分之一美分。每次查询的成本是舍入误差;对一台 24/7 的机器而言,*空闲时长*才是整份账单。
在 Mac 或迷你 PC 上,不贵——全包每月 1–3 美元。在配大号 GPU 的游戏主机上,主机自身的空闲功耗按你的电价要花每月 8–17 美元。如果这台机器主要是服务器,高效硬件省下的比任何软件微调都多。
每一瓦特都会变成热量。450W 的推理负载就是一台开小档的取暖器;夏天开着空调,你为这些瓦特付两次钱——一次制造热量,一次移走它。给 GPU 限功耗有帮助,免费的通风也有帮助。
对稳定的个人使用,通常是的:即便一台 4090 机器每月约 10 美元的电费,对重度用户也低于等价的 API 支出,而硬件会在数年间摊销。完整对比——含硬件成本——见本地 AI vs 云成本指南。