24/7 运行本地 LLM 的电费成本

作者: Jakub Rusinowski · 最后更新: 2026年7月12日

24/7 运行一个本地 LLM,每月电费在 1 到 30 美元之间,几乎完全取决于你的硬件:一台常开的 Mac Mini 花的电比一盏夜灯还少,而一台双 GPU 主机则接近一份流媒体订阅的预算。本指南给出按 GPU 档位划分的真实空闲与负载功耗、一个可代入你自己电价的公式,以及最能压低账单的两项设置。

本指南内容

24/7 运行一个本地 LLM,每月电费在 1 到 30 美元之间,几乎完全取决于你的硬件:一台常开的 Mac Mini 花的电比一盏夜灯还少,而一台双 GPU 主机则接近一份流媒体订阅的预算。本指南给出按 GPU 档位划分的真实空闲与负载功耗、一个可代入你自己电价的公式,以及最能压低账单的两项设置。

最后更新:2026 年 7 月

公式(30 秒的算术)

Monthly cost = watts ÷ 1000 × hours per day × 30 × your rate per kWh

示例:一台全天以 80W 空闲的 PC,按 2026 年美国平均电价约 0.17 美元/kWh: 80 ÷ 1000 × 24 × 30 × 0.17 = 每月 9.79 美元——而这还没算上 GPU 做任何实际工作。

在同一档位内,你的电价比任何硬件选择都更重要:美国平均约 0.17 美元/kWh,德国大约是其两倍,而分时电价在正午和深夜之间可能相差 2 倍。看你自己的账单,而非全国平均。

按硬件档位划分的本地 AI 功耗

墙上实测数据(整机,而非仅 GPU):

系统空闲LLM 推理说明
Mac Mini M44–7 W20–35 W24/7 能效冠军
Mac Studio M4 Max10–14 W55–90 W以笔记本功耗胜任 70B
PC + RTX 3060 12GB45–60 W220–280 W典型预算主机
PC + RTX 309060–85 W380–450 W高空闲功耗是隐性成本
PC + RTX 409055–75 W400–500 W快速爆发,大瞬态尖峰
PC + 2× RTX 309090–130 W700–850 W先读多 GPU 指南

人们算错的那个数字:空闲。一台个人 LLM 服务器一天里 95% 以上的时间处于空闲——模型驻留在内存里等待。一台游戏主机 70W 的空闲,按 0.17 美元/kWh,*什么都不干*就要约每月 8.60 美元,而 Mac Mini 5W 的空闲只要 0.61 美元。相比之下推理爆发几乎不值一提:即便一台 4090 每天以 450W 满负荷生成整整两小时,也只增加约每月 4.60 美元。

一台 24/7 的 LLM 服务器每月花多少

假设一个现实的个人助理占空比(每天 22 小时空闲 + 2 小时活跃推理):

系统@ $0.12/kWh@ $0.17/kWh(美国均值)@ $0.30/kWh(近欧洲)
Mac Mini M4$0.60$0.85$1.50
Mac Studio M4 Max$1.30$1.85$3.25
PC + RTX 3060$3.90$5.50$9.70
PC + RTX 3090$6.80$9.60$17.00
PC + RTX 4090$6.40$9.10$16.00
PC + 2× 3090$11.60$16.40$29.00

成本计算器里代入你自己的模型和 GPU 算一算。两条诚实的结论:对常开运行而言,苹果芯片或迷你 PC 比任何主机都便宜得多;而即便是"昂贵"的 4090 机器,每月成本也低于一个 ChatGPT Plus 席位——本地 vs 云对比有完整的盈亏平衡算账,含硬件摊销。

最能压低账单的两项设置

1. 给 GPU 限功耗(最大收益,几乎零副作用)

LLM 推理受内存带宽限制,而非算力限制——GPU 的最高功耗区间大多被浪费。将 RTX 4090 从 450W 限到 300W,通常只损失约 5–10% 的 token/秒;将 3090 从 350W 限到 250W,表现相同:

# Cap the GPU at 300W (resets at reboot; persist via a startup script)
sudo nvidia-smi -pl 300

# Verify under load
nvidia-smi --query-gpu=power.draw,power.limit --format=csv -l 5

这一条命令为重度 24/7 用户每月省下 3–8 美元,并按比例降低热量和风扇噪音。

2. 别在耗电的卡上一直挂着模型

Ollama 默认在 5 分钟后卸载模型(OLLAMA_KEEP_ALIVE),让 GPU 跌入深度空闲。如果你为了即时响应设置 OLLAMA_KEEP_ALIVE=-1,要知道代价:一块挂着模型的 3090,空闲功耗比空载时高 20–30W。在高效硬件上让模型常驻;在大号 NVIDIA 卡上让它们卸载。

在无头 Linux 服务器上还值得检查:如果 nvidia-smi 在什么都没加载时显示 40W 以上,说明卡卡在了高 P-state——查一下你驱动版本对应的持久化模式和 P-state 修复方法。

测量,别猜

AI 机器的电源选型

现代 GPU 会拉出远超额定功率的尖锐毫秒级尖峰——一块 4090 瞬时可拉 600W 以上。电源功率不足会产生经典的"模型一加载 PC 就重启"故障:

一个 80+ 金牌或白金单元还能以更少的瓦特化为热量浪费——在 24/7 运行下,这份能效溢价会在电源寿命内自行回本。

{{affiliate-link:psu-1000w-platinum}}

常见问题

本地 LLM 每次查询用多少电?

几乎没有。一块 4090 以 450W 花 15 秒生成一个 500-token 的回答,约用 1.9 瓦时——三百分之一美分。每次查询的成本是舍入误差;对一台 24/7 的机器而言,*空闲时长*才是整份账单。

让 Ollama 24/7 运行贵吗?

在 Mac 或迷你 PC 上,不贵——全包每月 1–3 美元。在配大号 GPU 的游戏主机上,主机自身的空闲功耗按你的电价要花每月 8–17 美元。如果这台机器主要是服务器,高效硬件省下的比任何软件微调都多。

运行本地 LLM 会把房间加热吗?

每一瓦特都会变成热量。450W 的推理负载就是一台开小档的取暖器;夏天开着空调,你为这些瓦特付两次钱——一次制造热量,一次移走它。给 GPU 限功耗有帮助,免费的通风也有帮助。

算上电费后,本地 AI 仍比云 API 便宜吗?

对稳定的个人使用,通常是的:即便一台 4090 机器每月约 10 美元的电费,对重度用户也低于等价的 API 支出,而硬件会在数年间摊销。完整对比——含硬件成本——见本地 AI vs 云成本指南

相关指南

← 所有指南 | 检查 GPU 兼容性