外观
监控与告警
先解决告警通道
「没收到告警」不等于「没有问题」
PVE 默认用本机 Postfix 直接投递邮件,绝大多数收件服务器会拒收来自家宽 IP 的直连邮件。
结果是:备份失败了、磁盘报警了、池降级了,你什么都收不到,还以为一切正常。
配一个外部 SMTP 中继,是监控这一块最先该做的事。配完之后一定要发一封测试邮件验证。
本章文章
- 内置图表与 RRD:不装任何外部工具,读懂节点、虚拟机和存储自带的图表,以及它的局限。
- 外部指标服务器:InfluxDB 与 Graphite:用 PVE 内置的推送功能接入已有的时序数据库。
- Prometheus + Grafana 监控:用社区维护的导出器把 PVE 接入 Prometheus 生态。
指标导出
PVE 内置了指标导出功能(数据中心 → Metric Server),支持 InfluxDB 和 Graphite 协议。配合 Grafana 能做出完整的监控面板,见外部指标服务器。
另一条路是用社区维护的 prometheus-pve-exporter 接进 Prometheus,见Prometheus + Grafana 监控。
该监控什么
按重要性:
| 指标 | 阈值建议 |
|---|---|
系统盘(/)使用率 | > 85% 告警 |
| LVM-Thin 的 Data% / Meta% | > 80% 告警 |
| ZFS 池状态 | 非 ONLINE 立即告警 |
| ZFS 池使用率 | > 80% 告警 |
| 备份任务结果 | 失败立即告警 |
| SMART 属性变化 | 重映射扇区数增长时告警 |
| 内存 available | 持续偏低时告警 |
什么时候该上自动监控
单机 + 少量客户机时,健康检查清单手动跑就够。
出现这些信号时考虑自动化:节点超过两三台、出现过「问题几天后才发现」、有人依赖你的服务。