跳转到内容

监控与告警 ​

先解决告警通道 ​

「没收到告警」不等于「没有问题」

PVE 默认用本机 Postfix 直接投递邮件,绝大多数收件服务器会拒收来自家宽 IP 的直连邮件。

结果是:备份失败了、磁盘报警了、池降级了,你什么都收不到,还以为一切正常。

配一个外部 SMTP 中继,是监控这一块最先该做的事。配完之后一定要发一封测试邮件验证。

本章文章 ​

  1. 内置图表与 RRD:不装任何外部工具,读懂节点、虚拟机和存储自带的图表,以及它的局限。
  2. 外部指标服务器:InfluxDB 与 Graphite:用 PVE 内置的推送功能接入已有的时序数据库。
  3. Prometheus + Grafana 监控:用社区维护的导出器把 PVE 接入 Prometheus 生态。

指标导出 ​

PVE 内置了指标导出功能(数据中心 → Metric Server),支持 InfluxDB 和 Graphite 协议。配合 Grafana 能做出完整的监控面板,见外部指标服务器。

另一条路是用社区维护的 prometheus-pve-exporter 接进 Prometheus,见Prometheus + Grafana 监控。

该监控什么 ​

按重要性:

指标阈值建议
系统盘(/)使用率> 85% 告警
LVM-Thin 的 Data% / Meta%> 80% 告警
ZFS 池状态非 ONLINE 立即告警
ZFS 池使用率> 80% 告警
备份任务结果失败立即告警
SMART 属性变化重映射扇区数增长时告警
内存 available持续偏低时告警

什么时候该上自动监控 ​

单机 + 少量客户机时,健康检查清单手动跑就够。

出现这些信号时考虑自动化:节点超过两三台、出现过「问题几天后才发现」、有人依赖你的服务。

继续浏览 ​

Proxmox VE 非官方中文使用指南,与 Proxmox Server Solutions GmbH 无隶属关系。