外观
故障排查
这个栏目按症状组织,不按功能。你看到的是现象,先从现象出发。
按症状找
| 分类 | 典型症状 |
|---|---|
| 安装与启动 | 装不上、装完不开机、进不了系统 |
| 网络与访问 | Web UI 打不开、改完网络失联、客户机没网 |
| 存储与磁盘 | 空间满了、盘不见了、ZFS 池异常 |
| 虚拟机问题 | 开不了机、卡在启动、直通后黑屏 |
| 容器问题 | 起不来、权限拒绝、挂载点不可写 |
| 集群与 HA | 失去 quorum、节点显示离线、自己重启了 |
| 性能与资源 | IO 慢、内存被吃光、客户机卡顿 |
排查之前先做三件事
慌乱中的操作是二次伤害的主要来源
遇到问题时最危险的做法是「先试试网上搜到的命令」。在动手之前:
1. 记录现状。 现在是什么状态?什么时候开始的?最近改过什么?把报错信息原样抄下来,不要凭印象复述。
2. 确认备份状态。 最近一次成功的备份是什么时候?如果接下来的操作让情况变糟,你能回到哪里?
3. 判断哪些操作不可逆。 格式化、销毁池、强制删除、覆盖恢复——这类操作做之前先停下来想。优先做只读的检查,把范围缩小了再动手。
万能的第一步
不管什么症状,这几条命令先跑一遍:
sh
# 最近的错误
journalctl -p err -b --no-pager | tail -40
# 有没有服务挂了
systemctl --failed
# PVE 核心服务
systemctl status pve-cluster pvedaemon pveproxy pvestatd
# 存储状态
pvesm status
# 空间
df -h /
lvs -a 2>/dev/null
zpool status 2>/dev/null空间满是最常见的根因
「Web UI 打不开」「虚拟机起不来」「任务全部卡住」——这三种症状里,相当一部分的实际原因是系统盘或存储池写满了。先查空间,能省很多时间。
查客户机的问题
sh
# 某台虚拟机的状态和配置
qm status <vmid>
qm config <vmid>
# 启动时的详细输出(会告诉你为什么起不来)
qm start <vmid>
# 容器同理
pct status <ctid>
pct config <ctid>
pct start <ctid>直接在命令行 start,报错更清楚
Web UI 上的任务失败提示常常只有一句话。在 shell 里执行 qm start <vmid>,会把完整的错误输出打出来,通常直接指明原因。
高频问题
宿主机彻底起不来,或者 /etc/pve 出了问题,见迁移与救援。
求助的时候带上什么
去官方论坛或社区提问时,准备好:
sh
pveversion -v加上相关的日志片段、存储配置(cat /etc/pve/storage.cfg)、网络配置(cat /etc/network/interfaces)和客户机配置(qm config <vmid>)。
完整的信息收集和脱敏方法,见如何有效求助。
贴日志前先脱敏
移除:公网 IP、主机名(如果能关联到你)、订阅密钥、API Token、用户名。截图里的这些信息也要遮掉。