跳转到内容

故障排查 ​

这个栏目按症状组织,不按功能。你看到的是现象,先从现象出发。

按症状找 ​

分类典型症状
安装与启动装不上、装完不开机、进不了系统
网络与访问Web UI 打不开、改完网络失联、客户机没网
存储与磁盘空间满了、盘不见了、ZFS 池异常
虚拟机问题开不了机、卡在启动、直通后黑屏
容器问题起不来、权限拒绝、挂载点不可写
集群与 HA失去 quorum、节点显示离线、自己重启了
性能与资源IO 慢、内存被吃光、客户机卡顿

排查之前先做三件事 ​

慌乱中的操作是二次伤害的主要来源

遇到问题时最危险的做法是「先试试网上搜到的命令」。在动手之前:

1. 记录现状。 现在是什么状态?什么时候开始的?最近改过什么?把报错信息原样抄下来,不要凭印象复述。

2. 确认备份状态。 最近一次成功的备份是什么时候?如果接下来的操作让情况变糟,你能回到哪里?

3. 判断哪些操作不可逆。 格式化、销毁池、强制删除、覆盖恢复——这类操作做之前先停下来想。优先做只读的检查,把范围缩小了再动手。

万能的第一步 ​

不管什么症状,这几条命令先跑一遍:

sh
# 最近的错误
journalctl -p err -b --no-pager | tail -40

# 有没有服务挂了
systemctl --failed

# PVE 核心服务
systemctl status pve-cluster pvedaemon pveproxy pvestatd

# 存储状态
pvesm status

# 空间
df -h /
lvs -a 2>/dev/null
zpool status 2>/dev/null

空间满是最常见的根因

「Web UI 打不开」「虚拟机起不来」「任务全部卡住」——这三种症状里,相当一部分的实际原因是系统盘或存储池写满了。先查空间,能省很多时间。

查客户机的问题 ​

sh
# 某台虚拟机的状态和配置
qm status <vmid>
qm config <vmid>

# 启动时的详细输出(会告诉你为什么起不来)
qm start <vmid>

# 容器同理
pct status <ctid>
pct config <ctid>
pct start <ctid>

直接在命令行 start,报错更清楚

Web UI 上的任务失败提示常常只有一句话。在 shell 里执行 qm start <vmid>,会把完整的错误输出打出来,通常直接指明原因。

高频问题 ​

宿主机彻底起不来,或者 /etc/pve 出了问题,见迁移与救援。

求助的时候带上什么 ​

去官方论坛或社区提问时,准备好:

sh
pveversion -v

加上相关的日志片段、存储配置(cat /etc/pve/storage.cfg)、网络配置(cat /etc/network/interfaces)和客户机配置(qm config <vmid>)。

完整的信息收集和脱敏方法,见如何有效求助。

贴日志前先脱敏

移除:公网 IP、主机名(如果能关联到你)、订阅密钥、API Token、用户名。截图里的这些信息也要遮掉。

继续浏览 ​

Proxmox VE 非官方中文使用指南,与 Proxmox Server Solutions GmbH 无隶属关系。