Hallo zusammen,
ich versuche derzeit einen sporadischen, aber vollständigen Freeze meines Proxmox-Hosts zu finden und wollte fragen, ob jemand ein ähnliches Problem mit einer vergleichbaren Hardware-/PCIe-Konfiguration kennt.
pve-manager 9.2.10
Getestete Kernel:
7.0.14-12-pve
6.17.13-21-pve
Der komplette Host-Freeze ist mit beiden Kernel-Versionen aufgetreten. Daher gehe ich momentan nicht davon aus, dass es ausschließlich ein Problem des 7.0-Kernels ist.
Relevante PCIe-Geräte:
01:00.0 Phison PS5013-E13 PCIe3 NVMe
02:00.0 Realtek RTL8111/8168/8211/8411 Ethernet
03:00.0 MediaTek MT7921K / RZ608 Wi-Fi 6E
04:00.0 Intel I225-V Ethernet
05:00.0 VIA VL805/806 USB 3.0 Controller
06:00.x AMD Renoir/Cezanne interne Geräte
Treiber:
NVMe -> nvme
I225-V -> igc
MT7921K -> mt7921e
Die PCIe-Topologie sieht unter anderem so aus:
00:01.2-[01]----00:00.0 Phison NVMe
00:02.1-[03]----00:00.0 MediaTek MT7921K
00:02.2-[04]----00:00.0 Intel I225-V
00:02.3-[05]----00:00.0 VIA USB
Critical Warning: 0x00
Temperature: 37 °C
Available Spare: 100 %
Available Spare Threshold: 5 %
Percentage Used: 14 %
Data Units Read: 167 TB
Data Units Written: 29,8 TB
Power Cycles: 53
Power On Hours: 32544
Unsafe Shutdowns: 29
Media and Data Integrity Errors: 0
Error Information Log Entries: 0
Warning Comp. Temperature Time: 0
Critical Comp. Temperature Time: 0
Temperature Sensor 1: 52 °C
Im Kernel-Log finde ich ebenfalls keine offensichtlichen NVMe-Probleme wie:
AER
PCIe Bus Error
Corrected error
Uncorrected
fatal
non-fatal
timeout
unsupported request
I/O error
Dabei wurden keine tatsächlichen PCIe-AER-Fehler gefunden.
Interessant ist allerdings, dass bei mehreren Geräten ASPM/L1 aktiv ist.
Beispielsweise beim I225-V:
LnkCap: Speed 5GT/s, Width x1, ASPM L1
LnkCtl: ASPM L1 Enabled
LnkSta: Speed 5GT/s, Width x1
und beim NVMe:
LnkCap: Speed 8GT/s, Width x4, ASPM L1
LnkCtl: ASPM L1 Enabled
LnkSta: Speed 8GT/s, Width x4
7.0.14-12-pve → Freeze
6.17.13-21-pve → ebenfalls Freeze
Damit lässt sich ein ausschließlich auf den aktuell verwendeten 7.0-Kernel beschränktes Problem zumindest nicht bestätigen.
Aktuell teste ich weitere mögliche Ursachen und möchte dabei möglichst nur eine Variable nach der anderen verändern.
Falls jemand eine ähnliche Konfiguration hat oder einen Ansatz kennt, mit dem man bei einem vollständigen Hard-Freeze noch mehr Informationen sammeln kann, wäre ich für Hinweise sehr dankbar.
Bei Bedarf kann ich noch folgende Informationen posten:
pveversion -v
lspci -vvv
journalctl -k -b -1
BIOS-Version
CPU/Mainboard
Danke!
ich versuche derzeit einen sporadischen, aber vollständigen Freeze meines Proxmox-Hosts zu finden und wollte fragen, ob jemand ein ähnliches Problem mit einer vergleichbaren Hardware-/PCIe-Konfiguration kennt.
Fehlerbild
Der Proxmox-Host friert sporadisch komplett ein.- Web-GUI nicht mehr erreichbar
- SSH nicht mehr erreichbar
- Netzwerk reagiert nicht mehr
- Host-Konsole reagiert nicht mehr
- es hilft nur ein Hardreset
Proxmox
Proxmox VE 9.2.0pve-manager 9.2.10
Getestete Kernel:
7.0.14-12-pve
6.17.13-21-pve
Der komplette Host-Freeze ist mit beiden Kernel-Versionen aufgetreten. Daher gehe ich momentan nicht davon aus, dass es ausschließlich ein Problem des 7.0-Kernels ist.
Hardware / PCIe
Die Plattform basiert auf AMD Renoir/Cezanne.Relevante PCIe-Geräte:
01:00.0 Phison PS5013-E13 PCIe3 NVMe
02:00.0 Realtek RTL8111/8168/8211/8411 Ethernet
03:00.0 MediaTek MT7921K / RZ608 Wi-Fi 6E
04:00.0 Intel I225-V Ethernet
05:00.0 VIA VL805/806 USB 3.0 Controller
06:00.x AMD Renoir/Cezanne interne Geräte
Treiber:
NVMe -> nvme
I225-V -> igc
MT7921K -> mt7921e
Die PCIe-Topologie sieht unter anderem so aus:
00:01.2-[01]----00:00.0 Phison NVMe
00:02.1-[03]----00:00.0 MediaTek MT7921K
00:02.2-[04]----00:00.0 Intel I225-V
00:02.3-[05]----00:00.0 VIA USB
NVMe
Die NVMe SMART/Health-Daten sehen unauffällig aus:Critical Warning: 0x00
Temperature: 37 °C
Available Spare: 100 %
Available Spare Threshold: 5 %
Percentage Used: 14 %
Data Units Read: 167 TB
Data Units Written: 29,8 TB
Power Cycles: 53
Power On Hours: 32544
Unsafe Shutdowns: 29
Media and Data Integrity Errors: 0
Error Information Log Entries: 0
Warning Comp. Temperature Time: 0
Critical Comp. Temperature Time: 0
Temperature Sensor 1: 52 °C
Im Kernel-Log finde ich ebenfalls keine offensichtlichen NVMe-Probleme wie:
- I/O errors
- Controller reset
- Timeout
- Abort
- NVMe error
PCIe / AER
Ich habe die Kernel-Logs nach folgenden Meldungen durchsucht:AER
PCIe Bus Error
Corrected error
Uncorrected
fatal
non-fatal
timeout
unsupported request
I/O error
Dabei wurden keine tatsächlichen PCIe-AER-Fehler gefunden.
Interessant ist allerdings, dass bei mehreren Geräten ASPM/L1 aktiv ist.
Beispielsweise beim I225-V:
LnkCap: Speed 5GT/s, Width x1, ASPM L1
LnkCtl: ASPM L1 Enabled
LnkSta: Speed 5GT/s, Width x1
und beim NVMe:
LnkCap: Speed 8GT/s, Width x4, ASPM L1
LnkCtl: ASPM L1 Enabled
LnkSta: Speed 8GT/s, Width x4
Bisherige Tests
Ich habe zunächst verschiedene Kernel getestet:7.0.14-12-pve → Freeze
6.17.13-21-pve → ebenfalls Freeze
Damit lässt sich ein ausschließlich auf den aktuell verwendeten 7.0-Kernel beschränktes Problem zumindest nicht bestätigen.
Aktuell teste ich weitere mögliche Ursachen und möchte dabei möglichst nur eine Variable nach der anderen verändern.
Meine aktuelle Vermutung
Da NVMe-SMART unauffällig ist und keine offensichtlichen PCIe-AER- oder NVMe-Fehler geloggt werden, vermute ich momentan eher ein Problem in einem dieser Bereiche:- PCIe Power Management / ASPM
- PCIe-Link bzw. AMD-Root-Port
- Intel I225-V / igc
- MediaTek MT7921K / mt7921e
- Zusammenspiel mehrerer PCIe-Geräte
- AMD-Firmware/BIOS bzw. ACPI
Falls jemand eine ähnliche Konfiguration hat oder einen Ansatz kennt, mit dem man bei einem vollständigen Hard-Freeze noch mehr Informationen sammeln kann, wäre ich für Hinweise sehr dankbar.
Bei Bedarf kann ich noch folgende Informationen posten:
pveversion -v
lspci -vvv
journalctl -k -b -1
BIOS-Version
CPU/Mainboard
Danke!