Proxmox VE 9.2 – kompletter Host-Freeze / Hardreset nötig

xBeaTz

Member
Nov 27, 2022
2
1
8
Hallo zusammen,

ich versuche derzeit einen sporadischen, aber vollständigen Freeze meines Proxmox-Hosts zu finden und wollte fragen, ob jemand ein ähnliches Problem mit einer vergleichbaren Hardware-/PCIe-Konfiguration kennt.

Fehlerbild​

Der Proxmox-Host friert sporadisch komplett ein.

  • Web-GUI nicht mehr erreichbar
  • SSH nicht mehr erreichbar
  • Netzwerk reagiert nicht mehr
  • Host-Konsole reagiert nicht mehr
  • es hilft nur ein Hardreset
Bisher konnte ich keinen eindeutigen Fehler im Kernel-Log finden.

Proxmox​

Proxmox VE 9.2.0
pve-manager 9.2.10

Getestete Kernel:

7.0.14-12-pve
6.17.13-21-pve
Der komplette Host-Freeze ist mit beiden Kernel-Versionen aufgetreten. Daher gehe ich momentan nicht davon aus, dass es ausschließlich ein Problem des 7.0-Kernels ist.

Hardware / PCIe​

Die Plattform basiert auf AMD Renoir/Cezanne.

Relevante PCIe-Geräte:

01:00.0 Phison PS5013-E13 PCIe3 NVMe
02:00.0 Realtek RTL8111/8168/8211/8411 Ethernet
03:00.0 MediaTek MT7921K / RZ608 Wi-Fi 6E
04:00.0 Intel I225-V Ethernet
05:00.0 VIA VL805/806 USB 3.0 Controller
06:00.x AMD Renoir/Cezanne interne Geräte
Treiber:

NVMe -> nvme
I225-V -> igc
MT7921K -> mt7921e
Die PCIe-Topologie sieht unter anderem so aus:

00:01.2-[01]----00:00.0 Phison NVMe
00:02.1-[03]----00:00.0 MediaTek MT7921K
00:02.2-[04]----00:00.0 Intel I225-V
00:02.3-[05]----00:00.0 VIA USB

NVMe​

Die NVMe SMART/Health-Daten sehen unauffällig aus:

Critical Warning: 0x00
Temperature: 37 °C
Available Spare: 100 %
Available Spare Threshold: 5 %
Percentage Used: 14 %
Data Units Read: 167 TB
Data Units Written: 29,8 TB
Power Cycles: 53
Power On Hours: 32544
Unsafe Shutdowns: 29
Media and Data Integrity Errors: 0
Error Information Log Entries: 0
Warning Comp. Temperature Time: 0
Critical Comp. Temperature Time: 0
Temperature Sensor 1: 52 °C
Im Kernel-Log finde ich ebenfalls keine offensichtlichen NVMe-Probleme wie:

  • I/O errors
  • Controller reset
  • Timeout
  • Abort
  • NVMe error
Daher halte ich einen klassischen NVMe-Defekt momentan eher für unwahrscheinlich.

PCIe / AER​

Ich habe die Kernel-Logs nach folgenden Meldungen durchsucht:

AER
PCIe Bus Error
Corrected error
Uncorrected
fatal
non-fatal
timeout
unsupported request
I/O error
Dabei wurden keine tatsächlichen PCIe-AER-Fehler gefunden.

Interessant ist allerdings, dass bei mehreren Geräten ASPM/L1 aktiv ist.

Beispielsweise beim I225-V:

LnkCap: Speed 5GT/s, Width x1, ASPM L1
LnkCtl: ASPM L1 Enabled
LnkSta: Speed 5GT/s, Width x1
und beim NVMe:

LnkCap: Speed 8GT/s, Width x4, ASPM L1
LnkCtl: ASPM L1 Enabled
LnkSta: Speed 8GT/s, Width x4

Bisherige Tests​

Ich habe zunächst verschiedene Kernel getestet:

7.0.14-12-pve → Freeze
6.17.13-21-pve → ebenfalls Freeze
Damit lässt sich ein ausschließlich auf den aktuell verwendeten 7.0-Kernel beschränktes Problem zumindest nicht bestätigen.

Aktuell teste ich weitere mögliche Ursachen und möchte dabei möglichst nur eine Variable nach der anderen verändern.

Meine aktuelle Vermutung​

Da NVMe-SMART unauffällig ist und keine offensichtlichen PCIe-AER- oder NVMe-Fehler geloggt werden, vermute ich momentan eher ein Problem in einem dieser Bereiche:

  • PCIe Power Management / ASPM
  • PCIe-Link bzw. AMD-Root-Port
  • Intel I225-V / igc
  • MediaTek MT7921K / mt7921e
  • Zusammenspiel mehrerer PCIe-Geräte
  • AMD-Firmware/BIOS bzw. ACPI
Interessant wäre insbesondere, ob jemand mit AMD Renoir/Cezanne + I225-V + MT7921K + Phison E13 NVMe bereits ähnliche komplette Host-Freezes erlebt hat.

Falls jemand eine ähnliche Konfiguration hat oder einen Ansatz kennt, mit dem man bei einem vollständigen Hard-Freeze noch mehr Informationen sammeln kann, wäre ich für Hinweise sehr dankbar.

Bei Bedarf kann ich noch folgende Informationen posten:

pveversion -v
lspci -vvv
journalctl -k -b -1
BIOS-Version
CPU/Mainboard
Danke!
 
Der Proxmox-Host friert sporadisch komplett ein.
Das mit dem sporadisch ist immer der gemeinste Fehler, da er schlecht reproduziert werden kann.
Wäre ja interessant, ob es hier zu einem Swappen des Systems kommt.
Poste bitte einmal dazu : Mainboard, Genaue CPU, verbauter Speicher.
Dann was läuft darauf an VMs/ Container und wie wurden die Resourcen CPU und Speicher verplant, bzw. zugewiesen.
Evtl kannst du auch auf einer angemeldeten Konsole mal das Programm TOP (besser HTOP ) laufen lassen - ein Monitor mit Tastatur ist angeschlossen, wenn "die Konsole nicht reagiert"? Wenn er einfriert hätte man ja ein letztes Auslastungsbild der Maschine.
 
Bin ich der einzige, der davon ausgeht, dass hier der Intel-NIC-Bug schuld ist?

Ich würde zuerst mal das Wifi und die Intel-NIC im Bios rausnehmen. Wifi ist Quatsch und Intel macht Probleme.

Aber noch sind die Infos zu rar, um wirklich helfen zu können.
 
Guten Mittag, ich werfe noch mal in den Raum bios-batterie, BIOS Update, korruptes Flash für das BIOS und da würde ich mal anfangen, so wie halt Netzteil und Netzteil tauschen.
 
  • Like
Reactions: Johannes S
Danke für die Hinweise!

Ein Swappen des Systems halte ich aktuell eher für unwahrscheinlich. Der Host hat 32 GB RAM, aktuell sind etwa 12–14 GB belegt und noch ca. 16–18 GB verfügbar. Swap sind 8 GB vorhanden, davon werden nur rund 700 KB verwendet.

Wichtig vielleicht noch als Ergänzung: Wenn der Freeze auftritt, ist nicht nur das Netzwerk bzw. die GUI weg. Auch der direkte Konsolenzugriff am Gerät funktioniert nicht mehr und über HDMI kommt nur noch „No Signal“. Es hilft anschließend nur ein Hardreset. htop kann ich daher im eingefrorenen Zustand leider nicht mehr auswerten.

Die Hardware ist:

  • Minisforum HM80
  • AMD Ryzen 7 4800U, 8C/16T
  • 32 GB DDR4-3200 (2× 16 GB A-DATA, non-ECC)
Darauf laufen aktuell 4 VMs und 17 LXC-Container.

Der Hinweis auf die Intel I225-V bzw. das WLAN ist interessant. Ich werde beide Geräte testweise im BIOS deaktivieren und beobachten, ob die Freezes weiterhin auftreten.

Was mich dabei etwas stutzig macht: Das System läuft in genau dieser Hardwarekonfiguration seit etwa 3 Jahren völlig problemlos. Die kompletten Host-Freezes haben erst vor kurzem und ziemlich plötzlich angefangen.

Daher würde ich jetzt möglichst eine Variable nach der anderen ändern und schauen, ob sich das Verhalten dadurch verändert.
 
  • Like
Reactions: ThoSo
Ein Swappen des Systems halte ich aktuell eher für unwahrscheinlich. Der Host hat 32 GB RAM, aktuell sind etwa 12–14 GB belegt und noch ca. 16–18 GB verfügbar. Swap sind 8 GB vorhanden, davon werden nur rund 700 KB verwendet.
Der Knackpunkt ist eher das Gegenteil. Ohne Swap kann das System Speicher nicht auslagern, nach meinen Verständnis folgender Blogposts eines Kernel-Entwicklers werden freezes also wahrscheinlicher:

In deinen Fall dürfte das aber als Ursache ausfallen
 
Wichtig vielleicht noch als Ergänzung: Wenn der Freeze auftritt, ist nicht nur das Netzwerk bzw. die GUI weg. Auch der direkte Konsolenzugriff am Gerät funktioniert nicht mehr und über HDMI kommt nur noch „No Signal“. Es hilft anschließend nur ein Hardreset. htop kann ich daher im eingefrorenen Zustand leider nicht mehr auswerten.
Das habe ich bei dem e1000-Problem noch nie erlebt. Deutet tatsächlich auf ein HWProblem.
Da bin ich dann ganz bei @news. Zusätzlich ein Wärmeproblem in Betracht ziehen. Also Lüfter kontrollieren.
 
  • Like
Reactions: news and GMBauer
Vielleicht die Kiste mal öffnen und ordentlich mit Druckluft durchblasen, damit die Ritzen wieder sauber werden.
Wenn auf der Maschine noch ein 6.14er Kernel verfügbar ist, könntest mit diesem auch einen Testlauf starten um auszuschließen das es an den neueren Kerneln liegt.
Steht der an einem kühlen Ort oder eher im warmen bis extrem heißen Bereich? Wobei die NVMe mit 37 Grad eher kühl ist.

Ich würde auch das Mainboard einem intensiven Blick gönnen, ob da vielleicht ein Bauteil ungewöhnliche Formen hat oder es elektrisch riecht.
 
Last edited:
  • Like
Reactions: Johannes S
Vielleicht die Kiste mal öffnen und ordentlich mit Druckluft durchblasen, damit die Ritzen wieder sauber werden.
Wenn auf der Maschine noch ein 6.14er Kernel verfügbar ist, könntest mit diesem auch einen Testlauf starten um auszuschließen das es an den neueren Kerneln liegt.
Steht der an einem kühlen Ort oder eher im warmen bis extrem heißen Bereich? Wobei die NVMe mit 37 Grad eher kühl ist.

Ich würde auch das Mainboard einem intensiven Blick gönnen, ob da vielleicht ein Bauteil ungewöhnliche Formen hat oder es elektrisch riecht.
Und das Lüfterrad mit einem Zahnstocher o.ä blockieren. Du wärst nicht der Erste, der einem Lüfter mit Druckluft den Hals umdreht.
 
  • Like
Reactions: Johannes S and UdoB
Du darfst da auch gerne ein zartes lüften aus deinem spitzen Mündchen pusten.
Zahnstocher … Witzbold,
Druckluft mit 5bar, selbst aus der Dose, ist nun was anderes als ein Püsterchen oder Staubsauger. Darum die Anmerkung.
 
Last edited:
Danke für die Hinweise!

Ein Swappen des Systems halte ich aktuell eher für unwahrscheinlich. Der Host hat 32 GB RAM, aktuell sind etwa 12–14 GB belegt und noch ca. 16–18 GB verfügbar. Swap sind 8 GB vorhanden, davon werden nur rund 700 KB verwendet.

Wichtig vielleicht noch als Ergänzung: Wenn der Freeze auftritt, ist nicht nur das Netzwerk bzw. die GUI weg. Auch der direkte Konsolenzugriff am Gerät funktioniert nicht mehr und über HDMI kommt nur noch „No Signal“. Es hilft anschließend nur ein Hardreset. htop kann ich daher im eingefrorenen Zustand leider nicht mehr auswerten.

Die Hardware ist:

  • Minisforum HM80
  • AMD Ryzen 7 4800U, 8C/16T
  • 32 GB DDR4-3200 (2× 16 GB A-DATA, non-ECC)
Darauf laufen aktuell 4 VMs und 17 LXC-Container.

Der Hinweis auf die Intel I225-V bzw. das WLAN ist interessant. Ich werde beide Geräte testweise im BIOS deaktivieren und beobachten, ob die Freezes weiterhin auftreten.

Was mich dabei etwas stutzig macht: Das System läuft in genau dieser Hardwarekonfiguration seit etwa 3 Jahren völlig problemlos. Die kompletten Host-Freezes haben erst vor kurzem und ziemlich plötzlich angefangen.

Daher würde ich jetzt möglichst eine Variable nach der anderen ändern und schauen, ob sich das Verhalten dadurch verändert.
Ich habe da nicht so viel Ahnung von Customer Hardware, aber HM80 und HM90 habe ich schon oft mit diesen Problemen gehört. Komischerweise treten da die Fehler nicht auf wenn man ein nacktes Debian13 installiert. Entweder mögen die Dinger keine aktuellen Kernel oder etwas anderes.
Such mal im Netz oder auf Discord nach Leidgenossen, da gibts eine Menge. Eventuell haben die spezielle Tipps für die Modelle.