Proxmox VE 9.2.5: Host friert während LXC-Backups auf PBS ein und wird vom Watchdog neu gestartet

hschade

New Member
Jul 24, 2026
1
0
1
Hallo zusammen,


wir haben auf zwei identisch aufgebauten Proxmox-Hosts ein reproduzierbares Problem und kommen mit der Fehlersuche nicht mehr weiter.


Umgebung​


  • Proxmox VE 9.2.5
  • getestet mit
    • Kernel 7.0.14-5-pve
    • Kernel 7.0.14-6-pve
  • Root-Dateisystem: ZFS (rpool)
  • VM-/LXC-Daten liegen auf einem klassischen LVM auf einer Fujitsu ETERNUS über Fibre Channel
  • 2 × QLogic QLE2690 (qla2xxx)
  • Multipath (ALUA)
  • Backupziel ist ein Proxmox Backup Server (PBS)

Problem​


Während eines Backupjobs mit mehreren LXC-Containern friert der komplette Host ein.


Anschließend startet der Server durch den Watchdog automatisch neu.


Im Backup erscheint anschließend nur noch:



Connection error 595: No route to host


Das ist jedoch lediglich die Folge des Neustarts, da der komplette Host zuvor bereits nicht mehr erreichbar ist.


Während des Fehlers sind


  • SSH nicht mehr erreichbar
  • WebGUI nicht mehr erreichbar
  • Ping ebenfalls nicht mehr erreichbar

Bisherige Tests​


Einzelne Container lassen sich problemlos sichern.


Zum Beispiel:




vzdump 501 --storage STW-PBS-NAS --mode suspend


läuft erfolgreich durch.


Ebenso




vzdump 502 --storage STW-PBS-NAS --mode suspend


funktioniert problemlos.


Der Fehler tritt erst bei einem Backupjob mit mehreren Containern auf.


Beispielsweise:




501
502
801


Container 501 wird erfolgreich gesichert.


Während der Sicherung von Container 502 friert der komplette Host ein und wird anschließend vom Watchdog neu gestartet.


Bereits ausgeschlossen​


  • gleiches Verhalten unter Kernel 7.0.14-5 und 7.0.14-6
  • PBS selbst funktioniert
  • einzelne Backups funktionieren zuverlässig
  • keine Auffälligkeiten im Multipath
  • keine Fibre-Channel-Linkfehler
  • keine SCSI- oder qla2xxx-Fehler im dmesg
  • Root-Dateisystem ist ZFS
  • Container liegen auf LVM über Fibre Channel

Der Watchdog läuft als Software Watchdog:




watchdog-mux
Software Watchdog


Hardware​


Server:
Fujitsu PRIMERGY


Storage:
Fujitsu ETERNUS


Fibre-Channel-HBAs:


  • 2 × QLogic QLE2690
  • Treiber: qla2xxx

Frage​


Hat jemand ein ähnliches Verhalten bereits unter Proxmox VE 9.2.x beobachtet?


Insbesondere in Verbindung mit


  • LVM auf Fibre Channel
  • Fujitsu ETERNUS
  • QLogic qla2xxx
  • PBS-Backups
  • Watchdog-Reboots

Gibt es bekannte Probleme oder weitere Debug-Möglichkeiten, um herauszufinden, welcher Kernel-Thread bzw. Treiber den Host zum Stillstand bringt?


Für jeden Hinweis wären wir sehr dankbar.


Vielen Dank!
 
Hallo @hschade

vielen Dank für deinen Post!

Hat der Kernel vllt unter /var/lib/systemd/pstore/*/dmesg.txt einen Crash dump abgelegt?

Ansonsten bitte gerne auch mal die Journals von einem Crash anfügen, dann können wir ggf. einen ungewöhnlichen Prozessablauf sehen.

Du schreibst das Problem tritt auf beiden 7.0.14-5 und -6 auf.
Besteht die Möglichkeit den Host nochmal mit Kernel 6.17 zu booten oder einem vorhergehend known-good Kernel, um auszuschließen dass ein anderes Paket Update das Problem verursacht?
Dafür kannst du das proxmox-boot-tool verwenden.

MfG
Jonas
 
Hat jemand ein ähnliches Verhalten bereits unter Proxmox VE 9.2.x beobachtet?
Bisher nicht. Bin vor gut einer Stunde auf 9.2.5 7.0.14-6-pve und der stündliche Multi-LXC-Backup-Job lief normal. Der geht auf NFS. Derzeit läuft aber einer auf PBS mit LXCs und VMs auch problemlos.
Insbesondere in Verbindung mit
  • LVM auf Fibre Channel
  • Fujitsu ETERNUS
  • QLogic qla2xxx
Ok, ich hab nur'n Homelab mit ZFS.
 
Last edited:
Ich habe zwar Kunden mit Eternus im Backend, aber die nutzen keine LXC, sondern nur VMs, damit man die im Cluster Live migrieren kann.
Da gibt es keine Probleme. Warum genau nutzt du LXC auf einem shared Storage?