Hallo zusammen,
wir haben auf zwei identisch aufgebauten Proxmox-Hosts ein reproduzierbares Problem und kommen mit der Fehlersuche nicht mehr weiter.
Während eines Backupjobs mit mehreren LXC-Containern friert der komplette Host ein.
Anschließend startet der Server durch den Watchdog automatisch neu.
Im Backup erscheint anschließend nur noch:
Connection error 595: No route to host
Das ist jedoch lediglich die Folge des Neustarts, da der komplette Host zuvor bereits nicht mehr erreichbar ist.
Während des Fehlers sind
Einzelne Container lassen sich problemlos sichern.
Zum Beispiel:
vzdump 501 --storage STW-PBS-NAS --mode suspend
läuft erfolgreich durch.
Ebenso
vzdump 502 --storage STW-PBS-NAS --mode suspend
funktioniert problemlos.
Der Fehler tritt erst bei einem Backupjob mit mehreren Containern auf.
Beispielsweise:
501
502
801
Container 501 wird erfolgreich gesichert.
Während der Sicherung von Container 502 friert der komplette Host ein und wird anschließend vom Watchdog neu gestartet.
Der Watchdog läuft als Software Watchdog:
watchdog-mux
Software Watchdog
Server:
Fujitsu PRIMERGY
Storage:
Fujitsu ETERNUS
Fibre-Channel-HBAs:
Hat jemand ein ähnliches Verhalten bereits unter Proxmox VE 9.2.x beobachtet?
Insbesondere in Verbindung mit
Gibt es bekannte Probleme oder weitere Debug-Möglichkeiten, um herauszufinden, welcher Kernel-Thread bzw. Treiber den Host zum Stillstand bringt?
Für jeden Hinweis wären wir sehr dankbar.
Vielen Dank!
wir haben auf zwei identisch aufgebauten Proxmox-Hosts ein reproduzierbares Problem und kommen mit der Fehlersuche nicht mehr weiter.
Umgebung
- Proxmox VE 9.2.5
- getestet mit
- Kernel 7.0.14-5-pve
- Kernel 7.0.14-6-pve
- Root-Dateisystem: ZFS (rpool)
- VM-/LXC-Daten liegen auf einem klassischen LVM auf einer Fujitsu ETERNUS über Fibre Channel
- 2 × QLogic QLE2690 (qla2xxx)
- Multipath (ALUA)
- Backupziel ist ein Proxmox Backup Server (PBS)
Problem
Während eines Backupjobs mit mehreren LXC-Containern friert der komplette Host ein.
Anschließend startet der Server durch den Watchdog automatisch neu.
Im Backup erscheint anschließend nur noch:
Connection error 595: No route to host
Das ist jedoch lediglich die Folge des Neustarts, da der komplette Host zuvor bereits nicht mehr erreichbar ist.
Während des Fehlers sind
- SSH nicht mehr erreichbar
- WebGUI nicht mehr erreichbar
- Ping ebenfalls nicht mehr erreichbar
Bisherige Tests
Einzelne Container lassen sich problemlos sichern.
Zum Beispiel:
vzdump 501 --storage STW-PBS-NAS --mode suspend
läuft erfolgreich durch.
Ebenso
vzdump 502 --storage STW-PBS-NAS --mode suspend
funktioniert problemlos.
Der Fehler tritt erst bei einem Backupjob mit mehreren Containern auf.
Beispielsweise:
501
502
801
Container 501 wird erfolgreich gesichert.
Während der Sicherung von Container 502 friert der komplette Host ein und wird anschließend vom Watchdog neu gestartet.
Bereits ausgeschlossen
- gleiches Verhalten unter Kernel 7.0.14-5 und 7.0.14-6
- PBS selbst funktioniert
- einzelne Backups funktionieren zuverlässig
- keine Auffälligkeiten im Multipath
- keine Fibre-Channel-Linkfehler
- keine SCSI- oder qla2xxx-Fehler im dmesg
- Root-Dateisystem ist ZFS
- Container liegen auf LVM über Fibre Channel
Der Watchdog läuft als Software Watchdog:
watchdog-mux
Software Watchdog
Hardware
Server:
Fujitsu PRIMERGY
Storage:
Fujitsu ETERNUS
Fibre-Channel-HBAs:
- 2 × QLogic QLE2690
- Treiber: qla2xxx
Frage
Hat jemand ein ähnliches Verhalten bereits unter Proxmox VE 9.2.x beobachtet?
Insbesondere in Verbindung mit
- LVM auf Fibre Channel
- Fujitsu ETERNUS
- QLogic qla2xxx
- PBS-Backups
- Watchdog-Reboots
Gibt es bekannte Probleme oder weitere Debug-Möglichkeiten, um herauszufinden, welcher Kernel-Thread bzw. Treiber den Host zum Stillstand bringt?
Für jeden Hinweis wären wir sehr dankbar.
Vielen Dank!