Ich habe mehrere HP Gen8 Server mit mehreren 1G-Netzwerkanschlüsse.
Nach längerem habe ich wieder ein Update gemacht und ist jetzt auf 9.2.20
Seither habe ich massiv Netzwerkprobleme, was sich auch schon in Pulk-Start geäussert hat.
Ausgangslage:
Was spannend ist: der eigentliche Netzwerkdurchsatz scheint unauffällig zu sein:
:~# iperf3 -c 10.16.100.11
Connecting to host 10.16.100.11, port 5201
[ 5] local 10.16.100.10 port 33594 connected to 10.16.100.11 port 5201
[ ID] Interval Transfer Bitrate Retr Cwnd
[ 5] 0.00-1.00 sec 114 MBytes 956 Mbits/sec 0 414 KBytes
[ 5] 1.00-2.00 sec 112 MBytes 940 Mbits/sec 0 414 KBytes
[ 5] 2.00-3.00 sec 113 MBytes 947 Mbits/sec 0 444 KBytes
[ 5] 3.00-4.00 sec 96.6 MBytes 811 Mbits/sec 0 472 KBytes
[ 5] 4.00-5.00 sec 112 MBytes 937 Mbits/sec 0 499 KBytes
[ 5] 5.00-6.00 sec 113 MBytes 946 Mbits/sec 0 499 KBytes
[ 5] 6.00-7.00 sec 112 MBytes 940 Mbits/sec 0 499 KBytes
[ 5] 7.00-8.00 sec 107 MBytes 900 Mbits/sec 0 499 KBytes
[ 5] 8.00-9.00 sec 86.8 MBytes 728 Mbits/sec 0 499 KBytes
[ 5] 9.00-10.00 sec 112 MBytes 938 Mbits/sec 0 499 KBytes
- - - - - - - - - - - - - - - - - - - - - - - - -
[ ID] Interval Transfer Bitrate Retr
[ 5] 0.00-10.00 sec 1.05 GBytes 904 Mbits/sec 0 sender
[ 5] 0.00-10.00 sec 1.05 GBytes 902 Mbits/sec receiver
iperf Done.
----------------------------------------------
Aber in der Praxix läufft seit Update das Backup seht lange mit gefühlt Faktor 1000. Eine einfache Maschine:
INFO: processed 3.226 GiB in 11h 10m 0.8s, uploaded 722.48 MiB
Ich bekomme seit Update auch viele "ERROR: can't acquire lock '/var/run/vzdump.lock' - got timeout" Meldungen bei Backup und Migration.
Auch hängt sich Replikation des öffters, sodass ich es mit "pvesr delete <VM-ID>-<INDEX> --force" abbrechen muss.
Ich habe den Eindruck, dass sich Backup-Prozesse und Replikation-Prozesse untereinander und gegeneinander blockieren.


Nach längerem habe ich wieder ein Update gemacht und ist jetzt auf 9.2.20
Seither habe ich massiv Netzwerkprobleme, was sich auch schon in Pulk-Start geäussert hat.
Ausgangslage:
- nic0, nic1, nic3 sind UP → drei physische Ports aktiv.
- nic2 ist DOWN.
- vmbr0 hat 10.16.50.10/24
- vmbr4 hat 10.16.100.10/24
- vmbr1 hat keine IPv4-Adresse -> VM/CT-Netzwerk.
- alle drei Leitungen haben getrennte Switch
Aktueller Aufbau
| Verkehr | Netzwerk | Physisches Interface |
|---|---|---|
| Corosync | 10.16.50.0/24 | nic0 / vmbr0 |
| Management/Gateway | 10.16.50.0/24 | nic0 / vmbr0 |
| VM-Netz | Layer 2 | nic1 / vmbr1 |
| Backup | 10.16.100.0/24 | nic3 / vmbr4 |
| ZFS-Replication | 10.16.100.0/24 | nic3 / vmbr4 |
Was spannend ist: der eigentliche Netzwerkdurchsatz scheint unauffällig zu sein:
:~# iperf3 -c 10.16.100.11
Connecting to host 10.16.100.11, port 5201
[ 5] local 10.16.100.10 port 33594 connected to 10.16.100.11 port 5201
[ ID] Interval Transfer Bitrate Retr Cwnd
[ 5] 0.00-1.00 sec 114 MBytes 956 Mbits/sec 0 414 KBytes
[ 5] 1.00-2.00 sec 112 MBytes 940 Mbits/sec 0 414 KBytes
[ 5] 2.00-3.00 sec 113 MBytes 947 Mbits/sec 0 444 KBytes
[ 5] 3.00-4.00 sec 96.6 MBytes 811 Mbits/sec 0 472 KBytes
[ 5] 4.00-5.00 sec 112 MBytes 937 Mbits/sec 0 499 KBytes
[ 5] 5.00-6.00 sec 113 MBytes 946 Mbits/sec 0 499 KBytes
[ 5] 6.00-7.00 sec 112 MBytes 940 Mbits/sec 0 499 KBytes
[ 5] 7.00-8.00 sec 107 MBytes 900 Mbits/sec 0 499 KBytes
[ 5] 8.00-9.00 sec 86.8 MBytes 728 Mbits/sec 0 499 KBytes
[ 5] 9.00-10.00 sec 112 MBytes 938 Mbits/sec 0 499 KBytes
- - - - - - - - - - - - - - - - - - - - - - - - -
[ ID] Interval Transfer Bitrate Retr
[ 5] 0.00-10.00 sec 1.05 GBytes 904 Mbits/sec 0 sender
[ 5] 0.00-10.00 sec 1.05 GBytes 902 Mbits/sec receiver
iperf Done.
----------------------------------------------
Aber in der Praxix läufft seit Update das Backup seht lange mit gefühlt Faktor 1000. Eine einfache Maschine:
INFO: processed 3.226 GiB in 11h 10m 0.8s, uploaded 722.48 MiB
Ich bekomme seit Update auch viele "ERROR: can't acquire lock '/var/run/vzdump.lock' - got timeout" Meldungen bei Backup und Migration.
Auch hängt sich Replikation des öffters, sodass ich es mit "pvesr delete <VM-ID>-<INDEX> --force" abbrechen muss.
Ich habe den Eindruck, dass sich Backup-Prozesse und Replikation-Prozesse untereinander und gegeneinander blockieren.

