ZFS Autosnapshot und PVE Cluster Replikation

antiager

Well-Known Member
Jan 15, 2020
201
11
58
64
61191 Rosbach vor der Höhe
Hallo Forum!

Ist es empfehlenwert beide nebeineinander zu betreiben?

Wenn ja, was muss man in einem solchen Fall beachten?

Ich habe aktuell in einem V9 Cluster mit raspi quorum (der Raspi ist kein echter node) Problem mit der VM Replikation die sehr lange braucht (ok, ist die erstreplikation) und auch gerne mal abbricht.

Teilweise funktioniert es auch.

Das ganze Fehlerbild ist undurchsichtig für mich. Deshalb auch die Frage betr. Autosnapshot.

Es sind Gigabit Nics im Einsatz und es gibt kein dezidiertes Clusternetzwerk (das rüste ich gerade nach).

Server ist ein HP Proliant und ein Dell (also echte Servermaschinen) Typenbezeihchnungen könnte ich nachliefern.

Erstmal danke für eure Hilfe!!
 
Wenn alles über die gleiche Netzwerkhardware läuft, würde ich schlicht darauf tippen, dass der Netzwerktraffic zu viel für die Karten ist. Da würde ich also zuerst gucken, dass du dir zusätzliche Karten nur für corosync und den Replikationstraffic besorgst. Die vorhandene kann dann als Fallback für corosync dienen zusätzlich zu ihren sonstigen Aufgaben.
Da die Replikation auch mit ( anders benamten ) Snapshots arbeitet, sehe ich da kein Problem. Höchstens bei rotierenden HDDs könnte ich mir das vorstellen, aber auch da nicht wirklich? Was für Storage hast du denn verbaut?
 
Dann tipped ich auf das Netzwerk, was sage die Logs? Wie ist die Auslastung des Netzwerks?
 
Für die Replikation schau direkt ins Job-Log: in der GUI beim Gast unter Replication den Job anklicken, da steht meist recht klar drin an welchem Punkt er abbricht. Auf der Shell dazu journalctl -u pvesr. Und parallel pvecm status beobachten, wenn dir während der Übertragung das Quorum flappt (Corosync lief ja vorher über die selbe Gigabit-Leitung), reißt das gern mitten drin die Replikation ab. Dann im journalctl -u corosync nach Retransmits/Link-down schauen.

Ehrlich gesagt ist Gigabit bei der Erstreplikation von nem SSD-Raid10 aber einfach der Flaschenhals, ~110 MB/s netto und mehr geht nicht. Bei viel Daten zieht sich der erste Sync deshalb ewig, danach läufts inkrementell fix. Dass du Corosync und Replikation jetzt aufs eigene Netz gelegt hast war auf jeden Fall richtig.

Autosnapshot und PVE-Replikation beißen sich nicht. Die Replikation nutzt eigene Snapshots (__replicate_...) und räumt die selbst wieder auf. Einzig aufpassen, dass dein Autosnapshot-Tool beim Prunen nicht mit nem zu breiten Pattern die Replikations-Snapshots mit wegräumt, sonst bricht dir der nächste inkrementelle Sync weg.
 
  • Like
Reactions: Johannes S and news