RAID5 und XFS im Cluster mixen?

oelk

Member
Feb 15, 2023
9
0
6
Hallo Gemeinde,
unsere bisherigen Nodes waren Intel-Maschinen mit 500GB RAID1 zum booten und 20TB RAID5 (4xHDD) für die VMs.
Jetzt liefert der Anbieter eine Maschine mit einem Broadcom MegaRAID 9550-8i, der kann nur RAID 0,1,10 und
teilt uns auf Anfrage mit, das RAID5 outdated wäre und wir ZFS machen sollten.
Abgesehen davon, das wir keine Erfahrung mit ZFS haben, kann man das im Cluster mischen, was passiert da beim verschieben von VMs?

MfG
 
Last edited:
Hallo,

naja grundsätzlich sollte man ZFS und HW-Raid nicht mischen. Ich unterstelle jetzt mal dass das 500GB RAID1 zwei SSDs auf einen eigenen Controller für die boot-Disc ist? Das kann dann dann so bleiben. Beim HW-Controller muss man jetzt abwägen: HW-Raid (insbesondere wenn man das in RAID10 schaltet) ist performanter als zfs, weil es dann (sofern vorhanden) den Battery-Cache mitnutzen kann. ZFS dagegen ist deutlich flexibler und hat andere nette Features (siehe: https://forum.proxmox.com/threads/f...y-a-few-disks-should-i-use-zfs-at-all.160037/ ) , die ein HW-Raid normalerweise NICHT hat, aber dafür leider keine Beschleunigung durch den Battery-Cache (außer man achtet auf bestimmte Feinheiten, @Falk R. weiß (anders als ich) näheres aus der Praxis zu berichten). Dafür kann man bei zfs ssds als special- und logdevice dazuschalten und damit den Zugriff beschleunigen.
Was aber so oder so eher schlecht performt: HDDs als VM-Storage nutzen, das ist einfach generell eine recht lahme Angelegenheit und RAIDZ macht das noch mal deutlich langsamer: https://forum.proxmox.com/threads/fabu-can-i-use-zfs-raidz-for-my-vms.159923/ Wofür HDDs dagegen natürlich voll klar gehen, um große Datenmengen vorzuhalten, wo es nicht so sehr auf IOPS und Performance ankommt.
Pick your poison :)
Schöne Grüße, Johannes.
 
  • Like
Reactions: ThoSo and UdoB
Mischen kannst du das problemlos, Storage ist im Cluster ja pro Node definiert. Was du halt nicht kriegst ist gemeinsamer Storage: egal ob XFS-Directory oder ZFS, lokal bleibt lokal, und beim Verschieben wird jedes Mal die komplette Disk über die Leitung kopiert. Wenn dabei noch von qcow2 auf ein zvol umgewandelt wird, ist das extra langsam. Live geht mit qm migrate <vmid> <node> --online --with-local-disks, aber wirklich schnell wird es so nicht.

Was beim Mischen komplett flachfällt ist die ZFS-Replikation (pvesr), die geht nur ZFS auf ZFS. Wenn ihr irgendwann HA haben wollt, würd ich eher alle Nodes nach und nach auf ZFS ziehen statt dauerhaft zu mischen.

Der 9550 muss in den JBOD/HBA-Modus, ZFS will die Platten direkt sehen und kein RAID-Volume drunter. Bei 4 HDDs würd ich zwei gespiegelte vdevs nehmen statt RAIDZ1 – das hat deutlich bessere IOPS. Und ARC-Limit setzen, sonst frisst der Cache den RAM, den du für die Gäste brauchst.

Was ist bei euch der XFS-Storage genau, Directory mit qcow2 oder LVM drunter?
 
mit 500GB RAID1 zum booten und 20TB RAID5 (4xHDD)
Damit würde ich:
  • bei der PVE-Installation nur auf das Blech installieren, und zwar auf zwei Spiegel, fka "Raid10". Am Ende ist jede dieser vier Platten bootfähig.
  • später, wenn alles läuft, die beiden kleineren Platten (SSD?) als "Special Device" hinzufügen. Dies beschleunigt den Metadatenzugriff für den gesamten Pool drastisch.
Dieses Konzept wurde schon mehrfach erläutert; es gibt weitere Aspekte wie "special_small_blocks"...

Disclaimer: es gibt durchaus mehrere unterschiedliche Methoden - ich rede hier (natürlich!) nur für mich :-)
 
  • Like
Reactions: news and Johannes S
Hallo Gemeinde,
unsere bisherigen Nodes waren Intel-Maschinen mit 500GB RAID1 zum booten und 20TB RAID5 (4xHDD) für die VMs.
Jetzt liefert der Anbieter eine Maschine mit einem Broadcom MegaRAID 9550-8i, der kann nur RAID 0,1,10 und
teilt uns auf Anfrage mit, das RAID5 outdated wäre und wir ZFS machen sollten.
Abgesehen davon, das wir keine Erfahrung mit ZFS haben, kann man das im Cluster mischen, was passiert da beim verschieben von VMs?

MfG
Den 9550-8i habe ich nirgends gefunden, nur den 9540-8i - ab dem 9560-8i geht Raid 5/6/10/50/60, wird aktuell auch noch angeboten.
Wenn ich das aber richtig sehe, sind die neusten Generationen doch die 96xx Reihe.

Also das RAID5 outdated ist, wäre mir jetzt neu.
Würde man auf dem "neuen" Server ESXi installieren wollen, hätte man die Option "ZFS" nicht einmal und wäre gekniffen.
Die bisherigen Nodes passen da "klassisch" auch in des ESXI Design mit den Datastores.
https://www.thomas-krenn.com/de/wiki/ZFS_dRAID_Grundlagen_und_Einrichtung

Wenn man beim gleichen Aufbau bleiben möchte, bleibt nur der Einsatz es "besseren" RAID Controllers.
Wie schaut es den mit der angedachten neuen Plattenbestückung aus - NVME / SSD / HDD?
 
Last edited:
@ThoSo hat recht, den 9550-8i gibt es so nicht. @oelk, lass auf der Kiste mal storcli64 /c0 show laufen, dann steht der echte Typ drin. Das ist wichtig: 9500 ist ein reiner HBA (ideal für ZFS), 9540 kann 0/1/10, und erst ab 9560 gibt es RAID5/6 mit Cache. Genauso wichtig ist, ob das Ding echten JBOD/Passthrough kann oder nur RAID0 simuliert. Für ZFS ist das ein großer Unterschied, weil SMART und Fehler sonst nicht korrekt durchkommen.

Bei "RAID5 ist outdated": so pauschal nicht, aber bei Platten in der Größenordnung dauert ein Rebuild Tage, bis dahin ist das Risiko zu hoch. Das ist das eigentliche Problem.

Der Special-Device-Vorschlag von @UdoB ist gut, nur müssen die SSDs dafür gespiegelt sein und PLP haben. Wenn das Special Device weg ist, ist auch der Pool weg, da liegen die Metadaten drin. Consumer-SSDs würde ich da nicht riskieren.
 
nur müssen die SSDs dafür gespiegelt sein und PLP haben.
Ja, Spiegel sind essentiell! Und PLP ist wertvoll. PLP verhindert nicht nur Datenverlust, sondern erhöht auch die Performance drastisch. (Nachtrag: ... und die Lebensdauer...) Ja, ich weiß, dass du das weißt. ;-)

Ich würde allerdings das "müssen" in "sollten dringend" herabstufen. Die Blechplatten, auf denen die Metadaten sonst landen würden, haben ja auch kein PLP!

Oder anders formuliert: ohne PLP droht Datenverlust - und zwar genau soviel, wie ohne Special Device. Ich würde daher SSDs ohne PLP dem weglassen derselben vorziehen.

Disclaimer: ich bin kein ZFS Spezialist - ich lasse mich gerne eines besseren belehren...
 
Last edited:
  • Like
Reactions: news
Bei "RAID5 ist outdated": so pauschal nicht, aber bei Platten in der Größenordnung dauert ein Rebuild Tage, bis dahin ist das Risiko zu hoch. Das ist das eigentliche Problem.
unsere bisherigen Nodes waren Intel-Maschinen mit 500GB RAID1 zum booten und 20TB RAID5 (4xHDD) für die VMs.
@Bu66as - 20TB RAID5 (4xHDD) - da ist jetzt die Frage, ob die einzelnen Platten je 20TB haben (dann wäre ich bei Dir), oder ob das das gesamte Raid-System ist (Bsp: mit 6x 4TB).
Ich habe bei einem Kunden noch ein sehr altes NAS laufen mit 8x4TB Platten im RAID6 - ein Rebuild des Volumens dauert etwa 1-1/2 Tage - ist aber auch nur für Backup's - also sonst kein Workload.
Der es sich dabei nur um die "bisherigen" Maschinen geht , wissen wir auch nichts zum Neuen System da der TE hierzu noch nicht gepostet hat.
 
Fair, "müssen" war zu hart, "sollte man dringend" trifft es besser. Auf einem Special Device landen die Metadaten und je nach special_small_blocks auch noch die kleinen Blöcke, also viele kleine synchrone Writes. Ohne PLP muss die SSD jedes sync-Write bis in die Zellen durchschreiben, das kostet Latenz und kostet Haltbarkeit. Ich hatte mal einen Kunden, da waren die billigen Dinger nach gut einem Jahr kaputt. Mit Spiegel und Wearout im Monitoring ist das trotzdem besser als gar kein Special Device, da stimme ich dir zu.

Ein Punkt noch: Solange der Pool nur Mirrors hat und kein RAIDZ, kann man das Special Device notfalls per zpool remove wieder rausnehmen. Das ist also kein endgültiger Schritt, macht die Entscheidung leichter.

@ThoSo guter Punkt, bei 20TB netto aus 4 Platten sind das ja etwa 6-7TB pro Stück, dann ist der Rebuild eher Stunden als Tage. @oelk, was sind denn konkret die Platten, und was sagt storcli64 /c0 show zum Controller?
 
Hallo Gemeinde,
unsere bisherigen Nodes waren Intel-Maschinen mit 500GB RAID1 zum booten und 20TB RAID5 (4xHDD) für die VMs.
Jetzt liefert der Anbieter eine Maschine mit einem Broadcom MegaRAID 9550-8i, der kann nur RAID 0,1,10 und
teilt uns auf Anfrage mit, das RAID5 outdated wäre und wir ZFS machen sollten.
Abgesehen davon, das wir keine Erfahrung mit ZFS haben, kann man das im Cluster mischen, was passiert da beim verschieben von VMs?

MfG
Ich würde mal den Lieferanten hinterfragen. Der Controller kann natürlich RAID5, aber dazu müsste man BBWC Cache verbauen. Wenn man den ohne Cache benutzt, geht nur RAID 1/0/10.
Bei langsamen HDDs bin ich immer ein Freund von HW RAID mit BBWC.
 
  • Like
Reactions: Johannes S