Moin zusammen,
bei mir steht leider eine Neuinstallation von Proxmox an.
Kurzes Vorwort dazu:
2024 startete ich mit einem CWWK n305 und hatte nicht geahnt, dass es in einem so massiven Single-Point-of-Failure ausartet
Sprich, heute würde ich definitiv lieber andere Hardware einsetzen und sehr viel mehr auf Ausfallsicherheit setzen. Bei den aktuellen Preisen setze ich das jedoch nicht um und hoffe auf Besserung Richtung 2028
Ursache:
Meine eingesetzte Samsung 970 Evo NVMe hat wohl defekte NAND Blöcke
Vor ~3 Monaten kam der erste Fehler, vergangenen Freitag bei Sicherung auf PBS der nächste inkl. Fehlschlag bei der Sicherung einer VM (zum Glück eine unwichtige), anschließend long self-test ebenfalls mit Fehler. Ich weiß nicht wie kritisch ihr die Werte seht, ich meine der NVMe ist nicht mehr zu vertrauen
Nun strebe ich an die 970 Evo durch eine Kingston KC3000 zu ersetzen.
Problematik:
Im Grunde habe ich nichts wildes, 3 VMs, 5 LXC, VLAN / Firewall über OPNsense realisiert, lediglich einen cronjob, einen angelegten systemd service, alle VMs / LXC liegen auf der 970 Evo, sämtliche Daten auf einer 4TB SSD und 22TB HDD über Netzwerkfreigaben im System.
Die Problematik besteht demnach nur in der Konfiguration von PVE selbst. Ich habe leider nicht von Anfang ein mittlerweile bestehendes Wiki gepflegt, das ziehe ich parallel für Proxmox nach, habe aktuell jedoch Angst vor der Neuinstallation etwas zu vergessen.
Die VMs sind im Grunde ja das einfachste, PBS als Storage wieder einbinden und wiederherstellen. Nur was mache ich mit meiner Konfiguration bzgl Users, Groups, API Tokens, Realms (Authentik OAuth)? Alles notieren und händisch wieder einrichten, oder könnte ich die gesicherten Configs wieder reinkopieren?
Habe bereits /etc und /root gesichert - ohne zu Wissen was hier die wichtigsten Sachen sind. (bspw. fstab oder ssh-keys sind mir natürlich schon klar, ich meine hier die Proxmox spezifischen Dinge)
Ich habe bei meiner Installation 2024 quasi Proxmox default durchgeführt, sprich 32GB local für Proxmox selbst und ISOs, 920GB local-lvm, lvm-thin für die VMs - ich würde das einfach genau wieder so machen wenn da nichts gegen spricht. Wenn ich irgendwann in der Zukunft meinen gewünschten Server mit der besseren Hardware umsetze, würde ich natürlich auf 2x NVMe und ZFS Mirror gehen, um nicht wieder irgendwann vor so einem Dilemma zu stehen.
Frage:
Könnt ihr mir eventuell Tipps / Ratschläge, eine Checkliste geben, nicht dass ich vor oder während der Umsetzung wichtiges vergesse?
Ich habe diesbezüglich schon einen älteren Thread gefunden, da hieß es, quasi einen Spickzettel anfertigen und dann händisch gerade ziehen, ich vermute das ist 2026 nicht anders.
Irgendwelche Ratschläge meine PBS-Backups vor der eigentlichen Umsetzung nochmals zu testen? Bisher habe ich nur 2x ein rollback bei OPNsense und Homeassistant durchgeführt, lief reibungslos.
Ich bin mir beim Vorgehen einfach etwas unsicher, da im Endeffekt das ganze System/Haus ohne Redundanz dran hängt. Für den Fall eines Hardwaredefekts habe ich einen alten Desktop-PC (i7-2600k, 32GB) noch mit PVE8 in der Ecke stehen, hatte aber zum Glück noch keinen Bedarf. Ich habe schlichtweg keine Erfahrungswerte bei einem gewachsenen System den Host von Grund auf wieder einzurichten.
Danke für's Lesen bis hier hin und für jeglichen Input
bei mir steht leider eine Neuinstallation von Proxmox an.
Kurzes Vorwort dazu:
2024 startete ich mit einem CWWK n305 und hatte nicht geahnt, dass es in einem so massiven Single-Point-of-Failure ausartet
Sprich, heute würde ich definitiv lieber andere Hardware einsetzen und sehr viel mehr auf Ausfallsicherheit setzen. Bei den aktuellen Preisen setze ich das jedoch nicht um und hoffe auf Besserung Richtung 2028
Ursache:
Meine eingesetzte Samsung 970 Evo NVMe hat wohl defekte NAND Blöcke
root@proxmox:~# smartctl -a /dev/nvme0
smartctl 7.5 2025-04-30 r5714 [x86_64-linux-6.17.13-7-pve] (local build)
Copyright (C) 2002-25, Bruce Allen, Christian Franke, www.smartmontools.org
=== START OF INFORMATION SECTION ===
Model Number: Samsung SSD 970 EVO 1TB
Serial Number:
Firmware Version: 2B2QEXE7
PCI Vendor/Subsystem ID: 0x144d
IEEE OUI Identifier: 0x002538
Total NVM Capacity: 1,000,204,886,016 [1.00 TB]
Unallocated NVM Capacity: 0
Controller ID: 4
NVMe Version: 1.3
Number of Namespaces: 1
Namespace 1 Size/Capacity: 1,000,204,886,016 [1.00 TB]
Namespace 1 Utilization: 447,366,172,672 [447 GB]
Namespace 1 Formatted LBA Size: 512
Namespace 1 IEEE EUI-64: 002538 5991b0065f
Local Time is: Tue Jul 28 07:58:05 2026 CEST
Firmware Updates (0x16): 3 Slots, no Reset required
Optional Admin Commands (0x0017): Security Format Frmw_DL Self_Test
Optional NVM Commands (0x005f): Comp Wr_Unc DS_Mngmt Wr_Zero Sav/Sel_Feat Timestmp
Log Page Attributes (0x03): S/H_per_NS Cmd_Eff_Lg
Maximum Data Transfer Size: 512 Pages
Warning Comp. Temp. Threshold: 85 Celsius
Critical Comp. Temp. Threshold: 85 Celsius
Supported Power States
St Op Max Active Idle RL RT WL WT Ent_Lat Ex_Lat
0 + 6.20W - - 0 0 0 0 0 0
1 + 4.30W - - 1 1 1 1 0 0
2 + 2.10W - - 2 2 2 2 0 0
3 - 0.0400W - - 3 3 3 3 210 1200
4 - 0.0050W - - 4 4 4 4 2000 8000
Supported LBA Sizes (NSID 0x1)
Id Fmt Data Metadt Rel_Perf
0 + 512 0 0
=== START OF SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED
SMART/Health Information (NVMe Log 0x02, NSID 0xffffffff)
Critical Warning: 0x00
Temperature: 36 Celsius
Available Spare: 89%
Available Spare Threshold: 10%
Percentage Used: 2%
Data Units Read: 112,689,472 [57.6 TB]
Data Units Written: 140,232,909 [71.7 TB]
Host Read Commands: 1,037,974,807
Host Write Commands: 3,469,542,987
Controller Busy Time: 6,580
Power Cycles: 2,229
Power On Hours: 13,279
Unsafe Shutdowns: 72
Media and Data Integrity Errors: 4
Error Information Log Entries: 5,215
Warning Comp. Temperature Time: 0
Critical Comp. Temperature Time: 0
Temperature Sensor 1: 36 Celsius
Temperature Sensor 2: 42 Celsius
Error Information (NVMe Log 0x01, 16 of 64 entries)
Num ErrCount SQId CmdId Status PELoc LBA NSID VS Message
0 5215 1 0x9125 0xc502 0x000 370533990 1 - Unrecovered Read Error
1 5214 2 0x3383 0xc502 0x000 204167172 1 - Unrecovered Read Error
2 5213 0 0x000c 0x4004 - 0 0 - Invalid Field in Command
Self-test Log (NVMe Log 0x06, NSID 0xffffffff)
Self-test status: No self-test in progress
Num Test_Description Status Power_on_Hours Failing_LBA NSID Seg SCT Code
0 Extended Completed: failed segments 13221 216501408 1 7 - -
smartctl 7.5 2025-04-30 r5714 [x86_64-linux-6.17.13-7-pve] (local build)
Copyright (C) 2002-25, Bruce Allen, Christian Franke, www.smartmontools.org
=== START OF INFORMATION SECTION ===
Model Number: Samsung SSD 970 EVO 1TB
Serial Number:
Firmware Version: 2B2QEXE7
PCI Vendor/Subsystem ID: 0x144d
IEEE OUI Identifier: 0x002538
Total NVM Capacity: 1,000,204,886,016 [1.00 TB]
Unallocated NVM Capacity: 0
Controller ID: 4
NVMe Version: 1.3
Number of Namespaces: 1
Namespace 1 Size/Capacity: 1,000,204,886,016 [1.00 TB]
Namespace 1 Utilization: 447,366,172,672 [447 GB]
Namespace 1 Formatted LBA Size: 512
Namespace 1 IEEE EUI-64: 002538 5991b0065f
Local Time is: Tue Jul 28 07:58:05 2026 CEST
Firmware Updates (0x16): 3 Slots, no Reset required
Optional Admin Commands (0x0017): Security Format Frmw_DL Self_Test
Optional NVM Commands (0x005f): Comp Wr_Unc DS_Mngmt Wr_Zero Sav/Sel_Feat Timestmp
Log Page Attributes (0x03): S/H_per_NS Cmd_Eff_Lg
Maximum Data Transfer Size: 512 Pages
Warning Comp. Temp. Threshold: 85 Celsius
Critical Comp. Temp. Threshold: 85 Celsius
Supported Power States
St Op Max Active Idle RL RT WL WT Ent_Lat Ex_Lat
0 + 6.20W - - 0 0 0 0 0 0
1 + 4.30W - - 1 1 1 1 0 0
2 + 2.10W - - 2 2 2 2 0 0
3 - 0.0400W - - 3 3 3 3 210 1200
4 - 0.0050W - - 4 4 4 4 2000 8000
Supported LBA Sizes (NSID 0x1)
Id Fmt Data Metadt Rel_Perf
0 + 512 0 0
=== START OF SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED
SMART/Health Information (NVMe Log 0x02, NSID 0xffffffff)
Critical Warning: 0x00
Temperature: 36 Celsius
Available Spare: 89%
Available Spare Threshold: 10%
Percentage Used: 2%
Data Units Read: 112,689,472 [57.6 TB]
Data Units Written: 140,232,909 [71.7 TB]
Host Read Commands: 1,037,974,807
Host Write Commands: 3,469,542,987
Controller Busy Time: 6,580
Power Cycles: 2,229
Power On Hours: 13,279
Unsafe Shutdowns: 72
Media and Data Integrity Errors: 4
Error Information Log Entries: 5,215
Warning Comp. Temperature Time: 0
Critical Comp. Temperature Time: 0
Temperature Sensor 1: 36 Celsius
Temperature Sensor 2: 42 Celsius
Error Information (NVMe Log 0x01, 16 of 64 entries)
Num ErrCount SQId CmdId Status PELoc LBA NSID VS Message
0 5215 1 0x9125 0xc502 0x000 370533990 1 - Unrecovered Read Error
1 5214 2 0x3383 0xc502 0x000 204167172 1 - Unrecovered Read Error
2 5213 0 0x000c 0x4004 - 0 0 - Invalid Field in Command
Self-test Log (NVMe Log 0x06, NSID 0xffffffff)
Self-test status: No self-test in progress
Num Test_Description Status Power_on_Hours Failing_LBA NSID Seg SCT Code
0 Extended Completed: failed segments 13221 216501408 1 7 - -
Nun strebe ich an die 970 Evo durch eine Kingston KC3000 zu ersetzen.
Problematik:
Im Grunde habe ich nichts wildes, 3 VMs, 5 LXC, VLAN / Firewall über OPNsense realisiert, lediglich einen cronjob, einen angelegten systemd service, alle VMs / LXC liegen auf der 970 Evo, sämtliche Daten auf einer 4TB SSD und 22TB HDD über Netzwerkfreigaben im System.
Die Problematik besteht demnach nur in der Konfiguration von PVE selbst. Ich habe leider nicht von Anfang ein mittlerweile bestehendes Wiki gepflegt, das ziehe ich parallel für Proxmox nach, habe aktuell jedoch Angst vor der Neuinstallation etwas zu vergessen.
Die VMs sind im Grunde ja das einfachste, PBS als Storage wieder einbinden und wiederherstellen. Nur was mache ich mit meiner Konfiguration bzgl Users, Groups, API Tokens, Realms (Authentik OAuth)? Alles notieren und händisch wieder einrichten, oder könnte ich die gesicherten Configs wieder reinkopieren?
Habe bereits /etc und /root gesichert - ohne zu Wissen was hier die wichtigsten Sachen sind. (bspw. fstab oder ssh-keys sind mir natürlich schon klar, ich meine hier die Proxmox spezifischen Dinge)
Ich habe bei meiner Installation 2024 quasi Proxmox default durchgeführt, sprich 32GB local für Proxmox selbst und ISOs, 920GB local-lvm, lvm-thin für die VMs - ich würde das einfach genau wieder so machen wenn da nichts gegen spricht. Wenn ich irgendwann in der Zukunft meinen gewünschten Server mit der besseren Hardware umsetze, würde ich natürlich auf 2x NVMe und ZFS Mirror gehen, um nicht wieder irgendwann vor so einem Dilemma zu stehen.
Frage:
Könnt ihr mir eventuell Tipps / Ratschläge, eine Checkliste geben, nicht dass ich vor oder während der Umsetzung wichtiges vergesse?
Ich habe diesbezüglich schon einen älteren Thread gefunden, da hieß es, quasi einen Spickzettel anfertigen und dann händisch gerade ziehen, ich vermute das ist 2026 nicht anders.
Irgendwelche Ratschläge meine PBS-Backups vor der eigentlichen Umsetzung nochmals zu testen? Bisher habe ich nur 2x ein rollback bei OPNsense und Homeassistant durchgeführt, lief reibungslos.
Ich bin mir beim Vorgehen einfach etwas unsicher, da im Endeffekt das ganze System/Haus ohne Redundanz dran hängt. Für den Fall eines Hardwaredefekts habe ich einen alten Desktop-PC (i7-2600k, 32GB) noch mit PVE8 in der Ecke stehen, hatte aber zum Glück noch keinen Bedarf. Ich habe schlichtweg keine Erfahrungswerte bei einem gewachsenen System den Host von Grund auf wieder einzurichten.
Danke für's Lesen bis hier hin und für jeglichen Input
Last edited: