Ceph: "error with mon dump" got timeout (500)

fips

Renowned Member
May 5, 2014
175
7
83
Hallo,

habe bei meinem Ceph Cluster (4 Nodes, wobei nur 3 waren Mon und Mgr) am WE nacheinander 2 Server entfernt, neu installiert (lokalen HDs waren fehlerhaft) und danach wieder in den Cluster aufgenommen. Und auch gleich alle Nodes updatet auf die letzten Patches bzw. Ceph 16.2.9 ganz nach Doku und auch problemlos.

Nun wäre nun zwar alles fertig (Cluster healthy) aber ich erhalte im GUI alle paar Sekunden folgende Meldung: "error with mon dump" got timeout (500)... Was ist das?
Weiters ist mir auch aufgefallen, dass ein Node Monitor immer mal wieder kurz off ist, der gleiche Manager auf dem Node ist up...
Und zu guter Letzt wollte ich mal den Node neustarten der den Manager auf "Status active" hat (weil Memory auf Anschlag war) und dann hat der ganze nicht mehr funktioniert...

Sollten bei einem Ausfall von einem Manager nicht ein anderer Manager übernehmen?

Habt ihr vielleicht Ideen oder könnt mir einen Tipp geben was ich prüfen könnte?

Das Grundsetup (die Hostes, die OSDs das Netzwerk) hat sich ja nicht geändert.
Weiß echt nicht warum das jetzt so zu spinnen beginnt...
 
Servus!

Kannst du mal den Output von ceph status sowie ceph osd status posten?
 

About

The Proxmox community has been around for many years and offers help and support for Proxmox VE, Proxmox Backup Server, and Proxmox Mail Gateway.
We think our community is one of the best thanks to people like you!

Get your subscription!

The Proxmox team works very hard to make sure you are running the best software and getting stable updates and security enhancements, as well as quick enterprise support. Tens of thousands of happy customers have a Proxmox subscription. Get yours easily in our online shop.

Buy now!