Plötzliches Netzwerproblem

TErxleben

Distinguished Member
Oct 20, 2008
1,164
421
153
Hamburg
Das Leben ist doch eine Überraschungstüte.
Ich habe hier einen Kandidaten, der jahrelang ohne besondere Auffälligkeiten lief. Das Ding war live und in Farbe plötzlich offline.
Nun muss ich reproduzierbar nach Neustart per kvm immer das Netzwerk neustarten, damit die Bude wieder erreichbar ist.
journalctl liefert nichts. Kernelprobleme möchte ich ausschließen, da diverse, identische Maschinen nicht betroffen sind.
Obwohl es sich um den berühmt berüchtigten i219-Controller handelt glaube ich nicht an diesen Problembären.
So bin ich z.Zt. recht ratlos und freue mich über jede Idee eurerseits.
 
Was sagt lspci -vnnk | awk '/VGA/{print $0}' RS=? E1000E fix bereits angewendet?
 
Wenn die identischen Kisten sauber laufen und nur die eine nach jedem Boot rumzickt, würd ich erst mal Kabel, Switchport und Autoneg checken, nicht Kernel oder Treiber. Was zeigt denn ip -br link und ethtool <nic> direkt nach dem Boot, also bevor du das Netzwerk neu startest? Steht da "Link detected: no" oder NO-CARRIER, oder ist der Link oben und die Bridge hat nur keine IP oder ist down? Hatte sowas mal bei einem Kunden, da hat ein Switchport nach jedem Link-Flap beim Booten zu langsam ausgehandelt und der Host war erst nach dem zweiten Anlauf da. Port und Kabel tauschen kostet nix und schließt das schnell aus.
 
  • Like
Reactions: beisser and fba
Wenn die identischen Kisten sauber laufen und nur die eine nach jedem Boot rumzickt, würd ich erst mal Kabel, Switchport und Autoneg checken, nicht Kernel oder Treiber. Was zeigt denn ip -br link und ethtool <nic> direkt nach dem Boot, also bevor du das Netzwerk neu startest? Steht da "Link detected: no" oder NO-CARRIER, oder ist der Link oben und die Bridge hat nur keine IP oder ist down? Hatte sowas mal bei einem Kunden, da hat ein Switchport nach jedem Link-Flap beim Booten zu langsam ausgehandelt und der Host war erst nach dem zweiten Anlauf da. Port und Kabel tauschen kostet nix und schließt das schnell aus.
Bis auf Kabel tauschen alles gemacht.
ethtool liefert:direkt nach Neustart:
Bildschirmfoto_20261009_213726.png

Nach beherztem Netzwerkneustart und funktionierendem Zugang dann das:
Bildschirmfoto_20261009_214104.png
 
Wie alt ist die Hardware? Lässt sich ein Hardwaredefekt sicher ausschließen? Gibt es auf dem Mainboard sichtbare Auffälligkeiten, zum Beispiel beschädigte oder aufgeblähte Kondensatoren?
 
Kleiner Typo: du hast ethtool enp0s31f5 getippt, die NIC heißt aber enp0s31f6. Darum kommt nur "No such device". Der erste Screenshot ist aber interessanter. Nach dem Boot gibt es vmbr0 gar nicht und die NIC ist ohne Carrier DOWN. Das hat nichts mit Kabel oder Switchport zu tun. Sieht für mich so aus, als würde das networking beim Boot nicht richtig durchlaufen. Nach dem manuellen Restart kommt der Link ja sofort mit 1000/Full hoch.

Schau mal direkt nach dem Boot, also vor dem Restart, was hier rauskommt:
Code:
systemctl status networking
journalctl -b -u networking
systemctl is-enabled networking
ls -la /etc/network/
Mich würde besonders interessieren, ob da noch eine interfaces.new rumliegt und ob in der /etc/network/interfaces vor vmbr0 und der NIC jeweils ein auto steht. Hatte schon Fälle, wo nach einem Update irgendwas an der Datei nicht gestimmt hat und ifupdown2 beim Boot abgebrochen ist. Der Restart von Hand hat dann trotzdem funktioniert. Ein Diff gegen eine der identischen Maschinen wäre auch schnell gemacht.
 
  • Like
Reactions: beisser and news
Uups der Tippfehler ist meinen dicken dicken Fingern zuzuschreiben. Eine interfaces.new gibt es nicht. Nur vor der vmbr0 steht auto. Die Konfigurationen hab ich schon mit anderen Hosts verlichen.

Die von @Bu66as gewünschten Screenshots werde ich nachliefern. Das Mainboard werde ich morgen inspizieren.
 
Und bitte nenne auch noch, wie alt die Hardware ist.
Um die 6-8J. Schwer genauer zu zu definieren. Die Kiste wurde nachträglich immer "gepimpt". Das MB stammt von Gigabyte und sonst sind da auch nur Markenhersteller involviert.
Mich hat das seltsame Fehlerverhalten auch in Richtung HW-Defekt blicken lassen. Wie ich schrieb, werde ich die Kiste morgen auf übliche, sichtbare Fehlerursachen untersuchen und Rapport leisten.
 
Man weiß ja nie, wa Updates mit sich bringen. Allerdings lief die Kiste jahrelang ohne Auffälligkeiten und stieg plötzlich einfach aus. Wohlgemerkt ganz ohne vorheriges Update. Morgen bekommt die Kiste eine sowieso fehlende zweite Netzkarte und wird per Bond betrieben.
 
@celemine1gig ULP würde für mich die NIC ohne Carrier erklären, aber nicht, dass vmbr0 nach dem Boot komplett fehlt. ifupdown2 legt die Bridge auch ohne Link an, die wäre dann halt NO-CARRIER. Wenn sie gar nicht existiert, ist networking beim Boot entweder nicht gelaufen oder abgebrochen. Dass nur vor vmbr0 ein auto steht, ist übrigens normal, so legt das der PVE-Installer an.

Mit der zweiten Karte und dem Bond wär ich deshalb vorsichtig. Wenn networking beim Boot nicht durchläuft, fehlt danach eben auch bond0 und du hast dasselbe Problem mit mehr Hardware. Schau dir die Ausgabe von systemctl status networking und journalctl -b -u networking direkt nach dem Boot an, bevor du von Hand neu startest. Schau bei der Gelegenheit auch mal in systemctl --failed.
 
Mit der zweiten Karte und dem Bond wär ich deshalb vorsichtig. Wenn networking beim Boot nicht durchläuft, fehlt danach eben auch bond0 und du hast dasselbe Problem mit mehr Hardware. Schau dir die Ausgabe von systemctl status networking und journalctl -b -u networking direkt nach dem Boot an, bevor du von Hand neu startest. Schau bei der Gelegenheit auch mal in systemctl --failed.
Das ist mir schon klar. Dann kann ich aber eine Netzwerkschnittstelle als (HW)Übeltäter ausschließen oder festnageln. Werde ich selbständlich per Logging kontrollieren.
Das Fehlen von vmbr0 nach Neustart haut mich ja auch vom Hocker. Wenn in der Konfiguration die Bridge mit auto definiert wird, sollte selbige ja für sauberes Starten sorgen. Im Bondbetrieb sollte aber jede NIC ja mit dem Attribut auto versehen werden. Ich bin gespannt.