vzdump-Stale-Lock seit 10 Tagen: Warum Zabbix nichts gemeldet hat
10 Tage stiller Backup-Ausfall auf einem Proxmox-Host. Ursache: ein stale vzdump-Lock plus vier unabhängige Monitoring-Lücken, die sich gegenseitig deckten.
10 Tage stiller Backup-Ausfall auf einem Proxmox-Host. Ursache: ein stale vzdump-Lock plus vier unabhängige Monitoring-Lücken, die sich gegenseitig deckten.
Ein reines Log-Größenlimit reichte nicht: enable_log_mgmt fehlte komplett in der config.xml. Root-Partition lief auf 107%, unbound crashte minütlich, DNS fiel fürs gesamte LAN aus — per pfBlockerNG-NAT sogar für Clients, die die Firewall nie direkt ansprechen.
PBS Sync Pull bricht nach jeder Let’s Encrypt Zertifikats-Erneuerung ab — leise, ohne Alert, monatelang. Ein systemd path unit auf dem Remote-Host fixt das Problem automatisch.
Tunnel steht, Internet läuft, Handshake aktuell — und trotzdem feuert Zabbix einen Output-Error-Trigger. Ursache: Die Interface-Subnetzmaske der WireGuard-Zuweisung stand auf /32 statt /16. Plus: Beim Re-Configure springt die Default-Route weg.
Ein n8n-Workflow feuerte alle 15 Minuten fälschlich einen Zabbix-Alert — obwohl die Threshold-Logik klar ‘false’ lieferte. Anatomie einer Boolean-Truthy-Falle, plus was die Self-Heal-Pipeline dabei noch über sich selbst verraten hat.
Dein Docker-Host meldet 100% Disk und Zabbix schweigt? Vier versteckte Fallen beim Zabbix Agent 2 auf containerisierten Hosts — von Port-Konflikten bis zu silent Plugin-Crashes.
852 Alerts empfangen, 0 repariert. So habe ich eine kaputte Self-Healing Pipeline debuggt und um eine KI-gestützte Diagnose mit Approval-Flow erweitert.
Drei Bugs die eine Zabbix-Remediation-Pipeline 10 Tage lang still legten — und warum continueOnFail dein schlimmster Feind sein kann.
Ein Windows-Server startet neu. Zabbix feuert 65 Service-Alerts gleichzeitig — für jeden Dienst der beim Hochfahren kurz nicht läuft. Die Lösung: Trigger Dependencies auf LLD-Prototypen. Ein Pitfall den die Doku verschweigt.
Die Intel I226-V NIC auf einer pfSense stalled sporadisch für Sekunden. Klingt harmlos — bis du merkst, dass die Kerberos-Tickets ablaufen, DFS auf NTLM zurückfällt und Active-Directory-Accounts gesperrt werden. Weil ein Umlaut im Benutzernamen ist.