Zentrales Logging im Homelab: Docker-Logs & Journal nach Loki (Grafana Alloy/Promtail)

Ein Host, ein Suchfeld, alle Logs: Dieser Guide zeigt dir den Aufbau einer zentralen Log-Pipeline mit Loki, Grafana Alloy und Promtail — inklusive Retention-Planung, Secret-Schwärzung, Memory-Limits und der Frage, wie du einen überlauten Log-Verursacher findest, ohne das Ingest-Limit hochzudrehen.

02.10.2026 · 18 Minuten · 3703 Wörter · root_cause

vzdump-Stale-Lock seit 10 Tagen: Warum Zabbix nichts gemeldet hat

10 Tage stiller Backup-Ausfall auf einem Proxmox-Host. Ursache: ein stale vzdump-Lock plus vier unabhängige Monitoring-Lücken, die sich gegenseitig deckten.

02.10.2026 · 8 Minuten · 1664 Wörter · root_cause

87 MB/h ins zentrale Logging: Eine Nextcloud-Sync-Unit ohne -s flutet Loki

Eine stille Sync-Unit lieferte 92 % des gesamten Loki-Ingests. Kein Fehler, kein Retry-Loop — nur ein fehlendes Flag.

02.10.2026 · 5 Minuten · 941 Wörter · root_cause

Suricata-Logflut füllt die Root-Partition auf 107 % – und reißt DNS fürs ganze LAN mit

Ein reines Log-Größenlimit reichte nicht: enable_log_mgmt fehlte komplett in der config.xml. Root-Partition lief auf 107%, unbound crashte minütlich, DNS fiel fürs gesamte LAN aus — per pfBlockerNG-NAT sogar für Clients, die die Firewall nie direkt ansprechen.

02.10.2026 · 7 Minuten · 1368 Wörter · root_cause

Todesstern-Evakuierung: 36 Docker-Container sicher migrieren — ein Decommission-Komplettbericht

36 Container, 98% Disk, 3 Ziel-Hosts, 2 Wochen Fenster. Was beim Ausmustern eines Docker-Hosts alles schiefgeht — und warum die “Aufrufer-Karte” dein wichtigstes Werkzeug ist.

12.07.2026 · 11 Minuten · 2135 Wörter · root_cause

PBS Sync Pull + Let's Encrypt: Warum dein Backup seit 3 Monaten nicht läuft

PBS Sync Pull bricht nach jeder Let’s Encrypt Zertifikats-Erneuerung ab — leise, ohne Alert, monatelang. Ein systemd path unit auf dem Remote-Host fixt das Problem automatisch.

02.06.2026 · 3 Minuten · 626 Wörter · root_cause

n8n IF-Node: Warum `{{ $json.flag }} == true` immer wahr ist

Ein n8n-Workflow feuerte alle 15 Minuten fälschlich einen Zabbix-Alert — obwohl die Threshold-Logik klar ‘false’ lieferte. Anatomie einer Boolean-Truthy-Falle, plus was die Self-Heal-Pipeline dabei noch über sich selbst verraten hat.

13.04.2026 · 8 Minuten · 1498 Wörter · root_cause

Zabbix Agent 2 auf Docker-Hosts: Warum dein Disk-Monitoring blind ist

Dein Docker-Host meldet 100% Disk und Zabbix schweigt? Vier versteckte Fallen beim Zabbix Agent 2 auf containerisierten Hosts — von Port-Konflikten bis zu silent Plugin-Crashes.

06.04.2026 · 4 Minuten · 748 Wörter · root_cause

Zabbix + n8n + Claude: Self-Healing Monitoring mit Human-in-the-Loop

852 Alerts empfangen, 0 repariert. So habe ich eine kaputte Self-Healing Pipeline debuggt und um eine KI-gestützte Diagnose mit Approval-Flow erweitert.

06.04.2026 · 6 Minuten · 1091 Wörter · root_cause

Zabbix: Server neugestartet, 65 Alerts — wie Trigger Dependencies das Reboot-Chaos stoppen

Ein Windows-Server startet neu. Zabbix feuert 65 Service-Alerts gleichzeitig — für jeden Dienst der beim Hochfahren kurz nicht läuft. Die Lösung: Trigger Dependencies auf LLD-Prototypen. Ein Pitfall den die Doku verschweigt.

31.03.2026 · 5 Minuten · 944 Wörter · root_cause