Hier wie #Hermes meine Linux-Systeme (Linuxe und Linuxinas) automatisch aktuell hält
Nächtliches Server-Checkup als Best Practice Blueprint
Zwei-Phasen-Architektur mit strikt getrennten Verantwortlichkeiten:
PHASE 1 — DATENSAMMLUNG (System-Cron, 01:00)
Bash-Script, kein LLM. Führt alle Checks sequentiell aus und schreibt das Ergebnis in ein versioniertes Logfile (check_YYMMDD.log). Log-Rotation automatisch (30 Tage). Jedes Modul darf einzeln fehlschlagen ohne den gesamten Check abzubrechen.
PHASE 2 — BENACHRICHTIGUNG (Hermes-Cron, 02:00)
Python-Parser, kein LLM. Liest das Logfile deterministisch ein, baut einen kompakten Report, generiert automatische Alerts bei Schwellwert-Überschreitungen. Das Script-stdout wird 1:1 als Telegram-Nachricht zugestellt. Hermes startet keinen Agent-Loop — reiner Cron-to-Telegram-Bridge.
DESIGN-PRINZIPIEN
1. Decoupling: Checks laufen über System-Cron, nicht über den Bot. Fällt der Bot aus, liegen die Logs trotzdem bereit. Bot ist nur der Zusteller.
2. Deterministisch: Der Report wird von einem Python-Script geparst, nicht von einem LLM generiert. Keine API-Kosten, keine Halluzinationen, garantiert gleiches Format jeden Tag.
3. Asynchroner Versatz: Phase 2 startet 1h nach Phase 1 — das Logfile ist sicher vollständig, keine Locking-Mechanismen nötig.
4. Logfile als Schnittstelle: Der einzige Kontaktpunkt zwischen den Phasen. Versioniert, rotiert, manuell inspectable, kann jederzeit nachträglich geparst werden.
CHECK-DOMÄNEN
- Storage: SMART, Temperaturen, Verschleiß, Mount-Health
- Hardware: CPU/Sensor-Temperaturen, NVMe-Wear
- Pool: Kapazität, Auslastung, Merge-Status
- Identität: AD/Domänen-Anbindung, Trust, User-Sichtbarkeit
- Backup: Client installiert, Server erreichbar, letztes Backup
- Updates: Ausstehende Pakete, Reboot-Required
- Self-Update: Eigener Agent auf aktuellem Stand
- Prävention: Proaktiver Remount von Fuse-Pools (nicht nur bei Ausfall)
ALERTING
Zwei Lagen: 🔴 Alerts bei echten Problemen (SMART FAILED, AD offline, Reboot nötig). ℹ️ Hinweise bei Auffälligkeiten ohne akuten Handlungsbedarf. Keine Alerts = "Alle Systeme unauffällig."
WATCHDOG-PATTERN
Zusätzlich zum nächtlichen Check läuft ein Watchdog-Cronjob (alle 30 Min) für kritische Komponenten. Silent bei Gesundheit (0 Byte stdout = keine Nachricht, keine Notification-Fatigue). Bei Ausfall: Selbstheilung (z.B. Remount) + Telegram-Alert.
WARUM DAS FUNKTIONIERT
- Ausfallsicher: Jede Komponente kann einzeln ausfallen, alles degradiert graceful
- Kostenlos: Kein einziger LLM-Call in der Pipeline
- Reproduzierbar: Logfile + Parser = deterministischer Report
- Präventiv: Fuse-Pools werden proaktiv remounted, nicht erst bei User-Beschwerden
- Auditierbar: 30 Tage Logfile-Historie liegen lokal
#linux #sysadmin #bestpractice #monitoring #automation