Zum Inhalt springen
FM-Connect Chat

Hallo! Ich bin Ihr FM-Connect Chat-Assistent. Wie kann ich Ihnen helfen?

FM-Solutionmaker: Gemeinsam Facility Management neu denken

Störungs-, Ausfall- und Wiederanlaufmanagement

Facility Management: IT-Infrastruktur » ITIL » Störungs-, Ausfall- und Wiederanlaufmanagement

Nicht nur reparieren, sondern den digitalen Gebäudebetrieb wiederherstellen

Die Microsite besitzt bereits eine eigene ITIL-Seite und einen Service Desk. Der Service Desk ist dort bewusst als First Line konzipiert, der Anfragen aufnimmt, einfache Probleme löst und komplexere Fälle an spezialisierte IT-Funktionen eskaliert.

Für IT-Infrastruktur im Facility Management fehlt jedoch eine eigenständige Seite, die technische Störung, betriebliche Wirkung und Wiederanlauf verknüpft.

Störungen wirksam steuern und Betrieb wiederherstellen

Incident zunächst nach Wirkung klassifizieren

Eine technische Meldung sollte nicht nur nach Gerätetyp priorisiert werden.

Wichtiger ist:

Welche Funktion ist betroffen?

Beispiele:

  • einzelne Datendose,

  • komplette Etage,

  • WLAN eines Gebäudes,

  • Gebäudeautomation,

  • Zutrittskontrolle,

  • Core-Netzwerk.

Daraus ergibt sich die betriebliche Priorität.

Kritische Services vorher kennen

Für ein wirksames Störungsmanagement muss bereits vor dem Ausfall bekannt sein, welche Services besonders kritisch sind.

Die vorhandene IT-Technikraumstruktur enthält hierfür bereits Risiko-, Geschäftsimpact- und Kritikalitätsanalysen.

Diese Logik sollte auf Netzwerk- und IT-/OT-Services erweitert werden.

Monitoring kann beispielsweise erkennen:

  • Switch nicht erreichbar,

  • redundanter Uplink ausgefallen,

  • USV-Alarm,

  • Temperatur zu hoch.

Ein Alarm sollte – abhängig von Kritikalität – automatisiert oder organisatorisch in einen bearbeitbaren Vorgang überführt werden.

Damit wird verhindert, dass Warnungen nur in technischen Dashboards sichtbar bleiben.

Störungsführung festlegen

Bei einem größeren Ausfall sollte eine Person beziehungsweise Rolle die Koordination übernehmen.

Sie muss nicht jeden technischen Fehler selbst beheben.

Ihre Aufgaben sind:

  • Lagebild führen,

  • Spezialisten koordinieren,

  • Prioritäten setzen,

  • Nutzerkommunikation organisieren,

  • Entscheidungen eskalieren.

Dies ist besonders wichtig, wenn IT, FM und externe Hersteller gleichzeitig beteiligt sind.

Workaround und endgültige Lösung unterscheiden

Ein Incident kann betrieblich zunächst durch einen Workaround gelöst werden.

Beispiele:

  • redundanten Pfad nutzen,

  • Ersatzswitch einsetzen,

  • temporär umpatchen,

  • mobiles Netzwerk bereitstellen.

Der Vorgang darf anschließend jedoch nicht als vollständig erledigt gelten, wenn die ursprüngliche Resilienz noch nicht hergestellt ist.

Wiederanlauf in definierter Reihenfolge

Nach größeren Ausfällen kann die Wiederinbetriebnahme mehrerer Systeme voneinander abhängen.

Beispielsweise:

  1. Stromversorgung,

  2. Core-Netzwerk,

  3. Distribution,

  4. Access,

  5. zentrale Dienste,

  6. OT-Services.

Die Reihenfolge sollte für kritische Standorte vorab bekannt sein.

Funktion nach Wiederanlauf prüfen

„Gerät online“ bedeutet nicht automatisch „Service wiederhergestellt“.

Nach Wiederanlauf sollten relevante End-to-End-Funktionen geprüft werden:

  • Nutzerzugriff,

  • Gebäudesteuerung,

  • Zutrittsfunktion,

  • Kommunikation,

  • Monitoring.

Major Incident gesondert behandeln

Große standortweite Störungen benötigen andere Kommunikation als einzelne Standardtickets.

Ein Major-Incident-Prozess kann definieren:

  • Führungsrolle,

  • Eskalation,

  • Managementinformation,

  • Updateintervalle,

  • Abschlussreview.

Ursache anschließend analysieren

Nach Wiederherstellung folgt bei relevanten Ereignissen die Ursachenanalyse.

Zu klären sind:

  • technischer Auslöser,

  • warum Redundanz gegebenenfalls nicht wirkte,

  • warum Monitoring beziehungsweise Reaktion funktionierte oder versagte,

  • welche Präventionsmaßnahme notwendig ist.

Damit wird aus dem Incident organisatorisches Lernen.

Betriebsfähigkeit statt Ticketabschluss

Die zentrale Frage lautet:

Ist nicht nur die technische Komponente wieder erreichbar, sondern ist die betroffene Geschäfts- beziehungsweise Gebäudefunktion wieder vollständig und stabil verfügbar?

Damit entwickelt sich IT-Störungsmanagement vom Gerätesupport zu einem echten Wiederherstellungsprozess für den digitalisierten Gebäudebetrieb.