Mobile-Menu

Komplexität als größte Schwachstelle Resiliente Hybrid-IT als Basis des Digital Workplace

Von Christian Knauer 6 min Lesedauer

Anbieter zum Thema

Der Erfolg des Digital Workplace hängt heute weniger von einzelnen Technologien als von der Resilienz der zugrundeliegenden Hybrid-IT ab. Entscheidend sind beherrschbare Abhängigkeiten, standardisierte Betriebsmodelle und eine Infrastruktur, die auch unter Belastung kontrollierbar bleibt.

Resiliente Hybrid-IT verbindet Cloud, Netzwerk, Identity und Betriebsprozesse zu einer belastbaren Basis für den Digital Workplace.(Bild:  Adlon / KI-generiert)
Resiliente Hybrid-IT verbindet Cloud, Netzwerk, Identity und Betriebsprozesse zu einer belastbaren Basis für den Digital Workplace.
(Bild: Adlon / KI-generiert)

Der Digital Workplace steht und fällt mit der Stabilität seiner Backend-Systeme. Mitarbeitende erwarten jederzeit funktionierende Zugänge zu Daten, Anwendungen und Kollaborationsplattformen. Gleichzeitig verteilen sich diese Dienste heute über Cloud-Plattformen, Colocation-Rechenzentren, Edge-Standorte und eigene Infrastrukturen.

Die eigentliche Herausforderung liegt dabei nicht in den Technologien selbst. Sie entsteht an den Schnittstellen zwischen ihnen. Aus operativer Sicht lassen sich schwerwiegende Störungen deutlich häufiger auf Abhängigkeiten zwischen Identitätsdiensten, Netzwerkkomponenten, Security-Layern und Cloud-Plattformen zurückführen als auf den Ausfall einzelner Server oder Storage-Systeme. Ein nicht erreichbarer Authentifizierungsdienst kann einen kompletten Digital Workplace zum Stillstand bringen, obwohl sämtliche Anwendungen physisch verfügbar sind. Wer Hybrid-IT wie mehrere Einzelplattformen betreibt, erhält mehrere Fehlerquellen. Wer sie als integrierten Service betrachtet, schafft hingegen Resilienz.

Praxisansatz: Abhängigkeiten sichtbar machen

Für jeden geschäftskritischen Service sollte dokumentiert sein, welche Identity-, DNS-, Netzwerk-, Cloud- und externen Schnittstellenabhängigkeiten bestehen. Die Analyse zeigt in der Praxis häufig, dass vermeintlich unabhängige Systeme gemeinsame Single Points of Failure besitzen.

Verfügbarkeit wird heute durch Identitäten bestimmt

Noch vor wenigen Jahren konzentrierten sich Hochverfügbarkeitskonzepte vor allem auf Rechenzentrumskomponenten. Heute bildet das Identity-Management häufig den kritischsten Bestandteil einer digitalen Arbeitsumgebung.

Microsoft Entra ID, Active Directory, Single-Sign-On-Plattformen und Conditional-Access-Richtlinien sind zentrale Schaltstellen nahezu aller Geschäftsprozesse. Fällt diese Ebene aus oder arbeitet sie inkonsistent, verlieren Anwender den Zugriff auf Microsoft 365, SaaS-Anwendungen, VPN-Lösungen oder digitale Arbeitsplätze. Resilienz muss deshalb aus Sicht der gesamten Servicekette geplant werden.

Dazu gehören unter anderem:

  • mindestens zwei unabhängige, überwachte Break-Glass-Konten ohne Conditional-Access-Bindung
  • Alarmierung bei Anmeldungen und Änderungen an privilegierten Konten
  • Conditional-Access-Richtlinien – dokumentiert, versioniert und im Report-only-Modus vorgetestet
  • definierte und getestete Wiederherstellung von Verzeichnisdiensten inklusive Zeitvorgabe
  • dokumentiertes Vorgehen für den Ausfall des zentralen Identitätsdienstes, inklusive betroffener Anwendungen und Notfallzugänge
  • regelmäßige Prüfung, welche Anwendungen bei einem Identity-Ausfall weiterhin nutzbar bleiben

Die entscheidende Frage lautet nicht: „Ist der Server verfügbar?" Sondern: „Kann der Anwender arbeiten?"

Netzwerk-Resilienz endet nicht beim zweiten Uplink

Auch Netzwerke haben sich grundlegend verändert. Der klassische Perimeter weicht zunehmend verteilten Architekturen aus SD-WAN, SASE, Cloud-Backbones und direkten Cloud-Anbindungen.

Dabei entsteht häufig ein Trugschluss: Redundante Leitungen allein schaffen noch keine Resilienz. Entscheidend ist die Beherrschung der gesamten Kommunikationspfade. Routing-Fehler, DNS-Probleme, fehlerhafte Firewall-Regeln oder inkonsistente Security Policies verursachen im Alltag deutlich häufiger Serviceunterbrechungen als physische Leitungsausfälle.

Erfahrene Betriebsteams betrachten deshalb nicht nur die Infrastruktur, sondern die so genannten „Failure Domains“. Die zentrale Frage lautet: Welche Komponenten können gemeinsam ausfallen und welche Geschäftsprozesse wären davon betroffen?

Diese Szenarien sollten regelmäßig getestet werden:

  • Ausfall einer WAN- oder Cloud-Anbindung
  • Ausfall eines DNS-Servers oder fehlerhafte Namensauflösung
  • Ausfall einer zentralen Firewall oder eines SD-WAN-Knotens
  • Ausfall des VPN-beziehungsweise ZTNA-Zugangs
  • Ablauf oder Fehlkonfiguration von Zertifikaten

Erst wenn geschäftskritische Anwendungen unter diesen Bedingungen nachweislich erreichbar bleiben, kann von belastbarer Netzwerk-Resilienz gesprochen werden.

Konfigurationsdrift ist der stille Gegner der Betriebsstabilität

Eine der größten Herausforderungen im Betrieb hybrider Umgebungen ist nicht der technische Wandel, sondern die schleichende Veränderung bestehender Systeme. Jede manuelle Anpassung erhöht die Wahrscheinlichkeit von Abweichungen zwischen Soll- und Ist-Zustand. Unterschiedliche Server-Images, individuelle Firewall-Regeln oder historisch gewachsene Sonderkonfigurationen erschweren Fehleranalysen und verlängern Wiederherstellungszeiten erheblich.

Aus Sicht des Betriebs gilt deshalb ein einfaches Prinzip: Standardisierung reduziert nicht die Handlungsfähigkeit des Betriebs. Sie schafft die Voraussetzung dafür, Änderungen reproduzierbar, nachvollziehbar und mit geringerem Risiko umzusetzen. Infrastructure-as-Code-Ansätze mit Werkzeugen wie Terraform oder Ansible haben sich als wirksames Mittel etabliert, um reproduzierbare Plattformen bereitzustellen. Änderungen werden versioniert, automatisiert ausgerollt und nachvollziehbar dokumentiert.

Jetzt Newsletter abonnieren

Täglich die wichtigsten Infos zu Netzwerktechnik, IP-Kommunikation und UCC

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Für den Einstieg genügt bereits ein pragmatischer Ansatz: definierte Soll-Konfigurationen für Server-Images, Firewall-Regelwerke und Client-Baselines, ein regelmäßiger automatisierter Abgleich gegen diesen Soll-Zustand sowie eine dokumentierte Freigabe für jede Abweichung. Nicht dokumentierte Sonderkonfigurationen sind erfahrungsgemäß der häufigste Grund für verlängerte Wiederherstellungszeiten.

Resilienz-Check für Administratoren

Werden drei oder mehr Fragen mit „Nein“ beantwortet, besteht kurzfristiger Handlungsbedarf:

  • Sind alle geschäftskritischen Services inklusive ihrer Identity-, Netzwerk-, Security- und Cloud-Abhängigkeiten dokumentiert?
  • Existieren für diese Services definierte Wiederherstellungsziele (RTO/RPO)?
  • Wurde die Wiederherstellung innerhalb der letzten zwölf Monate nachweislich getestet?
  • Gibt es geprüfte Break-Glass-Zugänge für den Ausfall des zentralen Identitätsdienstes?
  • Werden Infrastrukturänderungen versioniert, nachvollziehbar und überwiegend automatisiert umgesetzt?
  • Ist bekannt, welche Geschäftsprozesse beim Ausfall einzelner Netzwerk- oder Cloud-Komponenten betroffen wären?
  • Sind Service-Owner und Eskalationswege plattformübergreifend eindeutig definiert?

Resilienz entsteht durch Automatisierung

In hybriden Infrastrukturen wachsen technische Abhängigkeiten, während Change-Zyklen und Bereitstellungszeiten kürzer werden. Manuelle Betriebsprozesse stoßen dadurch schnell an Grenzen. Automatisierung wird zur Grundvoraussetzung resilienter Betriebsmodelle, insbesondere wenn Infrastruktur, Konfigurationen und Sicherheitsrichtlinien reproduzierbar bereitgestellt werden.

Dazu zählen beispielsweise:

  • Bereitstellung von Servern und Plattformdiensten über versionierte Templates
  • automatisiertes Patch-Management mit definierten Wartungsfenstern und Rollback-Option
  • automatisierte Kontrolle von Backup-Jobs inklusive Erfolgsmeldung und Eskalation bei Fehlern
  • regelmäßige automatisierte Restore-Tests, mindestens stichprobenartig
  • automatisierter Abgleich von Konfigurationen gegen definierte Soll-Zustände
  • automatisierte Bereitstellung und Prüfung von Security-Richtlinien

Eine wichtige Erkenntnis aus dem Betriebsalltag lautet: Die Geschwindigkeit einer Wiederherstellung hängt nicht allein von der Qualität der Dokumentation ab, sondern wesentlich davon, wie stark Wiederherstellungsprozesse standardisiert, getestet und automatisiert sind.

Resilienz muss regelmäßig getestet werden

Resilienz entsteht nicht durch Konzepte auf Papier. Sie zeigt sich erst dann, wenn Wiederanlauf, Failover und Recovery unter realistischen Bedingungen überprüft werden. Dazu gehören regelmäßige Restore-Tests, die Prüfung von Notfallzugängen, die Validierung von Identity- und Netzwerkabhängigkeiten sowie dokumentierte Lessons Learned nach Störungen oder Übungen. Nur getestete Wiederherstellungsprozesse liefern im Ernstfall belastbare Sicherheit.

Warum klassisches Monitoring nicht mehr ausreicht

Monitoring-Systeme liefern seit Jahren Kennzahlen zu CPU-Auslastungen, Speicherkapazitäten oder Netzwerk-Latenzen. Für hybride Infrastrukturen genügt diese Sichtweise jedoch nicht mehr. Administratoren benötigen heute Transparenz über komplette Serviceketten hinweg. Observability-Lösungen wie Grafana, Dynatrace, Splunk oder Azure Monitor korrelieren Logs, Traces und Metriken aus unterschiedlichen Plattformen und machen Abhängigkeiten sichtbar. Betriebsteams erkennen dadurch nicht nur technische Alarme, sondern deren Auswirkungen auf Benutzeranmeldungen, Anwendungsperformance und Geschäftsprozesse.

Für den Einstieg genügt es, für die fünf wichtigsten Geschäftsservices je eine Ende-zu-Ende-Überwachung aufzubauen: synthetische Anmeldung, Prüfung der Anwendungserreichbarkeit aus Anwendersicht, Kontrolle der zugehörigen Backup- und Replikationsjobs sowie Alarmierung auf Service-Ebene statt auf Komponentenebene. Ein Alarm sollte die Frage beantworten, welcher Geschäftsprozess betroffen ist, nicht nur, welche Komponente auffällig ist.

Der Mehrwert ist erheblich: Ursachenanalysen verkürzen sich, Ausfallzeiten sinken und Fehlentscheidungen werden reduziert. Nicht die Störung selbst verursacht lange Ausfälle. Die eigentliche Herausforderung besteht darin, ihre Ursache schnell zu erkennen.

Betriebsmodelle sind wichtiger als Technologie

Technologien lassen sich beschaffen. Betriebsdisziplin lässt sich nicht einkaufen. Resiliente Hybrid-IT entsteht nur dann, wenn Verantwortlichkeiten, Prozesse und Eskalationswege eindeutig definiert sind. Für jeden geschäftskritischen Service sollten Service Owner, technisch verantwortliches Team, Eskalationsweg, Wiederherstellungsziel (RTO), tolerierbarer Datenverlust (RPO) und Entscheidungsbefugnis im Störungsfall festgelegt sein. Fehlt eine dieser Festlegungen, verlängern sich Störungen häufig nicht durch technische Ursachen, sondern durch unklare Zuständigkeiten. Der entscheidende Perspektivwechsel lautet: Der Anwender interessiert sich nicht für Server, Firewalls oder Cloud-Tenants. Er erwartet einen funktionierenden Service. Genau daran sollte sich auch die Betriebsorganisation orientieren.

Die Cloud löst keine Architekturprobleme

Cloud-Plattformen bieten enorme Vorteile bei Skalierung, Agilität und Innovationsgeschwindigkeit. Dennoch lösen sie keine strukturellen Schwächen bestehender Architekturen. Technische Schulden, unklare Verantwortlichkeiten oder fehlende Standardisierung verschwinden durch eine Migration nicht. Sie werden lediglich an einen anderen Ort verlagert.

Eine resiliente Hybrid-IT benötigt daher eine strategische Architekturplanung mit klaren Entscheidungen zu Datenhaltung, Identity-Management, Backup- und Recovery-Konzepten, Netzwerkdesign, Security-Governance und Betriebsverantwortung. Erst auf dieser Grundlage entsteht ein belastbarer Digital Workplace.

Fazit: Resilienz ist Architekturdisziplin

Die Diskussion um den Digital Workplace konzentriert sich häufig auf Anwendungen, Collaboration-Plattformen und Benutzererfahrung. Tatsächlich entscheidet jedoch die Qualität der zugrundeliegenden Hybrid-IT über deren langfristigen Erfolg.

Resilienz entsteht nicht durch zusätzliche Technologien. Sie entsteht durch beherrschbare Architekturen, standardisierte Plattformen, intelligente Automatisierung und klare Betriebsmodelle. Oder anders formuliert: Der Digital Workplace ist kein Frontend-Thema. Seine Stabilität wird im Backend entschieden.

Unternehmen, die Hybrid-IT konsequent aus Sicht ihrer Geschäftsservices planen und betreiben, schaffen nicht nur höhere Verfügbarkeit. Sie legen gleichzeitig die Grundlage für Skalierbarkeit, Innovationsfähigkeit und langfristige digitale Handlungsfähigkeit.

Christian Knauer.(Bild:  Adlon)
Christian Knauer.
(Bild: Adlon)

Über den Autor

Christian Knauer ist Head of Operations bei der Adlon Intelligent Solutions GmbH. Sein Schwerpunkt liegt auf dem Betrieb und der Weiterentwicklung komplexer Hybrid-IT- und Digital-Workplace-Umgebungen. Dabei verantwortet er insbesondere die Themen Managed Services, Cloud Operations, Infrastruktur-Resilienz und Betriebsmodelle für moderne Arbeitsumgebungen.

(ID:50967245)