Der Erfolg des Digital Workplace hängt heute weniger von einzelnen Technologien als von der Resilienz der zugrundeliegenden Hybrid-IT ab. Entscheidend sind beherrschbare Abhängigkeiten, standardisierte Betriebsmodelle und eine Infrastruktur, die auch unter Belastung kontrollierbar bleibt.
Resiliente Hybrid-IT verbindet Cloud, Netzwerk, Identity und Betriebsprozesse zu einer belastbaren Basis für den Digital Workplace.
(Bild: Adlon / KI-generiert)
Der Digital Workplace steht und fällt mit der Stabilität seiner Backend-Systeme. Mitarbeitende erwarten jederzeit funktionierende Zugänge zu Daten, Anwendungen und Kollaborationsplattformen. Gleichzeitig verteilen sich diese Dienste heute über Cloud-Plattformen, Colocation-Rechenzentren, Edge-Standorte und eigene Infrastrukturen.
Die eigentliche Herausforderung liegt dabei nicht in den Technologien selbst. Sie entsteht an den Schnittstellen zwischen ihnen. Aus operativer Sicht lassen sich schwerwiegende Störungen deutlich häufiger auf Abhängigkeiten zwischen Identitätsdiensten, Netzwerkkomponenten, Security-Layern und Cloud-Plattformen zurückführen als auf den Ausfall einzelner Server oder Storage-Systeme. Ein nicht erreichbarer Authentifizierungsdienst kann einen kompletten Digital Workplace zum Stillstand bringen, obwohl sämtliche Anwendungen physisch verfügbar sind. Wer Hybrid-IT wie mehrere Einzelplattformen betreibt, erhält mehrere Fehlerquellen. Wer sie als integrierten Service betrachtet, schafft hingegen Resilienz.
Praxisansatz: Abhängigkeiten sichtbar machen
Für jeden geschäftskritischen Service sollte dokumentiert sein, welche Identity-, DNS-, Netzwerk-, Cloud- und externen Schnittstellenabhängigkeiten bestehen. Die Analyse zeigt in der Praxis häufig, dass vermeintlich unabhängige Systeme gemeinsame Single Points of Failure besitzen.
Verfügbarkeit wird heute durch Identitäten bestimmt
Noch vor wenigen Jahren konzentrierten sich Hochverfügbarkeitskonzepte vor allem auf Rechenzentrumskomponenten. Heute bildet das Identity-Management häufig den kritischsten Bestandteil einer digitalen Arbeitsumgebung.
Microsoft Entra ID, Active Directory, Single-Sign-On-Plattformen und Conditional-Access-Richtlinien sind zentrale Schaltstellen nahezu aller Geschäftsprozesse. Fällt diese Ebene aus oder arbeitet sie inkonsistent, verlieren Anwender den Zugriff auf Microsoft 365, SaaS-Anwendungen, VPN-Lösungen oder digitale Arbeitsplätze. Resilienz muss deshalb aus Sicht der gesamten Servicekette geplant werden.
Dazu gehören unter anderem:
mindestens zwei unabhängige, überwachte Break-Glass-Konten ohne Conditional-Access-Bindung
Alarmierung bei Anmeldungen und Änderungen an privilegierten Konten
Conditional-Access-Richtlinien – dokumentiert, versioniert und im Report-only-Modus vorgetestet
definierte und getestete Wiederherstellung von Verzeichnisdiensten inklusive Zeitvorgabe
dokumentiertes Vorgehen für den Ausfall des zentralen Identitätsdienstes, inklusive betroffener Anwendungen und Notfallzugänge
regelmäßige Prüfung, welche Anwendungen bei einem Identity-Ausfall weiterhin nutzbar bleiben
Die entscheidende Frage lautet nicht: „Ist der Server verfügbar?" Sondern: „Kann der Anwender arbeiten?"
Netzwerk-Resilienz endet nicht beim zweiten Uplink
Auch Netzwerke haben sich grundlegend verändert. Der klassische Perimeter weicht zunehmend verteilten Architekturen aus SD-WAN, SASE, Cloud-Backbones und direkten Cloud-Anbindungen.
Dabei entsteht häufig ein Trugschluss: Redundante Leitungen allein schaffen noch keine Resilienz. Entscheidend ist die Beherrschung der gesamten Kommunikationspfade. Routing-Fehler, DNS-Probleme, fehlerhafte Firewall-Regeln oder inkonsistente Security Policies verursachen im Alltag deutlich häufiger Serviceunterbrechungen als physische Leitungsausfälle.
Erfahrene Betriebsteams betrachten deshalb nicht nur die Infrastruktur, sondern die so genannten „Failure Domains“. Die zentrale Frage lautet: Welche Komponenten können gemeinsam ausfallen und welche Geschäftsprozesse wären davon betroffen?
Diese Szenarien sollten regelmäßig getestet werden:
Ausfall einer WAN- oder Cloud-Anbindung
Ausfall eines DNS-Servers oder fehlerhafte Namensauflösung
Ausfall einer zentralen Firewall oder eines SD-WAN-Knotens
Ausfall des VPN-beziehungsweise ZTNA-Zugangs
Ablauf oder Fehlkonfiguration von Zertifikaten
Erst wenn geschäftskritische Anwendungen unter diesen Bedingungen nachweislich erreichbar bleiben, kann von belastbarer Netzwerk-Resilienz gesprochen werden.
Konfigurationsdrift ist der stille Gegner der Betriebsstabilität
Eine der größten Herausforderungen im Betrieb hybrider Umgebungen ist nicht der technische Wandel, sondern die schleichende Veränderung bestehender Systeme. Jede manuelle Anpassung erhöht die Wahrscheinlichkeit von Abweichungen zwischen Soll- und Ist-Zustand. Unterschiedliche Server-Images, individuelle Firewall-Regeln oder historisch gewachsene Sonderkonfigurationen erschweren Fehleranalysen und verlängern Wiederherstellungszeiten erheblich.
Aus Sicht des Betriebs gilt deshalb ein einfaches Prinzip: Standardisierung reduziert nicht die Handlungsfähigkeit des Betriebs. Sie schafft die Voraussetzung dafür, Änderungen reproduzierbar, nachvollziehbar und mit geringerem Risiko umzusetzen. Infrastructure-as-Code-Ansätze mit Werkzeugen wie Terraform oder Ansible haben sich als wirksames Mittel etabliert, um reproduzierbare Plattformen bereitzustellen. Änderungen werden versioniert, automatisiert ausgerollt und nachvollziehbar dokumentiert.
Stand: 08.12.2025
Es ist für uns eine Selbstverständlichkeit, dass wir verantwortungsvoll mit Ihren personenbezogenen Daten umgehen. Sofern wir personenbezogene Daten von Ihnen erheben, verarbeiten wir diese unter Beachtung der geltenden Datenschutzvorschriften. Detaillierte Informationen finden Sie in unserer Datenschutzerklärung.
Einwilligung in die Verwendung von Daten zu Werbezwecken
Ich bin damit einverstanden, dass die Vogel IT-Medien GmbH, Max-Josef-Metzger-Straße 21, 86157 Augsburg, einschließlich aller mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen (im weiteren: Vogel Communications Group) meine E-Mail-Adresse für die Zusendung von Newslettern und Werbung nutzt. Auflistungen der jeweils zugehörigen Unternehmen können hier abgerufen werden.
Der Newsletterinhalt erstreckt sich dabei auf Produkte und Dienstleistungen aller zuvor genannten Unternehmen, darunter beispielsweise Fachzeitschriften und Fachbücher, Veranstaltungen und Messen sowie veranstaltungsbezogene Produkte und Dienstleistungen, Print- und Digital-Mediaangebote und Services wie weitere (redaktionelle) Newsletter, Gewinnspiele, Lead-Kampagnen, Marktforschung im Online- und Offline-Bereich, fachspezifische Webportale und E-Learning-Angebote. Wenn auch meine persönliche Telefonnummer erhoben wurde, darf diese für die Unterbreitung von Angeboten der vorgenannten Produkte und Dienstleistungen der vorgenannten Unternehmen und Marktforschung genutzt werden.
Meine Einwilligung umfasst zudem die Verarbeitung meiner E-Mail-Adresse und Telefonnummer für den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern wie z.B. LinkedIN, Google und Meta. Hierfür darf die Vogel Communications Group die genannten Daten gehasht an Werbepartner übermitteln, die diese Daten dann nutzen, um feststellen zu können, ob ich ebenfalls Mitglied auf den besagten Werbepartnerportalen bin. Die Vogel Communications Group nutzt diese Funktion zu Zwecken des Retargeting (Upselling, Crossselling und Kundenbindung), der Generierung von sog. Lookalike Audiences zur Neukundengewinnung und als Ausschlussgrundlage für laufende Werbekampagnen. Weitere Informationen kann ich dem Abschnitt „Datenabgleich zu Marketingzwecken“ in der Datenschutzerklärung entnehmen.
Falls ich im Internet auf Portalen der Vogel Communications Group einschließlich deren mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen geschützte Inhalte abrufe, muss ich mich mit weiteren Daten für den Zugang zu diesen Inhalten registrieren. Im Gegenzug für diesen gebührenlosen Zugang zu redaktionellen Inhalten dürfen meine Daten im Sinne dieser Einwilligung für die hier genannten Zwecke verwendet werden. Dies gilt nicht für den Datenabgleich zu Marketingzwecken.
Recht auf Widerruf
Mir ist bewusst, dass ich diese Einwilligung jederzeit für die Zukunft widerrufen kann. Durch meinen Widerruf wird die Rechtmäßigkeit der aufgrund meiner Einwilligung bis zum Widerruf erfolgten Verarbeitung nicht berührt. Um meinen Widerruf zu erklären, kann ich als eine Möglichkeit das unter https://contact.vogel.de abrufbare Kontaktformular nutzen. Sofern ich einzelne von mir abonnierte Newsletter nicht mehr erhalten möchte, kann ich darüber hinaus auch den am Ende eines Newsletters eingebundenen Abmeldelink anklicken. Weitere Informationen zu meinem Widerrufsrecht und dessen Ausübung sowie zu den Folgen meines Widerrufs finde ich in der Datenschutzerklärung.
Für den Einstieg genügt bereits ein pragmatischer Ansatz: definierte Soll-Konfigurationen für Server-Images, Firewall-Regelwerke und Client-Baselines, ein regelmäßiger automatisierter Abgleich gegen diesen Soll-Zustand sowie eine dokumentierte Freigabe für jede Abweichung. Nicht dokumentierte Sonderkonfigurationen sind erfahrungsgemäß der häufigste Grund für verlängerte Wiederherstellungszeiten.
Resilienz-Check für Administratoren
Werden drei oder mehr Fragen mit „Nein“ beantwortet, besteht kurzfristiger Handlungsbedarf:
Sind alle geschäftskritischen Services inklusive ihrer Identity-, Netzwerk-, Security- und Cloud-Abhängigkeiten dokumentiert?
Existieren für diese Services definierte Wiederherstellungsziele (RTO/RPO)?
Wurde die Wiederherstellung innerhalb der letzten zwölf Monate nachweislich getestet?
Gibt es geprüfte Break-Glass-Zugänge für den Ausfall des zentralen Identitätsdienstes?
Werden Infrastrukturänderungen versioniert, nachvollziehbar und überwiegend automatisiert umgesetzt?
Ist bekannt, welche Geschäftsprozesse beim Ausfall einzelner Netzwerk- oder Cloud-Komponenten betroffen wären?
Sind Service-Owner und Eskalationswege plattformübergreifend eindeutig definiert?
Resilienz entsteht durch Automatisierung
In hybriden Infrastrukturen wachsen technische Abhängigkeiten, während Change-Zyklen und Bereitstellungszeiten kürzer werden. Manuelle Betriebsprozesse stoßen dadurch schnell an Grenzen. Automatisierung wird zur Grundvoraussetzung resilienter Betriebsmodelle, insbesondere wenn Infrastruktur, Konfigurationen und Sicherheitsrichtlinien reproduzierbar bereitgestellt werden.
Dazu zählen beispielsweise:
Bereitstellung von Servern und Plattformdiensten über versionierte Templates
automatisiertes Patch-Management mit definierten Wartungsfenstern und Rollback-Option
automatisierte Kontrolle von Backup-Jobs inklusive Erfolgsmeldung und Eskalation bei Fehlern
automatisierter Abgleich von Konfigurationen gegen definierte Soll-Zustände
automatisierte Bereitstellung und Prüfung von Security-Richtlinien
Eine wichtige Erkenntnis aus dem Betriebsalltag lautet: Die Geschwindigkeit einer Wiederherstellung hängt nicht allein von der Qualität der Dokumentation ab, sondern wesentlich davon, wie stark Wiederherstellungsprozesse standardisiert, getestet und automatisiert sind.
Resilienz muss regelmäßig getestet werden
Resilienz entsteht nicht durch Konzepte auf Papier. Sie zeigt sich erst dann, wenn Wiederanlauf, Failover und Recovery unter realistischen Bedingungen überprüft werden. Dazu gehören regelmäßige Restore-Tests, die Prüfung von Notfallzugängen, die Validierung von Identity- und Netzwerkabhängigkeiten sowie dokumentierte Lessons Learned nach Störungen oder Übungen. Nur getestete Wiederherstellungsprozesse liefern im Ernstfall belastbare Sicherheit.
Warum klassisches Monitoring nicht mehr ausreicht
Monitoring-Systeme liefern seit Jahren Kennzahlen zu CPU-Auslastungen, Speicherkapazitäten oder Netzwerk-Latenzen. Für hybride Infrastrukturen genügt diese Sichtweise jedoch nicht mehr. Administratoren benötigen heute Transparenz über komplette Serviceketten hinweg. Observability-Lösungen wie Grafana, Dynatrace, Splunk oder Azure Monitor korrelieren Logs, Traces und Metriken aus unterschiedlichen Plattformen und machen Abhängigkeiten sichtbar. Betriebsteams erkennen dadurch nicht nur technische Alarme, sondern deren Auswirkungen auf Benutzeranmeldungen, Anwendungsperformance und Geschäftsprozesse.
Für den Einstieg genügt es, für die fünf wichtigsten Geschäftsservices je eine Ende-zu-Ende-Überwachung aufzubauen: synthetische Anmeldung, Prüfung der Anwendungserreichbarkeit aus Anwendersicht, Kontrolle der zugehörigen Backup- und Replikationsjobs sowie Alarmierung auf Service-Ebene statt auf Komponentenebene. Ein Alarm sollte die Frage beantworten, welcher Geschäftsprozess betroffen ist, nicht nur, welche Komponente auffällig ist.
Der Mehrwert ist erheblich: Ursachenanalysen verkürzen sich, Ausfallzeiten sinken und Fehlentscheidungen werden reduziert. Nicht die Störung selbst verursacht lange Ausfälle. Die eigentliche Herausforderung besteht darin, ihre Ursache schnell zu erkennen.
Betriebsmodelle sind wichtiger als Technologie
Technologien lassen sich beschaffen. Betriebsdisziplin lässt sich nicht einkaufen. Resiliente Hybrid-IT entsteht nur dann, wenn Verantwortlichkeiten, Prozesse und Eskalationswege eindeutig definiert sind. Für jeden geschäftskritischen Service sollten Service Owner, technisch verantwortliches Team, Eskalationsweg, Wiederherstellungsziel (RTO), tolerierbarer Datenverlust (RPO) und Entscheidungsbefugnis im Störungsfall festgelegt sein. Fehlt eine dieser Festlegungen, verlängern sich Störungen häufig nicht durch technische Ursachen, sondern durch unklare Zuständigkeiten. Der entscheidende Perspektivwechsel lautet: Der Anwender interessiert sich nicht für Server, Firewalls oder Cloud-Tenants. Er erwartet einen funktionierenden Service. Genau daran sollte sich auch die Betriebsorganisation orientieren.
Die Cloud löst keine Architekturprobleme
Cloud-Plattformen bieten enorme Vorteile bei Skalierung, Agilität und Innovationsgeschwindigkeit. Dennoch lösen sie keine strukturellen Schwächen bestehender Architekturen. Technische Schulden, unklare Verantwortlichkeiten oder fehlende Standardisierung verschwinden durch eine Migration nicht. Sie werden lediglich an einen anderen Ort verlagert.
Eine resiliente Hybrid-IT benötigt daher eine strategische Architekturplanung mit klaren Entscheidungen zu Datenhaltung, Identity-Management, Backup- und Recovery-Konzepten, Netzwerkdesign, Security-Governance und Betriebsverantwortung. Erst auf dieser Grundlage entsteht ein belastbarer Digital Workplace.
Fazit: Resilienz ist Architekturdisziplin
Die Diskussion um den Digital Workplace konzentriert sich häufig auf Anwendungen, Collaboration-Plattformen und Benutzererfahrung. Tatsächlich entscheidet jedoch die Qualität der zugrundeliegenden Hybrid-IT über deren langfristigen Erfolg.
Resilienz entsteht nicht durch zusätzliche Technologien. Sie entsteht durch beherrschbare Architekturen, standardisierte Plattformen, intelligente Automatisierung und klare Betriebsmodelle. Oder anders formuliert: Der Digital Workplace ist kein Frontend-Thema. Seine Stabilität wird im Backend entschieden.
Unternehmen, die Hybrid-IT konsequent aus Sicht ihrer Geschäftsservices planen und betreiben, schaffen nicht nur höhere Verfügbarkeit. Sie legen gleichzeitig die Grundlage für Skalierbarkeit, Innovationsfähigkeit und langfristige digitale Handlungsfähigkeit.
Christian Knauer.
(Bild: Adlon)
Über den Autor
Christian Knauer ist Head of Operations bei der Adlon Intelligent Solutions GmbH. Sein Schwerpunkt liegt auf dem Betrieb und der Weiterentwicklung komplexer Hybrid-IT- und Digital-Workplace-Umgebungen. Dabei verantwortet er insbesondere die Themen Managed Services, Cloud Operations, Infrastruktur-Resilienz und Betriebsmodelle für moderne Arbeitsumgebungen.