Disaster Recovery: Traditional vs. Azure Site Recovery Scenarios - TrustedTech

Notfallwiederherstellung: Herkömmliche Szenarien im Vergleich zu Azure Site Recovery-Szenarien

Need Help Figuring Out the Licensing You Need? Save Up to 20% by Chatting with our Experts!

Get Expert Licensing Help

 

Ein paar „Was-wäre-wenn“-Szenarien (denn genau dafür ist DR da)

Lassen Sie uns einige gängige Szenarien zur Notfallwiederherstellung durchgehen. Nicht die dramatischen Katastrophen wie im Film, sondern die schmerzlich realistischen, mit denen wir regelmäßig zu tun haben.

Gleiches Geschäftsfeld. Gleiche Arbeitsbelastung. Zwei Modelle:

  • Traditionelle DR (vor Ort oder in einem Rechenzentrum untergebrachte Hardware)
  • Azure Site Recovery (ASR)

Wir werden den Text für Führungskräfte verständlich halten und uns auf Ausfallzeiten und deren Auswirkungen auf das Geschäft konzentrieren.


1) Was passiert, wenn ein kritischer DR-Host ausfällt?

Traditionelle DR

Ihr DR-Cluster hat nicht die Größe einer Produktionsumgebung. Er ist „auf einen schlechten Tag ausgelegt“. Das ist eine höfliche Umschreibung dafür, dass er oft eher schlank aufgebaut ist. Wenn ein Host ausfällt:

  • Sie suchen verzweifelt nach freien Kapazitäten.
  • Sie rufen einen Lieferanten an.
  • Sie überprüfen den Garantiestatus.
  • Du hoffst inständig, dass das Teil vorrätig ist und sich der Preis dank KI nicht vervierfacht hat.

Voraussichtliche Auswirkungen: 4–48 Stunden eingeschränkte Wiederherstellungsfähigkeit. Sollte dieser Ausfall während einer tatsächlichen Katastrophe auftreten, ist Ihre RTO nicht mehr als eine bloße Empfehlung.

As-salamu alaykum

Es gibt keinen „einzigen DR-Host“, den Sie besitzen oder für den Sie verantwortlich sind. Bei einem Failover werden Rechenressourcen in Azure bereitgestellt. Falls ein Host in Azure ausfällt? Das ist Microsofts Problem. Der Wiederherstellungsplan wird nicht unterbrochen, nur weil ein bestimmter physischer Server einen schlechten Tag hatte.

Geschätzte Auswirkungen: Minimal bis keine. Die Plattform gleicht den Ausfall nahtlos aus.


2) Was passiert, wenn am DR-Standort der Strom ausfällt?

Traditionelle DR

Ja, Sie haben sich für eine „Tier-III-Einrichtung“ entschieden. Ja, sie verfügt über Generatoren. Ja, sie verfügt über eine Batterie-Notstromversorgung. Aber Generatoren benötigen Kraftstoff. Batterien müssen gewartet werden. Und manchmal dauert der Ausfall nicht nur wenige Minuten – er ist regional, was bedeutet, dass er Stunden oder Tage andauern kann. Nun ist auch Ihr „redundanter Standort“ offline.

Geschätzte Auswirkungsdauer: Zwischen 1 und 24+ Stunden, je nach Dauer der Wiederherstellung. Wenn sowohl die Primär- als auch die DR-Stromversorgung von demselben regionalen Stromausfall betroffen sind? Dann müssen Sie offiziell improvisieren.

As-salamu alaykum

Ihr DR-Ziel ist eine Hyperscale-Cloud-Region mit mehrstufiger Stromversorgungsredundanz, die die meisten Unternehmen wirtschaftlich nicht nachbilden können. Sollte an Ihrem Primärstandort ein Stromausfall auftreten, erfolgt eine Ausfallsicherung auf Azure. Sollte in Ihrer DR-Region ein Problem auftreten, bietet Azure regionale Ausfallsicherheitsstrategien, die weit über die eines durchschnittlichen Colocation-Racks hinausgehen.

Geschätzte Auswirkungen: Nur die Failover-Zeit. Die Stromversorgung Ihres Gebäudes spielt für die Wiederherstellungsfähigkeit keine Rolle mehr.


3) Was passiert, wenn die Internetverbindung zum DR-Standort ausfällt?

Traditionelle DR

Ihr DR-Standort ist nur dann von Nutzen, wenn er erreichbar ist, das Routing funktioniert, DNS-Aktualisierungen weitergeleitet werden und VPN-Verbindungen korrekt hergestellt werden. Ein einziger Glasfaserbruch, eine falsch konfigurierte BGP-Route, ein einziges Problem beim Internetdienstanbieter … und schon wird Ihr DR-Standort zu einer sehr teuren Insel.

Voraussichtliche Dauer: 2–12 Stunden für die Fehlerdiagnose und die Wiederherstellung der Verbindung. Länger, falls es sich um ein Problem beim Netzbetreiber handelt.

As-salamu alaykum

Die Ausfallsicherung in Azure umfasst eine Netzwerkinfrastruktur, die bereits für globale Konnektivität ausgelegt ist. Sie können VPN oder ExpressRoute vorab einrichten, und Ausfallsicherungspläne können eine Neukonfiguration des Netzwerks beinhalten. Falls eine Verbindung ausfällt, bleibt Azure weiterhin verfügbar.

Geschätzte Auswirkung: Nur die Dauer des Failovers. Die Netzwerkausfallsicherheit wird zu einem architektonischen Merkmal und ist nicht mehr dem Zufall überlassen.


4) Was passiert, wenn die Region von einer Naturkatastrophe heimgesucht wird?

Hochwasser. Feuer. Tornado. Erdbeben. Suchen Sie sich Ihr ganz persönliches unvorhersehbares Worst-Case-Szenario aus.

Traditionelle DR

Befindet sich Ihr DR-Standort im selben Ballungsraum (was aus Latenzgründen häufig der Fall ist), teilen Sie sich möglicherweise das Risiko. In einer anderen Region zahlen Sie rund um die Uhr für doppelte Infrastruktur, um ein Risiko abzusichern, das möglicherweise nie eintritt. Was passiert, wenn beide Standorte betroffen sind? Dann wird die Wiederherstellung zu einer forensischen Untersuchung.

Geschätzte Auswirkungen: Tage bis Wochen, falls beide Standorte betroffen sind. Erhebliche finanzielle Einbußen und Rufschädigung. Einstellung des Geschäftsbetriebs.

As-salamu alaykum

Sie wählen bewusst Azure-Regionen aus, die von Ihrem primären Einsatzgebiet getrennt sind. Sie nutzen eine Infrastruktur von globalem Ausmaß, die von Grund auf geografisch verteilt ist. Sie „hoffen“ nicht, dass Ihr zweites Rechenzentrum weit genug entfernt ist. Das ist es definitiv.

Geschätzte Auswirkungen: Die RTO wird je nach Komplexität der Arbeitslast in Minuten bis Stunden gemessen. Eine regionale Katastrophe wird zu einem Failover-Ereignis und nicht zu einer existenziellen Krise. Möglicherweise kommt es zu einer leichten Erhöhung der Latenz zwischen den Regionen um einige Dutzend Millisekunden.


5) Was passiert, wenn die DR-Umgebung seit einem Jahr nicht mehr getestet wurde?

Das ist die stille Art. Und sie kommt häufig vor. Und sie ist vielleicht die schlimmste auf der Liste.

Traditionelle DR

Tests sind störend. Sie sind komplex. Sie erfordern koordinierte Ausfälle, lange Nächte, Genehmigungen für Änderungen, manuelle Ablaufanleitungen und jede Menge Kaffee. Deshalb werden sie immer wieder verschoben. Bis eines Tages während eines echten Ausfalls jemand feststellt, dass eine Firewall-Regel nie repliziert wurde, ein Zertifikat abgelaufen ist, sich das Passwort eines Dienstkontos geändert hat oder eine Speicherzuordnung in der Produktion aktualisiert wurde, nicht aber in der Notfallwiederherstellung.

Geschätzte Auswirkungen: Unerwarteter Zeitaufwand von 8–24+ Stunden für die Fehlerbehebung während der eigentlich geplanten Wiederherstellungsphase.

As-salamu alaykum

In die Plattform sind unterbrechungsfreie Test-Failovers integriert. Sie können isolierte Testnetzwerke einrichten, die Startreihenfolge überprüfen, das Anwendungsverhalten bestätigen und diese anschließend automatisch und sauber wieder abbauen. Das Testen wird zu einem operativen Vorgang und ist keine reine Formalität mehr.

Geschätzte Auswirkungen: Vorhersehbare RTO, da die Validierung routinemäßig erfolgt.


6) Was passiert, wenn das Wachstum das DR-Konzept überholt?

Das Geschäft wächst. Das Arbeitsaufkommen steigt. Der Speicherbedarf nimmt zu. Neue Anwendungen kommen hinzu.

Traditionelle DR

Ihre DR-Hardware wurde auf der Grundlage der Annahmen des letzten Jahres dimensioniert. Nun müssen Sie entweder während des Failovers mehr Ressourcen bereitstellen, als tatsächlich benötigt werden, oder „für alle Fälle“ zusätzliche Hardware anschaffen. Die Skalierung der DR ist mit Investitionsausgaben verbunden.

Voraussichtliche Auswirkungen: Kapazitätsengpässe während einer Katastrophe = Leistungsbeeinträchtigung oder teilweise Wiederherstellung.

As-salamu alaykum

Die Replikation skaliert mit dem Wachstum der Arbeitslast. Der Speicherbedarf steigt? Die Replikation passt sich an. Die Anzahl der VMs steigt? Die Replikationsrichtlinien werden erweitert. Sie wechseln den Anbieter? Einfaches Update Ihres Failover-Plans. Sie zahlen anteilig, nicht im Voraus.

Geschätzte Auswirkungen: Konsistente Abstimmung von RTO und Leistung mit der Produktion.


Die „Was-wäre-wenn“-Fragen aus 30.000 Fuß Höhe

Bei der herkömmlichen Notfallwiederherstellung (DR) lautet die Frage: „Welche Hardware sollten wir anschaffen, um eine Katastrophe zu überstehen?“

Azure Site Recovery fragt: „Welches Ergebnis möchten wir im Katastrophenfall erzielen?“

Das eine Modell finanziert Gebäude, Serverracks, Generatoren und Hoffnung. Das andere finanziert Koordination, Automatisierung und Vorhersehbarkeit. In den meisten mittelständischen Unternehmen ist der Unterschied zwischen beiden nicht gerade subtil. Es ist der Unterschied zwischen:

  • Sechsstellige Investitionsvorhaben pro Standort
  • Laufende Co-Lo-Verträge
  • Aktualisierungen im Hardware-Lebenszyklus
  • Und die Komplexität der Betriebsabläufe

…im Vergleich zu…

  • Die monatlichen Servicekosten belaufen sich oft auf Hunderte oder einige Tausend
  • Dokumentierte Failover-Skripte
  • Niedrige RTO
  • Wiederholbare Prüfungen
  • Und eine Infrastruktur, die auf einer Compliance-fähigen globalen Plattform basiert

Früher bedeutete „Disaster Recovery“, eine zweite Version des eigenen Unternehmens aufzubauen und zu hoffen, dass man sie niemals brauchen würde. Heute kann es bedeuten, das eigene Unternehmen auf einer Plattform zu replizieren, die dafür ausgelegt ist, Ereignisse zu überstehen, die man selbst wirtschaftlich nicht bewältigen kann. Das ist nicht nur ein technologischer Wandel, sondern auch ein finanzieller.