Unser Team landet oft mitten in solchen Feueralarm-Situationen. Die erste Maßnahme ist dann nicht, eine 100-seitige PowerPoint über ideales DevOps zu präsentieren. Sondern: zum virtuellen Feuerwehrschlauch greifen und helfen, die dringendsten Brände zu identifizieren und zu löschen. Dabei geht es nicht nur um Soforthilfe, sondern darum, wertvolle Zeit zurückzugewinnen. Zeit zum Atmen, Nachdenken und zur gemeinsamen Entwicklung eines echten Fahrplans, um das System langfristig zu stabilisieren. Bei XALT glauben wir daran, alle auf diese Reise mitzunehmen. Das Team soll nicht nur das „Warum“ verstehen, sondern auch aktiv am „Wie“ mitarbeiten.
Authentifizierungsplattform im Active/Active-Betrieb
Nehmen wir zum Beispiel eine zentrale Plattform für Authentifizierung und Autorisierung bei einem kritischen Institut. Sie war im Falle unseres Kunden eine ständige Quelle jener vorfallreichen Wochenenden.
Eine nicht verhandelbare Anforderung war: Die Plattform musste im Active/Active-Modus über zwei Regionen hinweg betrieben werden. Ohne das weigerten sich andere zentrale Dienste, auf sie umzuziehen. Diese Anforderung wurde in jeder erdenklichen internen Besprechung erwähnt. Diese Strategie der Verstärkung, basierend auf Prinzipien erfolgreicher Organisationen (wie sie zum Beispiel Gene Kim in seinen Büchern beschreibt), erwies sich hier als entscheidend.
Unsere Erfahrung zeigt: Dieses konsequente Kommunizieren hilft enorm dabei, überhaupt erst das Budget für die Behebung solcher Kernprobleme zu sichern. Sobald die Mittel bewilligt waren, lag es an uns, die Lage zu verbessern. Unter Berücksichtigung der einzigartigen Umgebung und Rahmenbedingungen entwarfen und implementierten wir eine maßgeschneiderte Lösung für den robusten Active/Active-Betrieb und beseitigten damit endlich den Blocker für die abhängigen Teams.
SRE-Kultur und strukturierte Betriebsprozesse
Doch Technologie ist nur ein Teil der Gleichung. Während des komplexen Umstiegs von Active/Standby auf Active/Active arbeiteten wir eng mit dem Operations-Team zusammen, um dessen SRE-Kultur (Site Reliability Engineering) weiterzuentwickeln.
Zunächst erstellten wir klare Anleitungen für alle täglichen Aufgaben. Dabei war es uns sehr wichtig, dass diese Anleitungen nicht einfach verstreut in Einzelnotizen enden. Wir sorgten dafür, dass sie alle an einem zentralen Ort in Confluence zusammengeführt wurden. So wurde Confluence zur einzigen zuverlässigen Anlaufstelle für alle Informationen.
Als Atlassian Platinum Partner wissen wir, wie viel besser Teams Wissen teilen, wenn Confluence strukturiert genutzt wird. Und ja, wir helfen auch gerne bei der Migration von Jira und Confluence in die Cloud!
Parallel dazu etablierten wir eine Kultur von Post-Mortems ohne Schuldzuweisungen. Es ist beeindruckend, wie viel man lernen kann, wenn der Fokus auf Systemverbesserung statt auf Schuld liegt. Damit diese Kultur wirklich verankert wird und Teams auf alle Eventualitäten vorbereiten kann, gehen wir bewusst über die übliche Praxis hinaus, diese Reviews nur bei großen, umsatzkritischen Incidents durchzuführen, wie es in einigen Finanzunternehmen Standard ist.