• PagerDuty
    /
  • Blog
    /
  • KI
    /
  • 5 Wege, wie IT-Führungskräfte KI im Jahr 2026 zur Verbesserung ihrer Abläufe einsetzen

Blog

5 Wege, wie IT-Führungskräfte KI im Jahr 2026 zur Verbesserung ihrer Abläufe einsetzen

von PagerDuty 11. August 2026 | 7 Minuten Lesezeit

Da die Welt mit Hochdruck daran arbeitet, KI in nahezu alle Geschäftsbereiche, insbesondere die Softwareentwicklung, zu integrieren, ist die Bedeutung der Aufrechterhaltung der Betriebssicherheit so hoch wie nie zuvor. KI-generierter Code und KI-Agenten werden schneller ausgeliefert, als menschliche SREs sich darauf vorbereiten können, was später zu kostspieligen Problemen führen kann: Vorfälle werden schwerer vorherzusagen und die Behebung teurer. Laut Aktuelle Forschungsergebnisse von PagerDuty 76 % der Unternehmen, die mindestens einen KI-Agenten eingesetzt haben, glauben, dass die durch KI bedingte Komplexität bald die Anzahl der Personen übersteigen wird, die ihr Unternehmen zur Bewältigung dieser Komplexität hat.

Wird diese Komplexität nicht bewältigt, führt sie nicht nur zu Störungen, sondern untergräbt auch die Rentabilität von KI. Unternehmen kürzen ihre KI-Budgets aufgrund explodierender Token-Kosten, und Gartner prognostiziert… Mehr als 40 % der Projekte im Bereich agentenbasierter KI werden abgebrochen. bis Ende 2027.

Die Lösung liegt nicht in der flächendeckenden Einführung von KI. Sondern in der Anwendung von KI an den richtigen Stellen.

Entsprechend PagerDuty-Bericht zum Stand der KI-gestützten Operationen 75 % der Unternehmen, die KI in ihren digitalen Abläufen einsetzen, verzeichnen eine höhere Widerstandsfähigkeit und operative Reife, aber nur 59 % tun dies tatsächlich.

In über 30 Sessions auf der PagerDuty on Tour 2026 präsentierten IT-Führungskräfte von Intuit, Roche, Cursor und anderen Unternehmen, wie sie diese Lücke schließen: durch die Integration von KI in das Incident-Management, die Risikominderung und die Systemarchitektur, um einen widerstandsfähigeren Betrieb zu gewährleisten. Fünf ihrer Methoden werden hier vorgestellt.

1. Shift-Left-Ansatz: Einsatzrisiko vorhersagen

Rund 70 % der Vorfälle lassen sich auf Änderungen zurückführen. In einem Live-System bedeutet laut Googles SRE-Buch: Mehr KI-generierter Code, der schneller durch die Pipeline fließt, birgt ein höheres Risiko – es sei denn, man kann dieses Risiko erkennen, bevor der Code ausgeliefert wird.

Bei PagerDuty on Tour 2026 in San Francisco, Intuition , Der Fintech-Riese hinter TurboTax und QuickBooks erläuterte außerdem, wie sein Team KI einsetzt, um Risiken durch frühzeitiges Fehlererkennen zu minimieren. Während ein Entwickler Code schreibt, bewertet die KI die Änderung hinsichtlich des betroffenen Dienstes, des potenziellen Einflussbereichs und der Anzahl der betroffenen Systeme. Anschließend berechnet das Modell einen Risikowert für den neuen Code, der dem Entwickler signalisiert, ob er sicher veröffentlicht werden kann.

PagerDuty-Plugin für Claude Code Dies erzielt denselben Effekt. Mithilfe des Model Context Protocol werden vergangene Vorfälle der letzten 90 Tage auf Warnmuster überprüft. Wenn ein Entwickler beispielsweise zu viele Änderungen in einem Pull Request bündelt, sendet die Integration eine Warnung, dass die Änderung einer früheren Bereitstellung ähnelt, die bereits einen Vorfall verursacht hat.

Auf diese Weise können Teams eine große Menge an Code ausliefern, ohne die Stabilität zu beeinträchtigen, und die Rahmenbedingungen schaffen, damit die KI langfristig mehr Programmierarbeit übernehmen kann.

2. Auswirkungen verstehen: Versteckte Architekturabhängigkeiten abbilden

Ein Vorfall betrifft selten nur ein einzelnes System. Die meisten Anwendungen sind für ihre Funktion auf andere Anwendungen angewiesen. Tritt ein Vorfall auf, kann er mehrere verbundene Systeme beeinträchtigen, manchmal sogar ohne dass Warnmeldungen ausgelöst werden.

Diese Zusammenhänge sind nicht immer klar erkennbar, was es Einsatzteams erschwert, die vollen Auswirkungen eines Vorfalls schnell zu erfassen. Auf der PagerDuty on Tour 2026 in London diskutierten IT-Führungskräfte mit diesem Thema. Roche , ein weltweit tätiges Pharma- und Diagnostikunternehmen, schilderte, wie es KI einsetzt, um historische und aktuelle Daten zu verarbeiten und die Zusammenhänge zwischen fehlerhaften Anwendungen und den darunterliegenden Diensten aufzudecken, wodurch es seine Infrastruktur in Sekundenschnelle abbildet.

Durch die Kenntnis des gesamten Explosionsradius eines Vorfalls können Ingenieure viel schneller eine Priorisierung vornehmen, die richtigen Reparaturen priorisieren, Ressourcen dorthin lenken, wo sie wirklich benötigt werden, und die Betriebszeit schützen.

3. Weniger Aufwand: Der SRE-Agent von PagerDuty automatisiert die Priorisierung und Diagnose.

SREs verbringen ganze Nächte mit der Fehlerbehebung und durchforsten unzählige Warnmeldungen, nur um die eigentliche Ursache zu finden. Diese Plackerei beschränkt sich auch nicht auf den Bereitschaftsingenieur. Laut PagerDuty-Bericht zum Stand der KI-gestützten Betriebsabläufe 2026 Mehr als zwei Drittel der Unternehmen verlieren bei größeren Vorfällen über 300.000 US-Dollar pro Stunde. Die dadurch entstehenden Belastungen können zudem zu massivem Burnout und Personalfluktuation führen.

In jeder Phase PagerDutys SRE-Agent arbeitet daran, diese Mühe zu beseitigen:

  • Autonome Triage Der Agent kann automatisch ausgelöst werden, sobald ein Vorfall beginnt (im Early Access), und ist bereits mit Kontextinformationen aus vergangenen Vorfällen und Benutzerinteraktionen ausgestattet.
  • Erweiterbar durch Design : Konnektoren, Tools und Fähigkeiten ermöglichen es Teams, den SRE Agent in ihren eigenen Stack (Grafana, Datadog, Confluence, GitHub und mehr) zu integrieren und ihn mit kundenspezifischem Domänenwissen auszustatten.
  • Empfehlen und beheben Der SRE-Agent schlägt basierend auf bisherigen Erfolgen die beste Vorgehensweise mit nachvollziehbarer Begründung vor und führt die genehmigte Korrektur aus. Er generiert außerdem ein neues Runbook, um die Behebung des nächsten Vorfalls noch schneller zu gestalten.
  • Regulierter Zugang: Berechtigungen auf Teamebene ermöglichen es Organisationen, den KI-Zugriff auf Teamebene zu beschränken und geben Unternehmen so die Kontrolle, die sie für eine sichere Einführung von KI benötigen.

Doch um genügend Vertrauen aufzubauen, um sich auf ein autonomes System verlassen zu können, bedarf es auch eines kontinuierlichen Feedbacks, nicht eines Glaubenssprungs. Cursor Der KI-gestützte Code-Editor Cursor gibt einen Einblick in die praktische Anwendung. Auf der PagerDuty on Tour 2026 in San Francisco beschrieb Alexi Robbins, Leiter der Agentenentwicklung bei Cursor, die „WTF“-Funktion des Unternehmens. Diese fordert Agenten automatisch dazu auf, ihre eigenen Probleme in einem zentralen System zu protokollieren. Manager-Agenten sortieren diese Protokolle in Kategorien, anschließend analysieren die Entwickler die Muster und beheben Fehler in den zugrundeliegenden Tools.

Dieser Kreislauf, in dem Agenten ihre eigenen Schwachstellen aufdecken und Ingenieure Korrekturen zurückgeben, ist das gleiche Governance-Prinzip, das hinter den Fähigkeiten des SRE-Agenten und den Berechtigungen auf Teamebene steht: Geben Sie den Agenten echte Autonomie, aber halten Sie die Menschen im Prozess, um das Vertrauen aufzubauen, das eine sichere Erweiterung ermöglicht.

4. Optimierung der Reaktion auf Vorfälle durch proaktive Kommunikation mit den Beteiligten

Inmitten eines kritischen Einsatzes ist effiziente Kommunikation entscheidend. Einsatzkräfte müssen sich schnell mit dem Kontext des Vorfalls und den bereits ergriffenen Maßnahmen vertraut machen. Doch manchmal kann ein später eintreffender Einsatzkraft die wichtige Diskussion durch die Frage „Was ist hier los?“ stören.

Wenn die Einsatzkräfte innehalten und diese Personen auf den neuesten Stand bringen müssen, lenkt das den Fokus von der eigentlichen Problemlösung ab und verzögert die Lösungsfindung.

Eine Cloud-Kommunikationsplattform hat dieses Problem mit dem Scribe Agent von PagerDuty gelöst. Der Agent transkribiert nicht nur automatisch die Besprechungen während des Vorfalls und erfasst den Gesprächsverlauf, sondern veröffentlicht auch regelmäßig Statusberichte in einem dedizierten Vorfallskanal. So erhalten Techniker und Beteiligte sofort nach ihrer Teilnahme die benötigten Informationen.

So kann sich das Reaktionsteam voll und ganz auf die Problembehebung konzentrieren. Durch die Optimierung der Arbeitsabläufe im Incident-Management bei hohem Aufkommen konnte die mittlere Reparaturzeit (MTTR) zudem deutlich reduziert werden.

5. Schneller lernen: Automatische Generierung von Berichten nach Vorfällen.

Die Nachbesprechung von Vorfällen ist für jedes resiliente Entwicklerteam unerlässlich. Sie liefert zwar wertvolle Erkenntnisse, ist aber oft aufwendig: Entwickler verbringen häufig Stunden damit, Chatverläufe, Tickethistorien und Dashboards zu durchforsten, nur um den Hergang zu rekonstruieren.

Bei PagerDuty on Tour 2026 in San Francisco, Intuition Sie erörterten, wie sie den Prozess mithilfe von KI beschleunigen. Sobald das Team einen Vorfall behoben hat, scannt ihr KI-Agent Konversationen und Slack-Threads und erstellt anschließend automatisch ein Dokument zur Ursachenanalyse.

Dieser einfache Workflow hat den Teams von Intuit mehrere Stunden manueller Arbeit pro Vorfall erspart. Die Ingenieure müssen sich nicht mehr mit der mühsamen Erstellung des Vorfallberichts herumschlagen. Stattdessen können sie diese Zeit nutzen, um das „Warum“ zu analysieren – den Aspekt, der sich letztendlich in der Ausfallsicherheit auszahlt.

Operative Resilienz Schritt für Schritt schaffen

Mehr KI ist nicht automatisch der Schlüssel zum Erfolg. Agenten ohne Plan in bestehende Arbeitsabläufe zu integrieren, erhöht lediglich die Komplexität. Intuit, Roche, Cursor und PagerDuty zeigen einen besseren Weg auf: Sie nutzen KI, um spezifische operative Probleme zu lösen und so die Resilienz zu stärken.

Fragen Sie sich zunächst, was KI gut kann und was Ihre Ingenieure noch besser können. Identifizieren Sie dann einen besonders arbeitsintensiven oder risikoreichen Arbeitsablauf und entscheiden Sie, wie die Arbeit aufgeteilt werden soll, sodass sowohl KI-Agenten als auch Menschen jeweils das tun, was sie am besten können.

Einzelne Agenten-Workflows lohnen sich jedoch nur dann, wenn sie in ein größeres System eingebunden sind, das sie automatisieren und daraus lernen kann. Ohne die Möglichkeit, aus vergangenen Vorfällen operative Erkenntnisse zu gewinnen, bleiben Teams dabei stecken, immer wieder dieselben Probleme zu beheben.

Engineering-Teams können ihren ROI steigern, indem sie einen Feedback-Kreislauf aufbauen und die Daten nach einem Vorfall nutzen, um die Infrastruktur zu stärken und Ausfälle präventiv zu verhindern. Genau dieses Modell steckt hinter der PagerDuty Plattform. Dank integrierter Agenten, die aus jedem Vorfall lernen, führt die Plattform Teams näher an einen vollständig autonomen Betrieb heran. Wenn Ihr Backend-System die mühsame, sich wiederholende Fehlerbehebung automatisiert, gewinnen Ihre Ingenieure ihre wertvollste Ressource zurück: ungestörte Zeit für die Entwicklung besserer und robusterer Services.

Möchten Sie erfahren, wie IT-Führungskräfte weltweit über KI im Betriebsablauf denken? Erhalten Sie vollen Zugriff auf alle Sessions von PagerDuty on Tour 2026 auf Abruf. Die