Zum Inhalt springen

Prozessbeobachtbarkeit: Was einen Monat nach dem Go-live sichtbar sein muss

Prozessbeobachtbarkeit: Was einen Monat nach dem Go-live sichtbar sein muss

In unserem Angebotsgenerator sammelten sich von Anfang an zwei Arten von Statistiken: Kennzahlen je Vertriebsmitarbeiter und Daten dazu, welche Angebotstypen die höchste Nachfrage auslösten. Das war der am einfachsten umzusetzende Teil des Services – und der einzige, der die Frage „Funktioniert es?" mit Zahlen statt mit Eindrücken beantwortete.

Einen Monat nach dem Start eines jeden Prozesses stellt die Geschäftsführung immer dieselbe Frage. Lautet die Antwort „Das Team ist zufrieden" und „Es fühlt sich einfacher an", wurde kein Prozess eingeführt, sondern eine Demo vorgeführt. Prozessbeobachtbarkeit (die Eigenschaft eines Systems, seinen inneren Zustand aus externen Daten zu rekonstruieren) wird vor dem Go-live angelegt – und so gut wie nie im Nachhinein ergänzt.

Kurz gefasst

Das Mindestmaß an Prozessbeobachtbarkeit besteht aus drei Zahlen: wie viele Vorgänge abgeschlossen wurden, welcher Anteil davon mit einem Fehler endete, und wie viel Zeit vom Start bis zum Ergebnis verging. Das reicht, um eine echte Verbesserung von reinem Zufall zu unterscheiden. Alles darüber hinaus wird erst ergänzt, wenn konkrete Fragen auftauchen – nicht im Voraus, denn ein zu umfangreiches KPI-Reporting verzerrt das Verhalten der Beteiligten stärker, als es hilft.

3Kennzahlen im Mindestumfang der Prozessbeobachtbarkeit
51 %Übereinstimmung zwischen dem formalen Prozessmodell und der tatsächlichen Ausführung in einem der untersuchten Fälle
54 %der Organisationen haben ein Monitoring für KI-Systeme im produktiven Betrieb eingeführt

Drei Kennzahlen, auf die Sie nicht verzichten können

Der Umfang bleibt bewusst minimal – nicht aus Sparsamkeit, sondern aus Erfahrung: Jede zusätzliche Kennzahl braucht einen Verantwortlichen und erzeugt Diskussionen, die zu keiner Entscheidung führen. Die drei folgenden Kennzahlen beantworten jeweils eine andere Frage und ersetzen einander nicht.

Anzahl abgeschlossener Vorgänge. Nicht die Zahl der Nutzer und nicht die Zahl der Logins, sondern die Zahl der Fälle, in denen der Prozess vollständig von Anfang bis Ende durchlaufen wurde. Das ist die einzige Kennzahl, die echte Arbeit von bloßer Aktivität unterscheidet: Ein Nutzer kann sich täglich einloggen, ohne einen einzigen Vorgang abzuschließen.

Fehlerquote. Ein Fehler liegt vor, wenn die Arbeit formal erledigt wurde, das Ergebnis aber nicht weiterverarbeitet wurde: Das Dokument wurde nicht versendet, der Vorgang keinem Mitarbeiter zugewiesen, die Antwort nicht erfasst. Diese Quote sinkt bei Korrekturen und steigt unter Last – an ihr erkennen Sie, ob ein Prozess wirklich stabil läuft oder nur durch den persönlichen Einsatz der Mitarbeitenden zusammengehalten wird.

Median-Durchlaufzeit vom Start bis zum Ergebnis. Der Median, nicht der Durchschnitt: Die Verteilung hat fast immer einen langen Ausläufer, und der Durchschnitt beschreibt dann keinen einzigen realen Fall mehr. Der Median beantwortet die Frage „Wie lange dauert das normalerweise?", der Ausläufer die Frage „Was läuft schief?"

KennzahlWelche Frage sie beantwortetWodurch sie häufig ersetzt wird
Abgeschlossene VorgängeLäuft die Arbeit tatsächlich durch den ProzessZahl der aktiven Nutzer
FehlerquoteIst der Prozess stabilZahl der Support-Anfragen
Median-DurchlaufzeitIst es tatsächlich schneller gewordenDurchschnittszeit oder Einschätzung des Teams

Die dritte Spalte ist entscheidend: Die Ersatzgröße wirkt fast immer plausibel und zeichnet immer ein zu positives Bild. Die Zahl aktiver Nutzer steigt schon durch bloße Neugier, die Zahl der Support-Anfragen sinkt, sobald niemand mehr Hilfe erwartet, und die Durchschnittszeit verbessert sich, sobald Ausreißer aus der Betrachtung fallen.

Warum das Prozessmodell von der tatsächlichen Ausführung abweicht

Es gibt einen weiteren Grund für Prozessbeobachtbarkeit: Der beschriebene Prozess und der tatsächlich gelebte Prozess sind zwei unterschiedliche Dinge – und der Unterschied lässt sich messen. Die Methode, Ereignisprotokolle mit einem formalen Modell abzugleichen – Conformance Checking, der Abgleich von Modell und Ist-Prozess –, gibt es seit Langem, und sie liefert überraschend große Abweichungen.

Studie

Beim Abgleich realer Ereignisprotokolle mit dem formalen Prozessmodell lag die Übereinstimmung bei 0,51 für einen der administrativen Prozesse (35 Fälle) und bei 0,80 für einen Genehmigungsprozess (407 Fälle). Ursachen der Abweichungen waren manuelle Korrekturen der Einträge durch Sachbearbeiter sowie eine fehlerhafte Konfiguration paralleler Verzweigungen.

Anne Rozinat, Wil M. P. van der Aalst (Eindhoven University of Technology). „Conformance checking of processes based on monitoring real behavior", Information Systems, 2008. Abgleich von Ereignisprotokollen mit Petri-Netzen für vier administrative Prozesse einer niederländischen Gemeinde sowie ein serviceorientiertes System · vdaalst.com (PDF)

Die Studie ist inzwischen fast zwanzig Jahre alt und bezieht sich auf den niederländischen öffentlichen Sektor – das ist ihre Grenze. Die Methode selbst bleibt jedoch bis heute eine Grundlage des Process Mining, und das Ergebnis lässt sich in jeder Organisation reproduzieren, in der jemand tatsächlich den beschriebenen Ablauf mit den Protokollen vergleicht. Die praktische Schlussfolgerung: Eine Abweichung von bis zur Hälfte aller Fälle ist keine Anomalie, sondern der Normalfall für einen Prozess, dessen Ausführung niemand beobachtet.

Ein Prozess, den niemand beobachtet, läuft nicht so ab, wie er beschrieben ist. Offen bleibt nur, wie groß die Lücke ist.

Der Ergebnisunterschied zwischen Teams mit und ohne Messung

Der Zusammenhang zwischen der Fähigkeit zu messen und dem tatsächlichen Ergebnis ist in der Softwareentwicklung am besten belegt – dort, wo Kennzahlen standardisiert sind und seit Jahren erhoben werden.

Studie

Der Abstand zwischen Teams der obersten und der untersten Reifegradstufe erreicht das 182-Fache beim Anteil fehlgeschlagener Änderungen und das 2.293-Fache bei der Wiederherstellungszeit nach einem Ausfall. Zwischen zwei benachbarten Reifegradgruppen liegt der Unterschied bei der Fehlerquote von Änderungen bei 5 % gegenüber 20 %.

DORA (DevOps Research and Assessment), Google Cloud. „2024 Accelerate State of DevOps Report", 2024. Jährliche weltweite Praktiker-Befragung mit mehr als 39.000 Teilnehmenden, Clusteranalyse mit vier Reifegradgruppen sowie vertiefenden Interviews · dora.dev (PDF)

Die Einschränkung nenne ich klar beim Namen: Der Bericht beweist nicht, dass Prozessbeobachtbarkeit allein das Ergebnis verursacht – er zeigt, dass sich Gruppen unterschiedlicher Reife unter anderem in ihrer Fähigkeit unterscheiden, eigene Fehler überhaupt zu zählen. Kausalität ist damit nicht belegt, und ich nutze diese Zahlen als Illustration der Größenordnung des Unterschieds, nicht als Beweis eines Zusammenhangs.

Prozessbeobachtbarkeit bei KI-Szenarien: ein Sonderfall

Bei Szenarien mit Sprachmodellen kommt zu den drei Basiszahlen eine vierte hinzu: der Anteil der Ergebnisse, die von einem Menschen korrigiert werden mussten. Ohne sie bleibt jede Verbesserung des Prompts oder jeder Modellwechsel eine reine Vertrauensfrage.

Studie

Der Anteil der Organisationen, die ein Monitoring für KI-Systeme im produktiven Betrieb eingeführt haben, stieg von 42 % im Jahr 2024 auf 54 % im Jahr 2025.

New Relic gemeinsam mit Enterprise Technology Research, „2025 Observability Forecast", September 2025. Online-Befragung von mehr als 1.700 IT- und Engineering-Führungskräften aus mehr als 20 Ländern; 65 % der Befragten waren Praktiker, 24 % Manager, 11 % Führungskräfte auf oberster Ebene · newrelic.com (PDF)

Hier braucht es eine Präzision, die in Zusammenfassungen meist verloren geht: Der Bericht misst, ob überhaupt ein Monitoring für KI-Systeme eingeführt wurde – nicht, ob speziell die Qualität der Antworten überwacht wird. Eine gesonderte Kennzahl zur Genauigkeitskontrolle oder zum Anteil fehlerhafter Antworten enthält er nicht. Und es handelt sich um eine Befragung, die von einem Anbieter von Observability-Tools durchgeführt wurde – das kommerzielle Interesse liegt auf der Hand. Nützlich bleibt die Tendenz: Fast die Hälfte der Unternehmen bringt KI-Szenarien in den produktiven Betrieb, ohne eine eingebaute Kontrolle über deren tatsächliches Verhalten zu haben.

Warum das KPI-Set klein bleiben muss

Die Versuchung, alles zu messen, entsteht sofort und setzt sich fast immer durch. Dagegen gibt es ein Argument, das älter ist als jedes Dashboard: Eine Kennzahl, die zum Ziel wird, hört auf, eine Kennzahl zu sein – ein Mechanismus, der heute als Goodharts Gesetz bekannt ist.

Studie

Ein Mess- und Rankingmechanismus bleibt kein neutraler Beobachter: Er entwickelt ein Eigenleben und untergräbt genau das, was er eigentlich erfassen sollte. Diese Arbeit ist die Quelle der weithin bekannten Formulierung über eine Kennzahl, die zum Ziel geworden ist.

Marilyn Strathern (University of Cambridge). „'Improving ratings': audit in the British university system", European Review, Juli 1997. Anthropologische Analyse von Audit- und Ranking-Praktiken an britischen Universitäten; keine quantitative Studie · cambridge.org

Eine Einschränkung nenne ich offen: Der vollständige Artikeltext ist kostenpflichtig, ich habe mit dem Abstract gearbeitet – die berühmte Formulierung selbst taucht im frei zugänglichen Teil nicht auf, wird aber genau dieser Arbeit zugeschrieben. Ich verwende sie als konzeptionelles Argument, nicht als wörtliches Zitat. Die praktische Konsequenz ist eindeutig: Jede Kennzahl, an der Mitarbeitende gemessen werden, beginnt, deren Verhalten zu steuern – deshalb ist ein Set aus drei Zahlen sicherer als eines aus fünfzehn.

Wie Sie Prozessbeobachtbarkeit vor dem Go-live verankern

Vier Entscheidungen, die vor dem Go-live getroffen werden müssen. Nach dem Start kosten die ersten drei ein Vielfaches – und die vierte wird unmöglich.
01Was als abgeschlossener Vorgang zählt
02Was als Fehler zählt
03Wo der Zeitstempel für Start und Ende gesetzt wird
04Die Ausgangsmessung
einen Monat später werden die drei Kennzahlen mit der Ausgangsmessung „vorher" verglichen – ohne diese Messung fehlt der Vergleichsmaßstab

Die vierte Entscheidung ist die einzige, die sich später nicht mehr nachholen lässt. Die Ausgangsmessung nimmt einen halben Tag in Anspruch und wird manuell anhand der letzten zwanzig Ergebnisse vor dem Go-live durchgeführt. Unternehmen, die diesen Schritt auslassen, diskutieren einen Monat später nicht über die tatsächliche Wirkung, sondern über Erinnerungen daran, wie es früher war. Dazu passt auch diese Analyse, wie sich ein Effekt in seine Bestandteile zerlegen lässt: Ohne Ausgangsmessung ist eine solche Zerlegung grundsätzlich nicht möglich.

Die ersten drei Entscheidungen wirken technisch, werden aber vom Prozessverantwortlichen getroffen. Was als Fehler gilt, ist keine Frage der Systemarchitektur, sondern der Frage, wo im Unternehmen die Grenze zwischen erledigter und nicht erledigter Arbeit verläuft.

Vier Schritte vor dem Go-live

01

Beschreiben Sie den abgeschlossenen Vorgang in einem Satz

Wenn Sie dafür Bedingungen und Ausnahmen brauchen, ist der Prozess noch nicht präzise genug definiert, um ihn zu messen.

02

Benennen Sie drei Fehlerarten

Keine „Fehler" im Allgemeinen, sondern konkrete Ereignisse: nicht versendet, nicht zugewiesen, nicht erfasst. Drei genügen für den Start.

03

Führen Sie die Ausgangsmessung an zwanzig Fällen durch

Ein halber Tag Arbeit. Das Einzige, was sich nach dem Go-live nicht mehr rekonstruieren lässt.

04

Legen Sie einen festen Tag für die Auswertung fest

Ein konkreter Wochentag und eine konkrete verantwortliche Person. Eine Kennzahl ohne festen Auswertungstermin existiert in der Praxis nicht.

Wenn einen Monat nach dem Go-live die Frage „Funktioniert es?" mit Worten statt mit drei Zahlen beantwortet wird, war das Projekt eine Demo – unabhängig davon, was im Abnahmeprotokoll steht.

Häufig gestellte Fragen zur Prozessbeobachtbarkeit

Welche Kennzahlen brauchen Sie zur Bewertung eines eingeführten Prozesses?

Drei: die Anzahl abgeschlossener Vorgänge, die Fehlerquote und die Median-Durchlaufzeit vom Start bis zum Ergebnis. Bei KI-Szenarien kommt eine vierte hinzu – der Anteil der von Menschen korrigierten Ergebnisse. Mehr als vier Kennzahlen zum Start schaden eher: Jede benötigt einen Verantwortlichen und beeinflusst das Verhalten der Mitarbeitenden, bevor sie überhaupt einen Nutzen stiften konnte.

Warum ist die Median-Durchlaufzeit besser als der Durchschnitt?

Die Verteilung der Bearbeitungszeit hat fast immer einen langen Ausläufer: Die meisten Fälle dauern wenige Minuten, einzelne mehrere Tage. Der Durchschnitt einer solchen Verteilung beschreibt keinen einzigen realen Fall und verschiebt sich schon durch einen einzelnen Ausreißer. Der Median beantwortet die Frage „Wie lange dauert das normalerweise?", der Ausläufer wird separat als Informationsquelle dafür analysiert, was tatsächlich schiefläuft.

Lässt sich Prozessbeobachtbarkeit nachträglich einführen?

Teilweise. Zähler und Zeitstempel lassen sich später ergänzen, wenn auch mit höherem Aufwand. Nicht wiederherstellbar bleibt die Ausgangsmessung: Ohne sie wird jeder Vergleich zu einer Debatte über Erinnerungen. Ist die Messung versäumt worden, bleibt als einzig ehrlicher Ausweg, sie anhand vorhandener Unterlagen aus der Zeit vor der Einführung zu rekonstruieren – und klar zu benennen, dass es sich um eine Rekonstruktion und nicht um eine Messung handelt.

Fangen Mitarbeitende nicht an, die Kennzahlen zu schönen?

Ja, sobald Menschen anhand dieser Kennzahlen bewertet werden. Deshalb sollten die drei Basiszahlen als Prozesskennzahlen behandelt werden, nicht als persönliche Leistungskennzahlen, und auf der Ebene „Was läuft schief?" diskutiert werden, nicht „Wer ist schuld?". Sobald die Fehlerquote zur Grundlage für eine Prämie wird, hört sie auf, die Realität abzubilden – das ist eine stabile Eigenschaft jeder Messung in Organisationen, kein Einzelfall.

Woher die internen Zahlen stammen

Die Mechanik der Statistikerfassung je Vertriebsmitarbeiter und je Nachfrage nach einzelnen Angebotstypen stammt aus der Produktbeschreibung von Alego.Digital, dem Angebotsgenerator des Autors. Es handelt sich um internes Material des Unternehmens des Autors; es wurde nicht von unabhängiger Seite geprüft und dient hier als Illustration der Mechanik. Das Set aus drei Basiskennzahlen und die Reihenfolge der vier Entscheidungen vor dem Go-live sind eine eigene Verallgemeinerung des Autors aus der Umsetzungspraxis, keine übernommene Methodik – in den Unternehmensdokumenten ist sie nicht formalisiert.

Externe Quellen
  1. Rozinat A., van der Aalst W. M. P. Conformance checking of processes based on monitoring real behavior. Information Systems, 2008. vdaalst.com
  2. DORA, Google Cloud. 2024 Accelerate State of DevOps Report, 2024 (mehr als 39.000 Teilnehmende). dora.dev
  3. New Relic, Enterprise Technology Research. 2025 Observability Forecast, September 2025. newrelic.com
  4. Strathern M. „Improving ratings": audit in the British university system. European Review, 1997. cambridge.org