Zum Inhalt springen

Warum KI-Pilotprojekte scheitern: Der Fehler liegt im Format

Warum KI-Pilotprojekte scheitern: Der Fehler liegt im Format

Ein Pilot hat eine Eigenschaft, über die selten offen gesprochen wird: Per Definition ist er nicht verpflichtet, irgendetwas zu verändern. Er hat keinen Prozessverantwortlichen, keine Integration in das System of Record und kein Datum, ab dem der alte Arbeitsweg abgeschaltet wird. Seine einzige Aufgabe ist der Nachweis, dass die Technologie funktioniert.

Und die Technologie funktioniert fast immer. Genau deshalb dreht sich die Diskussion immer wieder um Modelle und Anbieter, obwohl der Unterschied zwischen Erfolg und Misserfolg dort gar nicht entsteht. Die meisten Piloten scheitern an ihrer Konstruktion, nicht an ihrem Inhalt.

Kurz gesagt

Ein Pilot prüft die Technologie. Die Entscheidung über den Rollout verlangt Antworten auf drei andere Fragen: Wer übernimmt nach dem Start die Prozessverantwortung, wo landet das Ergebnis, und wann wird der alte Weg abgeschaltet? Auf keine dieser Fragen liefert der Pilot eine Antwort – und das muss er auch nicht. Die Lösung ist einfach: Der Pilot soll nicht die Fähigkeiten der Technologie vorführen, sondern eine einzige Kennzahl messen – den Anteil der Ergebnisse, die nachträglich korrigiert werden müssen.

35 %der Führungskräfte wissen nicht, wer eine KI-Empfehlung außer Kraft setzen darf
34 %haben keinen Mechanismus zur Klärung von Konflikten zwischen Mensch und Modell
15 %der Organisationen sind sowohl im KI-Einsatz als auch im Change-Management ausgereift

Die drei Fragen, die ein KI-Pilot nicht beantwortet

Trennen wir, was ein Pilot tatsächlich prüft, von dem, was ungeprüft bleibt. Die Liste ist kurz, und jeder Punkt entscheidet über das Schicksal der Einführung stärker als die Qualität der Modellantworten.

Wer nach dem Start die Prozessverantwortung übernimmt. Während des Piloten trägt das Projektteam die Verantwortung, und dieses Team löst sich nach Abschluss auf. Danach zeigt sich: Der Prozess hat niemanden, der für die Fehlerquote geradesteht, der über den Stopp des Szenarios entscheidet und der Regeländerungen freigibt. Ohne diese Person überlebt das Szenario nur bis zur ersten ernsten Störung.

Wo das Ergebnis landet. Im Pilotbetrieb sehen nur die Beteiligten das Ergebnis – das reicht für eine Qualitätsbeurteilung. Im Produktivbetrieb muss das Ergebnis in dem System landen, in dem für das Unternehmen die verbindliche Wahrheit über einen Sachverhalt liegt, dem System of Record (führendes System), sonst sieht es niemand, der an der Anfrage nicht beteiligt war. Die Integration ist im Pilotumfang meist nicht enthalten, weil sie teurer ist als der Pilot selbst.

Wann der alte Weg abgeschaltet wird. Dass der Pilot parallel zur bestehenden Arbeit läuft, ist normal – das gehört zu seinem Wesen. Aber der Parallelbetrieb endet nicht von selbst: Solange der alte Weg verfügbar bleibt und nichts kostet, läuft ein Teil der Arbeit weiter darüber, und der Effekt lässt sich nicht mehr sauber zuordnen.

FrageWas der Pilot prüftWas ungeprüft bleibt
ErgebnisqualitätVollständig geprüft
ProzessverantwortlicherNicht geprüftWer für die Fehlerquote und den Stopp verantwortlich ist
Anbindung an das System of RecordNicht geprüftOb das Ergebnis auch Unbeteiligte erreicht
Abschaltung des alten WegsNicht geprüftOb die Arbeit vollständig umzieht
BetriebskostenTeilweise geprüftSupport, Updates, Fehleranalyse

Beachten Sie: Der Pilot erfüllt exakt die Aufgabe, die man ihm gestellt hat, und zwar tadellos. Das Problem liegt nicht im Piloten, sondern darin, dass sein Ergebnis als Antwort auf die Einführungsfrage gedeutet wird.

Was Daten über fehlende Entscheidungszuständigkeit bei KI zeigen

Der fehlende Prozessverantwortliche ist keine Abstraktion, sondern ein gemessener Befund – gemessen an einer großen Stichprobe von Führungskräften.

Studie

35 % der befragten Führungskräfte gaben an, dass bis heute unklar ist, wer befugt ist, eine KI-Empfehlung anzufechten oder außer Kraft zu setzen, und 34 % verfügen über keinen belastbaren Mechanismus, um Konflikte zwischen einer menschlichen Entscheidung und einer Modellausgabe zu lösen. Nur 15 % der Organisationen haben gleichzeitig Reife im KI-Einsatz und im Change-Management erreicht.

IBM Institute for Business Value gemeinsam mit Oxford Economics, Juni 2026. Befragung von 1.000 Führungskräften mit Verantwortung für KI, Daten und Technologie in 14 Ländern und 21 Branchen, Quotenstichprobe mit Screening auf tatsächliche Involvierung; separat befragt wurden 8.400 Mitarbeitende in 28 Ländern · ibm.com

Es handelt sich um eine Auftragsstudie einer Beratungssparte, deren Ziel der Verkauf eines Operating-Model-Redesigns ist; die Daten sind korrelativ, nicht kausal. Diese Einschränkung wiegt schwer. Aber die Zahl selbst beschreibt einen Fakt, keine Bewertung: Ein Drittel der Führungskräfte kann nicht benennen, wer befugt ist, eine Systementscheidung zu widerrufen. Genau diese Frage stellt ein Pilot nicht.

Ein Pilot beantwortet die Frage „Funktioniert die Technologie?“ Das Scheitern entsteht an der Frage „Wer ist dafür verantwortlich?“

Warum ein erfolgreicher KI-Pilot im Betrieb wieder zurückfällt

Es gibt einen Forschungsstrang, der den Mechanismus erklärt, mit dem einmalig erkämpfte Verbesserungen wieder verpuffen – und er ist älter als die aktuelle Technologiewelle.

Studie

Verbesserungen, die durch einmalig verstärkte Aufmerksamkeit erzielt werden, ohne in einen dauerhaften Prozess eingebettet zu sein, fallen systematisch zurück: Sobald sich die Kennzahlen verbessern, wird das Personal von dieser Arbeit abgezogen, und die Probleme kehren zurück. Die Autoren nennen dies die Capability Trap (Fähigkeitsfalle).

Nelson P. Repenning, John D. Sterman (MIT Sloan). „Nobody Ever Gets Credit for Fixing Problems that Never Happened", California Management Review, Sommer 2001. Mehr als zehn Jahre Feldforschung, über 12 Tiefenfallstudien aus verschiedenen Branchen, systemdynamische Modellierung, Interviews und Archivanalyse · web.mit.edu (PDF)

Die Arbeit hat mit KI nichts zu tun und wurde vor einem Vierteljahrhundert verfasst – sie ist eine Analogie, kein direkter Beweis, und genau so setze ich sie ein. Der beschriebene Mechanismus ist jedoch präzise und lässt sich in jedem Piloten wiedererkennen: Drei Monate verstärkter Teamaufmerksamkeit erzeugen ein Ergebnis, das der Technologie zugeschrieben wird statt der Aufmerksamkeit, und es verschwindet mit ihr.

Dieser Mechanismus hat noch eine zweite Seite – eine systematische Überschätzung der Ergebnisse allein durch die Tatsache der Beobachtung.

Studie

Eine erneute Analyse der wiederentdeckten Originaldaten der berühmten Beleuchtungsexperimente zeigte, dass sich das Lehrbuchbild eines sprunghaften Produktivitätsanstiegs allein durch den Umstand der Beobachtung nicht bestätigen lässt: „Die vorliegenden Beschreibungen der angeblich bemerkenswerten Datenmuster erweisen sich als vollständig erfunden", auch wenn schwache Anzeichen eines Beobachtungseffekts vorhanden sind.

Steven D. Levitt, John A. List (University of Chicago). NBER Working Paper 15016, Mai 2009; später erschienen in American Economic Journal: Applied Economics, 2011. Suche nach und Rekonstruktion der als verloren geltenden Originaldaten der Experimente aus den 1920er-Jahren auf Mikrofilm sowie deren formale quantitative Reanalyse · nber.org

Der Volltext ist kostenpflichtig, und ich habe mit dem Abstract und der Ergebnisbeschreibung gearbeitet – das ist eine Einschränkung. Die praktische Schlussfolgerung ist zweifach und gerade deshalb nützlich: Man darf sich nicht auf den „Hawthorne-Effekt" berufen, um jeden Pilotenerfolg zu erklären – er ist schwächer, als landläufig angenommen. Man darf aber auch Pilotenergebnisse nicht ohne Korrektur für die erhöhte Teamaufmerksamkeit auf den Produktivbetrieb übertragen – nur fällt die Korrektur geringer aus, als die Folklore behauptet.

Warum das Aussortieren von Piloten normal ist, ein fehlendes Kriterium aber nicht

Es lohnt sich, auch einen falschen Rahmen abzulegen: Dass die meisten Experimente nicht bis in den Produktivbetrieb gelangen, ist für sich genommen kein Scheitern.

Studie

Machine-Learning-Ingenieure beschreiben den Weg vom Experiment zum Produktivbetrieb als Selektionsprozess: Für Organisationen lohnt es sich, viele Ideen schnell zu prototypisieren und auszusortieren, bevor die beste davon in den produktiven Einsatz geht. Der oft zitierte Anteil an Modellen, die nie in den Produktivbetrieb gelangen, spiegelt die Natur des Experimentierens wider, kein Versagen.

Shreya Shankar, Rolando Garcia, Joseph M. Hellerstein, Aditya G. Parameswaran (UC Berkeley). „Operationalizing Machine Learning: An Interview Study", arXiv, September 2022. Halbstrukturierte Interviews mit 18 Machine-Learning-Ingenieuren aus Unternehmen unterschiedlicher Größe und Branche, Kodierung nach Grounded Theory · arxiv.org

Die Stichprobe ist klein – 18 Personen – und statistisch nicht repräsentativ; das räumen die Autoren selbst ein. Doch ihre Beobachtung entkräftet einen falschen Alarm: Das Problem ist nicht, dass neun von zehn Piloten eingestellt werden, sondern dass das Ausschlusskriterium nie im Voraus formuliert wurde. Fehlt das Kriterium, werden nicht die schwächsten Szenarien eingestellt, sondern die, deren Sponsor das Interesse verloren hat.

So gestalten Sie einen Piloten für KI-Prozessautomatisierung, der den Betrieb vorhersagt

Sie müssen den Piloten nicht abschaffen – Sie müssen die Frage ändern, auf die er antwortet. Statt „Funktioniert die Technologie?" sollte er beantworten: „Welcher Anteil der Ergebnisse muss korrigiert werden?"

Ein Pilot mit vorab festgelegtem Kriterium: eine gemessene Kennzahl, eine Akzeptanzschwelle, eine Entscheidung am Ende.
01Was wir messen: der Anteil korrekturbedürftiger Ergebnisse
02Die Akzeptanzschwelle, ab der das Szenario weitergeht
03Messung im realen Arbeitsfluss, nicht an ausgewählten Beispielen
04Entscheidung: einführen, überarbeiten oder einstellen
Schwelle und Abbruchkriterium werden vor Beginn des Piloten festgelegt, nicht nach Vorliegen der Ergebnisse

Entscheidend ist der zweite Knoten. Eine vorab benannte Schwelle macht aus dem Piloten eine Prüfung statt einer Vorführung, und aus dem Streit über das Ergebnis einen Abgleich mit einer Zahl. Ohne sie wird das Ergebnis anhand von Eindrücken diskutiert, und es entscheidet, wer überzeugender argumentiert.

Ebenso wichtig ist der dritte Knoten. Der reale Arbeitsfluss unterscheidet sich von ausgewählten Beispielen genau in den Fällen, um derentwillen die Einführung überhaupt angestoßen wird: untypische Formulierungen, unvollständige Daten, seltene Situationen. Eine Vorführung mit vorbereiteten Daten liefert dazu keinerlei Information. Wie sich daraus der geschäftliche Effekt berechnen lässt, lesen Sie in einer gesonderten Analyse.

Vier Entscheidungen vor dem Start eines KI-Piloten

01

Benennen Sie den Prozessverantwortlichen, nicht den Projektverantwortlichen

Die Person, die nach dem Piloten bleibt und für die Fehlerquote geradesteht. Gibt es sie nicht, ist der Pilot sinnlos.

02

Legen Sie die Akzeptanzschwelle vor dem Start fest

Welcher Anteil korrekturbedürftiger Ergebnisse gilt als akzeptabel. Die Zahl wird vorab genannt und schriftlich festgehalten.

03

Prüfen Sie im realen Arbeitsfluss

Ohne Vorauswahl der Beispiele. Gerade die untypischen Fälle entscheiden über die Eignung des Szenarios.

04

Benennen Sie den Termin für die Abschaltung des alten Wegs

Nicht im Piloten selbst, sondern im Einführungsplan – aber benannt werden muss er vor dem Piloten, sonst kommt die Einführung nie zum Abschluss.

Ein Pilot ohne vorab festgelegte Schwelle ist kein Hypothesentest, sondern die Suche nach Argumenten für eine Entscheidung, die längst gefallen ist.

Häufig gestellte Fragen zum Scheitern von KI-Pilotprojekten

Warum schaffen es KI-Piloten nicht in den Produktivbetrieb?

Weil ein Pilot die Qualität der Technologie prüft, während der Übergang in den Produktivbetrieb Antworten auf drei andere Fragen verlangt: Wer trägt die Prozessverantwortung, wo landet das Ergebnis, und wann wird die bisherige Arbeitsweise abgeschaltet? Keine dieser Fragen gehört zum Pilotformat. Der Pilot endet erfolgreich und stößt dann auf Entscheidungen, die niemand vorbereitet hat.

Wie setzt man einen KI-Piloten richtig auf?

Reduzieren Sie ihn auf die Messung einer einzigen Kennzahl – den Anteil der korrekturbedürftigen Ergebnisse – und legen Sie die Akzeptanzschwelle vor dem Start fest. Die Messung erfolgt im realen Arbeitsfluss, ohne Vorauswahl der Beispiele. Am Ende steht eine Zahl statt eines Eindrucks, und die Entscheidung fällt durch Abgleich mit der Schwelle, nicht durch Diskussion.

Muss man einen Piloten bei uneindeutigem Ergebnis einstellen?

Ja, und ein vorab festgelegtes Abbruchkriterium ist der einzige Weg, das ohne Konflikt zu tun. Dass die meisten Experimente aussortiert werden, ist normal – das gehört zum Wesen des Experimentierens und ist kein Zeichen des Scheiterns. Nicht normal ist es, wenn nicht die schwächsten Szenarien eingestellt werden, sondern die, deren Sponsor das Interesse verloren hat – so verliert die Organisation die Fähigkeit, aus eigenen Versuchen zu lernen.

Wie stark lassen sich Pilotenergebnisse auf den Produktivbetrieb übertragen?

Nur mit Korrektur um die erhöhte Teamaufmerksamkeit, die im Produktivbetrieb entfällt. Diese Korrektur fällt geringer aus, als die populäre Version des Beobachtungseffekts nahelegt – eine erneute Analyse der klassischen Experimente ergab, dass sie gering ist. Aber sie ist nicht null: Ein Pilot, der von der täglichen Beteiligung des Initiators lebt, liefert im Produktivbetrieb ein spürbar schwächeres Ergebnis.

Woher die internen Zahlen stammen

Die Liste der drei Fragen, die ein Pilot nicht beantwortet, sowie das Pilotformat mit vorab festgelegter Schwelle sind eine eigene Verallgemeinerung aus der Praxis der Bewertung von Technologieprojekten im Portfolio des China-Russia Investment Fund und aus der Einführungspraxis bei Alego.Digital. Interne Kennzahlen werden in diesem Artikel nicht genannt: Alle Zahlen stammen aus externen Quellen mit ausgewiesener Methodik. Eine formalisierte Beschreibung dieses Formats existiert in keinem Unternehmensdokument; hier wird es erstmals dargestellt.

Externe Quellen
  1. IBM Institute for Business Value, Oxford Economics. The AI-Human Operating Model, Juni 2026 (Befragung von 1.000 Führungskräften in 14 Ländern). ibm.com
  2. Repenning N. P., Sterman J. D. Nobody Ever Gets Credit for Fixing Problems that Never Happened. California Management Review, 2001. web.mit.edu
  3. Levitt S. D., List J. A. Was There Really a Hawthorne Effect at the Hawthorne Plant? NBER Working Paper 15016, 2009. nber.org
  4. Shankar S., Garcia R., Hellerstein J. M., Parameswaran A. G. Operationalizing Machine Learning: An Interview Study. arXiv:2209.09125, 2022. arxiv.org