Mitte 2025 veröffentlichte die NANDA-Initiative des MIT eine Studie, deren Kernzahl seither die meistzitierte der Branche ist: Von den untersuchten Generative-KI-Pilotprojekten in Unternehmen erzielten rund 95 % keine messbare Wirkung auf die Gewinn- und Verlustrechnung. Die Untersuchung dahinter – Interviews mit Führungskräften, Mitarbeiterbefragungen und eine Analyse von rund 300 öffentlich bekannten KI-Einführungen – gab einer Beobachtung eine Zahl, die Praktiker seit zwei Jahren leise aussprachen: Die Tools machen in der Demo eine gute Figur. Die Unternehmen verändern sich nicht.
Die Zahl ging viral, weil sie wie ein Urteil über die Technologie klingt. Wer die Studie liest, stellt fest: Das ist sie keineswegs. Sie ist ein Urteil darüber, wie die Technologie eingekauft, zugeschnitten und integriert wird. Dieser Unterschied ist entscheidend – denn ein Technologieproblem müsste jemand anderes lösen. Ein Einkaufs- und Prozessproblem gehört Ihnen. Und das heißt: Es lässt sich auch beheben.
95 %
der Pilotprojekte ohne messbare Wirkung auf die Gewinn- und Verlustrechnung
67 %
erfolgreicher Betrieb bei Projekten mit Partnern, gegenüber 22 % bei internen Eigenentwicklungen
90 Tage
vom Piloten zur vollständigen Umsetzung, bei den schnellsten Organisationen
Was die gescheiterten 95 % gemeinsam haben
Die Autoren der Studie nennen die Lücke zwischen Einführung und tatsächlicher Veränderung den „GenAI Divide". Auf der einen Seite: nahezu flächendeckendes Experimentieren. Auf der anderen: eine kleine Minderheit, die echten Wert herausholt. Vier Muster trennen die beiden Seiten – und keines davon hat mit der Qualität der Modelle zu tun.
Das Geld floss in die falsche Abteilung.
Mehr als die Hälfte der KI-Budgets im Datensatz ging in Vertriebs- und Marketing-Piloten – die sichtbaren, vorzeigbaren Anwendungsfälle. Die messbaren Erträge zeigten sich dagegen im Backoffice: Dokumentenverarbeitung, Compliance-Abläufe, interne Prozesse. Die Bereiche, die niemand im Vorstand vorführt, sind die Bereiche, in denen sich die Zahlen tatsächlich bewegen.
Die Tools konnten das Unternehmen nicht lernen.
Das MIT beschreibt eine „Lernlücke": Systeme, die in einer kontrollierten Vorführung funktionieren, aber keinen Kontext behalten, sich nicht an Rückmeldungen anpassen und nicht an die Daten anschließen können, die sie im Echtbetrieb bräuchten. Ein Tool, dem man das Geschäft in jeder Sitzung neu beibringen muss, ist kein Mitarbeiter. Es ist ein Partytrick mit Abogebühr.
Projekte mit Partnern waren rund dreimal so oft erfolgreich wie interne Eigenentwicklungen.
Piloten, die internes Wissen mit externer Umsetzungserfahrung kombinierten, erreichten deutlich häufiger einen erfolgreichen Betrieb als reine IT-Eigenbauten – die Studie beziffert die beiden Quoten auf rund 67 % gegenüber 22 %. Nicht, weil internen Teams das Können fehlt, sondern weil Integration eine eigene Disziplin ist, die die meisten Organisationen einmal ausüben. Ein Umsetzungspartner übt sie jede Woche aus.
Niemand hat definiert, was Erfolg bedeutet.
Das ist der leiseste Punkt – und aus unserer Sicht der entscheidende. Ein Pilot ohne schriftliches Erfolgskriterium kann nicht scheitern – und deshalb auch nicht gelingen. Er läuft einfach, bis Begeisterung oder Budget aufgebraucht sind. Als die MIT-Forscher untersuchten, was die erfolgreichen 5 % verbindet, fanden sie eng zugeschnittene Vorhaben mit einem konkreten Schmerzpunkt, einem konkreten Arbeitsablauf und einem messbaren Ergebnis, das vor Projektbeginn vereinbart wurde.
Der Geschwindigkeitsbefund, mit dem niemand wirbt
In derselben Untersuchung steckt ein Ergebnis, das nur einen Bruchteil der Aufmerksamkeit der Schlagzeile bekam: Die Organisationen, die am schnellsten vom Piloten zur vollständigen Umsetzung kamen, schafften das in rund 90 Tagen – die langsamsten brauchten neun Monate oder länger. Was sie unterschied, war weder Budget noch Personalstärke. Die Schnellen hatten kurze Entscheidungswege, einen klar verantworteten Prozess und jemanden, der die Kosten des kaputten Ablaufs persönlich spürte. Die Langsamen hatten Gremien, parallele Piloten und keine einzelne Person, deren Name mit dem Ergebnis verbunden war.
Das schneidet in beide Richtungen, ganz gleich, wie groß das Unternehmen ist. Eine kleine Firma hat das schnelle Profil von Haus aus – und verspielt es in dem Moment, in dem sie drei Tools gleichzeitig jagt. Eine große Organisation hat das langsame Profil von Haus aus – und entkommt ihm in dem Moment, in dem ein Team ein sauber zugeschnittenes Projekt zu Ende führen darf, bevor irgendetwas skaliert wird. Die Studie ist in diesem Punkt deutlich: Die Organisationen mit den meisten Piloten schlossen die wenigsten ab.
Was die 5 % tatsächlich tun
Reduziert man die Studie auf ihre praktischen Lehren, bleibt eine kurze Liste. Sie liest sich weniger wie eine KI-Strategie und mehr wie gewöhnliche Ingenieursdisziplin – und genau das ist der Punkt.
Sie beginnen beim Prozess, nicht beim Tool.
Die gescheiterten Piloten begannen mit einer Technologie auf der Suche nach einer Anwendung. Die erfolgreichen begannen mit einem Engpass – einem konkreten Ablauf, bei dem sich Stunden, Fehler oder Durchlaufzeit zählen lassen – und wählten das Werkzeug zuletzt. Ist der Prozess nicht sauber erfasst, automatisiert die Automatisierung das Durcheinander.
Sie schreiben die Zahl zuerst auf.
Gesparte Stunden pro Woche. Fehlerquote vorher und nachher. Eingesparte Tage Durchlaufzeit. Ein vor Baubeginn schriftlich vereinbartes Kriterium bewirkt zweierlei: Es erzwingt ehrlichen Zuschnitt, und es macht das Ergebnis für jemanden überprüfbar, der kein Interesse am guten Ruf des Projekts hat. Ein Partner, der vor dem Bau keine Zahl unterschreiben will, sagt Ihnen damit etwas über sein Vertrauen in das Ergebnis.
Sie integrieren in die Systeme, die bereits laufen.
Die Piloten, die überlebten, waren im ERP, im CRM, in der Buchhaltungssoftware verankert – dort, wo die Arbeit tatsächlich stattfindet. Die, die starben, lebten in einem separaten Tab. Ein Tool, für das Menschen ihren Arbeitsfluss verlassen müssen, wird in der ersten vollen Woche aufgegeben – und jede Woche ist eine volle Woche.
Sie messen hinterher – und veröffentlichen, was sie finden.
Auch die Fehlschläge. Die Studie hält fest, dass das Vertrauen der Nutzer am schnellsten bei Tools zusammenbrach, deren versprochene Ergebnisse nie überprüft wurden. Messung ist keine Bürokratie; sie ist der Mechanismus, durch den das zweite Projekt leichter genehmigt wird als das erste.
Die unbequeme Frage an Ihren nächsten Anbieter
Wenn es eine praktische Lehre gibt, dann ist es eine Frage: „Was ist das schriftliche Erfolgskriterium – und was passiert, wenn wir es verfehlen?"
Ein Anbieter, der eine Demo verkauft, antwortet mit Funktionen. Ein Partner, der ein Ergebnis verkauft, antwortet mit einer Zahl, einer Messmethode und einem Datum. Die 95-Prozent-Quote ist im Kern ein Markt voller Antworten der ersten Sorte, gekauft von Käufern, die die zweite gebraucht hätten.
Die Technologie funktioniert. Die MIT-Studie dokumentiert – bei aller düsteren Schlagzeile – Unternehmen, die aus denselben Modellen, zu denen alle Zugang haben, erheblichen Wert ziehen. Der Unterschied lag nie am Modell. Er lag daran, ob jemand im Raum in einem Satz sagen konnte, was das System verändern sollte – und hinterher belegen konnte, dass es das getan hat.
Quellen: MIT NANDA, „The GenAI Divide: State of AI in Business 2025" (Juli 2025); Berichterstattung über die Studie in Fortune und Forbes (August 2025). Zahlen wie in der Studie und ihrer Berichterstattung ausgewiesen.



