Im Jahr 1902 hatte die französische Kolonialverwaltung in Hanoi ein Rattenproblem. Ausgerechnet die neue Kanalisation im französischen Viertel war zum idealen Lebensraum für Ratten geworden, und die Angst vor der Pest wuchs. Nachdem angestellte Rattenfänger der Plage nicht Herr wurden, setzte die Verwaltung auf die Bevölkerung: Für jede getötete Ratte gab es eine kleine Prämie. Um sich den Transport toter Tiere zu ersparen, genügte als Nachweis der Schwanz.
Die Zahl der abgelieferten Schwänze stieg beeindruckend. Bald fiel allerdings auf, dass in der Stadt Ratten ohne Schwanz herumliefen. Sie waren gefangen, um ihren Schwanz erleichtert und wieder freigelassen worden, damit sie sich weiter vermehren und künftige Prämien sichern konnten. Später wurden sogar Rattenzuchten außerhalb der Stadt entdeckt. Der US-Historiker Michael Vann hat die Episode in den Archiven der Kolonialverwaltung rekonstruiert. Die Kennzahl „abgelieferte Schwänze“ wurde erfüllt, das Ziel „weniger Ratten“ verfehlt.
Was nach Anekdote klingt, ist ein Muster, das in jeder Organisation vorkommt, die mit Zielvorgaben steuert.
„When a measure becomes a target, it ceases to be a good measure.“ Sinngemäß: Sobald eine Messgröße zum Ziel wird, ist sie keine gute Messgröße mehr.
Woher das Gesetz stammt
Der Name geht auf den britischen Ökonomen Charles Goodhart zurück, der lange als Berater der Bank of England arbeitete. In den 1970er Jahren versuchte die britische Notenbank, die Inflation zu steuern, indem sie das Wachstum der Geldmenge begrenzte. Die Idee beruhte auf einem beobachteten Zusammenhang: Bestimmte Geldmengen-Kennzahlen hatten sich in der Vergangenheit verlässlich parallel zur Inflation entwickelt. Sobald die Notenbank jedoch eine dieser Kennzahlen zum offiziellen Steuerungsziel machte, passten Banken und Anleger ihr Verhalten an, etwa indem sie Geld in andere, nicht erfasste Anlageformen verschoben. Der Zusammenhang, auf dem die Steuerung beruhte, löste sich auf. Goodhart formulierte 1975 trocken, dass jede beobachtete statistische Regelmäßigkeit dazu neige zusammenzubrechen, sobald man sie zu Steuerungszwecken unter Druck setze.
Die heute bekannte, zugespitzte Fassung stammt von der britischen Sozialanthropologin Marilyn Strathern. Sie untersuchte in den 1990er Jahren, wie sich britische Universitäten unter dem Druck staatlicher Leistungsbewertungen veränderten, und fasste Goodharts Beobachtung 1997 in den Satz, der seither zitiert wird.
Fast zeitgleich mit Goodhart kam der US-Sozialpsychologe Donald Campbell, einer der Begründer der modernen Evaluationsforschung, zu demselben Ergebnis für gesellschaftliche Kennzahlen wie Kriminalitäts- oder Schulstatistiken: Je stärker eine Kennzahl für Entscheidungen genutzt wird, desto stärker wird sie verzerrt, und desto mehr verzerrt sie die Prozesse, die sie eigentlich beobachten soll.
In der Managementforschung ist der Gedanke vor allem durch den Aufsatz „On the Folly of Rewarding A, While Hoping for B“ (1975) des US-Managementforschers Steven Kerr bekannt geworden, der später als Chief Learning Officer bei General Electric und Goldman Sachs arbeitete. Kerr sammelte Beispiele von Organisationen, die sich ein Verhalten wünschen, aber ein anderes belohnen. Eines davon betrifft Universitäten: Sie erwarten von ihren Professorinnen und Professoren gute Lehre, befördern sie aber nach Zahl und Rang ihrer Veröffentlichungen. Niemand sollte überrascht sein, wenn dann die Forschung Vorrang bekommt.
Warum Kennzahlen kippen: vier Mechanismen
Goodharts Gesetz klingt wie ein einziger Effekt, beschreibt aber mehrere. Die Forscher David Manheim und Scott Garrabrant haben 2018 vier Varianten unterschieden, ursprünglich mit Blick auf die Frage, wie sich lernende Systeme und künstliche Intelligenz an Zielgrößen anpassen. Für die Praxis in Organisationen lassen sie sich so übersetzen:
Die Kennzahl misst nur einen Teil
Jede Kennzahl ist eine Vereinfachung dessen, was eigentlich gemeint ist. Wird nur auf sie optimiert, wächst genau der gemessene Teil, während der ungemessene vernachlässigt wird. Wer Ärztinnen und Ärzte nach Fallzahlen bewertet, bekommt mehr Fälle, nicht unbedingt mehr Gesundheit.
Der Zusammenhang gilt nur im bekannten Bereich
Viele Zusammenhänge gelten nur innerhalb des Bereichs, in dem man sie beobachtet hat. Kürzere Bearbeitungszeiten verbessern die Kundenzufriedenheit, bis zu einem Punkt. Wird die Kennzahl ins Extrem getrieben, kippt der Zusammenhang: Gespräche werden abgewürgt, Fälle unvollständig geschlossen, und die Zufriedenheit sinkt wieder.
Man bewegt die Zahl, nicht die Ursache
Eine Kennzahl hängt oft nur statistisch mit dem Ziel zusammen, ist aber nicht seine Ursache. Wer direkt an ihr dreht, verändert das Messergebnis, nicht das, wofür es stand. Das ist der Hanoi-Fall: Abgelieferte Schwänze waren ein Anzeichen für getötete Ratten, aber kein Hebel, um die Rattenzahl zu senken.
Menschen reagieren strategisch
Sobald Prämien, Bewertungen oder Ansehen an einer Zahl hängen, lernen Menschen, die Zahl zu erfüllen. Das ist keine Charakterschwäche, sondern eine vernünftige Reaktion auf die gesetzten Anreize.
Ein vielzitiertes Beispiel für den vierten Mechanismus ist der Skandal bei der US-Bank Wells Fargo. Die Bank hatte sich das Ziel gesetzt, jedem Kunden im Schnitt acht Produkte zu verkaufen, intern unter dem Motto „Eight is great“. Beschäftigte in den Filialen standen unter hohem Druck, tägliche Verkaufsziele zu erreichen. Über Jahre wurden deshalb Millionen von Konten und Kreditkarten ohne Wissen der Kundinnen und Kunden eröffnet. Als der Skandal 2016 öffentlich wurde, zahlte die Bank zunächst eine Strafe von 185 Millionen US-Dollar; 2020 folgte ein Vergleich mit den US-Behörden über drei Milliarden Dollar. Die Kennzahl „Produkte je Kunde“ entwickelte sich prächtig, die Kundenbeziehungen nicht.
Die psychologische Seite
Aus wirtschaftspsychologischer Sicht wirken Zielkennzahlen auf zwei Wegen.
Erstens lenken sie Aufmerksamkeit. Menschen haben begrenzte Kapazität, und was gemessen, berichtet und besprochen wird, bekommt sie. Alles andere wird zum Hintergrund, auch wenn es eigentlich wichtiger ist.
Zweitens können sie Motivation verdrängen. Der US-Psychologe Edward Deci ließ 1971 Studierende knifflige Puzzles lösen. Eine Gruppe erhielt für jedes gelöste Puzzle einen Dollar, die andere nichts. In einer anschließenden Pause, in der die Versuchspersonen sich unbeobachtet glaubten, beschäftigten sich die zuvor Bezahlten deutlich weniger mit den Puzzles als die Unbezahlten. Die Bezahlung hatte aus einer interessanten Tätigkeit eine Arbeit gemacht, die man ohne Lohn nicht mehr tut. Aus diesen Befunden entwickelte Deci zusammen mit Richard Ryan die Selbstbestimmungstheorie, eine der einflussreichsten Motivationstheorien.
Der Schweizer Ökonom Bruno Frey hat für dieses Phänomen den Begriff Verdrängungseffekt geprägt und ihn in der Praxis nachgewiesen. In einer bekannten Studie befragten er und Felix Oberholzer-Gee Anfang der 1990er Jahre Bewohnerinnen und Bewohner Schweizer Gemeinden, die als Standort für ein Atommüll-Endlager im Gespräch waren. Rund die Hälfte war bereit, das Lager zu akzeptieren, aus Pflichtgefühl gegenüber dem Gemeinwohl. Als zusätzlich eine finanzielle Entschädigung angeboten wurde, sank die Zustimmung auf etwa ein Viertel. Das Geld verwandelte eine Bürgerpflicht in ein Geschäft, und für ein Geschäft war der Preis zu niedrig.
Übertragen auf Organisationen: Eine Pflegekraft, die bisher aus Überzeugung sorgfältig dokumentiert hat, dokumentiert unter Kennzahlendruck womöglich vollständig, aber nicht mehr sorgfältig.
Wenn Beschäftigte Kennzahlen „schönen“, liegt der Reflex nahe, mehr zu kontrollieren. Das verschärft das Problem meist. Hilfreicher ist die Frage, welchen Zielkonflikt die Kennzahl erzeugt hat. Ähnlich wie beim Widerstand im Wandel zeigt das Verhalten, wo das System widersprüchliche Signale sendet.
Woran man erkennt, dass eine Kennzahl kippt
- Die Zahl verbessert sich, die Lage nicht. Das Dashboard ist grün, die Beschwerden nehmen zu.
- Die Werte ballen sich an der Schwelle. Wenn auffällig viele Ergebnisse knapp über dem Zielwert liegen und kaum welche knapp darunter, wird auf die Schwelle hin gearbeitet. Natürlich schwankende Werte würden sich gleichmäßiger verteilen.
- Definitionsdebatten nehmen zu. Wenn intensiv darüber verhandelt wird, was als „Fall“ oder „abgeschlossen“ zählt, geht es um die Zahl, nicht um die Sache.
- Niemand nutzt die Zahl mehr zur Analyse. Wer die Kennzahl steuert, traut ihr selbst nicht mehr.
Kennzahlen trotzdem sinnvoll nutzen
Goodharts Gesetz ist kein Argument gegen Kennzahlen, sondern gegen ihren naiven Gebrauch. Einige Gegenmittel haben sich bewährt:
- Paare statt Einzelwerte. Jede Mengenkennzahl bekommt ein Gegengewicht: Bearbeitungszeit zusammen mit der Quote wieder geöffneter Fälle, Neukunden zusammen mit der Kündigungsquote. Wer nur eine Seite optimiert, verschlechtert sichtbar die andere.
- Diagnose und Bewertung trennen. Kennzahlen zur Analyse werden nicht an Prämien oder Beurteilungen gekoppelt. Nur so bleiben sie ehrlich.
- Schwellen statt Maximierung. Ein Korridor „gut genug“ erzeugt weniger Druck ins Extrem als „so viel wie möglich“.
- Zahlen mit Gesprächen verbinden. Eine Kennzahl eröffnet die Frage, sie beantwortet sie nicht. Qualitative Einschätzungen gehören in dieselbe Runde.
- Beteiligung bei der Definition. Wer eine Kennzahl mitentwickelt, versteht ihren Zweck und hat weniger Grund, sie zu umgehen.
- Regelmäßig überprüfen. Kennzahlen altern. Was vor zwei Jahren ein guter Indikator war, ist vielleicht längst gelernt und gespielt.
Diese Grundsätze stecken auch in den Abschnitten „Messbar machen“ in den Artikeln dieses Wissensbereichs: Jede dort vorgeschlagene Messgröße nennt ausdrücklich ihre Grenze. Wie man Kennzahlen von vornherein aus dem Ziel ableitet, statt sie zu sammeln, beschreibt der Artikel Kennzahlensysteme bauen.
Fazit
Kennzahlen sind Beobachtungsinstrumente. Sobald sie zum Ziel erklärt werden, beginnen Menschen, auf sie zu reagieren, und das Instrument verändert, was es beobachtet. Wer mit Zahlen steuert, sollte deshalb nicht nur fragen, was eine Kennzahl misst, sondern auch, welches Verhalten sie auslöst.
Zum Weiterlesen
- Goodhart, C. A. E. (1975). Problems of Monetary Management: The U.K. Experience. Papers in Monetary Economics, Reserve Bank of Australia.
- Strathern, M. (1997). ‘Improving ratings’: audit in the British University system. European Review, 5(3), 305–321.
- Campbell, D. T. (1979). Assessing the impact of planned social change. Evaluation and Program Planning, 2(1), 67–90.
- Kerr, S. (1975). On the Folly of Rewarding A, While Hoping for B. Academy of Management Journal, 18(4), 769–783.
- Manheim, D. & Garrabrant, S. (2018). Categorizing Variants of Goodhart’s Law. arXiv:1803.04585.
- Deci, E. L. (1971). Effects of externally mediated rewards on intrinsic motivation. Journal of Personality and Social Psychology, 18(1), 105–115.
- Frey, B. S. & Oberholzer-Gee, F. (1997). The Cost of Price Incentives: An Empirical Analysis of Motivation Crowding-Out. American Economic Review, 87(4), 746–755.
- Vann, M. G. (2003). Of Rats, Rice, and Race: The Great Hanoi Rat Massacre, an Episode in French Colonial History. French Colonial History, 4, 191–203.