Wikipedia · einfach zusammengefasst · Stand
Benfordsches Gesetz
Das Benfordsche Gesetz, auch Newcomb-Benford's Law (NBL), beschreibt eine Gesetzmäßigkeit in der Verteilung der führenden Ziffern von Zahlen in empirischen …
Inhalt5 Abschnitte
Grundidee und mathematische Verteilung
Das Benfordsche Gesetz, auch Newcomb-Benford’s Law (NBL), beschreibt die Verteilung führender Ziffern in ausreichend breit gestreuten empirischen Datensätzen. Es gilt beispielsweise für Einwohnerzahlen, Geldbeträge in Buchhaltungen oder Naturkonstanten. Die Anfangsziffern sind dabei nicht gleich wahrscheinlich: Je niedriger der Zahlenwert einer Ziffernsequenz bestimmter Länge an einer bestimmten Stelle ist, desto wahrscheinlicher tritt sie auf.
Für die erste von 0 verschiedene Ziffer d einer Dezimalzahl gilt:
p(d) = log₁₀(1 + 1/d) = log₁₀((d+1)/d) = log₁₀(d+1) − log₁₀(d).
Mit dem natürlichen Logarithmus lautet die Formel:
p(d) = ln(1 + 1/d) / ln(10) = (ln(d+1) − ln(d)) / ln(10).
Die Wahrscheinlichkeiten der ersten Ziffern 1 bis 9 betragen:
- 1: 30,1 %
- 2: 17,6 %
- 3: 12,5 %
- 4: 9,7 %
- 5: 7,9 %
- 6: 6,7 %
- 7: 5,8 %
- 8: 5,1 %
- 9: 4,6 %
Die Summe der Wahrscheinlichkeiten aller möglichen Ziffern an einer bestimmten Stelle ist 1. Mathematisch entsteht dies als Teleskopsumme nach Anwendung des Logarithmengesetzes.
Das Gesetz lässt sich auf weitere Stellen verallgemeinern. Soll beispielsweise die Wahrscheinlichkeit berechnet werden, dass die zweite Ziffer 6 ist, müssen die zehn möglichen zweistelligen Anfangssequenzen 16, 26, …, 96 berücksichtigt werden. Allgemein gilt für die Wahrscheinlichkeit, dass die Ziffer d an der n-ten Stelle im Stellenwertsystem zur Basis b erscheint:
pₙ,ᵦ(d) = Σ von k = ⌊bⁿ⁻²⌋ bis bⁿ⁻¹−1 logᵦ(1 + 1/(k·b+d)),
wobei ⌊·⌋ die Gaußklammer bezeichnet. Für die erste Ziffer vereinfacht sich dies zu p(d) = p₀(d) = log_B(1 + 1/d) = log_B(d+1) − log_B(d). Mit abnehmendem Stellenwert nähert sich die Ziffernverteilung zunehmend der Gleichverteilung an.
Gültigkeit und Invarianzen
Ein Datensatz ist eine Benford-Variable, wenn die Mantissen seiner Logarithmen im Intervall von 0 bis 1 gleichverteilt sind. Die Mantisse ist dabei der gebrochene Teil eines Logarithmus. Im Allgemeinen tritt diese Gleichverteilung auf, wenn die Varianz des Datensatzes einen von der Verteilungsklasse abhängigen Mindestwert erreicht.
Das NBL gilt vor allem für reale, umfangreiche und nicht manipulierte Datensätze, deren Werte mindestens ungefähr den Bereich von x bis 10000x abdecken. Es beschreibt eine logarithmische statt einer gleichverteilten Häufigkeit: Kleine Anfangssequenzen und Sequenzen, die weiter links in der Zahl beginnen, treten häufiger auf. Die Anfangssequenz „1“ ist mit theoretisch 30,103 % am häufigsten.
Viele reale Datensätze sind log-normalverteilt. Das bedeutet, dass nicht die Daten selbst, sondern ihre Größenordnungen einer Normalverteilung folgen. Bei ausreichend breit gestreuten normalverteilten Logarithmen, insbesondere bei einer Standardabweichung von mindestens etwa 0,74, werden deren Mantissen stabil gleichverteilt. Bei einer Standardabweichung unter 0,74 bleiben die Mantissen eher normalverteilt; dann gilt das einfache NBL nicht mehr zuverlässig. Außerdem kann bei dieser geringen Streuung der Mittelwert der Normalverteilung der Logarithmen die Häufigkeit der Anfangssequenzen beeinflussen.
Viele Zahlenfolgen erfüllen das Gesetz, andere nicht. Bei den Fibonacci-Zahlen, bei denen jede Zahl die Summe ihrer beiden Vorgänger ist, reichen bereits die Anfangsziffern der ersten 30 Zahlen für eine verblüffend nahe Benford-Verteilung. Dies gilt auch für ähnliche Folgen wie Lucas-Folgen. Zugleich wurde eine allgemeinere Formulierung des Gesetzes vorgeschlagen, nach der sämtliche Datensätze eine entsprechende Benford-Eigenschaft erfüllen können.
Das NBL ist skaleninvariant: Wird ein Benford-verteilter Datensatz mit einer Konstanten multipliziert, bleibt er Benford-verteilt. In den Logarithmen entspricht dies der Addition einer Konstanten; bei hinreichender Streuung verändert sich die Mantissenverteilung nicht. Diese Eigenschaft erklärt die Eignung für Geldbeträge, denn eine universelle Verteilung muss unabhängig von Währung und Inflation sein. Der Artikel bezeichnet die Newcomb-Benford-Verteilung als die einzige Verteilung, die diese Bedingung erfüllt.
Das Gesetz ist außerdem baseninvariant. Ein Datensatz, der in der Basis B₁ Benfords Gesetz genügt, genügt ihm auch in der Basis B₂. Ein dekadischer Datensatz bleibt demnach auch nach Umrechnung in ein oktales oder hexadezimales Zahlensystem Benford-verteilt.
Anwendungen und Beispiele
Benford-Analysen dienen als schnelles Prüfverfahren. Weicht die Häufigkeit einer Anfangsziffer trotz erfüllter Voraussetzungen signifikant von der theoretischen Erwartung ab, werden die betreffenden Daten genauer untersucht. Das kann Besonderheiten eines Datensatzes zeigen oder Hinweise auf Manipulationen liefern.
In einem Beispiel wurden 87 Ernteergebnisse aus dem Jahr 2002 untersucht. Die beobachtete Verteilung passte deutlich besser zur Benford-Verteilung als zu einer Gleichverteilung. Die Ziffer 1 erschien 27-mal an erster Stelle; erwartet waren 26,19 Fälle. Die Ziffer 4 erschien 17-mal, obwohl nach Benford im Mittel nur 8,43 Fälle erwartet wurden. Auch bei der zweiten Ziffer war eine Tendenz erkennbar, allerdings nähert sich deren Verteilung bereits stärker der Gleichverteilung.
In der Wirtschaft wird das Gesetz zur Suche nach Betrug bei Bilanzen, Abrechnungen und im Rechnungswesen eingesetzt. Es wurde unter anderem im Zusammenhang mit dem „kreativen“ Rechnungswesen von Enron und Worldcom verwendet. Wirtschaftsprüfer und Steuerfahnder nutzen entsprechende mathematisch-statistische Verfahren zur Aufdeckung von Bilanzfälschung, Steuerbetrug, Investorenbetrug und allgemeinem Datenbetrug. Auch führende Ziffern von Marktpreisen können dem Gesetz folgen.
In der Forschung kann die Analyse Hinweise auf gefälschte wissenschaftliche Daten geben. Karl-Heinz Tödter überprüfte damit die Ergebnisse von 117 volkswirtschaftlichen Arbeiten.
Bei Bundestagswahlen der Jahre 1990–2005 wurden Wahlkreisergebnisse untersucht. Für die Erststimme ergaben sich in 4 von 1500 Tests signifikante Unregelmäßigkeiten. Bei der Zweitstimme wurden in 51 von 190 Tests Abweichungen beobachtet. Laut dem Studienautor Achim Goerres waren diese Ergebnisse kein Hinweis auf Manipulationen. Im Zusammenhang mit den iranischen Präsidentschaftswahlen 2009 wurden mögliche Fälschungshinweise gefunden. Andere Experten halten das NBL für die Untersuchung von Wahlen nur beschränkt geeignet.
Die Einwohnerzahlen der 998 größten deutschen Städte wichen deutlich von Benford ab. Gemessen und nach Benford erwartet wurden für die Anfangsziffern 1 bis 9: 340 zu 300,4; 320 zu 175,7; 133 zu 124,7; 87 zu 96,7; 50 zu 79,0; 24 zu 66,8; 20 zu 57,9; 12 zu 51,1 und 12 zu 45,7. Die Ziffern 3 und 4 lagen ungefähr in der Erwartung, die Ziffern 1 und besonders 2 waren überrepräsentiert, während 7, 8 und 9 selten auftraten. Der Datensatz erfüllt die Voraussetzungen nicht ausreichend, unter anderem wegen der Begrenzung auf Städte, einer natürlichen Mindestsiedlungsgröße und Gemeindezusammenlegungen. Der Artikel weist außerdem darauf hin, dass etwa 50 % der von Benford selbst angeführten Beispiele höchstens grob ähnlich, aber nicht tatsächlich Benford-verteilt waren.
Eine 2023 veröffentlichte Untersuchung der amtlichen Einwohnerzahlen von 72 Stadtvierteln Bielefelds fand statistische Evidenz dafür, dass diese Zahlen nicht der Benford-Verteilung genügen und teilweise fingiert oder manipuliert sein könnten.
Signifikanz und weiterführende Prüfungen
Ob eine Abweichung zufällig oder statistisch auffällig ist, wird mit Signifikanztests untersucht, zum Beispiel mit dem Chi-Quadrat-Test oder dem Kolmogorow-Smirnow-Test (KS-Test). Für den Chi-Quadrat-Test sollte bei der Prüfung der Anfangsziffern eine Stichprobe von mindestens 109 Zahlen vorliegen, weil dann n · 0,046 ≥ 5 gilt. Bei kleineren Stichproben können die Ergebnisse des Chi-Quadrat-Tests anfechtbar und die des KS-Tests zu tolerant sein. Als aufwändige, aber exakte Alternative nennt der Artikel einen Test auf Grundlage der Multinomialverteilung. Die Daten müssen außerdem statistisch unabhängig sein; deshalb sind Fibonacci-Zahlen für einen solchen Chi-Quadrat-Anpassungs-Test ungeeignet.
Als Beispiel für systematische Manipulation gilt ein Angestellter, der Bestellungen bis 1000 EUR ohne Genehmigung auslösen darf und größere Bestellungen in mehrere kleinere Posten aufteilt. Dadurch können signifikante Abweichungen von der theoretischen Benford-Verteilung entstehen. Einzelne Unregelmäßigkeiten werden durch statistische Verfahren jedoch nicht unbedingt erkannt. Je größer die Stichprobe ist, desto empfindlicher reagieren Signifikanztests im Allgemeinen. In einem Beispiel mit 109 Summen wurde ein Signifikanzniveau von 5 % verwendet. Da 52 % aller Verteilungen mindestens ebenso große Abweichungen aufwiesen, wurde die Zufallshypothese nicht verworfen. Herkömmliche Tests gelten in der Praxis zudem nicht immer als zuverlässig; an besser an das NBL angepassten Verfahren wird gearbeitet.
Bei Listen mit mehreren tausend Zahlen können neben der ersten auch die zweite und dritte Ziffer sowie die Summen 1. + 2. und 1. + 2. + 3. Ziffer geprüft werden. Für die letztgenannte Prüfung sollten mindestens 11.500 Zahlen vorliegen. Die Anfangssequenz 123… hat theoretisch eine Häufigkeit von 0,35166 %, die Sequenz 321… nur 0,13508 %. Mit kleiner werdendem Stellenwert nähert sich die Verteilung der Gleichverteilung. Cent-Beträge sind nahezu gleichverteilt; bei kleinen Währungen werden Tests durch häufiges Runden unscharf.
Schätzung, Planung und Erzeugung
Das NBL kann zur Schätzung von Unternehmensumsätzen verwendet werden. Für die Logarithmen aller Fakturenbeträge wird zunächst eine annähernde Normalverteilung angenommen. Die Anfangsziffern folgen dann der Benford-Verteilung mit einem Erwartungswert von etwa 3,91. Der Abstand zwischen dem Logarithmus des kleinsten und des größten Fakturenbetrags entspricht annähernd der 6-fachen Standardabweichung. Zusammen mit dem höchsten Fakturenbetrag und der Anzahl gültiger Fakturen ist so eine brauchbare Umsatzschätzung möglich. In einem Praxisbeispiel lag der tatsächliche Umsatz bei 3,2 Mio. Währungseinheiten. Die Schätzung ist jedoch nicht immer so genau; bei fehlender Normalverteilung muss eine passendere Schätzverteilung, meist eine logarithmische Normalverteilung, gewählt werden. Die zufälligen Schätzfehler der einzelnen Stellenwerte kompensieren sich meist weitgehend.
Auch Planumsätze können geprüft werden, indem geschätzt wird, wie viele Fakturen und welcher höchste Fakturenbetrag zum angegebenen Umsatz erforderlich wären. Das Verfahren kann dadurch unrealistische Erwartungen von Verkaufsabteilungen sichtbar machen.
Benford-verteilte Zufallszahlen lassen sich am Computer erzeugen. Bei gleichverteilten Zufallszahlen erzeugt y = 10ᵏ mit k = r + s Benford-verteilte Anfangsziffern. Dabei ist r eine gleichverteilte positive ganze Zahl aus einem festen Intervall und s eine gleichverteilte Zufallszahl zwischen 0 und 1. Wegen der Baseninvarianz kann anstelle von 10 jede andere Zahl größer Zwei verwendet werden.
Für annähernd normalverteilte Größenordnungen dient y = r² · tan²(t) mit 0 ≤ t < 1/2 π und gleichverteiltem t. Für praktische Zwecke sollte r > 1000 gewählt werden. Bei r < 1000 ähnelt die Verteilung zunehmend einer Lognormalverteilung; bei r < 50 sind die Anfangsziffern im Allgemeinen nicht mehr Benford-verteilt. Die durch die Tangensfunktion entstehende breite Streuung ist für praktische Anwendungen jedoch nicht immer optimal.