Wikipedia · einfach zusammengefasst · Stand
Hauptkomponentenanalyse
Die Hauptkomponentenanalyse (kurz: HKA, englisch Principal Component Analysis, kurz: PCA) – das mathematische Verfahren ist auch als …
Inhalt6 Abschnitte
Zweck und Grundidee
Die Hauptkomponentenanalyse (HKA; englisch Principal Component Analysis, PCA) ist ein Verfahren der multivariaten Statistik. Sie wird auch Hauptachsentransformation oder Singulärwertzerlegung genannt. Ihr Ziel ist, umfangreiche Datensätze mit ratio-skalierten Variablen zu vereinfachen und anschaulich darzustellen: Viele ursprüngliche Variablen werden durch weniger, möglichst aussagekräftige Linearkombinationen ersetzt. Diese neuen Variablen heißen Hauptkomponenten.
Typisch sind n Personen oder Gegenstände, bei denen jeweils p Merkmale gemessen wurden. Als Punkte im p-dimensionalen Raum aufgefasst, werden sie auf einen q-dimensionalen Unterraum mit q < p projiziert. Dabei soll möglichst wenig Information verloren gehen; Redundanz in Form von Korrelationen wird zusammengefasst.
Die HKA gehört zu den Ordinationen. Sie wird unter anderem als Karhunen-Loève-Transformation in der Signal- und besonders der Bildverarbeitung eingesetzt. Sie ähnelt formal der Faktorenanalyse, ist aber von ihr zu unterscheiden und kann dort zur näherungsweisen Faktorenextraktion dienen. Genannt werden außerdem Verallgemeinerungen wie Principal Curves, Principal Surfaces, t-distributed stochastic neighbor embedding, kernel PCA und für kategoriale Daten die multiple Korrespondenzanalyse.
Translation, Rotation und Projektion
Die Arbeitsweise besteht aus Translation, Rotation und Projektion. Zuerst wird die Punktwolke verschoben, sodass ihr Mittelpunkt, der Zentroid beziehungsweise Vektor der Variablenmittelwerte, im Ursprung liegt. Danach wird sie gedreht. Die Richtung mit der größten gemeinsamen Streuung, also Kovarianz, wird zur ersten neuen Achse, die nächstgrößte dazu orthogonale Richtung zur zweiten Achse und so weiter. Schließlich kann die Punktwolke auf wenige dieser Achsen projiziert werden, etwa in einem zweidimensionalen Biplot.
Die optimale Rotation wird durch die Eigenvektoren der Streuungsmatrix bestimmt. Der Anteil der Eigenwerte der ersten Hauptachsen an der Summe aller Eigenwerte gibt vereinfacht den maximal darstellbaren Anteil der Unterschiede zwischen den Punkten an.
Man kann mit der Kovarianzmatrix oder mit der Korrelationsmatrix arbeiten. Bei unterschiedlichen Maßeinheiten muss die Korrelationsmatrix verwendet werden: Dann werden die Variablen zuvor entlang ihrer ursprünglichen Achsen gestaucht oder gestreckt. Andernfalls sind die Ladungen nicht deutbar.
Mathematisch bildet eine orthogonale Matrix aus den Eigenvektoren der Kovarianzmatrix die neue Basis. Die Kovarianzmatrix wird diagonalisiert; die Daten sind dann dekorreliert, ihre Korrelationen also beseitigt. Bei normalverteilten Daten sind die Komponenten danach auch statistisch unabhängig. Bei nicht normalverteilten Daten können sie trotz fehlender Korrelation weiterhin abhängig sein; nur für normalverteilte Datensätze ist die PCA daher eine „optimale“ Methode.
Hauptkomponenten und Varianz
Die erste Hauptkomponente ist die Gerade durch den Datenmittelwert, für die die Summe der quadrierten senkrechten Abstände aller Datenpunkte minimal ist. Jede weitere Hauptkomponente geht ebenfalls durch den Mittelwert und steht orthogonal auf allen vorherigen Komponenten. So lassen sich bis zu p Hauptkomponenten bestimmen.
Dies ist gleichbedeutend mit einer Maximierung der Varianz: Wegen a² + b² = c² bedeutet die Minimierung der rechtwinkligen Abstände zur Geraden, dass die Abstände in Richtung der Geraden maximal werden. Die erste Achse wird deshalb so gewählt, dass die Varianz in ihrer Richtung am größten ist, die zweite orthogonale Achse erhält die zweitgrößte Varianz usw. Die Summe aller Achsenvarianzen ist die totale Varianz der Daten.
Decken die ersten r' Achsen mit r' < p einen hinreichend großen Anteil der totalen Varianz ab, können sie als ausreichend informationshaltig angesehen werden. Die hinteren Komponenten können dann oft weggelassen werden. Hauptkomponenten sind jedoch nicht immer inhaltlich interpretierbar; ihnen lässt sich dann keine verständliche Hypothese zuschreiben.
Statistisches Modell und Schätzung
Für p um ihre Erwartungswerte zentrierte Zufallsvariablen wird der Zufallsvektor X betrachtet. Seine Kovarianzmatrix ist Σ = E[XXᵀ]; sie ist symmetrisch und positiv semidefinit. Die absteigend geordneten Eigenwerte λj, j = 1, …, p, stehen in der Diagonalmatrix Λ. Die zugehörigen Eigenvektoren bilden die orthogonale Matrix Γ. Es gilt:
Λ = ΓᵀΣΓ.
Die Transformation Y = ΓᵀX liefert Hauptkomponenten, deren Kovarianzmatrix Λ ist. Damit ist die Varianz jeder Hauptkomponente gleich ihrem Eigenwert: Var(YA) = λA. Die erste Komponente besitzt also den größten Anteil an der Gesamtvarianz, die zweite den zweitgrößten usw. Die Einträge γjk der Ladungsmatrix Γ heißen Ladungen. Sie zeigen, wie stark eine ursprüngliche Variable Xj zu einer Hauptkomponente beiträgt.
Bei erhobenen Daten berechnet man aus p Merkmalen die Stichproben-Korrelationsmatrix und daraus Eigenwerte und Eigenvektoren. Für eine symmetrische p × p-Kovarianzmatrix sind insgesamt (p² + p)/2 Parameter zu schätzen. Dies ist nur sinnvoll, wenn die Zahl N der Datenpunkte deutlich größer ist: N ≫ (p² + p)/2. Sonst ist die Kovarianzmatrix stark fehlerbehaftet und die Methode sollte nicht angewandt werden.
Beispiele mit Artillerieschiffen
Für etwa 200 Artillerieschiffe des Zweiten Weltkriegs wurden Länge, Breite, Wasserverdrängung, Tiefgang, Maschinenleistung, Geschwindigkeit, Aktionsradius und Mannschaftsstärke untersucht. Länge, Breite, Wasserverdrängung und Tiefgang messen ähnlich gelagerte Eigenschaften und können als Faktor „Größe“ zusammengefasst werden. Ein zweiter deutlicher Faktor wird vor allem von Maschinenleistung und Höchstgeschwindigkeit bestimmt und kann „Geschwindigkeit“ heißen.
Im Beispiel mit Länge, Breite und Geschwindigkeit lautet die erste Komponente:
YA = 0,862 · Länge + 0,481 · Breite − 0,159 · Geschwindigkeit.
Die Eigenwerte der drei Komponenten A, B und C sind 2,16, 0,77 und 0,07. Sie erklären 71,97 %, 25,67 % und 2,36 % der Gesamtvarianz. Die ersten zwei Komponenten decken damit 97,64 % ab; C trägt nichts Nennenswertes zum Informationsgehalt bei.
Bei acht Merkmalen erklärt die erste Komponente mit Eigenwert 5,19 insgesamt 64,88 % der Varianz und kann als „Größe“ bezeichnet werden. Die zweite, vor allem durch PS und Knoten bestimmt, erklärt mit Eigenwert 1,54 weitere 19,22 % und kann „Geschwindigkeit“ heißen. Zusammen erklären beide 84,10 %. Die dritte Komponente, besonders mit Aktionsradius verbunden, erklärt weitere 10,43 %; die übrigen Komponenten liefern nur geringe zusätzliche Anteile.
Dimensionsreduktion und Clusteranalyse
Für Clusteranalyse und Dimensionsreduktion sortiert die PCA die orthogonalen Hauptkomponenten nach ihrem Anteil an der Gesamtstreuung. Komponenten mit nur geringem Varianzanteil können häufig weggelassen werden, ohne nennenswert Information zu verlieren. Die zugrunde liegende Arbeitshypothese lautet: Richtungen mit der größten Varianz enthalten die meiste Information. Sie trifft aber nicht immer zu.
Bei Signalvarianz liegen zwei Cluster klar getrennt, während die Streuung innerhalb jedes Clusters gering ist. Dann ist die erste Hauptkomponente x₁ ausreichend, um die Cluster zu trennen; die Dimension kann von 2 auf 1 reduziert werden. Bei Rauschvarianz ist dagegen die Streuung innerhalb der Cluster groß. Dann wird x₂ zur ersten Hauptkomponente, obwohl sie keine Information über die Trennbarkeit der Cluster enthält. Ob die Annahme zutrifft, hängt vom Datensatz ab und lässt sich bei hoher Dimensionalität oft nicht überprüfen.
Die metrische multidimensionale Skalierung und die PCA liefern dieselbe Lösung, wenn euklidische Distanzen verwendet werden und die Dimension der Konfiguration der Zahl der Hauptkomponenten entspricht. Die Rotation bei der PCA erhält die Distanzen zwischen Beobachtungen. Da die multidimensionale Skalierung auch andere Distanzen verwenden kann, ist die PCA ein Spezialfall davon.