Wikipedia · einfach zusammengefasst · Stand
Kosinus-Ähnlichkeit
Kosinus-Ähnlichkeit ist ein Maß für die Ähnlichkeit zweier Vektoren. Dabei wird der Kosinus des Winkels zwischen beiden Vektoren bestimmt.
Inhalt3 Abschnitte
Bedeutung und Anwendungen
Die Kosinus-Ähnlichkeit misst die Ähnlichkeit zweier Vektoren anhand des Kosinus des Winkels zwischen ihnen. Sie zeigt damit, wie stark beide Vektoren in dieselbe Richtung weisen: Bei einem Winkel von 0 ist der Kosinus 1; bei jedem anderen Winkel ist er kleiner als 1.
Typische Anwendungen sind der Vergleich von Dokumenten und Multimedia-Objekten, Textmining, Data-Mining, Plagiatserkennung, Suchmaschinen und die Entschlüsselung chiffrierter Texte. 2011 half die Kosinus-Ähnlichkeit von Zeichen-Platzierungsvektoren bei der Entschlüsselung des Codex Copiale.
Berechnung
Der Winkel θ zwischen den Vektoren a und b wird über das Standardskalarprodukt und die euklidische Norm bestimmt. Mit ‖a‖ := ‖a‖₂ gilt:
a · b = ‖a‖ ‖b‖ cos θ.
Daraus folgt für die Kosinus-Ähnlichkeit:
Kosinus-Ähnlichkeit = cos(θ) = (a · b)/(‖a‖ ‖b‖)
= (Σᵢ₌₁ⁿ aᵢbᵢ)/(√(Σᵢ₌₁ⁿ aᵢ²) · √(Σᵢ₌₁ⁿ bᵢ²)).
Das Skalarprodukt a · b ist die Summe der Produkte entsprechender Komponenten. Die euklidische Norm ‖a‖ bezeichnet die Länge des Vektors a.
Wertebereich und Interpretation
Die Kosinus-Ähnlichkeit liegt zwischen −1 und 1:
- 1 bedeutet, dass die Vektoren genau gleichgerichtet sind.
- 0 bedeutet üblicherweise Orthogonalität, also Unabhängigkeit.
- −1 bedeutet, dass die Vektoren genau entgegengerichtet sind.
- Zwischenwerte zeigen unterschiedliche Grade von Ähnlichkeit oder Unähnlichkeit an.
Beim Textvergleich verwendet man üblicherweise Häufigkeitsvektoren: Ihre Komponenten geben Häufigkeiten in den Dokumenten an und können nicht negativ sein. Deshalb liegt die Kosinus-Ähnlichkeit bei solchen Textvergleichen immer zwischen 0 und 1.