Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Kosinus-Ähnlichkeit

Kosinus-Ähnlichkeit ist ein Maß für die Ähnlichkeit zweier Vektoren. Dabei wird der Kosinus des Winkels zwischen beiden Vektoren bestimmt.

Inhalt3 Abschnitte
  1. 1. Bedeutung und Anwendungen
  2. 2. Berechnung
  3. 3. Wertebereich und Interpretation

Bedeutung und Anwendungen

Die Kosinus-Ähnlichkeit misst die Ähnlichkeit zweier Vektoren anhand des Kosinus des Winkels zwischen ihnen. Sie zeigt damit, wie stark beide Vektoren in dieselbe Richtung weisen: Bei einem Winkel von 0 ist der Kosinus 1; bei jedem anderen Winkel ist er kleiner als 1.

Typische Anwendungen sind der Vergleich von Dokumenten und Multimedia-Objekten, Textmining, Data-Mining, Plagiatserkennung, Suchmaschinen und die Entschlüsselung chiffrierter Texte. 2011 half die Kosinus-Ähnlichkeit von Zeichen-Platzierungsvektoren bei der Entschlüsselung des Codex Copiale.

Berechnung

Der Winkel θ zwischen den Vektoren a und b wird über das Standardskalarprodukt und die euklidische Norm bestimmt. Mit ‖a‖ := ‖a‖₂ gilt:

a · b = ‖a‖ ‖b‖ cos θ.

Daraus folgt für die Kosinus-Ähnlichkeit:

Kosinus-Ähnlichkeit = cos(θ) = (a · b)/(‖a‖ ‖b‖)

= (Σᵢ₌₁ⁿ aᵢbᵢ)/(√(Σᵢ₌₁ⁿ aᵢ²) · √(Σᵢ₌₁ⁿ bᵢ²)).

Das Skalarprodukt a · b ist die Summe der Produkte entsprechender Komponenten. Die euklidische Norm ‖a‖ bezeichnet die Länge des Vektors a.

Wertebereich und Interpretation

Die Kosinus-Ähnlichkeit liegt zwischen −1 und 1:

  • 1 bedeutet, dass die Vektoren genau gleichgerichtet sind.
  • 0 bedeutet üblicherweise Orthogonalität, also Unabhängigkeit.
  • −1 bedeutet, dass die Vektoren genau entgegengerichtet sind.
  • Zwischenwerte zeigen unterschiedliche Grade von Ähnlichkeit oder Unähnlichkeit an.

Beim Textvergleich verwendet man üblicherweise Häufigkeitsvektoren: Ihre Komponenten geben Häufigkeiten in den Dokumenten an und können nicht negativ sein. Deshalb liegt die Kosinus-Ähnlichkeit bei solchen Textvergleichen immer zwischen 0 und 1.

Lernvideos zu Kosinus-Ähnlichkeit

Weiterlesen