Wikipedia · einfach zusammengefasst · Stand
Quorum (Informatik)
Die Königslösung für Konsistenz-, Latenz- und Verfügbarkeitsprobleme stellt die (unter Umständen sehr teure) storageseitige Replikation im Storage Area Network …
Inhalt3 Abschnitte
Funktion und Definition
Ein Quorumssystem oder eine Voting Disk ist eine Komponente des Cluster Managers in einem verteilten System. Sie schützt die Datenintegrität bei einem Teilausfall, während weiterhin Daten geschrieben werden könnten. Für Lese- und Schreiboperationen müssen mehrere Knoten zustimmen oder exklusiv gelockt werden. Wie viele Knoten erforderlich sind, richtet sich danach, ob Verfügbarkeit oder Konsistenz Vorrang hat (CAP-Theorem).
Konkret gilt: Ein Cluster stimmt einer Schreiboperation zu, wenn N Knoten sie in ihrem Speicher umgesetzt und bestätigt haben. Die Zahl N wird Quorum genannt. Die Voting Disk liegt auf Shared Storage und speichert den Clusterstatus dauerhaft.
Schutz vor dem Split-Brain-Problem
Fällt der Cluster Interconnect, also die Verbindung zwischen den Clusterknoten, aus, kann sich das Gesamtsystem in mehrere autonom agierende Netzwerkpartitionen aufspalten. Dieses Split-Brain-Problem bedroht fast immer die Datenintegrität, weil verschiedene Teile gleichzeitig schreiben könnten.
Durch wechselweises oder konkurrierendes Schreiben in die logische Struktur der Voting Disk wird entschieden, welcher Teil des Clusters überleben soll. Im Beispiel Oracle RAC überlebt bei einer asymmetrischen Teilung, etwa 2:3 Knoten, der größere Teil. Bei einer geraden Teilung, etwa 2:2 Knoten, überlebt der Teil mit dem größeren Workload.
Die Abstimmung auf Massenspeicher ermöglicht diese Entscheidung. Da fast alle Clustermanager nach einem Ausfall des Interconnects mindestens einen Knoten neu starten, verhindert die persistente Speicherung des Clusterstatus einen großen Teil der erneuten Verhandlungen über Verfügbarkeit und Masterstatus. Dadurch entfallen häufig mehrere Neustarts, und die Verfügbarkeit der einzelnen Knoten steigt.
Probleme und technische Lösungen
Sobald eine Voting Disk verwendet wird, ist sie ein integraler Bestandteil des Clusters. Wird ein zuvor verfügbares Quorum während des Betriebs plötzlich unerreichbar, fällt das gesamte System aus. Besonders problematisch ist der Ausfall eines einzelnen Shared Storages, weil dadurch ein Single Point of Failure entsteht. Hersteller von Clusterware versuchen daher, diese Abhängigkeit zu vermeiden.
Ein verbreiteter Lösungsansatz ist, die Voting Disk auf mehrere physische Medien zu spiegeln. Dabei müssen die Voting Disks garantiert konsistent sein und eine möglichst geringe Latenz aufweisen. Außerdem darf ein Split-Brain-Szenario nicht dazu führen, dass die Voting Disks auf die potenziell autonomen Untereinheiten verteilt werden. Oracle Cluster Ready Services löst diesen Konflikt beispielsweise mit einer ungeraden Anzahl der Quoren.
Als umfassendste Lösung für Konsistenz-, Latenz- und Verfügbarkeitsprobleme gilt die unter Umständen sehr teure Replikation auf der Storage-Seite in einem Storage Area Network (SAN). Sie stellt allen Cluster-Mitgliedern transparent ein einziges repliziertes Gerät bereit und entlastet dadurch Clusterware, Cluster-Mitglieder und Administratoren.