Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Floating Point Operations Per Second

Gleitkommaoperationen pro Sekunde (kurz FLOPS; englisch für Floating Point Operations Per Second) ist ein Maß für die Leistungsfähigkeit von Computern oder …

Inhalt5 Abschnitte
  1. 1. Bedeutung und Maßeinheiten
  2. 2. Was die FLOPS-Zahl beeinflusst
  3. 3. Berechnung der theoretischen Spitzenleistung
  4. 4. Messung und Entwicklung von Computersystemen
  5. 5. Energie, Grenzen und Vergleichswerte

Bedeutung und Maßeinheiten

FLOPS („Floating Point Operations Per Second“) geben an, wie viele Gleitkommazahl-Operationen ein Computer oder Prozessor pro Sekunde ausführen kann. Gemeint sind insbesondere Additionen und Multiplikationen. Eine einzelne Gleitkommaoperation wird als FLOP bezeichnet; FLOP/s und FLOPS sind gleichbedeutend.

Die Einheit wird mit SI-Vorsätzen erweitert: kFLOPS = 10^3 FLOPS, MFLOPS = 10^6, GFLOPS = 10^9, TFLOPS = 10^12, PFLOPS = 10^15, EFLOPS = 10^18, ZFLOPS = 10^21, YFLOPS = 10^24 und RFLOPS = 10^27 FLOPS. RFLOPS steht für RonnaFLOPS.

Was die FLOPS-Zahl beeinflusst

Die Zahl der Gleitkommaoperationen ist nicht zwingend proportional zur Taktgeschwindigkeit. Je nach technischer Umsetzung benötigen Gleitkommaoperationen unterschiedlich viele Taktzyklen. Vektorprozessoren können in jedem Takt bis zu einige tausend Operationen ausführen. Grafikkarten der GeForce-30-Serie erreichten 2020 mehr als 30 TFLOPS in einfacher Genauigkeit mit 32 Bit. Dies ist ein Grund für das Auslagern von Gleitkommaoperationen auf Grafikprozessoren (GPGPU).

Bei Supercomputern bestimmen außerdem die Zahl und Leistungsfähigkeit der Prozessoren, die Vernetzung der Rechenknoten sowie die verwendete Software, Programmiersprache und Compiler die tatsächliche Leistung. FLOPS-Werte sind häufig Best-Case-Abschätzungen oder sogar nur theoretisch mögliche Werte.

Berechnung der theoretischen Spitzenleistung

Die theoretische Spitzenleistung (Theoretical Peak Performance) eines einzelnen Rechenknotens wird durch Multiplikation mehrerer Faktoren bestimmt:

  • Taktfrequenz
  • Anzahl der CPU-Sockel
  • CPU-Kerne pro Sockel
  • der kleinere Wert aus den pro Takt beginnbaren Befehlen und der Anzahl der Rechenwerke geteilt durch die Latenz eines Befehls
  • Datenworte pro Rechenregister
  • numerische Operationen pro Befehl

Beispiel: Bei 2,5 GHz, 2 Sockeln, 24 Kernen pro Sockel, 2 begonnenen Befehlen pro Takt, 8 Datenworten pro Rechenregister und 2 numerischen Operationen pro Befehl (FMA) ergibt sich eine theoretische Spitzenleistung von 3,84 TFLOPS. Die 8 Datenworte entsprechen 256-Bit-Registern bei single precision oder 512-Bit-Registern bei double precision.

Messung und Entwicklung von Computersystemen

Die FLOPS-Leistung wird mit standardisierten Programmpaketen, sogenannten Benchmarks, bestimmt, etwa LINPACK oder dem Livermore Benchmark. Die TOP500-Rangliste führt die 500 schnellsten Computersysteme nach ihrer mit LINPACK gemessenen FLOPS-Leistung auf. Sie ist nicht vollständig, weil vergleichbar leistungsfähige Systeme nicht am Ranking teilnehmen.

Historische Beispiele zeigen den starken Anstieg der Rechenleistung: Die elektromechanische Zuse Z3 von 1941 schaffte knapp 2 Additionen pro Sekunde und damit 2 FLOPS; andere Operationen dauerten teilweise länger. Ein Intel-8087-Koprozessor mit 8088-Hauptprozessor erreichte 1980 bei 5 MHz 50 kFLOPS. PCs mit Pentium 4 erreichten 2000 bei 1,5 GHz und durchgängiger SSE-Nutzung 6 GFLOPS. GeForce-30-Grafikkarten leisteten 2020 bis zu 36 TFLOPS. Eine Berechnung, die 2020 auf einer GPU eine Sekunde dauerte, hätte 2000 noch 100 Minuten und 1980 sogar 200.000 Stunden benötigt.

Auch Großrechner entwickelten sich stark weiter. BlueGene/L von IBM führte in der TOP500-Liste 11/2005 rund 280 TFLOPS aus, benötigte dafür 70 m² Fläche und 1,77 MW. Der drei Jahre ältere Earth Simulator erreichte 35,86 TFLOPS, benötigte aber 3000 m² und 6 MW. Der deutsche NEC am Höchstleistungsrechenzentrum Stuttgart erreichte im Juli 2005 bis zu 12,7 TFLOPS; er kostete 57 Millionen Euro, verursachte jährlich 1,3 Millionen Euro Betriebskosten und 1,5 Millionen Euro Personalkosten und wurde für etwa 4000 Euro pro Stunde vermietet. Der JUBL in Jülich erreichte im März 2006 45,6 TFLOPS und war damals der sechstschnellste Computer der Welt. Die Nachfrage nach Rechenzeit sollte nach einer Einschätzung von 2006 in fünf Jahren um den Faktor 1000 steigen.

Im Dezember 2015 erreichten etwa 700.000 aktive Computer der Berkeley Open Infrastructure for Network Computing durchschnittlich etwa 12 PFLOPS. Der ALMA-Korrelator führte im Dezember 2012 17 PFLOPS aus; für den WIDAR-Korrelator des EVLA wurden 40 PFLOPS angegeben. Als weiteres Beispiel wird Cray XC40 „Hazel Hen“ (2015) mit 7,42 PFLOPS genannt.

Energie, Grenzen und Vergleichswerte

Das Verhältnis von Rechenleistung zu elektrischer Leistung verbessert sich, während die gesamte Energiezufuhr eher ansteigt. Der Strombedarf ist ein Hauptgrund, warum ältere Systeme nicht dauerhaft als Supercomputer weiterbetrieben werden und ungefähr alle fünf Jahre eine neue Rechnergeneration installiert wird.

Mit immer mehr Prozessoren und Kernen steigen die Wahrscheinlichkeit von Ausfällen, der Strombedarf, die Abwärme sowie die Anforderungen an Datenaustausch, Datennetze, Speicherung und Archivierung. Systeme nutzen Abwärme zunehmend zum Heizen von Gebäuden oder Gewächshäusern. Teilweise wird über eigene Kraftwerke für Supercomputer nachgedacht; manche Anlagen stehen in kalten Gegenden, um die Wärmeabfuhr zu erleichtern. Verschiedene Supercomputer haben inzwischen den Exaflops-Bereich erreicht, zugleich nähert sich die Anhäufung weiterer Prozessoren den physikalischen Grenzen.

Beispiele aus einem LINPACK-Test mit 1kx1k und doppelter Genauigkeit (DP) zeigen Unterschiede zwischen Spitzen- und Durchschnittsleistung: Cell mit 1 SPU bei 3,2 GHz erreichte 1,83 beziehungsweise 1,45 GFLOPS (79 %), Cell mit 8 SPUs 14,63 beziehungsweise 9,46 GFLOPS (65 %), Pentium 4 bei 3,2 GHz 6,4 beziehungsweise 3,1 GFLOPS (48 %), Pentium 4 mit SSE3 bei 3,6 GHz 14,4 beziehungsweise 7,2 GFLOPS (50 %), Core i7 mit 4 Kernen bei 3,2 GHz 51,2 beziehungsweise 33,0 GFLOPS (64 %) und der Intel Core i7 2600k mit 4K/8T bei 3,4 GHz 102,5 beziehungsweise 92,3 GFLOPS (90 %). Der Itanium bei 1,6 GHz erreichte 6,4 beziehungsweise 5,95 GFLOPS (93 %). Weitere angegebene Spitzenwerte sind 82.580 GFLOPS für die Nvidia GeForce RTX 4090, 10.600 GFLOPS Durchschnittsleistung für die Nvidia Tesla GP100 bei 1,48 GHz, 19.553 beziehungsweise 12.901 GFLOPS für die Nvidia Quadro P6000, 1.536 GFLOPS für den Intel Xeon Skylake SP 6148, 221 GFLOPS für den bislang unoptimierten AMD Ryzen 1800X mit 8K/16T, 241 GFLOPS für den Intel Core i7 7700K mit 4K/8T, 375 GFLOPS für den Intel Core i7-5960X mit 8K/16T sowie 273,1 beziehungsweise 265 GFLOPS für den Intel Core i7 5820k mit 6K/12T und 3,3 GHz.

Weiterlesen

Internationales Einheitensystem Das Internationale Einheitensystem oder SI (französisch Système international d'unités) ist als Einheitensystem für physikalische Größen weltweit verbreitet. Vorsätze für Maßeinheiten Vorsätze für Maßeinheiten, Einheitenvorsätze, Einheitenpräfixe oder kurz Präfixe (von lateinisch praefixum: vorne angeheftet) dienen dazu, Vielfache oder … Computer Ein Computer (englisch; deutsche Aussprache [kɔmˈpjuːtɐ]) oder Rechner ist ein Gerät, das mittels programmierbarer Rechenvorschriften Daten verarbeitet. Prozessor Aufbau und Funktionale Einheiten · Hauptprozessor (CPU) und Mehrprozessorkerne · Steuer- bzw. Leitwerk · Rechenwerk und Register · Datenleitungen · Caches und MMU. Addition Die Addition basiert auf dem Vorgang des Zählens. Deshalb verwendet man für den Vorgang, eine Addition auszuführen, neben Addieren auch den Ausdruck … Multiplikation Obwohl die Multiplikation eine Grundrechenart ist, lässt sie sich durch Addition nachbilden, für die sie eine Verkürzung darstellt. Inhaltsverzeichnis. 1 … Gleitkommazahl Gleitkommazahlen bestehen aus einer festen Anzahl von Ziffern, die gemäß dem Stellenwertsystem den Wert der Zahl angeben, sowie der Angabe, um wie viele Stellen … Einfache Genauigkeit In der Mathematik und Informatik ist einfache Genauigkeit (englisch single precision oder auch nur single) eine Bezeichnung für ein Gleitkommaformat, … Instruktionen pro Sekunde Die Einheit gibt an, wie viele Maschinenbefehle (Instruktionen) ein Mikroprozessor pro Sekunde ausführen kann. 1 MIPS bedeutet, er kann eine Million … Zuse Z3 Die Z3 war einer der ersten funktionsfähigen Digitalrechner weltweit und wurde am 12. Mai 1941 von Konrad Zuse in seiner Werkstatt in der Methfesselstraße 7 in … Doppelte Genauigkeit Doppelte Genauigkeit (englisch double precision oder auch double) steht in der Computerarithmetik für ein Gleitkomma-Zahlenformat, bei dem eine Zahl 8 Byte … Watt (Einheit) Das Watt ist die SI-Einheit der Leistung (Energieumsatz pro Zeitspanne). Sie wurde nach dem schottischen Wissenschaftler und Ingenieur James Watt benannt.