Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Pandas (Software)

pandas ist eine Programmbibliothek für Python zur Verarbeitung, Analyse und Darstellung von Daten. Insbesondere enthält sie Datenstrukturen und Operatoren …

Inhalt3 Abschnitte
  1. 1. Überblick und Zweck
  2. 2. Entwicklung und Organisation
  3. 3. Typische Darstellungen

Überblick und Zweck

pandas ist eine plattformunabhängige Programmbibliothek für Python. Sie dient dazu, Daten zu verarbeiten, zu analysieren und darzustellen. Besonders wichtig sind ihre Datenstrukturen und Operatoren für numerische Tabellen und Zeitreihen, also Daten, deren Werte bestimmten Zeitpunkten oder Zeitabschnitten zugeordnet sind.

Eine zentrale Datenstruktur ist der DataFrame, eine Tabelle mit benannten Spalten. Daneben gibt es die Series, eine eindimensionale Datenreihe. pandas gehört zur Kategorie „Technical computing“ und ist Freie Software unter der 3-Klausel-BSD-Lizenz.

Entwicklung und Organisation

Wes McKinney begann 2008 mit der Entwicklung, weil er bei AQR Capital ein Werkzeug zur Analyse von Finanzdaten benötigte. Vor seinem Ausscheiden aus dem Unternehmen überzeugte er seine Vorgesetzten davon, die Software als quelloffenes Projekt verfügbar zu machen. Chang She, ebenfalls Mitarbeiter von AQR, wirkte ab 2012 an pandas mit. Seit 2015 wird das Community-Projekt von NumFOCUS gesponsert und unterstützt.

Als Erscheinungsdatum ist der 11. Januar 2008 angegeben. Zu den genannten Entwicklern gehören Wes McKinney, J. Brock Mendel, Joris Van den Bossche und Jeff Reback. Die aktuelle Version ist 3.0.5 vom 22. Juli 2026.

Typische Darstellungen

Die Beispiele zeigen, wie pandas zusammen mit NumPy und Matplotlib zur Erzeugung und grafischen Darstellung von Daten verwendet wird. NumPy liefert dabei zufällige Zahlen, pandas organisiert sie als DataFrame oder Series, und Matplotlib zeigt die fertigen Diagramme an.

• Kurvendiagramm: Ein DataFrame mit 100 Zeilen und fünf Spalten namens A bis E wird aus normalverteilten Zufallszahlen erzeugt. cumsum() bildet für jede Spalte kumulierte Summen. Anschließend zeichnet df.plot() die Daten als Kurven.

• Gestapeltes Balkendiagramm: Ein DataFrame mit 10 Zeilen und fünf Spalten wird aus Zufallszahlen erzeugt. df.plot.bar(stacked=True) stellt die Werte als gestapelte Balken dar.

• Boxplot: Ein DataFrame mit sieben Zeilen und fünf Spalten wird erzeugt. df.plot.box() erstellt einen Boxplot, der die Verteilungen der Spalten grafisch zusammenfasst.

• Histogramm: Eine Series mit 100 normalverteilten Zufallswerten wird angelegt. data.hist(grid=False) stellt deren Häufigkeitsverteilung ohne Gitternetz als Histogramm dar.

In allen Beispielen öffnet plt.show() die fertige Grafik.

Weiterlesen