Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Videokompression

Videokompression dient zur Reduzierung der Datenrate eines digitalisierten Videosignals, um es einfacher speichern oder übertragen zu können.

Inhalt6 Abschnitte
  1. 1. Zweck und Grundprinzip
  2. 2. Redundanzreduktion
  3. 3. Irrelevanzreduktion
  4. 4. Kompressionswerkzeuge
  5. 5. Entropiekodierung
  6. 6. Entwicklung und Standards

Zweck und Grundprinzip

Videokompression reduziert die Datenrate eines digitalisierten Videosignals, damit es leichter gespeichert oder übertragen werden kann. Typische Kompressionsraten liegen zwischen 1:5 und 1:500.

Einfachere Verfahren wie MJPEG komprimieren jedes Einzelbild unabhängig voneinander. Dabei werden etwa Kompressionsraten von 1:10 erreicht. Fortschrittlichere Verfahren nutzen zusätzlich Ähnlichkeiten zwischen einzelnen Teilbildern. So sind heute Kompressionsraten von oberhalb 1:100 bei kaum reduzierter Qualität möglich.

Videokompression beruht auf zwei grundlegenden Ansätzen: Redundanzreduktion und Irrelevanzreduktion. Redundanzreduktion nutzt wiederkehrende oder ähnliche Informationen im Videosignal. Irrelevanzreduktion lässt Informationen weg, die für die menschliche Wahrnehmung wenig wichtig sind. Die Begriffe stammen aus der Informationstheorie und beschreiben die Übertragung von Information von einer Quelle zu einer Senke. Bei der Videokodierung ist die Bildfolge aus der Kamera die Quelle, das Auge des Betrachters die Senke.

Redundanzreduktion

Redundanzreduktion nutzt statistische Eigenschaften des Bildsignals sowie Korrelationen, also Ähnlichkeiten zwischen zeitlich und räumlich benachbarten Bildpunkten. Ziel ist eine möglichst kompakte Darstellung. Dabei gehen keine Informationen verloren; es handelt sich um verlustlose Kodierung. Erreichbare Kompressionsfaktoren liegen bei 1:2 bis 1:5.

Für zeitliche Korrelationen wird Inter-Kodierung eingesetzt. Sie berechnet aus bereits übertragenen Einzelbildern Schätzwerte und überträgt anschließend nur die Schätzfehler. Räumliche Korrelationen werden mit Intra-Kodierung genutzt. Dabei werden Bildpunkte anhand der Differenz zu Schätzwerten aus räumlich umliegenden Punkten kodiert oder zusammenhängende Bildmuster kompakter beschrieben. Statistische Redundanz wird zusätzlich durch Entropiekodierung verringert.

Irrelevanzreduktion

Irrelevanzreduktion lässt Informationen weg, die für die menschliche Wahrnehmung nicht oder nur wenig relevant sind. Sie berücksichtigt physiologische Eigenschaften des Sehens und verwirft gezielt Daten, sodass die entstehenden Störungen möglichst wenig auffallen. Dadurch sind je nach Verfahren und gewünschter Qualität weitere Kompressionsraten von typischerweise 1:2 bis 1:50 möglich. Weil Informationen verloren gehen, spricht man von verlustbehafteter Kodierung.

Bei der Videokodierung geschieht dies vor allem durch Quantisierung: Nur ein Teil der Bilddaten wird übertragen. Außerdem ist die räumliche Auflösung der Farbwahrnehmung wegen der Anatomie des Auges schlechter als die Auflösung von Helligkeitsunterschieden. Deshalb kann die Auflösung der Farbinformation verringert werden. Dieses Verfahren heißt Farbunterabtastung. Meist wird das Bild vorher in ein geeignetes Farbmodell umgewandelt; dadurch sinkt die Datenrate üblicherweise bereits um 50 %.

Eine weitere Grundlage ist die Frequenzabhängigkeit des Sehens. Bilder können wie Töne als Überlagerung zweidimensionaler Schwingungen dargestellt werden. Niedrige Bildfrequenzen beschreiben grobe Strukturen, hohe Bildfrequenzen feine Details. Störungen in den verschiedenen Frequenzbereichen werden unterschiedlich stark wahrgenommen. In allen Videokompressionsverfahren der MPEG-Familie wird diese Eigenschaft nach einer geeigneten Transformation als psychovisueller Faktor bei der Quantisierung genutzt.

Kompressionswerkzeuge

Videokompressionsverfahren bestehen aus mehreren Kompressionswerkzeugen, die unterschiedliche Redundanzen ausnutzen. Intra-Frame-Vorhersage nutzt räumlich benachbarte Bildpunkte, unter anderem durch Pixelextrapolation, Differenzkodierung und Transformationskodierung. Inter-Frame-Kodierung nutzt zeitliche Abhängigkeiten zwischen Einzelbildern, beispielsweise durch Bewegungskompensation und DPCM. Statistische Redundanz wird mit Entropiekodierung verringert.

Bei der blockbasierten Transformationskodierung werden Einzelbilder in quadratische Blöcke geteilt und nach ihrer Komplexität beurteilt. Ein Beispiel ist die diskrete Kosinustransformation (DCT). Komplexe Bildblöcke benötigen mehr Speicherplatz, während für einfache Blöcke weniger Bits genügen. Diese Aufteilung schafft die Voraussetzung für die Irrelevanzreduktion.

Bei der Differential Pulse Code Modulation (DPCM) werden nur die Unterschiede zu bereits übertragenen Einzelbildern oder Bildpunkten gespeichert. Bei der Inter-Kodierung wird dieses Verfahren durch Bewegungskorrektur ergänzt. Dabei sucht man nach übereinstimmenden Bildteilen, die sich gegenüber dem letzten Einzelbild bewegt haben. Für solche Teile wird ein Bewegungsvektor gespeichert; unbewegte Bildteile werden vom letzten Einzelbild übernommen.

Entropiekodierung

Die Entropiekodierung entfernt statistische Redundanzen in Reihen von Werten. Dazu werden Codes mit variablen Wortlängen, englisch variable-length codes (VLC), verwendet. Häufige oder wahrscheinliche Symbole erhalten kürzere Codewörter als seltene Symbole. Dadurch ist die Darstellung insgesamt kompakter als bei einer konstanten Codewortlänge.

Am weitesten verbreitet sind Verfahren der arithmetischen Kodierung. Daneben werden weiterhin die ältere Huffman-Kodierung und Varianten der weniger komplexen Lauflängenkodierung eingesetzt, zum Beispiel CAVLC.

Entwicklung und Standards

Die Standardisierung begann mit H.120, der noch keine praktische Verwendung fand. Der bis heute grundlegende Entwurf wurde mit H.261 aus dem Jahr 1988 etabliert. Seine wichtigsten Merkmale sind blockbasierte Frequenztransformation, bewegungskompensierte Differential Pulse Code Modulation (DPCM) und Entropiekodierung. Die Haupttechniken waren bis 1979 entwickelt und wurden danach fortlaufend verfeinert. Neue Verfahren konnten teilweise erst später eingesetzt werden, wenn leistungsfähigere Mikroprozessoren dies ermöglichten. Eine Ausnahme mit gewisser Relevanz ist der wavelet-basierte Standard VC-2 in der Dirac-Variante.

Die H.26x-Videoformatserie der ITU-T und die MPEG-Videoformate waren 2016 die dominierenden Standards. Wichtige Veröffentlichungen waren MPEG-1 (1991), MPEG-2 (1994) und H.264/MPEG-4 AVC (2003). Weitere Konkurrenten waren unter anderem Windows Media Video 9 beziehungsweise VC-1 sowie Formate aus der VPx-Serie. Freie Formate waren zunächst technisch unterlegen. Mit der Freigabe von VP8 (2008) und VP9 (2012) verbesserten sie sich deutlich. Die Alliance for Open Media unterstützte ab 2015 lizenzkostenfreie Formate und veröffentlichte 2018 AV1 als Nachfolger von VP9.

An der Standardisierung sind unter anderem die Moving Picture Experts Group (MPEG) und die Internationale Fernmeldeunion (ITU) beteiligt. Deshalb kann dasselbe Verfahren mehrere Bezeichnungen tragen, etwa H.264, MPEG-4 AVC, MPEG-4/Part 10 oder ISO/IEC 14496-10.

Wichtige Entwicklungsschritte waren die Anmeldung des DPCM-Patents durch Bell Laboratories im Jahr 1950, die Shannon-Fano-Kodierung in den 1940ern, die darauf aufbauende Huffman-Kodierung von 1950, die Einführung der Transformationskodierung mit Hadamard-Transformation 1969, das Auftreten der DCT in der wissenschaftlichen Literatur 1974 und die Veröffentlichung der kontextadaptiven arithmetischen Kodierung (CABAC) Anfang der 1990er.

Weiterlesen