Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Computer Vision

Durch Aneinanderreihung in einer Zeile erhält man einen Zeilensensor und entsprechende Anordnung in einer Fläche erhält man einen flächenhaften Sensor.

Inhalt6 Abschnitte
  1. 1. Gegenstand und Bedeutung
  2. 2. Typischer Ablauf der Bildauswertung
  3. 3. Kamera, Kalibrierung und Verzeichnung
  4. 4. Zuordnung, Stereo und 3D-Rekonstruktion
  5. 5. Sensoren und Navigation
  6. 6. Einsatzfelder und maschinelles Sehen

Gegenstand und Bedeutung

Computer Vision (computerbasiertes Sehen) ist ein Fachgebiet zwischen Informatik und Ingenieurwissenschaften. Es verarbeitet und analysiert von Kameras aufgenommene Bilder, um ihren Inhalt zu verstehen oder geometrische Informationen zu gewinnen. Typische Ziele sind die Erkennung von Objekten sowie die Vermessung von Objektformen und Bewegungen, also Fremd- und Eigenbewegung.

Dafür verbindet das Gebiet Bildverarbeitung, Mustererkennung, projektive Geometrie, Künstliche Intelligenz und Computergrafik. Wichtige mathematische Grundlagen sind Geometrie, lineare Algebra, Statistik, Optimierung und Funktionalanalysis. Verwandte Bereiche sind Photogrammetrie, Fernerkundung und Kartografie.

Die Aufgaben sind meist inverse Probleme: Aus zweidimensionalen Bildern sollen Eigenschaften der dreidimensionalen Welt rekonstruiert werden, etwa Farbe, Beleuchtung und Form. Dies ist schwierig und fehleranfällig, weil unterschiedliche reale Situationen zu ähnlichen Bilddaten führen können. Deshalb gibt es je nach Anforderungen viele konkurrierende, oft maßgeschneiderte Lösungswege.

Typischer Ablauf der Bildauswertung

Am Anfang steht die Bildaufnahme. Das Bild wird häufig vorverarbeitet, beispielsweise durch Helligkeits- und Kontrastausgleich, Farbausgleich, Rauschunterdrückung oder Schärfung. Lineare Filter falten dazu ein Signal mit einem Kernel; Kernel können etwa Differenzen benachbarter Punkte oder eine Gauß-Glättung beschreiben.

Danach werden Merkmale extrahiert, besonders Kanten und Eckpunkte. Kanten helfen, geometrische Modelle abzuleiten. Eckpunkte sind Bildpunkte, die sich deutlich von ihrer Umgebung unterscheiden: Ein guter Punkt hat in zwei Hauptrichtungen große Helligkeitsänderungen. Dies lässt sich als möglichst kleine Fehlerellipse beschreiben; ihre Achsen ergeben sich aus den Eigenwerten der Kovarianzmatrix, etwa beim Förstner-Operator.

Bei der Bildsegmentierung werden zusammenhängende Bereiche mit ähnlichen Merkmalen oder ähnlicher Farbe bestimmt. Die Wasserscheidentransformation kann beispielsweise einzelne Ziegelsteine einer Hauswand trennen. Segmentierung unterstützt unter anderem die Klassifikation von Flächen in der Fernerkundung und die Erkennung kranken Gewebes in Röntgen- oder CT-Aufnahmen. Die Hough-Transformation erkennt Linien und Kreise, etwa Fahrbahnmarkierungen oder Straßenschilder. Objekterkennung kombiniert Merkmalsextraktion, Mustererkennung und selbst lernende Entscheidungsalgorithmen, um beispielsweise Fußgänger von anderen Verkehrsteilnehmern zu unterscheiden.

Kamera, Kalibrierung und Verzeichnung

Das häufigste ideale Kameramodell ist die Lochkamera, eine geometrische Zentralprojektion. Ein Objektpunkt wird entlang eines geraden Projektionsstrahls durch das Loch auf die Bildebene abgebildet; das Bild ist dabei kopfstehend und seitenverkehrt. Reale Kameras benötigen Linsen und lichtempfindliche Sensoren und weichen deshalb durch Sensorfehler, Objektiv-Aberrationen und Verzeichnung vom Ideal ab. Atmosphärische Refraktion ist im Nahbereich meist vernachlässigbar.

Digitale Sensoren wandeln Licht in Strom um. 1970 wurde ein CCD-Sensor (charge coupled device, ladungsgekoppeltes Bauelement) zur Bildaufnahme entwickelt; eine Alternative ist der CMOS-Sensor (complementary metal-oxide-semiconductor). Ein einzelnes Sensorelement heißt Pixel. Für RGB-Farbbilder werden Rot, Grün und Blau entweder auf drei Sensorflächen aufgeteilt oder mit Farbfiltern auf benachbarten Pixeln, meist im Bayer-Muster, erfasst.

Kamerakalibrierung bestimmt im engeren Sinn die innere Orientierung: Hauptpunkt, Kamerakonstante und Verzeichnungsparameter. Im weiteren Sinn kann sie auch die äußere Orientierung einschließen. Häufig werden bekannte 3D-Punkte eines Testfelds oder Kalibrierrahmens und ihre gemessenen Bildkoordinaten verwendet, um ein Gleichungssystem für die Parameter des Abbildungsmodells aufzustellen.

Das Projektionszentrum O ist der Mittelpunkt der Eintrittspupille, das bildseitige Projektionszentrum O' der Mittelpunkt der Austrittspupille. Dessen senkrechte Projektion auf die Bildebene ist der Hauptpunkt H; der Abstand O'H ist die Kamerakonstante c. Der Symmetriepunkt der Verzeichnung S liegt wegen Fertigungsungenauigkeiten nicht unbedingt im Hauptpunkt. Für Rechnungen werden beide oft gleichgesetzt, was wegen ihrer starken Korrelation die Kalibrierpräzision beeinträchtigen kann.

Radiale Verzeichnung wird durch ({\displaystyle {\begin{pmatrix}y_{d}\x_{d}\end{pmatrix}}=L({\tilde {r}}){\begin{pmatrix}{\tilde {y}}\{\tilde {x}}\end{pmatrix}}) beschrieben. Dabei sind (\tilde{x},\tilde{y}) ideale und x_d,y_d verzeichnete Bildkoordinaten, und \tilde r={\sqrt{{\tilde{x}}^2+{\tilde{y}}^2}} ihr Abstand vom Verzeichnungszentrum. Für die Korrektur gilt {\displaystyle {\hat {x}}=x_{c}+L(r)(x-x_{c})\quad {\hat {y}}=y_{c}+L(r)(y-y_{c})}, mit r^2=(x-x_c)^2+(y-y_c)^2. Meist wird L mittels Taylor-Approximation als Seidel-Reihe angenähert: {\displaystyle L(r)=k_{1}r+k_{2}r^{3}+k_{3}r^{5}+\ldots}. Die Koeffizienten k_i gehören zur inneren Kalibrierung und werden meist iterativ bestimmt. Bei der Plumbline-Kalibrierung dienen reale Geraden, etwa aufgehängte Lote, als Bedingung: Nach korrekter Entzerrung müssen sie im Bild gerade sein.

Zuordnung, Stereo und 3D-Rekonstruktion

Für räumliches Sehen müssen zunächst homologe, also einander entsprechende Bildpunkte gefunden werden. Diese Aufgabe heißt Korrespondenzproblem oder image matching. Sie ist schwierig durch perspektivische Verzerrung, Verdeckungen, unterschiedliche Beleuchtung und Reflektanz, sowie wiederholte Muster. Grauwertbasierte Verfahren vergleichen Helligkeitswerte kleiner Bildausschnitte; merkmalsbasierte Verfahren extrahieren beispielsweise Eckpunkte und vergleichen deren Merkmalsvektoren.

Bei Stereo-Bildern beschreibt die Epipolargeometrie die Beziehung korrespondierender Punkte. Die Fundamentalmatrix liefert zu einem Punkt im ersten Bild eine Epipolarlinie im zweiten Bild, auf der der zugehörige Punkt liegen muss. Sie kann aus korrespondierenden Punkten geschätzt werden, beispielsweise mit dem 7-Punkt- oder 8-Punkt-Algorithmus. Sind relative Orientierung und Punktzuordnungen bekannt, werden 3D-Objektpunkte durch Triangulation, also Vorwärtsschnitt von Projektionsstrahlen, berechnet. In Bildsequenzen kann zunächst aus wenigen Punktpaaren die Fundamentalmatrix und relative Orientierung geschätzt und anschließend eine dichte Korrespondenzsuche durchgeführt werden.

Shape-from-X fasst Verfahren zusammen, die Form aus unterschiedlichen Bildhinweisen ableiten. Shape-from-Stereo nutzt zwei Blickpunkte; problematisch bleiben besonders texturarme und verdeckte Bereiche. Shape-from-Silhouette verwendet mehrere Ansichten und schneidet die äußeren Umrisse aus einem groben Volumen heraus. Voraussetzung ist die Trennung von Vorder- und Hintergrund durch Segmentierung; das Ergebnis wird als Voxel-Volumen, die visuelle Hülle (visual hull), dargestellt.

Shape-from-Shading beziehungsweise Photometric Stereo nutzt Schattierung. Bei diffuser Reflexion an rauen Oberflächen beschreibt das Lambertsche Kosinusgesetz die Abhängigkeit der beobachteten Strahlung vom Winkel zur Oberflächennormalen. Bei bekannter Beleuchtungsstärke kann daraus die Richtung der Normalen bestimmt werden. Shape-from-Motion untersucht lokale Helligkeitsänderungen zwischen Bildern; die Differenz korrespondierender Punkte ist der optische Fluss. Die daraus gewonnene 3D-Rekonstruktion ist wegen weniger Punkte grob und eher für Hinderniserkennung als für genaue 3D-Modelle geeignet.

Shape-from-Texture leitet Oberflächenorientierung aus der perspektivischen Verzerrung einer bekannten realen, wiederholten Textur ab. Strukturiertes codiertes Licht ersetzt in einem Stereo-System eine Kamera durch einen Projektor: Die bekannte künstliche Textur wird durch das Oberflächenrelief verzerrt, sodass die Kamera die 3D-Position per Strahlenschnitt bestimmen kann. Shape-from-(De-)Focus berechnet bei fester Objektdistanz aus einer Bildreihe und dem Durchmesser unscharfer Punkte die Gegenstandsweite; die Unschärfe ist proportional zur Änderung der Fokuseinstellung.

Sensoren und Navigation

Aktive Sensoren senden selbst Licht aus und bestimmen Entfernungen berührungslos. LiDAR (light detection and ranging) misst die Laufzeit eines ausgesendeten Lasersignals und wird unter anderem zur Roboternavigation eingesetzt.

Eine 3D-ToF-Kamera (time of flight, Laufzeit) besitzt einen flächenhaften Sensor mit angeordneten Lichtsensoren sowie winzigen LEDs oder Laserdioden. Diese senden infrarote Lichtpulse aus. Das reflektierte Licht wird auf den Sensor abgebildet; ein Filter lässt nur die ausgestrahlte Farbe durch. So kann gleichzeitig für ein Oberflächenstück die Entfernung bestimmt werden, beispielsweise zur Objekterkennung bei autonomer Navigation. Kinect ist ein Kamerasystem mit strukturiertem Licht zur Objektrekonstruktion. Omnidirektionale Kameras erfassen mittels eines auf einen konischen Spiegel gerichteten Systems eine Umgebung aus allen Richtungen (360°), horizontal oder vertikal.

SLAM bedeutet Simultaneous Localization and Mapping, auf Deutsch simultane Positionsbestimmung und Kartenerstellung. Ein mobiler Roboter erfasst seine Umgebung mit Sensoren dreidimensional und bestimmt gleichzeitig seine Position und eine Karte. Das löst das Problem, dass eine Positionsbestimmung normalerweise bereits eine Karte mit auffindbaren Landmarken voraussetzt, Karten aber oft nicht detailliert genug sind und ihre Perspektive von der Robotersicht abweicht.

Einsatzfelder und maschinelles Sehen

Computer Vision wird etwa in Fahrerassistenzsystemen und der autonomen Navigation, in virtuellen Welten der Filmindustrie, in augmented reality der Spieleindustrie, bei Objektverfolgung sowie bei der Registrierung medizinischer CT-Aufnahmen und der Erkennung kranken Gewebes verwendet.

In industriellen Umgebungen kann der Programmierer Kameraposition, Beleuchtung, Bandgeschwindigkeit und Objektlage weitgehend festlegen. Dadurch unterstützen visuelle Systeme zuverlässig die Qualitätskontrolle und die Vermessung einfacher Gegenstände. Beispielsweise können Beilegscheiben auf einem Förderband auf Maßhaltigkeit kontrolliert und Schweißroboter zur richtigen Schweißposition gesteuert werden.

Natürliche Umgebungen stellen höhere Anforderungen, weil diese Bedingungen nicht kontrollierbar sind. Ein schwarzes Auto hebt sich vor einer weißen Wand deutlich ab, ein grünes Auto vor einer Wiese dagegen nur schwach. Weitere Beispiele sind die Erkennung von Gesichtern und Mimik, Personen und Tätigkeiten, Gesten, Schrift und Handschrift (OCR), berührungslose 1D-, 2D- und 3D-Vermessung sowie Medizintechnik.

Maschinelles Sehen umfasst industrielle Anwendungen, in denen visuelle Systeme automatisierte Prozesse lenken. Die eingesetzten Systeme müssen besonders zuverlässig, stabil und robust sein. Wirtschaftlich sinnvoll lösbare Aufgaben sind automatische optische Produktkontrolle, Defekterkennung unter Oberflächen, Form- und Maßprüfung, Lageerkennung, Oberflächeninspektion, Objekterkennung, Schichtdickenmessungen und Vollständigkeitsprüfung.

Weiterlesen

Segmentierung (Bildverarbeitung) Der k-Means-Algorithmus ist eine iterative Technik, mit der ein Bild in k Cluster aufgeteilt wird. Der grundlegende Algorithmus hat folgende Schritte: Wähle … Wahrscheinlichkeitstheorie Bedingte Wahrscheinlichkeit. Bearbeiten. Unter einer bedingten Wahrscheinlichkeit versteht man die Wahrscheinlichkeit für das Eintreten eines Ereignisses A … Künstliche Intelligenz Künstliche Intelligenz (kurz KI, englisch artificial intelligence, kurz AI) ist ein Forschungs- und Anwendungsgebiet der Informatik. Mathematik An deutschen Universitäten gehört die Mathematik meistens zur selben Fakultät wie die Naturwissenschaften, und so wird Mathematikern nach der Promotion in der … Geometrie Dieser Artikel behandelt das Teilgebiet der Mathematik. Zum Werk von René Descartes siehe La Géométrie. Einerseits versteht man unter Geometrie die zwei- und … Lineare Algebra Die lineare Algebra (auch Vektoralgebra) ist ein Teilgebiet der Mathematik, das sich mit Vektorräumen beschäftigt. Ähnlich wie in anderen Teilgebieten der … Funktionalanalysis Beispiele für Operatoren sind etwa Differentiation, unbestimmtes Integral, quantenmechanische Observable oder Shift-Operatoren für Folgen. Grundbegriffe der … Fernerkundung Der Begriff Fernerkundung bezeichnet die Gesamtheit der Verfahren zur Gewinnung von Informationen über die Erdoberfläche oder andere nicht direkt … Kartografie Kartografie (auch Kartographie) ist die Wissenschaft und Technik zur Darstellung von Himmelskörpern in topografischen und thematischen Karten, … Absorption (Physik) Die Lichtabsorption an Oberflächen oder beim Durchqueren von Materie ist abhängig vom Material und von der Frequenz des Lichts. Die Abschwächung der … Optische Abbildung Die optische Abbildung ist in der Optik die Erzeugung eines Bildpunkts von einem Gegenstandspunkt durch Vereinigung von Licht, das vom Gegenstandspunkt … Linse (Optik) Als Linsen bezeichnet man in der Optik transparente Scheiben, von deren zwei Oberflächen wenigstens eine – meistens sphärisch – gekrümmt ist.