Wikipedia · einfach zusammengefasst · Stand
Maschinelles Lernen
Maschinelles Lernen (ML) entwickelt, untersucht und verwendet statistische Algorithmen, auch Lernalgorithmen genannt. Solche Algorithmen können lernen, …
Inhalt5 Abschnitte
Grundidee und Lernstile
Maschinelles Lernen (ML), in der mathematischen Statistik auch statistisches Lernen, entwickelt, untersucht und verwendet statistische Algorithmen (Lernalgorithmen). Sie lernen aus vielen Beispieldaten, komplizierte Probleme zu lösen, deren Lösungsweg sich nicht einfach als feste Regeln programmieren lässt. Ein Lernalgorithmus bildet Beispieldaten auf ein mathematisches Modell ab und passt dieses beim Training so an, dass es auf neue, zuvor nicht gelernte Fälle verallgemeinern kann. Der gefundene Lösungsweg ist danach im Modell gespeichert; das Modell kann Vorhersagen, Empfehlungen oder Entscheidungen erzeugen.
Anwendungen sind unter anderem Bilderkennung, Spamfilter, automatisierte Diagnoseverfahren, Kreditkartenbetrugserkennung, Aktienmarktanalysen, die Klassifikation von Nukleotidsequenzen sowie Sprach- und Texterkennung. Seit 2023 wurden auch textbasierte Dialogsysteme allgemein bekannt, die mit ML trainierte Modelle nutzen.
Die Lernstile unterscheiden sich danach, woher Informationen über die korrekte Ausgabe kommen. Beim überwachten Lernen gibt es korrekte Ausgabewerte oder Rückmeldungen. Beim unüberwachten Lernen fehlen solche Vorgaben; die Algorithmen suchen beispielsweise Cluster oder korrelierende Merkmale und können mehrere anschließend zu bewertende Lösungen vorschlagen. Beim bestärkenden Lernen beobachten Agenten eine Umgebung, führen Aktionen aus und entwickeln anhand von Belohnungen eine Strategie für möglichst viele Belohnungen.
Einordnung und Entwicklung
ML ist ein Teilgebiet der Künstlichen Intelligenz (KI), die als Teilgebiet der Informatik menschliche Intelligenz imitieren soll. Etwa ab 1980 trennten sich die Wege: Während viele KI-Forscher Expertensysteme aus bekanntem Wissen entwickelten, konzentrierte sich ML auf das Lernen aus Daten, um praktische Probleme zu lösen. Heute gilt ML vielen Experten als Schlüsseltechnologie der KI; in der öffentlichen Berichterstattung werden KI und ML oft gleichgesetzt.
ML und Statistik verwenden ähnliche Methoden, verfolgen aber unterschiedliche Schwerpunkte. Statistik zieht aus sorgfältig ausgewählten Stichproben Schlüsse über eine Gesamtmenge und prüft mittels statistischer Inferenz, wie wahrscheinlich Zusammenhänge echt und nicht durch Störungen erklärbar sind. ML verarbeitet große Datenmengen mit allgemein formulierten Algorithmen, um verallgemeinerbare Vorhersagen zu lernen. Gute Vorhersagen eines ML-Modells müssen dabei nicht bedeuten, dass seine gelernten Zusammenhänge überprüfbar sind. Explainable-Artificial-Intelligence-Ansätze sollen Entscheidungen nachvollziehbarer machen. ML ist außerdem ein Baustein der Data Science, die Erkenntnisse aus strukturierten und unstrukturierten Daten gewinnt, und eng mit Data-Mining verbunden. Mathematische Optimierung ist eine Grundlage des ML, etwa wenn das Gradientenverfahren Modellparameter optimiert.
Wichtige Entwicklungsschritte waren die McCulloch-Pitts-Zelle von Warren McCulloch und Walter Pitts (1943), Rosenblatts einschichtiges Perzeptron (1957), Backpropagation für mehrschichtige Netze nach Paul Werbos (1982), Fortschritte durch Support Vector Machines und rekurrente neuronale Netze in den 1990er Jahren sowie Random Forests nach Leo Breiman (2001). Geoffrey Hinton et al. beschrieben 2006 Deep Learning für mehrschichtige Netze mit über 98 % Genauigkeit bei handgeschriebenen Zahlen. 2017 gewann AlphaGo gegen den besten Go-Spieler der Weltrangliste; im selben Jahr wurde die Transformer-Architektur mit Aufmerksamkeitsmechanismus vorgestellt. Sie begünstigte ab 2018 große Sprachmodelle wie BERT und GPT. AlphaFold wurde 2020 als Durchbruch bei der Proteinstrukturvorhersage aufgenommen; AlphaFold 3 kann seit 2024 auch Wechselwirkungen von Molekülen vorhersagen. ChatGPT wurde 2022 öffentlich zugänglich.
Training, Daten und Lernverfahren
Beim überwachten Lernen enthalten gelabelte Datensätze für jede Eingabe einen passenden, richtigen Ausgabewert. Der Lernalgorithmus passt die Parameter an, damit Modell- und Zielausgaben möglichst gut übereinstimmen. Typische Aufgaben sind Klassifikation und Regression. Er erstellt das Modell mit dem Trainingsdatensatz und prüft dessen Qualität mit einem getrennten Testdatensatz. Das Modell soll für neue Daten funktionieren, ohne die Trainingsdaten zu überangepasst zu lernen. Teilüberwachtes Lernen ergänzt fehlende Labels häufig zunächst durch Clusterbildung. Beim aktiven Lernen fragt der Algorithmus ausgewählte korrekte Ausgaben mit hohem erwarteten Informationsgewinn ab. Selbstüberwachtes Lernen erzeugt aus ungelabelten Daten zunächst Pseudolabels und verwendet danach überwachtes Lernen.
Unüberwachtes Lernen beschreibt Eingaben durch ein statistisches Modell und findet Kategorien oder Zusammenhänge. Clustering-Verfahren bilden Kategorien mit charakteristischen Mustern. Der EM-Algorithmus legt nicht beobachtbare Kategorien zugrunde und schätzt abwechselnd die Zugehörigkeit der Daten zu Kategorien sowie deren Parameter; eine Anwendung sind Hidden Markov Models. Verfahren wie die Hauptkomponentenanalyse übersetzen Daten in eine einfachere Repräsentation mit stark verringerter Information und können Datensätze für überwachtes Lernen vorbereiten.
Beim bestärkenden Lernen lernt ein Software-Agent durch Versuch und Irrtum eine policy, welche die Summe der rewards maximiert. Die Umgebung wird üblicherweise als Markov-Entscheidungsprozess dargestellt. Anders als klassische Verfahren wie dynamische Programmierung benötigen Verstärkungslernalgorithmen kein exaktes mathematisches Modell. Ein Beispiel ist ein Saugroboter, dessen Belohnung die in einer bestimmten Zeit aufgesaugte Staubmenge ist; weitere Einsatzfelder sind autonome Fahrzeuge und komplexe Strategiespiele wie AlphaGo.
Batch- oder Offline-Learning liest alle Daten auf einmal ein; währenddessen ist das System meist nicht nutzbar. Neue Daten erfordern ein vollständiges Training mit alten und neuen Daten. Online- oder inkrementelles Lernen trainiert schrittweise mit kleineren Datensätzen und kann sich rasch an Veränderungen anpassen, jedoch können ungeprüfte Daten, etwa von einem defekten Sensor, das Modell verschlechtern. Instanzbasiertes Lernen vergleicht neue Punkte direkt mit gespeicherten Trainingspunkten, etwa bei der Nächste-Nachbarn-Klassifikation. Modellbasiertes Lernen entwickelt dagegen ein Modell und passt dessen Parameter für Verallgemeinerungen an.
Beispieldaten müssen maschinenlesbar, relevant, repräsentativ und frei von Stichprobenverzerrungen sein. Sie müssen alle relevanten Merkmale korrekt und vollständig erfassen; unerwünschte Muster müssen entfernt werden. Ein auf Zugerkennung trainiertes neuronales Netz kann sonst etwa nur auf Gleise achten. Viele Verfahren brauchen sehr große Datensätze; bei komplizierten Problemen verbessert mehr Datenmaterial die Genauigkeit oft eher als bessere Lernalgorithmen.
Wichtige Modelle
Ein trainiertes mathematisches Modell verarbeitet neue Daten für Vorhersagen. Generative Modelle können zudem neue, den Lerndaten ähnliche Texte, Bilder oder Videos erzeugen.
Die lineare Regression erklärt eine abhängige Variable durch eine oder mehrere unabhängige Variablen. Bei der einfachen linearen Regression beschreiben zwei Parameter eine Regressionsgerade, die den linearen Zusammenhang zwischen X und Y möglichst gut darstellt. Optimiert wird eine Kostenfunktion mit der mittleren quadratischen Abweichung.
Die logistische Regression löst binäre Klassifikationsprobleme. Sie schätzt die Wahrscheinlichkeit für eine Klasse; liegt sie über 50 %, gibt sie diese Klasse aus, sonst die andere. Die Parameter werden durch Maximierung der Likelihood-Funktion bestimmt, also mit der Maximum-Likelihood-Methode.
Der k-Means-Algorithmus gruppiert ähnliche Objekte in eine vorgegebene Anzahl k von Clustern. Objekte werden dem nächstgelegenen Clusterzentrum zugeordnet. Er bevorzugt Cluster mit geringer Varianz und ähnlicher Größe; k muss vom Benutzer festgelegt werden. Meist beginnt eine approximative Variante mit zufälligen Mittelwerten und verbessert die Aufteilung schrittweise.
Support Vector Machines (SVM) sind Klassifikatoren und Regressoren. Sie suchen eine Hyperebene, welche zwei Klassen trennt und den Abstand der nächstgelegenen Objekte maximiert. Dieser breite, objektfreie Rand soll die Klassifikation neuer Objekte zuverlässiger machen. Für nicht linear trennbare Daten können SVMs mit dem Kernel-Trick nichtlineare Grenzen nutzen, ohne die rechenaufwendige Überführung in einen hochdimensionalen Raum ausdrücklich auszuführen.
Entscheidungsbäume repräsentieren Regeln durch Knoten und Zweige und Ergebnisse durch Blätter. Klassifizierungsbäume haben diskrete, Regressionsbäume kontinuierliche Ausgabewerte. Beim Training wird eine Reihenfolge von Merkmalsabfragen gewählt, die an jeder Verzweigung möglichst viel Information liefert. Random Forests mitteln die Ergebnisse mehrerer unkorrelierter Entscheidungsbäume, die auf unterschiedlichen Teilen desselben Trainingsdatensatzes trainiert sind, und verbessern damit in der Regel die Vorhersageleistung.
Künstliche neuronale Netze bestehen aus verbundenen künstlichen Neuronen. Gewichte bestimmen den Einfluss von Eingangssignalen; Aktivierungsfunktionen verarbeiten diese Signale. Gewichte und Schwellenwerte starten zufällig und werden trainiert. Neuronen sind meist in Eingabe-, versteckte und Ausgabeschichten gegliedert; viele versteckte Schichten bilden ein tiefes Netz beziehungsweise Deep Learning. Beispiele sind RNN für Sequenzen, CNN für Bild- oder Audiodaten und GPT für Sprachmodelle. GAN bestehen aus Generator und Diskriminator: Der Diskriminator unterscheidet echte von erzeugten Daten, der Generator lernt, ihn mit realistisch wirkenden Daten zu täuschen.
Anforderungen und Automatisierung
Im praktischen Einsatz ist ML oft Teil eines Produkts. Die Auswahl von Methoden und Modellen richtet sich daher nicht nur nach den Trainingsdaten, sondern auch nach Anforderungen wie Zertifizierungen für Verbrauchervorhersagen, autonome Systeme oder Fertigungsketten.
Genauigkeit ist die wichtigste Anforderung: Ist sie wegen eines zu hohen Aufwands für die Datenerhebung nicht erreichbar, müssen weitere Anforderungen nicht mehr untersucht werden. Transparenz bedeutet, dass klar ist, wo Daten wann verarbeitet und gelöscht werden. Erklärbarkeit bedeutet, dass die Entscheidungsgrundlage nachvollziehbar ist. Bei Entscheidungsbäumen ist dies grundsätzlich möglich, bei tiefen neuronalen Netzen derzeit nicht; auch tiefen Bäumen oder umfangreichen klassischen Programmen kann eine vollständige Prüfung praktisch schwerfallen. Die Analyse von Trainings- und Validierungsdaten kann zeigen, welche Eigenschaften Entscheidungen besonders beeinflussen.
Ressourcen betreffen vor allem Zeit und Energie für Training und Vorhersagen. Bei Echtzeitanwendungen kann die Antwortzeit wichtiger als die Genauigkeit sein. Datenschutz und Datensicherheit hängen häufig mit dem Ressourcenbedarf zusammen: Anonymisierung und lokales Training statt externer leistungsstärkerer Server können den Datenschutz erhöhen. Freiheit und Autonomie betreffen etwa einen sehenden Roboter als mobile Kamera; zur Vermeidung permanenter Überwachung sollen Bilder lokal verarbeitet und kurzfristig gelöscht werden. Robustheit und Sicherheit werden danach bewertet, wie wahrscheinlich Fehler sind und wie schwer ihre Folgen wiegen.
Automatisiertes maschinelles Lernen soll möglichst viele Arbeitsschritte automatisieren, insbesondere die Auswahl eines passenden Modells und die Anpassung seiner Hyperparameter.