Wikipedia · einfach zusammengefasst · Stand
Generatives KI-Modell
Ein generatives KI-Modell (englisch GenAI) ist ein Modell der künstlichen Intelligenz, das auf Grundlage erlernter Trainingsdaten neue Inhalte erzeugt, …
Inhalt5 Abschnitte
Grundidee und Bedeutung
Ein generatives KI-Modell (GenAI) ist ein Modell der künstlichen Intelligenz, das aus erlernten Trainingsdaten neue Inhalte erzeugt. Dazu gehören Texte, Bilder, Audio, Video und Programmcode. Das Modell lernt Muster und Strukturen der Trainingsdaten und erzeugt daraus neue Daten mit ähnlichen Eigenschaften, die so nicht in den Trainingsdaten vorkamen.
Bekannte Anwendungen sind Chatbots wie ChatGPT und Claude, Bildgeneratoren wie DALL-E und Midjourney sowie Videogeneratoren wie Sora. Seit den 2020er Jahren hat sich die Verbreitung generativer KI durch Fortschritte im Deep Learning und durch große Sprachmodelle (LLMs) auf Grundlage der Transformer-Architektur stark erhöht.
In der statistischen Klassifikation unterscheidet man zwei Hauptansätze: den generativen und den diskriminativen Ansatz. Sie berechnen Klassifikatoren mit unterschiedlichen Methoden und unterscheiden sich darin, wie umfassend sie statistische Verteilungen modellieren.
Generative Modelle und ihre Definitionen
Ein generatives Modell ist üblicherweise ein statistisches Modell der gemeinsamen Wahrscheinlichkeitsverteilung P(X,Y). X bezeichnet eine beobachtbare Variable mit konkreten Werten x; Y ist eine Ziel- oder Ausgangsvariable mit konkreten Werten beziehungsweise Objekten y, den sogenannten Labels. Mit einem generativen Modell lassen sich zufällige Ergebnisse einer Beobachtung x und einer Zielvariablen y, also (x,y), erzeugen.
Eine alternative, symmetrische Definition beschreibt ein generatives Modell als Modell der bedingten Wahrscheinlichkeitsverteilung P(X|Y=y). Es modelliert also die beobachtbare Variable X unter der Bedingung, dass die Zielvariable den Wert y besitzt. Unabhängig von der genauen Definition kann ein generatives Modell zufällige Instanzen entweder von (x,y) oder von x gegeben y erzeugen.
Der Ausdruck „generatives Modell“ wird außerdem für Modelle verwendet, die Ausgabevariablen erzeugen, ohne dass eine klare Beziehung zu Wahrscheinlichkeitsverteilungen über mögliche Eingabestichproben besteht. Erzeugende gegnerische Netze (GANs) gehören zu dieser Klasse und werden vor allem danach beurteilt, wie ähnlich ihre Ausgaben möglichen Eingaben sind. Solche Modelle sind keine Klassifikatoren.
Bei Klassifikationsaufgaben ist X häufig kontinuierlich, während Y im Allgemeinen diskret ist und aus einer endlichen Menge von Labels besteht. Die bedingte Verteilung P(Y|X) kann als nichtdeterministische Zielfunktion f: X → Y verstanden werden: X steht für die Eingaben und Y für die Ausgaben.
Zusammenhang der Wahrscheinlichkeitsverteilungen
Bei einer endlichen Menge von Labels sind die beiden Definitionen generativer Modelle eng verbunden. Die gemeinsame Verteilung setzt sich aus der Verteilung der Labels P(Y) und der Verteilung der Beobachtungen unter einem Label P(X|Y) zusammen:
P(X,Y)=P(X|Y)P(Y).
Aus der gemeinsamen Verteilung können die Randverteilungen berechnet werden:
P(X)=∑y P(X,Y=y) und P(Y)=∫x P(Y,X=x).
Dabei wird X als kontinuierlich betrachtet und integriert, während Y als diskret betrachtet und summiert wird. Aus der gemeinsamen Verteilung ergeben sich außerdem die bedingten Verteilungen:
P(X|Y)=P(X,Y)/P(Y) und P(Y|X)=P(X,Y)/P(X).
Wenn eine bedingte Verteilung sowie geschätzte Verteilungen P(X) und P(Y) bekannt sind, kann die jeweils entgegengesetzte bedingte Verteilung mithilfe der Bayesschen Regel geschätzt werden:
P(X|Y)P(Y)=P(Y|X)P(X).
Aus einem generativen Modell P(X|Y) folgt beispielsweise:
P(Y|X)=P(X|Y)P(Y)/P(X).
Aus einem diskriminativen Modell P(Y|X) kann entsprechend geschätzt werden:
P(X|Y)=P(Y|X)P(X)/P(Y).
Die Bayessche Regel und die Definition der bedingten Wahrscheinlichkeitsverteilung werden häufig verwechselt. Erstere berechnet eine bedingte Verteilung aus der jeweils anderen; letztere leitet sie aus der gemeinsamen Verteilung ab.
Diskriminative Modelle und der zentrale Unterschied
Ein diskriminatives Modell modelliert die bedingte Wahrscheinlichkeitsverteilung P(Y|X=x) der Zielvariablen Y bei einer gegebenen Beobachtung x. Es bestimmt also, welches Label oder welche Wahrscheinlichkeitsverteilung über Labels zu einer Beobachtung gehört.
Ein diskriminativer Algorithmus fragt nicht, wie die Daten erzeugt wurden, sondern kategorisiert ein gegebenes Signal direkt. Er lernt P(Y|X) aus den Daten. Ein generativer Algorithmus modelliert dagegen, wie die Daten entstanden sein könnten: Er lernt P(X,Y) und kann daraus später P(Y|X) für die Klassifikation berechnen. Der Vorteil des generativen Ansatzes besteht darin, dass P(X,Y) zusätzlich zur Erzeugung neuer, ähnlicher Daten genutzt werden kann.
Bei der Klassifikation gibt es drei Möglichkeiten: einen verteilungsfreien Klassifikator ohne Wahrscheinlichkeitsverteilung, ein diskriminatives Modell mit direkter Schätzung von P(Y|X=x) oder ein generatives Modell, das zunächst P(X,Y) schätzt und daraus P(Y|X=x) berechnet. Diese Ansätze werden zunehmend indirekter, aber auch zunehmend probabilistisch, wodurch mehr Domänenwissen und Wahrscheinlichkeitstheorie eingesetzt werden können. Je nach Problem werden auch hybride Verfahren genutzt.
Diskriminative Modelle müssen die Verteilung der beobachteten Variablen nicht modellieren. Sie können jedoch im Allgemeinen keine ebenso komplexen Beziehungen zwischen beobachteten Variablen und Zielvariablen ausdrücken. Dennoch erzielen manche diskriminativen Algorithmen bei Klassifikationsaufgaben bessere Ergebnisse als manche generativen Algorithmen. Bei Klassifikations- und Regressionsaufgaben schneiden diskriminative Modelle aber nicht grundsätzlich besser ab. Beide Modellklassen gelten als komplementär beziehungsweise als unterschiedliche Sichtweisen auf dasselbe Verfahren.
Typische diskriminative Modelle sind logistische Regression, Support Vector Machines, Entscheidungsbaumlernen, Random Forests und Maximum-Entropie-Markov-Modelle.
Tiefe Modelle, Modellarten und Kritik
Mit dem Deep Learning entstand die Familie der tiefen, mehrschichtigen generativen Modelle (DGMs). Sie verbinden generative Modelle mit tiefen künstlichen neuronalen Netzen. Größere neuronale Netze werden typischerweise mit größeren Trainingsdatenmengen verbunden; beides ist für eine gute Leistung erforderlich.
Zu den populären DGMs gehören Variational Autoencoders (VAEs), generative gegnerische Netzwerke (GANs) und autoregressive Modelle. Ein Trend geht zu sehr großen, tiefen generativen Modellen. GPT-2 und GPT-3 sind autoregressive neuronale Sprachmodelle mit Milliarden von Parametern. Auch KI-Systeme zur Bildgenerierung können Milliarden Parameter besitzen. Die elektronische Jukebox ist ein sehr großes generatives Modell für musikalisches Audio und enthält ebenfalls Milliarden von Parametern.
Weitere Arten generativer Modelle sind Hidden-Markov-Modelle, Bayes-Klassifikatoren wie Naive Bayes und autoregressive Modelle, latente Dirichlet-Zuweisung, Boltzmann-Maschinen einschließlich eingeschränkter Boltzmann-Maschinen und Deep-Belief-Netzwerken, Variational Autoencoders, generative gegnerische Netze sowie Diffusionsmodelle, insbesondere zur Bilderzeugung.
Kritisiert werden vor allem der sehr hohe Energie- und Ressourcenverbrauch, mögliche negative Auswirkungen auf Denkprozesse und kognitive Fähigkeiten sowie offene Folgen für Menschen und Umwelt. Nach Einschätzungen, die im Artikel wiedergegeben werden, lassen sich Auswirkungen auf Aufmerksamkeit, Problemlösefähigkeit und kritisches Denken sowie auf neurologische Prozesse beobachten; das Ausmaß dieser Folgen wird weiterhin erforscht. Genannte weitere Kritikpunkte sind eine geringere Entfaltung individueller Denkleistung, von der jeweiligen Anwendung abhängige Datensicherheit, Diskriminierung durch unausgewogene Trainingsdaten und mögliche Monopole weniger Betreiberunternehmen, die eigene Regeln festlegen.
Ein zusätzliches Problem ist die Zuverlässigkeit der Ausgaben: Generative KI kann Daten frei erfinden. ChatGPT erstellte sogar Gerichtsurteile, die in Wirklichkeit nicht existierten. Dadurch beriefen sich Anwälte auf vermeintliche Präzedenzfälle, ohne sie zuvor zu überprüfen.