Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Large Language Model

Ein Large Language Model (kurz LLM, englisch), übertragen großes Sprachmodell, ist die softwaretechnische Realisierung eines mathematischen Sprachmodells, …

Inhalt6 Abschnitte
  1. 1. Grundidee und Funktionsweise
  2. 2. Entwicklung und Modellarchitekturen
  3. 3. Angebote, offene und lokale Modelle
  4. 4. Infrastruktur, Software und Leistung
  5. 5. Multimodalität, Skalierung und Qualitätsrisiken
  6. 6. Auswirkungen, Sicherheit und Grenzen

Grundidee und Funktionsweise

Ein Large Language Model (LLM, „großes Sprachmodell“) ist die softwaretechnische Realisierung eines mathematischen Sprachmodells. Es ist ein computerlinguistisches Wahrscheinlichkeitsmodell: Es lernt aus vielen Textdokumenten statistische Beziehungen zwischen Wörtern und Sätzen und kann daraufhin Text erzeugen. LLMs gehören zum Deep Learning beziehungsweise maschinellen Lernen und zu generativer KI.

Das Training umfasst grob Datenerfassung, Modelltraining und Feinabstimmung. Danach wird das trainierte Modell bei der Inferenz abgefragt, also eingesetzt, um für neue Eingaben Vorhersagen oder Ausgaben zu erzeugen. Häufig werden vortrainierte Modelle wie GPT verwendet. Große Modelle lernen sehr viele Parameter, also Zahlenwerte, die Eingaben auf Ausgaben abbilden. Sie werden selbstüberwacht oder halbüberwacht trainiert.

Seit etwa 2018 bilden Transformer meist den Kern eines LLM. Diese neuronalen Netze analysieren Beziehungen zwischen Wörtern und lernen dadurch Kontext und Bedeutung. Ein LLM nimmt einen Eingabetext und sagt wiederholt das nächste Token voraus; ein Token ist eine Zeichenkette mit Bedeutung für das Modell und kann auch nur ein Wortteil sein. Deshalb können neue Wörter entstehen. Nach Stephen Wolfram fügt ein LLM „einfach ein Wort nach dem anderen hinzu“ und erzeugt Dinge, die sich anhand des Trainingsmaterials „richtig anhören“.

Wichtige Begriffe sind: Das Kontextfenster ist die Zahl von Tokens, die ein Modell zugleich berücksichtigen oder sich „merken“ kann. Feinabstimmung passt ein vortrainiertes Modell mit zusätzlichen Daten an bestimmte Aufgaben an. Prompt-Engineering nutzt eine gezielt formulierte Benutzereingabe, den Prompt, um ein Modell zu einer Aufgabe anzuleiten. Größere Modelle wie GPT-3 können damit ähnliche Ergebnisse wie durch Feinabstimmung erreichen. LLMs können etwa Texte zusammenfassen, übersetzen, vorhersagen und erstellen. Sie können jedoch Halluzinationen erzeugen: überzeugend formulierte, aber möglicherweise objektiv falsche Ergebnisse.

Entwicklung und Modellarchitekturen

Vorläufer moderner LLMs waren Verfahren der natürlichen Sprachverarbeitung wie die N-Gramm-Analyse, bei der Texte statistisch in Fragmente zerlegt werden. Ab den 2010er Jahren erweiterten künstliche neuronale Netze diese Fähigkeiten. Genannt werden Generative Adversarial Networks (GANs, ab 2014) und Semi-supervised Sequence Learning von 2015, das markierte und unmarkierte Daten nutzt.

Entscheidend war die Veröffentlichung „Attention Is All You Need“ eines Google-Forscherteams auf der Conference on Neural Information Processing Systems 2017. Sie stellte die Transformer-Technik mit Aufmerksamkeitsmechanismus vor und verbesserte die Sequence-to-Sequence- oder Encoder-Decoder-Architektur. Ein Encoder wandelt Eingaben wie Text in abstrakte Vektoren, Embeddings, um; ein Decoder erzeugt daraus Ausgabedaten. Der ursprüngliche Transformer nutzt Encoder und Decoder. BERT ist dagegen ein reines Encoder-Modell, während GPT-1, 2018 von OpenAI vorgestellt, ein reines Decoder-Modell ist. Decoder-GPTs verwenden maskierte Selbst-Aufmerksamkeit und sagen autoregressiv, also Token für Token, das nächste Token voraus.

BERT wurde 2018 von Google veröffentlicht; XLNet sollte BERT verbessern. GPT- und BERT-Modelle wurden mit BookCorpus trainiert, einem Korpus aus 7.000 selbstpublizierten Büchern und etwas unter einer Milliarde Wörtern. GPT-2 erschien 2019 und wurde darauf trainiert, aus den vorherigen Wörtern das nächste Wort in 40 GB Internettext vorherzusagen. Es hat 1,5 Milliarden Parameter und wurde mit 8 Millionen Webseiten trainiert. OpenAI veröffentlichte zunächst nur ein kleineres Modell und verwies auf mögliche missbräuchliche Zwecke wie Deepfakes oder irreführende Nachrichtenartikel.

GPT-3 folgte 2020. Bis GPT-3.5 waren die GPT-Modelle nur über eine API nutzbar; Ende 2022 wurde die Webschnittstelle ChatGPT veröffentlicht. GPT-4 wurde 2023 für erhöhte Genauigkeit und multimodale Fähigkeiten gelobt, doch Architektur und weitere Details wurden nicht veröffentlicht. 2024 übertraf Google Gemini Pro GPT-4 laut Elo-Bewertung. Als moderne Frontier-Modelle werden besonders fortgeschrittene Modelle mit komplexen Bausteinen wie Mixture-of-Experts (MoE) bezeichnet. Bei MoE werden relevante Teilmodelle dynamisch aktiviert; das Gegenstück heißt dichte Architektur.

Angebote, offene und lokale Modelle

LLMs werden meist als Cloud-Dienste oder Chatbots angeboten, etwa ChatGPT, Mistral AI, Ernie Bot und Grok. Anbieter können unterschiedliche Modelle oder Kombinationen in Produkte einbauen, zum Beispiel GPT oder Claude in Copilot. Manche Modelle können seit den 2020er Jahren das Internet durchsuchen und gefundene Daten auswerten. Die Lizenzen reichen von proprietär bis Open Source; Datenschutz spielt dabei eine wichtige Rolle.

Zu den genannten Herstellern und Modellen gehören OpenAI mit ChatGPT und Sora, Google/Alphabet mit Gemini und Gemma, Google AI mit LaMDA, Meta mit LLaMA, Anthropic mit Claude, xAI mit Grok, Alibaba und DeepSeek mit ihren gleichnamigen Modellen, Z.ai mit GLM, DeepL, Aleph Alpha mit Pharia und Luminous sowie Mistral AI mit Vibe, vormals Le Chat. Die Angaben zu Parametern, Modellgrößen, Kontextlängen und Benchmarkwerten sind bei mehreren Modellen unbekannt oder nur geschätzt.

Offene Modelle oder „Open Weights“-Modelle stellen die finalen Gewichte und Bias-Werte eines trainierten Netzes bereit. Die Open Source Initiative verwendet für offene KI-Modelle eine eigene Definition, die von der Definition vieler Hersteller abweicht. Beispiele sind BLOOM mit rund 176 Milliarden Parametern, 2022 von über 1.000 KI-Entwicklern veröffentlicht, und Metas kostenfreies LLaMA von 2023. Ende 2025 veröffentlichte OpenAI GPT-OSS unter der Apache-2.0-Permissive-License. GPT-OSS kann etwa hinsichtlich des Aufwands für Argumentation oder der Parameter konfiguriert werden.

Vortrainierte LLMs lassen sich auch lokal auf PC oder Workstation ausführen, beispielsweise Alibaba Qwen3, DeepSeek V3, Google Gemma 3, GPT-OSS und Mistral 3. Unterstützende Software sind Hugging Face, Ollama, LM Studio und GPT4All. Die lokale Nutzung wird vor allem durch die verfügbare Hardware begrenzt.

Infrastruktur, Software und Leistung

Training und Inferenz großer LLMs benötigen besonders viel Rechenleistung und Speicher. Das Training von GPT-4 benötigte schätzungsweise rund 50 GWh Strom und kostete etwa 100 Millionen US-Dollar; dies entspricht laut Artikel dem Stromverbrauch von San Francisco über drei Tage. Rund 4,4 Prozent des gesamten US-Stromverbrauchs entfallen bereits auf Rechen- oder Datenzentren. Das Lawrence Berkeley National Laboratory schätzt, dass bis 2028 mehr als die Hälfte des Stroms in Datenzentren für KI-Modelle verwendet wird; KI könnte dann allein so viel Strom verbrauchen wie 22 % aller US-Haushalte. ML.ENERGY Benchmark und das Teilprojekt „Zeus“ untersuchen beziehungsweise optimieren den Energieverbrauch.

Zum Einsatz kommen GPUs und andere KI-Beschleuniger mit großem Speicher, insbesondere VRAM beziehungsweise High Bandwidth Memory (HBM). Quantisierung senkt die Genauigkeit von beispielsweise 32 Bit auf 16, 8 oder 4 Bit. Sie kann Rechen- und Speicherbedarf verringern, verlangt aber einen Kompromiss zwischen Geschwindigkeit und Genauigkeit. Der Speicherbedarf lässt sich grob schätzen mit M_min ≈ P × (Q/8) × (1+O). P ist die Parameterzahl in Milliarden, Q die Präzision in Bits und O zusätzlicher Speicherbedarf für Cache und Ähnliches. Für GPT-OSS-20B ergeben sich bei 16 Bit und O = 0,2 ungefähr 48 GB, bei FP8 rund 24 GB; CPU/RAM-Offloading berücksichtigt die Formel nicht.

Neben GPUs gibt es spezialisierte Hardware wie Googles TPU, Cerebras CS-1 bis CS-3, AMD Instinct, Intel Gaudi, Nvidia Hopper und Blackwell. PyTorch und TensorFlow sind wichtige Programmbibliotheken; PyTorch kann unter anderem CUDA oder Apples Metal Performance Shaders nutzen. Bei einer Encoder-Decoder-Architektur folgen auf Encoder und Aufmerksamkeit jeweils Addieren und Normieren sowie ein Feed-Forward-Netz; der Decoder ergänzt maskierte Selbst-Aufmerksamkeit, Kreuzaufmerksamkeit, Linearisieren und Softmax. Ein GPT-Decoder kombiniert Multi-Selbst-Aufmerksamkeit, Feed-Forward-Netz und Residualverbindungen und generiert Token autoregressiv.

Zur Bewertung dienen Aufgaben und Plattformen wie AIME, GPQA Diamond, HumanEval, MMLU, TruthfulQA, Chatbot Arena und Elo-Zahl. Hardwarewerte wie FLOPS, IPS, GOPS oder TOPS sind format- und geräteabhängig. xOPS und xFLOPS sind grundsätzlich nicht gleichsetzbar; bei gleichem Format kann näherungsweise 1 MAC ≈ 2 × FLOP gelten. Genannt werden eine Nvidia H200 GPU mit 4 PetaFLOPS (FP8) bei bis zu 700 W und eine NXP Ara240 NPU mit 40 äquivalenten TOPS bei 6,5 W.

Multimodalität, Skalierung und Qualitätsrisiken

Vision-Language-Models (VLM) erweitern LLMs um Computer Vision und gehören zum multimodalen Lernen. Multimodale Modelle verarbeiten oder erzeugen verschiedene Datentypen: Text, Bilder, Audio und Video. Bei Text gehören Tokenisierung, Lemmatisierung, Syntaxanalyse, Erkennung benannter Entitäten und Textklassifizierung zu den Verfahren. Bilder werden etwa mit Convolutional Neural Networks verarbeitet; Audio stammt aus Sprachaufnahmen, Tondateien oder Live-Streams. Videos verbinden visuelle und auditive Informationen und ermöglichen beispielsweise Bewegungs-, Aktivitäts- oder Gestenerkennung.

Beim Bootstrapping Language-Image Pretraining bleiben vortrainierte Bild- und Sprachmodelle während des Vortrainings eingefroren, um Kosten zu senken und katastrophalem Vergessen entgegenzuwirken. Dies erschwert jedoch die Ausrichtung von Bild und Sprache, weil große Sprachmodelle im unimodalen Vortraining keine Bilder gesehen haben. Vortrainierte Vision-Modelle liefern hochwertige visuelle Darstellungen, LLMs starke Sprachgenerierung und Zero-Shot-Übertragung.

Skalierungsgesetze untersuchen, wie die Leistung neuronaler Netze von Faktoren abhängt. Vier zentrale Größen sind die Parameterzahl N, Datensatzgröße D, Trainingskosten beziehungsweise Zeit C und Verlust oder Fehlerrate L. Für GPT-3 wurde L = L_0 + (C_0/C)^0.048 bestätigt. Die Leistungsbewertung betrachtet die Genauigkeit der vorhergesagten Ausgabe; bei LLMs wird dafür auch die logarithmische Plausibilitätsfunktion, der Logarithmus der Perplexität, genutzt. Skalierungsgesetze sind weiterhin Gegenstand der Forschung.

Modellkollaps bezeichnet eine dauerhafte Verschlechterung der Ergebnisqualität bis zur Unbrauchbarkeit. Er kann auftreten, wenn spätere Modellversionen zunehmend mit künstlich erzeugten Daten oder Ausgaben früherer Modelle trainiert werden. Eine Vorsortierung der meist durch Webscraping gewonnenen Daten gilt bisher als zu aufwändig.

Auswirkungen, Sicherheit und Grenzen

LLMs bringen soziale, wirtschaftliche und politische Folgen mit sich. Ihr hoher Bedarf an Halbleitern, HBM-Speicher und Energie stellt die IT-Branche vor besondere Herausforderungen. Der Token-Verbrauch stieg seit Beginn der KI-Nutzung stark; im Februar 2026 überstieg der Bedarf durch agentische Anfragen den direkter menschlicher Anfragen. Als Grund nennt der Artikel den um den Faktor 15 höheren Token-Bedarf agentischer Anfragen. Der wachsende Strombedarf führt auch zu Diskussionen über Kernenergie, Small Modular Reactors sowie Speicher- und Steuerungsmöglichkeiten für nachhaltig erzeugte Energie.

Sicherheitsrisiken betreffen unter anderem Cybersecurity, militärische Nutzung und die Weitergabe leistungsfähiger Hardware. Joe Biden ordnete 2023 die Executive Order 14110 „Executive Order on Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence“ an. Exportkontrollen begrenzen etwa die Weitergabe moderner US-Halbleitertechnologie nach China. Anthropic kündigte im April 2026 „Mythos“ an, stellte es aber wegen möglicher Cybersecurity-Risiken nicht öffentlich bereit; in ersten Tests fand das Modell Zero-Day-Schwachstellen, die teils seit zwanzig Jahren offenstanden. Fachleute sehen zugleich die Möglichkeit, Angriffe mit solchen Fähigkeiten besser abzuwehren.

Für die KI-gestützte Kriegsführung beschafft das Pentagon seit spätestens 2025 moderne KI und richtete das Chief Digital and Artificial Intelligence Office (CDAO) ein. KI kann Auswertung und Zielidentifikation beschleunigen, die kill chain verkürzen und zu decision compression führen: Kommandeure müssen rascher und mehr Entscheidungen treffen. Anfang 2026 stritten Anthropic und Pentagon über den Einsatz von Claude in autonomen Waffensystemen und zur Massenüberwachung. Fachleute sehen außerdem Schwierigkeiten bei der Anbindung an eine stark fragmentierte Datenlandschaft.

Werkzeuge zur Erkennung LLM-generierter Texte liefern nur Anhaltspunkte, keine Beweise. Ihre hohen Genauigkeitsangaben beruhen oft auf vorgegebenen Testdaten unter Laborbedingungen; die Übertragbarkeit auf Alltagssituationen ist umstritten. Kritisiert werden eingeschränkte Testdaten und niedrigere Erkennungsraten auf fremden Datensätzen. Besonders Menschen, die nicht in ihrer Muttersprache oder weniger sprachgewandt schreiben, könnten häufiger fälschlich als KI-generiert eingestuft werden.

Weiterlesen

Softwaretechnik ... Agile Softwareentwicklung. Die Softwaretechnik umfasst den gesamten Prozess von der Identifizierung des Bedarfs bis hin zur Inbetriebnahme einer konkreten … Textgenerierung Die Generierung von Texten ist sowohl ein Teilbereich der Computerlinguistik als auch der künstlichen Intelligenz. Für eine Beispielanwendung zur … Wahrscheinlichkeitstheorie Bedingte Wahrscheinlichkeit. Bearbeiten. Unter einer bedingten Wahrscheinlichkeit versteht man die Wahrscheinlichkeit für das Eintreten eines Ereignisses A … Algorithmus Algorithmen bestehen aus endlich vielen, wohldefinierten Einzelschritten. ... Damit können sie zur Ausführung in ein Computerprogramm implementiert, aber auch in … Künstliche Intelligenz Künstliche Intelligenz (kurz KI, englisch artificial intelligence, kurz AI) ist ein Forschungs- und Anwendungsgebiet der Informatik. Deep Learning Deep Learning erlaubt die Verarbeitung und Analyse komplexer Datenmuster; dazu verwendet Deep Learning tiefe hierarchische neuronale Netze, die automatisch … Maschinelles Lernen Maschinelles Lernen (ML) entwickelt, untersucht und verwendet statistische Algorithmen, auch Lernalgorithmen genannt. Solche Algorithmen können lernen, … Generatives KI-Modell Ein generatives KI-Modell (englisch GenAI) ist ein Modell der künstlichen Intelligenz, das auf Grundlage erlernter Trainingsdaten neue Inhalte erzeugt, … Computer Vision Durch Aneinanderreihung in einer Zeile erhält man einen Zeilensensor und entsprechende Anordnung in einer Fläche erhält man einen flächenhaften Sensor. Künstliches neuronales Netz Ein künstliches neuronales Netz besteht aus mehreren künstlichen Neuronen, die miteinander verbunden sind und in der Regel in Schichten organisiert werden. Im … Transformer (Maschinelles Lernen) Ein Transformer ist eine von Google weiterentwickelte Deep Learning (DL)-Architektur, die einen sogenannten „Aufmerksamkeitsmechanismus“ (englisch … Syntax Die Syntax behandelt Sätze nicht nur als eine Aneinanderreihung von Wörtern, sondern arbeitet eine zugrundeliegende Satzstruktur heraus, die neben der …