Machine LearningLarge Language Models

Large Language Models

Die Geburt von ChatGPT

ChatGPT entstand aus der GPT-Modellreihe und wurde für interaktive Dialoge optimiert. Die Vorgängermodelle GPT und GPT-2 zeigten bereits, wie sich vortrainierte Transformer für die Verarbeitung und Erzeugung natürlicher Sprache einsetzen lassen. Spätere Modelle verbesserten Kontextverarbeitung, Bedienbarkeit und Sicherheitsmechanismen. Heute werden solche Systeme unter anderem in Bildung, Forschung und Wirtschaft verwendet.

Meilensteine

DatumEreignis
Juni 2018GPT (Generative Pre-trained Transformer)
Februar 2019GPT-2
Juni 2020GPT-3 wird veröffentlicht
November 2022ChatGPT wird auf Basis von GPT-3 entwickelt und optimiert
März 2023Veröffentlichung der API für GPT-3.5 und GPT-4
Mai 2023Neues Preismodell für die Nutzung der OpenAI-Dienste
Juli 2021GitHub Copilot
Februar 2023Claude Sonnet
November 2023Amazon Q

Funktionsweise von LLMs

Large Language Models (LLMs) wie ChatGPT beruhen auf neuronalen Netzwerken, insbesondere auf Transformer-Architekturen. Diese Modelle analysieren große Textmengen und lernen dabei Muster, Bedeutungen und Zusammenhänge zwischen Wörtern. Ein zentraler Mechanismus ist die Selbstaufmerksamkeit (Self-Attention), die es dem Modell ermöglicht, relevante Kontextinformationen zu jedem Wort dynamisch zu berücksichtigen.

Bei manchen Modellen ist Reinforcement Learning with Human Feedback (RLHF) ein Teil der nachgelagerten Abstimmung. Menschen vergleichen dabei Modellausgaben; aus diesen Bewertungen wird ein Belohnungsmodell abgeleitet. Damit lässt sich das Antwortverhalten stärker an vorgegebene Erwartungen ausrichten.

Anfänge

OpenAI veröffentlichte 2018 das erste GPT-Modell. Es zeigte, wie sich ein vortrainiertes Sprachmodell durch nachgelagertes Training für unterschiedliche Aufgaben anpassen lässt. Umfang und Fähigkeiten lagen noch deutlich unter denen späterer Modelle.

Fortschritte mit GPT-2 und GPT-3

2019 folgte GPT-2 mit größerem Modellumfang und einer verbesserten Erzeugung zusammenhängender Texte. GPT-3 erschien 2020 mit 175 Milliarden Parametern und ließ sich für verschiedene Aufgaben einsetzen, darunter Text- und Codeerzeugung.