Large Language Models
Die Geburt von ChatGPT
ChatGPT entstand aus der GPT-Modellreihe und wurde für interaktive Dialoge optimiert. Die Vorgängermodelle GPT und GPT-2 zeigten bereits, wie sich vortrainierte Transformer für die Verarbeitung und Erzeugung natürlicher Sprache einsetzen lassen. Spätere Modelle verbesserten Kontextverarbeitung, Bedienbarkeit und Sicherheitsmechanismen. Heute werden solche Systeme unter anderem in Bildung, Forschung und Wirtschaft verwendet.
Meilensteine
| Datum | Ereignis |
|---|---|
| Juni 2018 | GPT (Generative Pre-trained Transformer) |
| Februar 2019 | GPT-2 |
| Juni 2020 | GPT-3 wird veröffentlicht |
| November 2022 | ChatGPT wird auf Basis von GPT-3 entwickelt und optimiert |
| März 2023 | Veröffentlichung der API für GPT-3.5 und GPT-4 |
| Mai 2023 | Neues Preismodell für die Nutzung der OpenAI-Dienste |
| Juli 2021 | GitHub Copilot |
| Februar 2023 | Claude Sonnet |
| November 2023 | Amazon Q |

Funktionsweise von LLMs
Large Language Models (LLMs) wie ChatGPT beruhen auf neuronalen Netzwerken, insbesondere auf Transformer-Architekturen. Diese Modelle analysieren große Textmengen und lernen dabei Muster, Bedeutungen und Zusammenhänge zwischen Wörtern. Ein zentraler Mechanismus ist die Selbstaufmerksamkeit (Self-Attention), die es dem Modell ermöglicht, relevante Kontextinformationen zu jedem Wort dynamisch zu berücksichtigen.
Bei manchen Modellen ist Reinforcement Learning with Human Feedback (RLHF) ein Teil der nachgelagerten Abstimmung. Menschen vergleichen dabei Modellausgaben; aus diesen Bewertungen wird ein Belohnungsmodell abgeleitet. Damit lässt sich das Antwortverhalten stärker an vorgegebene Erwartungen ausrichten.
Anfänge
OpenAI veröffentlichte 2018 das erste GPT-Modell. Es zeigte, wie sich ein vortrainiertes Sprachmodell durch nachgelagertes Training für unterschiedliche Aufgaben anpassen lässt. Umfang und Fähigkeiten lagen noch deutlich unter denen späterer Modelle.
Fortschritte mit GPT-2 und GPT-3
2019 folgte GPT-2 mit größerem Modellumfang und einer verbesserten Erzeugung zusammenhängender Texte. GPT-3 erschien 2020 mit 175 Milliarden Parametern und ließ sich für verschiedene Aufgaben einsetzen, darunter Text- und Codeerzeugung.