Eine KI bekommt ihre Informationen nicht aus einer einzigen Datenbank. Bei großen Sprachmodellen stammen sie zunächst aus umfangreichen Trainingsdaten. Dazu können öffentlich zugängliche Inhalte aus dem Internet, lizenzierte Daten sowie Inhalte gehören, die von menschlichen Trainern, Forschern oder Nutzern bereitgestellt oder erzeugt wurden.
Beim Training werden diese Inhalte allerdings nicht einfach wie in einem Archiv gespeichert. Das Modell untersucht Muster und Zusammenhänge in Texten, Bildern oder anderen Daten. Dabei werden seine internen Parameter angepasst. Später erzeugt es Antworten auf Grundlage dieser erlernten Muster. Es schlägt also nicht zwangsläufig eine konkrete Webseite oder ein bestimmtes Buch nach.
Davon zu unterscheiden ist der Zugriff auf aktuelle Informationen. Manche KI-Systeme können zusätzlich Suchmaschinen, Datenbanken, hochgeladene Dokumente oder andere externe Quellen verwenden. Dann basiert eine Antwort teilweise auf Informationen, die eigens für die aktuelle Anfrage abgerufen wurden. Ohne solchen Zugriff kennt ein Modell neue Ereignisse nach seinem Trainingsstand möglicherweise nicht.
Welche Daten genau verwendet wurden, hängt vom jeweiligen Anbieter und Modell ab. Deshalb lässt sich aus einer KI-Antwort nicht automatisch erkennen, aus welcher ursprünglichen Quelle eine einzelne Information stammt.
Quellen:
▪︎ OpenAI: How ChatGPT and our foundation models are developed
▪︎ OpenAI: How ChatGPT learns about the world while protecting privacy
▪︎ OpenAI: Our approach to data and AI