Prompt Injection bezeichnet einen Angriff auf KI-Systeme, bei dem eingeschleuste Anweisungen das vorgesehene Verhalten eines Sprachmodells verändern. Das kann direkt geschehen, indem ein Nutzer versucht, bestehende Vorgaben zu überschreiben, oder indirekt über Inhalte, die eine KI verarbeitet – etwa Webseiten, Dokumente oder E-Mails. Besonders problematisch wird das bei KI-Agenten, die auf Daten, Programme oder externe Werkzeuge zugreifen dürfen. Eine erfolgreiche Prompt Injection kann dann nicht nur falsche Antworten erzeugen, sondern auch vertrauliche Informationen offenlegen oder unerwünschte Aktionen auslösen. Der Angriff nutzt eine grundsätzliche Schwierigkeit heutiger Sprachmodelle: Anweisungen und zu verarbeitende Inhalte lassen sich nicht immer zuverlässig voneinander trennen. Deshalb gilt Prompt Injection als eines der wichtigen Sicherheitsprobleme bei KI-Anwendungen.