Eine neue Studie findet Datenlecks auch dann, wenn eine zusätzliche Kontrollinstanz die Aktionen von KI-Agenten prüft. Shouju Wang und Haopeng Zhang veröffentlichten ihre Arbeit AgentPrivArena am 5. Oktober auf arXiv.
Die Forschenden ließen fünf Modelle 389 synthetische Aufgaben in selbst betriebenen Diensten ausführen. Nach ihren Messungen sank die durchschnittliche Weitergabe geschützter Informationen mit kontextbezogener Laufzeitkontrolle von 46,8 auf 17,8 Prozent der Aufgaben.
Die Kontrollinstanz erfasst Informationen nach Lesezugriffen und prüft sie vor ausgehenden Schreibaktionen. Sie übersah jedoch einen Teil der bereits gelesenen geschützten Fakten. Auch wiederholtes Verallgemeinern konnte einzelne Antworten unbrauchbar machen.
Die Ergebnisse beruhen auf Urteilen von Sprachmodellen; eine menschliche Prüfung war noch nicht abgeschlossen. Sämtliche Daten waren erfunden und die Dienste vom offenen Internet getrennt. Die Autoren warnen zudem, dass ihre Kontrolle bei einem Ausfall Aktionen zulässt und deshalb keinen verlässlichen Schutz gegen gezielte Angriffe garantiert.