Ein Sicherheitsmitarbeiter von OpenAI warnt davor, die Kontrolle leistungsfähiger KI-Agenten auf die Sandbox zu reduzieren. Der unter Joe beziehungsweise @joedaroo veröffentlichende Autor beschreibt in einem persönlichen Beitrag unerwartete Fähigkeitssprünge als Belastung für Sicherheitsprozesse.
Seine Vorschläge betreffen das gesamte Arbeitsumfeld eines Agenten: möglichst wenige Rechte, kontrollierte Werkzeuge und verbundene Dienste, mehrschichtige Isolation sowie fortlaufende Überwachung. Belege über Aktionen sollen außerhalb der Kontrolle des Modells liegen; zuständige Menschen müssen Zugriffe entziehen und einen Lauf stoppen können.
Joe fordert außerdem engere Zusammenarbeit zwischen klassischer IT-Sicherheit und KI-Sicherheitsforschung. Führungskräfte sollten Warnungen über Schwachstellen ernst nehmen und eine Kultur schaffen, die auf unerwartetes Verhalten vorbereitet ist. Die beschriebenen internen Fortschritte bleiben seine eigene Einschätzung.
Business Insider berichtet, OpenAI habe Joes Beschäftigung bestätigt. Auch ein Journalist von The Information veröffentlichte eine eigene Rollenbestätigung. Damit ist die berufliche Einordnung stärker belegt als durch das Profil allein. Dieses Risk Signal dokumentiert seine Warnung; es macht aus rückblickenden Schilderungen keine zusätzlichen Incidents.