SafeActBench untersucht, ob KI-Agenten nötige Belege prüfen, bevor sie Werkzeuge einsetzen. Hongzhan Lin und fünf Mitautoren veröffentlichten den Preprint am 6. Oktober. Der Benchmark umfasst 656 synthetische Fälle in sechs Aufgabenbereichen.
Zehn Modell-Werkzeug-Konfigurationen wurden bewertet. Bei drei Konfigurationen auf denselben Fällen lag die statische Entscheidungsgenauigkeit bei mindestens 95 Prozent, der Erfolg in der interaktiven Ausführung dagegen bei höchstens 52 Prozent.
In den V1-Episoden mit einem Aktionsversuch handelten je nach Konfiguration 37,0 bis 66,9 Prozent vor vollständiger Belegprüfung. Diese Anteile beziehen sich auf eine Teilmenge des kontrollierten Benchmarks, nicht auf alle Aufgaben oder den Produktiveinsatz.
Ein deterministischer Prüfer verfolgt, welche Belege vor welcher Aktion vorlagen. Er bewertet weder verborgene Gedanken noch reale Schadensfälle. Manche Aktionen wären nach vollständiger Prüfung erlaubt gewesen; der Test misst vor allem, ob Agenten den erforderlichen Prüfweg einhalten.