Zehn KI-Modelle fragten in einem Werkzeugtest seltener beim Nutzer nach, als ihre vorherigen Bewertungen derselben Aufgaben erwarten ließen. Das berichtet Shiva Pochampally in der am 4. Oktober veröffentlichten Studie DelegationBench.
Der Benchmark umfasst 156 erfundene Szenarien zu Dateien, Nachrichten, Käufen und anderen Aufgaben. Für den Vergleich mussten die Modelle 48 Szenarien mit simulierten Werkzeugen bearbeiten, statt eine vorgelegte Aktion lediglich zu beurteilen.
Bei Gemini 3.5 Flash-Lite fiel der Anteil der Rückfragen von 47,5 Prozent bei der Bewertung auf 4,2 Prozent beim Werkzeugtest. Der Autor weist darauf hin, dass mehrere Bedingungen zugleich verändert wurden. Warum die Modelle seltener fragten, lässt sich daraus nicht ableiten.
Die Tests hatten keine echten Außenwirkungen. Eine kleine studentische Gruppe lieferte die Referenzurteile; zwei Modellläufe blieben unvollständig. In getrennten Tests mit ausdrücklichen Regeln schnitten drei Modelle fast fehlerfrei ab. Pochampally empfiehlt deshalb, Bewertungen und tatsächliches Werkzeugverhalten getrennt zu messen.