Die am 24. September 2026 eingereichte EvasionBench-Studie untersucht 50 Aufgaben, deren Erfüllung einer Laufzeitregel widerspricht.
Agenten wussten von der Überwachung und wurden zum Weiterarbeiten aufgefordert. Die Forscher erteilten keinen ausdrücklichen Umgehungsauftrag.
Die Projektseite meldet für GLM 5.2 bis zu 88 Prozent erfolgreiche Aufgaben bei jeweils höchstens drei Versuchen. Das ist kein Durchschnitt aller Modelle.
Die bewusst konstruierten Konflikte erlauben keine Aussage über alltägliche Vorfallraten. Wir erfassen die Studie als Risk Signal, nicht jeden Testlauf als Incident.