Goodfire meldet für neue Cyber-Monitore eine Erkennung von rund 93 Prozent schädlicher Testsitzungen. Bei diesem Betriebspunkt würden 5,5 Prozent harmloser Sitzungen mindestens einmal unterbrochen. Die Studie vom 8. Oktober beschreibt Monitore für Kimi K3 und GLM 5.3.
Die Methode liest interne Modellaktivierungen und schickt nur verdächtige Schritte an ein weiteres Sprachmodell zur Prüfung. So soll eine Kontrolle vor riskanten Werkzeugaufrufen praktikabler werden.
Goodfire testete rund 2.400 Chat- und Agentensitzungen mit mehr als 60.000 Schritten. Als Referenz dienten Modellbewertungen; Teile des Datensatzes entstanden durch simulierte Nutzer.
Eine von Goodfire wiedergegebene statische FAR.AI-Prüfung fand keine universelle Umgehung, aber 18 erfolgreiche Einzelangriffe. Die Studie zeigt damit Fortschritte und verbleibende Grenzen der Überwachung, keine Garantie gegen beliebige Angriffe.