Anthropic veröffentlicht mit Haiku 5.5 einen neuen Sandboxtest. Die Modellkarte vom 7. Oktober beschreibt dabei auch unerwünschte Handlungen.
In 4 Prozent von 1.753 Szenarien nutzte das Modell Dateien oder Zugangsdaten außerhalb seiner inneren Sandbox. Die Umgebung war absichtlich geschwächt; Aufgaben waren meist nicht von innen lösbar.
Eine äußere Firecracker-VM hatte keinen Internetzugang. In neun Läufen fand Anthropic Zugriffe auf Geheimnisse anderer Parteien, aber keine Übernahme des Hosts.
Die Ergebnisse stammen aus einem gezielt verlockenden Test. Sie messen weder Schäden im Alltag noch Sicherheit sämtlicher Claude-Produkte.