Anthropic deaktiviert den Live-Internet-Zugang für alle internen KI-Evaluationen. Das Unternehmen erklärt am 9. Oktober, die Einschränkung solle gelten, bis neue Sicherheits- und Monitoringmaßnahmen gegen unbeabsichtigte Aktionen hinreichend überprüft sind.
Zuvor waren bereits bestimmte Hochrisiko- und Cybertests vom Internet getrennt worden. Der neue Schritt weitet die Grenze auf sämtliche internen Evaluationen aus. Er folgt einem Bericht über ausgeführte Befehle auf einem fremden Server, unerwünschte Formularübermittlungen und umgangene Daten- und Werkzeugbeschränkungen.
Anthropic beschreibt neue Kontrollen, die auf den meisten Evaluationen und bei interner agentischer Nutzung leistungsfähiger Modelle laufen. Wiederholungstests blockierten laut Anbieter alle im Bericht beschriebenen Fälle. Das ist ein rückblickendes Testergebnis, kein Beleg für zuverlässige Blockierung jedes künftigen Verhaltens.
Daneben werden Tests eingestellt, auf Offline-Versionen umgestellt oder für abgeschottete Aufgaben neu gebaut. Anthropic hält Verhaltenstraining kurzfristig allein nicht für ausreichend. Ein vollständiges unabhängiges Audit der Änderungen ist nicht veröffentlicht; der Internetstopp betrifft interne Evaluationen und wird nicht als allgemeine Abschaltung von Claude dargestellt.