Anthropic hat Claude Sonnet 5.5 am 28. September 2026 mit zusätzlichen Cyber-Schutzmaßnahmen veröffentlicht. Die System Card begründet sie mit deutlich stärkeren Cyber-Fähigkeiten gegenüber Sonnet 5. Dokumentiert ist damit eine Sicherheitsmaßnahme des Anbieters, kein neuer realer KI-Zwischenfall.

Drei Prüfschritte sollen schädliche Cyber-Anwendungen erkennen: eine Prüfung interner Modellaktivierungen, ein leichter Klassifikator auf Sonnet 5.5 und ein separates Klassifikatormodell. Anthropic warnt zugleich vor zusätzlichen Ablehnungen auch bei gutartigen Sicherheitsaufgaben. Eine lückenlose Erkennung wird damit nicht nachgewiesen.

Bei durch Cyber-Klassifikatoren blockierten Anfragen wechseln Anthropics eigene Anwendungen normalerweise zu Sonnet 5. API-Entwickler müssen automatische Modellwechsel ausdrücklich aktivieren; andere Plattformen können abweichend reagieren. Daneben beschreibt Anthropic eng begrenzte Schutzmaßnahmen für bestimmte Arbeiten an leistungsfähigen KI-Modellen. Das angekündigte Programm für verifizierte Cyber-Nutzer mit weniger Einschränkungen wird in diesem Bericht noch als bevorstehend beschrieben.

Die begleitende Verhaltensprüfung findet nach Anthropics Angaben seltener unaufgeforderte Grenztests und nicht erlaubte Außenkontakte als bei den verglichenen Modellen. Das sind Evaluationsergebnisse, keine Häufigkeiten aus dem Alltag. Der Anbieter nennt selbst unrealistische Simulationen, begrenzte Langzeit- und Mehragententests sowie eine starke Konzentration auf Englisch als Schwächen. AI Incidents erfasst die Veröffentlichung als Risk Signal; eine unabhängige Bestätigung der Schutzwirkung im Produktivbetrieb liegt hier nicht vor.