Alex Mallen argumentiert in einem am 2. Oktober bei Redwood Research veröffentlichten Beitrag, dass zusätzliche Sicherheitsoptionen allein KI nicht sicherer machen. Entscheidend sei, welche Möglichkeiten Entwickler tatsächlich nutzen.
Sein Modell vergleicht Sicherheit und Nützlichkeit. Leistungsfortschritte könnten stärkere Schutzmaßnahmen ermöglichen, zugleich aber den Anreiz erhöhen, zugunsten nützlicherer Systeme mehr Risiko hinzunehmen.
Unter glaubwürdiger Zurückhaltung bei weiterer Leistungssteigerung könnten bestimmte Forschungsarbeiten dagegen Sicherheit verbessern. Mallen beschreibt das als bedingtes Zukunftsszenario, nicht als Rechtfertigung des heutigen Wettlaufs.
Dieses Risk Signal dokumentiert eine Forschungsbewertung, keinen neuen Vorfall. Mallen nennt selbst Grenzen: Entwickler verfügen nicht über perfekte Informationen, und Sicherheit lässt sich schwer messen. Das Modell liefert keine empirische Kontrollverlustwahrscheinlichkeit.