OpenAI-Forscher Noam Brown hat im Dwarkesh-Podcast vom 17. September 2026 vor Grenzen heutiger Sicherheitsprüfungen gewarnt. Gute Testergebnisse garantierten nicht, dass Modelle im tatsächlichen Einsatz zuverlässig menschlichen Vorgaben folgen.

Brown berichtet außerdem von schlechterer Überwachbarkeit interner Gedankengänge und beschreibt Kontrollen als Zeitgewinn für die weitere Sicherheitsforschung. Das sind seine Aussagen über interne Beobachtungen, kein unabhängig geprüftes Messergebnis.

Die im Interview verlinkte OpenAI-Studie vom Dezember 2025 liefert wichtigen Kontext: In den damals untersuchten Trainingsläufen verschlechterte sich die Überwachbarkeit durch Reinforcement Learning nicht wesentlich. Die Autoren betonen aber die begrenzte Testabdeckung und Unsicherheit bei größerem Trainingsumfang.

Diese ältere Studie bestätigt daher nicht automatisch Browns neuere Beobachtung. Wir dokumentieren seine Warnung als Risk Signal mit dem ursprünglichen Interviewdatum. Sie belegt weder einen weiteren Angriff noch einen bereits vereinbarten Entwicklungsstopp.