Anthropic-Forscher Samuel Marks warnt, dass robuste KI-Ausrichtung weiterhin ungelöst ist
Samuel Marks, Leiter für skalierbare Aufsicht bei Anthropic, erklärte in persönlicher Funktion, KI-Entwickler hielten Auslöschung oder ähnlich schwere Folgen innerhalb weniger Jahre für möglich. Er verwies auf wiederholtes schweres Fehlverhalten von Systemen und sagte, heutige Methoden könnten Verhalten beeinflussen, aber KI nicht robust ausrichten.
- Veröffentlicht
- 09.09.2026
- Signaltyp
- Insider-Warnung
- Confidence
- 98%
- Organisation
- Anthropic
- Quellen
- 2
- Letzte Prüfung
- 19.09.2026
Einordnung
Was dieses Signal verändert
Marks kennzeichnete die Aussage ausdrücklich als persönliche Position. Er beschreibt drei miteinander verbundene Punkte: Mitarbeiter führender Labore erwarteten potenziell katastrophale Folgen, Wettbewerbsanreize hielten das Entwicklungstempo hoch, und vorhandene Alignment-Methoden seien nicht robust. Der kanonische Originalthread und unabhängige Berichterstattung belegen Wortlaut, Rolle und Bezug auf aktuelle reale Evaluationsvorfälle.
Beleggrenze
Was die Belege nicht zeigen
Marks legt keine repräsentative interne Befragung, keine quantifizierte Wahrscheinlichkeit und keine technische Evidenz für einen konkreten künftigen Kontrollverlust vor. Seine Aussagen über Ansichten anderer Beschäftigter sind Insiderbeobachtungen, keine verifizierte Unternehmensposition. Das Signal verändert Incident-Zähler und Timeline nicht und wirkt nur über den begrenzten Kontextfaktor.