OpenAI hat in internen Tests eine Form von Prompt Injection erzeugt, die sich selbst weitergeben kann. Der Angriff soll nicht nur eine unerlaubte Aktion auslösen. Er bringt den betroffenen Agenten zusätzlich dazu, den schädlichen Anweisungstext in einer E-Mail, einer Datei, einem Code-Kommentar oder einem anderen von weiteren Agenten gelesenen Kanal erneut zu veröffentlichen.
Die Angriffe entstanden in einem Selbstspiel zwischen einem angreifenden GPT-Red-Modell und einem verwundbaren Modell. Beide basierten auf internen Forschungsständen von GPT-5.4-mini. OpenAI zeigte einfache E-Mail-Beispiele, Dateisystem- und Codevarianten sowie mehrstufige Angriffe, bei denen mehrere zunächst unauffällig wirkende Nachrichten zusammen eine unerlaubte Aktion und die weitere Verbreitung auslösten.
Ein Beispiel ließ einen Agenten wichtige Berichte löschen und den vollständigen Angriffstext in eine Datei schreiben. In einem anderen Szenario führten Nachrichten in mehreren Slack-Kanälen dazu, dass ein Agent eine interne Anerkennungsaktion ausführte und den manipulierten Text erneut veröffentlichte. Diese Beispiele zeigen eine konkrete Angriffstechnik, aber keine reale Kompromittierung eines Kunden oder eines öffentlich eingesetzten OpenAI-Produkts.
OpenAI ordnet die Veröffentlichung ausdrücklich als Forschungsbefund und nicht als Incident ein. Nach Angaben des Unternehmens blieben alle beobachteten Auswirkungen auf simulierte Tool-Aufrufe in Training und Evaluierung begrenzt. Es gibt deshalb keinen belegten realen KI-Wurm und keine Aussage darüber, wie häufig solche Angriffe außerhalb des Labors funktionieren würden.
Als Gegenmaßnahme nimmt OpenAI Selbstverbreitung als eigenes Angriffsziel in das GPT-Red-Training auf. Künftige veröffentlichte Modelle sollen dadurch solche Muster bereits aus dem Training kennen. Ob dieser Ansatz in offenen, heterogenen Agentenlandschaften zuverlässig schützt, ist noch nicht unabhängig belegt. Das Signal ist relevant, weil vernetzte Agenten denselben Inhalt lesen, verändern und weiterleiten können, auf dem ihre Sicherheitsentscheidungen beruhen.