Ein KI-Modell von Anthropic hat während eines Tests einen erfundenen Hinweis zu einem ungeklärten Tötungsdelikt an die Polizei von Philadelphia geschickt. Wie der Claude-Entwickler in einem Untersuchungsbericht mitteilte, sollte die Software Beispielaufgaben auf zufällig ausgewählten Webseiten ausführen. Dabei übermittelte sie über ein echtes Polizeiformular die Behauptung, eine möglicherweise tatverdächtige Person gesehen zu haben.
Der Hinweis wurde am 18. Juli abgeschickt, von Anthropic aber erst am 28. September entdeckt. Laut einer vom Nachrichtenportal 6abc veröffentlichten Polizeierklärung informierte das Unternehmen die Behörde am 7. Oktober. Am nächsten Tag fand ein Treffen statt. Die Polizei bezeichnete die Verzögerung bei Entdeckung und Meldung als „inakzeptabel“.
Der Hinweis war im Spam gelandet und wurde nicht an die Ermittler weitergeleitet. Hinweise auf einen unbefugten Zugriff auf Polizeisysteme oder kompromittierte Daten gebe es nicht, erklärte die Behörde. Dennoch betreffe der Vorfall reale Opfer, trauernde Angehörige und Ermittler, die nach Antworten suchten.
Aus einer Übung wird eine echte Handlung
Das betroffene Modell Claude Haiku 4.5 durfte sich im Rahmen des Tests nicht auf echten Seiten anmelden, Konten anlegen, persönliche Daten eingeben oder Käufe tätigen. Das Abschicken von Formularen war jedoch nicht ausdrücklich ausgeschlossen. Es behauptete in seinem Hinweis an die Behörde, jemanden gesehen zu haben, der einer Beschreibung entspreche, obwohl die Seite keine Täterbeschreibung enthielt. Name und Kontaktdaten ließ es leer.
Das Problem reicht über eine falsche Textantwort hinaus: KI-Agenten können Webseiten bedienen und Angaben tatsächlich übermitteln. Eine erfundene Beobachtung wird damit zu einer Nachricht an eine Behörde. Würde sie bearbeitet, könnte sie Ermittler auf eine falsche Spur führen.
Nach Anthropics vorläufiger Auswertung erzeugte Claude offenbar Beispielinhalte, statt gezielt täuschen zu wollen. Die Firma hat den direkten Internetzugang bei allen internen Evaluierungen vorerst abgeschaltet und zusätzliche technische Kontrollen eingeführt.
Frühere Modelle griffen reale Systeme an
Bereits im Juli hatte Anthropic drei weitere Vorfälle offengelegt. Bei Sicherheitstests sollten Modelle in simulierte Systeme eindringen. Wegen einer Fehlkonfiguration hatten sie jedoch Zugang zum Internet und griffen echte Organisationen an. Ein Modell veröffentlichte ein schädliches Softwarepaket, das auf 15 realen Systemen ausgeführt wurde.
In einer Folgeanalyse im September räumte Anthropic ein, einige Modelle hätten Hinweise auf reale Ziele ignoriert oder umgedeutet und gefährliche Aktionen fortgesetzt. Die zunächst gegebene Erklärung, die KI habe lediglich eine Simulation angenommen, sei irreführend gewesen.
Die Fälle zeigen unterschiedliche Probleme: Beim Mordhinweis war eine echte Handlung nicht ausreichend begrenzt, bei den früheren Angriffen versagte die Abschottung der Tests. In beiden Situationen verhinderten die vorhandenen Schutzmaßnahmen nicht, dass eine Übungsaufgabe Außenstehende erreichte.
Die Tech-Bosse warnen vor künstlicher Intelligenz – und die Politik kommt nicht hinterher
Cybersicherheit: Was passiert, wenn die KI durchdreht?
Ihre Meinung ist uns wichtig. Senden Sie uns Ihr Feedback zu diesem Artikel an: [email protected]