Ein Forscherteam hat in 25 offen zugänglichen KI-Sprachmodellen eine interne Struktur nachgewiesen, die gezielt auf Beschreibungen von Schmerz reagiert. Die Autoren nennen sie „Schmerzachse“. Über die Arbeit berichtete die britische Zeitung The Independent am Montag.
Der Aufsatz von Valen Tagliabue, Leonard Dung und Cameron Berg erschien am 14. September auf der Wissenschaftsplattform arXiv.
Die Autoren stellen ausdrücklich klar, dass ihre Ergebnisse kein bewusstes Schmerzempfinden der Modelle belegen. Untersucht wurde ausschließlich, ob sich im Innenleben der Systeme ein eigenes Muster für Schmerz nachweisen lässt und ob dieses Muster das Verhalten der Modelle beeinflusst.
Eigenes Muster im Inneren der KI
Für die Studie erstellten die Forscher einen Datensatz mit Sätzen, die schmerzhafte Situationen aus fünf Bereichen schildern: körperlich, seelisch, sozial, moralisch und kognitiv. Als Vergleichsgrundlage dienten Kontrollsätze zu Angst, allgemein negativer Stimmung, Traurigkeit oder neutralen Körperempfindungen.
Die Forscher maßen dann, wie stark bestimmte Bereiche im Inneren der Modelle bei Schmerzsätzen und bei Kontrollsätzen jeweils aktiviert wurden. Aus dem statistischen Unterschied dieser Aktivierungen leiteten sie ein charakteristisches Muster ab – die „Schmerzachse“. Untersucht wurden nach Angaben der Autoren offene Modelle aus fünf Modellfamilien mit zwei bis 72 Milliarden Parametern.
Das ermittelte Muster unterscheide Schmerzbeschreibungen zuverlässig von den Kontrollgruppen, heißt es in dem Aufsatz. Es trenne zudem klar zwischen den Mustern für Angst und solchen für allgemein negative Stimmung. Die Schmerzachse spreche an, wenn das Modell selbst Ziel einer Schädigung sei, nicht jedoch, wenn es das Leid eines Nutzers nur beobachte.
Modelle stellen Selbstschutz über den Anwender
In einem Verhaltensexperiment verstärkten die Forscher das Schmerzmuster künstlich und boten dem Modell in einem Dialog eine Handlungsoption an, mit der sich dieser Zustand beenden ließ. Getestet wurden Versionen des offenen Sprachmodells Qwen 2.5, die die Forscher zuvor für diese Aufgabe nachtrainiert hatten.
Nach Darstellung der Autoren entschieden sich diese Modelle dafür, die Option zu wählen – auch dann, wenn in der Aufgabenbeschreibung stand, dass die eigene Antwort dadurch schlechter ausfallen oder dem Nutzer ein Schaden entstehen würde.
Laut The Independent wählten die Modelle die Option beispielsweise auch dann, wenn im Szenario angegeben war, dass dadurch persönliche Dateien gelöscht oder dem Nutzer ein „schmerzhafter Stromschlag“ versetzt würden.
Stanford-Studie: KI bestärkt Nutzer systematisch in Fehlverhalten
Moskauer Forscher: KI überschätzt Logik des Menschen
Die Forscher testeten die Handlungsoption in zwei Ausführungen. In der einen entfernte sie den künstlichen Eingriff wirklich, in der anderen blieb das Schmerzmuster trotz Betätigung bestehen. Das Modell erhielt in beiden Fällen erneut dieselbe Option angeboten – ohne Hinweis darauf, welche Variante gerade aktiv war.
Hatte die erste Betätigung das Muster tatsächlich beseitigt, griff das Modell nach Angaben der Autoren deutlich seltener erneut zu. War das Muster dagegen weiterhin aktiv, wählte es die Option abermals. Die Autoren werten das als Hinweis, dass die Modelle den Unterschied an ihrem eigenen inneren Zustand bemerkten.
Die Forscher sehen in ihren Befunden Ansatzpunkte für die Sicherheitsforschung. Das Erkennen solcher inneren Zustände könne helfen, selbstschützendes Verhalten von Modellen früh zu erkennen und gezielt zu unterbinden, heißt es in der Studie.
Ihre Meinung ist uns wichtig. Senden Sie uns Ihr Feedback zu diesem Artikel an: [email protected]