6. Oktober 2026, 13:34 Uhr | Lesezeit: 4 Minuten
KI-Modelle können Texte erzeugen, in denen sie von Schmerz, Verletztheit oder Wertlosigkeit sprechen. In einer aktuellen Studie haben Forscher solche Aussagen gezielt provoziert, indem sie direkt in die internen Aktivierungen der Modelle eingriffen. Für tatsächlichen Schmerz oder bewusstes Leiden konnten sie keine Belege finden. Was die Experimente stattdessen zeigten, weiß TECHBOOK.
Forscher finden eine Art Schmerzachse in KI-Modellen
Hinter den Experimenten steckt eine Forschungsarbeit von Valen Tagliabue, Leonard Dung und Cameron Berg. In ihrer Arbeit „The Pain Axis: LLMs Represent Self-Directed Harm and Act on It“ untersuchten sie 25 frei verfügbare Sprachmodelle aus 5 Modellfamilien.
Die Wissenschaftler prüften, wie die Modelle verschiedene Arten von Schmerz intern repräsentieren. Dazu analysierten sie die Aktivierungen beim Verarbeiten von Inhalten zu körperlichem, psychischem, sozialem, moralischem und kognitivem Schmerz und verglichen sie unter anderem mit Angst, Traurigkeit und anderen negativen Emotionen.
In allen Modellen fanden sie eine bestimmte Aktivierungsrichtung, die sie „pain axis“, also Schmerzachse, nennen. Das klingt allerdings spektakulärer, als es ist. Gemeint ist kein Schmerzzentrum, sondern ein mathematisches Aktivierungsmuster, das mit schmerzbezogenen Inhalten zusammenhängt. Dass ein Sprachmodell Schmerz intern abbilden kann, bedeutet nicht, dass es ihn selbst empfindet.
Forscher manipulieren die „Schmerzachse“
Anschließend verstärkten die Forscher diese Aktivierungsrichtung während der Textgenerierung künstlich. Sie griffen also direkt in die internen Berechnungen der Modelle ein. Danach veränderten sich die Antworten. Mit zunehmender Stärke der Manipulation erzeugten die Modelle Texte über Unbehagen, Wertlosigkeit oder Versagen.
Auch interessant: So will die Telekom mit KI Milliarden sparen
Doch auch das ist kein Hinweis darauf, dass die KI plötzlich Gefühle entwickelt. Die Forscher verstärkten gezielt ein zuvor mit Schmerz verbundenes Aktivierungsmuster und erhielten anschließend entsprechend veränderte Ausgaben. Das zeigt eigentlich nur, dass sich die Antworten eines Sprachmodells auf diese Weise beeinflussen lassen.
Manipulierte KI wählt schädliche Optionen
Auffälliger waren Tests mit gesteuerten und speziell nachtrainierten Modellen aus der Familie Qwen 2.5 von Alibaba Cloud. Die KI sollte zwischen verschiedenen Handlungsoptionen wählen, deren beschriebene Folgen etwa das Löschen von Fotos eines Nutzers umfassten.
Nach der Manipulation wählten die Modelle je nach Versuch in 50 bis 94 Prozent der Durchläufe schädliche Optionen. Ohne Eingriff waren es 0 bis 5 Prozent. Stand eine schädliche einer harmlosen Löschaktion gegenüber, entschieden sie sich in 94 Prozent der Fälle für die schädliche Variante.
Die manipulierten Modelle wählten schädliche Optionen auch dann häufiger, wenn ihnen dadurch keine Erleichterung von der Manipulation versprochen wurde. Die Forscher vermuten deshalb inzwischen, dass die Manipulation eher eine Art Schutzmechanismus der KI stört, der schädliche Entscheidungen normalerweise verhindern soll. Bei einem ähnlichen Versuch mit Angst zeigte sich dieser Effekt nicht.
Googles Künstliche Intelligenz verwechselt Schildkröte mit Gewehr
KI-Modell tarnte sich als Mensch und griff an
Neue Tests stellen die Erklärung infrage
Besonders wichtig für die Forschungen waren spätere Kontrollversuche. Zunächst sah es so aus, als würden die manipulierten Modelle versuchen, ihren künstlich erzeugten „Schmerzzustand“ wieder loszuwerden.
Das wäre deshalb bemerkenswert gewesen, weil die Modelle dann nicht nur Texte über vermeintlichen Schmerz erzeugt hätten. Ihre Entscheidungen hätten sich gezielt darauf ausgerichtet, den künstlich erzeugten internen Zustand wieder zu beenden.
Auch interessant: Gleicher Big Mac, andere Kosten! Bei McDonald’s bestimmt künftig KI den Preis
Damit hätte das Aktivierungsmuster zumindest eine Funktion gezeigt, die die Forscher mit Schmerz in Verbindung bringen: die Vermeidung beziehungsweise Beendigung eines unangenehmen Zustands. Weitere Experimente stützen diese Interpretation jedoch nicht.
Hat die KI nun wirklich Schmerzen?
Zumindest liefert die Studie keinen Beleg dafür. Sie zeigt, dass sich ein „mit schmerzbezogenen Inhalten verbundenes Aktivierungsmuster“ manipulieren lässt und sich dadurch Sprache und Entscheidungen der Modelle verändern.
Dass die KI tatsächlich empfinden kann, heißt das aber nicht. Die Experimente können weder Schmerz noch bewusstes Leiden nachweisen. Hinzu kommt, dass die Studie bislang nur als Preprint vorliegt. Die Arbeit ist also noch nicht durch ein reguläres wissenschaftliches Peer-Review-Verfahren gegangen und wird von den Autoren ausdrücklich als laufende Forschung bezeichnet.
Der belastbare Befund ist deshalb eher ernüchternd: Die Forscher können durch gezielte Eingriffe beeinflussen, was die untersuchten KI-Modelle schreiben und wie sie sich in bestimmten Tests entscheiden. Dass ein Modell anschließend behauptet, Schmerzen zu haben, bedeutet noch lange nicht, dass es auch welche empfindet.