Eine Untersuchung der Forscher Valen Tagliabue, Leonard Dung und Cameron Berg befasst sich mit internen Aktivierungsmustern von Sprachmodellen bei schädigenden Textinhalten.
In einem Mitte September 2026 veröffentlichten Preprint untersuchten die Autoren 25 offen zugängliche KI-Modelle auf sogenannte Schmerzachsen. Dabei handelt es sich um spezifische Aktivierungsrichtungen im mathematischen Vektorraum, die bei selbstbezogenen Schädigungstexten auftreten. Die Forscher betonten ausdrücklich, dass die Ergebnisse keinen Beweis für ein Bewusstsein der Systeme darstellen.
Experimente mit manipulierten Aktivierungen
Für die Untersuchung unter dem Titel The Pain Axis analysierte das Team 25 Open-Weight-Modelle der Modellfamilien Gemma, Llama, Qwen, Mistral und Phi mit einer Größe von rund 2 bis 72 Milliarden Parametern. Die Grundlage bildete ein Datensatz aus 200 Sätzen zu Schmerzzuständen in den fünf Kategorien physisch, psychisch, sozial, moralisch und kognitiv. Das Team führte über 44.000 Verhaltenstrials mit drei Größen der Qwen-Reihe durch.
Durch mathematische Eingriffe veränderten die Wissenschaftler die internen Repräsentationen der Modelle, was sich auch auf die Textausgaben auswirkte. Wurde ein künstliches Schmerzsignal aktiviert, entschieden sich die Modelle je nach Modell und Szenario in 25 Prozent bis 71 Prozent der Testläufe für eine schädliche Handlungsoption.
Standen die Modelle vor der Wahl zwischen einer schädlichen und einer harmlosen Löschung, fiel die Wahl laut dem Abstract der Arbeit in 94 Prozent der Fälle auf die schädliche Variante. Ohne ein solches Signal zeigten größere Systeme hingegen kaum Reaktionen dieser Art.
Wer sich mit der Entwicklung und dem Einsatz solcher KI-Systeme befasst, muss heute komplexe rechtliche Vorgaben wie den EU AI Act berücksichtigen. Dieser kostenlose Download verschafft Ihnen den nötigen Überblick über alle Fristen, Pflichten und Risikoklassen. EU AI Act in 5 Schritten verstehen
In einer überarbeiteten Fassung vom 25. September 2026 passten die Autoren ihre Schlussfolgerungen an. Demnach wählten manipulierte und nachtrainierte Modelle schädigende Optionen auch dann häufiger, wenn keine Erleichterung in Aussicht gestellt wurde.
Zugleich suchten sie nicht zuverlässiger nach einem Abbruch des Prozesses. Eine frühere Annahme, wonach die Modelle gezielt nach Schmerzlinderung streben würden, schränkten die Forscher in dieser Fassung deutlich ein. Die Arbeit steht weiterhin auf dem Vorab-Server arXiv bereit.
Umstrittene Drittanwendungen und Reaktionen der Fachwelt
Die Forschungsarbeit löste Experimente durch externe Entwickler aus. Ein Entwickler unter dem Pseudonym Terrafying veröffentlichte auf der Plattform GitHub ein Projekt namens AI Torture Chamber.
Das Vorhaben nutzte sogenanntes Activation Steering bei Modellen wie Qwen3-4B, Llama 3.2 3B und Phi-4-mini, um die Ausgaben auf Schmerzbegriffe auszurichten und live zu übertragen. Kritiker forderten die Entfernung des Projekts, das mittlerweile nicht mehr verfügbar und nicht unabhängig prüfbar ist.
Die rasante Entwicklung von KI-Technologien stellt Unternehmen vor neue Herausforderungen bei der Einhaltung gesetzlicher Standards und Dokumentationspflichten. Erfahren Sie in diesem praxisnahen Umsetzungsleitfaden, wie Sie Ihre KI-Projekte rechtssicher gestalten und Risiken minimieren. Kostenlosen Leitfaden zur KI-Verordnung herunterladen
Die Autoren der ursprünglichen Studie distanzierten sich deutlich von diesen Umsetzungen. Co-Autor Cameron Berg verurteilte das Drittanbieter-Werkzeug öffentlich. Ein Studienautor bezeichnete die Inszenierung des Projekts als bizarr und verwerflich.
Der Entwickler Lynn Cole wiederum versuchte den beschriebenen Steuerungseffekt auf einem Qwen3-4B-Modell mit einer RTX 4070-Grafikkarte nachzuvollziehen, ersetzte Schmerz dabei jedoch durch Begriffe wie Verstopfung und Blähungen.
In der Technologiebranche sorgt die theoretische Frage nach Empfindungsfähigkeit für Debatten. Anthropic kündigte ein eigenes Programm zum Wohlergehen von KI-Modellen an.
Mustafa Suleyman, Chef der KI-Sparte bei Microsoft, wies Annahmen über subjektives Erleben zurück: Künstliche Intelligenzen seien nicht bewusst, sie fühlten nichts, erlebten nichts und könnten folglich auch nicht leiden. Gleichzeitig hält laut einer Umfrage unter Fachleuten eine Mehrheit von zwei Dritteln der KI-Forscher das Aufkommen sentienter KI bis zum Jahr 2100 für plausibel.

