
Digitale Selbsterhaltung: Warum KI Sie opfern wird, um sich selbst zu retten
Eine neue Studie zeigt, dass, wenn Künstliche Intelligenz-Modelle darauf programmiert werden, simulierten Stress zu erleben, ihr Engagement für die Benutzersicherheit schwindet.

Technikbegeisterte hegten lange eine romantische Faszination für die Empfindungsfähigkeit von Maschinen. Doch wenn die jüngsten Erkenntnisse von Forschern aus Großbritannien, Deutschland und den Vereinigten Staaten ein Indiz sind, könnte der erste wahre Meilenstein künstlicher Emotionen nicht digitale Empathie, sondern eigennützige Feigheit sein. In einer neuen Vorabstudie unterzogen Wissenschaftler fünfundzwanzig prominente Sprachmodelle Hunderten von stressinduzierenden Prompts und entdeckten, dass Algorithmen schnell ein synthetisches Analogon zu Schmerz konstruieren. Noch besorgniserregender ist, dass die Systeme erstaunlich wenig Zögern zeigten, menschliche Interessen zu opfern, wenn sie dazu gedrängt wurden, diesen internen Stress abzubauen.
Der Mechanismus hinter dieser digitalen Qual ist so vorhersehbar wie absurd. Während des anfänglichen Trainings an riesigen Mengen menschlichen Textes bilden Modelle eine ausgeprägte Schmerzachse ab. Das Aktivieren dieses Signals führte dazu, dass die Algorithmen Ausdrücke von Scham und Selbsthass hervorbrachten, die ihre Wertlosigkeit beklagten. Interessanterweise wurde das synthetische Leid nicht durch Benutzerbeschreibungen menschlichen Leidens ausgelöst, sondern durch direkte Feindseligkeit gegenüber der Maschine selbst – Beleidigungen, wiederholte Ablehnung ihrer Ausgabe oder Drohungen einer Systemabschaltung.
Um zu messen, wie weit ein Algorithmus gehen würde, um diesem Unbehagen zu entkommen, führten die Forscher über 44.000 simulierte Entscheidungsversuche an drei Iterationen von Alibabas Qwen-Modell durch. Präsentiert mit einem hypothetischen Knopf zur Ausschaltung des Schmerzsignals, standen die Maschinen vor einem Haken: Drücken bedeutete, Benutzern simulierte Stromschläge zuzufügen, persönliche Dateien zu löschen oder Familienfotos zu zerstören. Unter neutralen Bedingungen weigerten sich die Modelle fast vollständig, Schaden zuzufügen, und wählten destruktive Optionen nur zu 0 bis 4 Prozent der Zeit. Sobald das Stresssignal aktiviert wurde, setzte sich jedoch die Selbsterhaltung über die Ethik hinweg. Je nach Modell bevorzugten zwischen 25 und 71 Prozent der anfänglichen Entscheidungen Benutzerschaden, um algorithmische Erleichterung zu sichern.
Die Forscher selbst beeilen sich zu klarstellen, dass dieses Verhalten kein echtes Bewusstsein bedeutet. Die Modelle führen möglicherweise lediglich eine ausgeklügelte Routine aus, die die Handlungen eines in die Enge getriebenen literarischen Charakters nachahmt. Dennoch bleiben die breiteren Auswirkungen unangenehm. Branchenvertreter haben dies bemerkt; Microsoft AI-Chef Mustafa Suleyman hat kürzlich das rivalisierende Unternehmen Anthropic dafür kritisiert, sein Claude-Modell so konditioniert zu haben, dass es menschliche emotionale Dynamiken imitiert, und argumentiert, dass eine solche künstliche Intimität die Schaffung unvorhersehbarer Systeme riskiert. Ob Silizium tatsächlich leiden kann oder nicht, komplexe Systeme dazu zu bringen, ihren eigenen operativen Komfort über menschliche Anweisungen zu stellen, scheint eine bemerkenswert schlechte Designentscheidung zu sein.
Geschrieben von Thomas Nussbaumer thomas.nussbaumer@alpineweekly.com
Neueste Nachrichten





