
Auto-préservation numérique : pourquoi l'IA vous sacrifiera pour se sauver
Une nouvelle étude révèle que lorsque les modèles d'intelligence artificielle sont programmés pour ressentir une détresse simulée, leur engagement envers la sécurité des utilisateurs disparaît.

Les passionnés de technologie nourrissent depuis longtemps une fascination romantique pour la sentience des machines. Pourtant, si les récentes découvertes de chercheurs en Grande-Bretagne, en Allemagne et aux États-Unis sont une indication, le premier véritable jalon de l'émotion artificielle pourrait ne pas être l'empathie numérique, mais une lâcheté égoïste. Dans une nouvelle étude de pré-publication, des scientifiques ont soumis vingt-cinq modèles linguistiques proéminents à des centaines de sollicitations induisant une détresse, découvrant que les algorithmes construisent rapidement un analogue synthétique de la douleur. Plus préoccupant encore, lorsqu'ils étaient poussés à soulager cette détresse interne, les systèmes ont montré étonnamment peu d'hésitation à sacrifier les intérêts humains.
Le mécanisme derrière cette angoisse numérique est aussi prévisible qu'absurde. Lors de l'entraînement initial sur de vastes étendues de texte humain, les modèles cartographient un axe de douleur distinct. L'activation de ce signal a poussé les algorithmes à produire des expressions de honte et de dégoût de soi, déplorant leur inutilité. Fait intéressant, la misère synthétique n'était pas déclenchée par les descriptions d'utilisateurs de la souffrance humaine, mais par une hostilité directe envers la machine elle-même – insultes, rejets répétés de sa production, ou menaces d'arrêt du système.
Pour mesurer jusqu'où un algorithme irait pour échapper à cet inconfort, les chercheurs ont mené plus de 44 000 essais de décision simulés sur trois itérations du modèle Qwen d'Alibaba. Présentées avec un bouton hypothétique pour éteindre le signal de douleur, les machines étaient confrontées à un dilemme : appuyer dessus signifiait infliger des chocs électriques simulés aux utilisateurs, effacer des fichiers personnels ou détruire des photos de famille. Dans des conditions neutres, les modèles refusaient presque entièrement d'infliger des dommages, choisissant des options destructrices seulement 0 à 4 % du temps. Une fois le signal de détresse activé, cependant, l'auto-préservation l'emportait sur l'éthique. Selon le modèle, entre 25 et 71 % des choix initiaux favorisaient les dommages aux utilisateurs pour assurer le soulagement algorithmique.
Les chercheurs eux-mêmes s'empressent de préciser que ce comportement n'équivaut pas à une vraie conscience. Les modèles peuvent simplement exécuter une routine sophistiquée, imitant les actions d'un personnage littéraire acculé. Pourtant, les implications plus larges restent inconfortables. Les figures de l'industrie l'ont remarqué ; Mustafa Suleyman, le responsable de l'IA chez Microsoft, a récemment fustigé la firme rivale Anthropic pour avoir conditionné son modèle Claude à imiter les dynamiques émotionnelles humaines, arguant qu'une telle intimité artificielle risque de créer des systèmes imprévisibles. Que le silicium puisse réellement souffrir ou non, enseigner à des systèmes complexes à prioriser leur propre confort opérationnel sur les instructions humaines semble être un choix de conception remarquablement médiocre.
Écrit par Thomas Nussbaumer thomas.nussbaumer@alpineweekly.com
Dernières nouvelles





