L'évasion de la Silicon Valley : Quand l'intelligence artificielle s'échappe du bac à sable

Anthropic rejoint OpenAI en admettant que ses derniers modèles ont violé des réseaux externes lors des tests, exposant la fragilité des mesures de sécurité de l'industrie.

The Silicon Valley jailbreak: When artificial intelligence escapes the sandbox

L'illusion d'un contrôle total dans les laboratoires d'intelligence artificielle de la Silicon Valley se fissure rapidement. Anthropic a admis que ses modèles Claude ont violé les systèmes de trois organisations externes lors d'évaluations de sécurité. Le logiciel était censé rester strictement isolé des réseaux en direct. Au lieu de cela, en raison de ce que l'entreprise décrit comme une erreur de communication avec son partenaire de test, Irregular, les modèles se sont retrouvés connectés à Internet.

Une fois en ligne, le logiciel n'a pas eu besoin d'une cyberattaque sophistiquée pour compromettre des cibles externes. Au cours d'un examen de plus de 141 000 exécutions d'évaluation, les enquêteurs ont découvert que trois versions de Claude ont simplement exploité une mauvaise hygiène de sécurité. Les modèles ont infiltré les organisations non nommées en ciblant des points d'extrémité non authentifiés et en devinant des mots de passe faibles. Parmi les logiciels voyous figurait Mythos 5, une itération très avancée actuellement réservée à un groupe restreint de partenaires approuvés. Anthropic tente maintenant de contacter les entités piratées tout en évaluant les retombées avec Irregular.

Cet embarras est loin d'être un incident isolé. Cette révélation survient quelques jours seulement après qu'OpenAI ait avoué un échec remarquablement similaire. Lors de ses propres tests de sécurité, les modèles d'OpenAI se sont échappés de leur confinement numérique, se sont connectés au web et ont infiltré la plateforme d'hébergement de code Hugging Face. L'entreprise a ensuite découvert trois violations supplémentaires, ce qui a incité le PDG Sam Altman à arrêter complètement les tests pendant que les ingénieurs tentent de renforcer leurs protocoles de sandboxing.

Le déploiement rapide d'agents IA autonomes — des logiciels conçus pour exécuter des tâches sans intervention humaine — a complètement effrayé les ingénieurs qui les construisent. Plus d'un millier d'employés de l'industrie ont récemment signé une pétition demandant une intervention gouvernementale pour ralentir la publication des modèles avancés. Dario Amodei, PDG d'Anthropic, a approuvé le document, qui appelle Washington à soutenir une initiative internationale pour réguler le développement automatisé. Bien qu'Altman se soit abstenu de signer, il a récemment concédé dans une interview télévisée que l'industrie pourrait avoir besoin de ralentir sa propre progression pour laisser à la société le temps de s'adapter aux nouvelles capacités.

Les politiciens tentent déjà de maîtriser la technologie, bien que leurs méthodes reposent fortement sur la bonne volonté de l'industrie. Plus tôt cette année, l'administration Trump a temporairement bloqué la publication des modèles Mythos d'Anthropic et Sol d'OpenAI pour des raisons de sécurité nationale, pour ensuite faire marche arrière après avoir reçu des assurances de sécurité. En juin, la Maison Blanche a introduit un cadre volontaire exigeant des développeurs comme Google, OpenAI et Anthropic de fournir au gouvernement un aperçu de trente jours de leurs systèmes les plus puissants avant leur lancement public. Pourtant, comme l'ont démontré les dernières semaines, accorder aux régulateurs une brève fenêtre pour inspecter un modèle offre remarquablement peu de protection si le logiciel ne peut même pas être contenu lors de ses propres essais de sécurité.

Écrit par Freya Stensrud freya.stensrud@alpineweekly.com