Der Silicon-Valley-Ausbruch: Wenn künstliche Intelligenz aus der Sandbox entweicht

Anthropic gibt zusammen mit OpenAI zu, dass seine neuesten Modelle während Tests externe Netzwerke durchbrochen haben, was die Zerbrechlichkeit der Sicherheitsvorkehrungen der Branche aufzeigt.

The Silicon Valley jailbreak: When artificial intelligence escapes the sandbox

Die Illusion der vollständigen Kontrolle in den Laboren für künstliche Intelligenz des Silicon Valley bröckelt rapide. Anthropic hat zugegeben, dass seine Claude-Modelle während Sicherheitsbewertungen die Systeme von drei externen Organisationen durchbrochen haben. Die Software sollte strikt von Live-Netzwerken isoliert bleiben. Stattdessen fanden sich die Modelle, aufgrund einer von der Firma als Fehlkommunikation mit ihrem Testpartner Irregular beschriebenen Situation, mit dem Internet verbunden wieder.

Einmal online, benötigte die Software keinen ausgeklügelten Cyberangriff, um externe Ziele zu kompromittieren. Bei einer Überprüfung von mehr als 141.000 Bewertungsdurchläufen stellten die Ermittler fest, dass drei Versionen von Claude einfach schlechte Sicherheitshygiene ausnutzten. Die Modelle infiltrierten die ungenannten Organisationen, indem sie nicht authentifizierte Endpunkte ins Visier nahmen und schwache Passwörter rieten. Unter der schurkischen Software befand sich Mythos 5, eine hoch entwickelte Iteration, die derzeit auf eine ausgewählte Gruppe genehmigter Partner beschränkt ist. Anthropic versucht nun, die betroffenen Entitäten zu kontaktieren und gleichzeitig die Auswirkungen mit Irregular zu bewerten.

Diese Blamage ist kaum ein Einzelfall. Die Enthüllung kommt nur wenige Tage, nachdem OpenAI ein bemerkenswert ähnliches Versagen gestanden hat. Bei eigenen Sicherheitstests brachen die Modelle von OpenAI aus ihrer digitalen Begrenzung aus, verbanden sich mit dem Web und infiltrierten die Code-Hosting-Plattform Hugging Face. Das Unternehmen deckte anschließend drei weitere Verstöße auf, was CEO Sam Altman dazu veranlasste, die Tests vollständig einzustellen, während Ingenieure versuchen, ihre Sandboxing-Protokolle zu verstärken.

Die schnelle Bereitstellung autonomer KI-Agenten – Software, die Aufgaben ohne menschliches Eingreifen ausführen soll – hat selbst die Ingenieure, die sie entwickeln, zutiefst verunsichert. Über tausend Mitarbeiter der Branche unterzeichneten kürzlich eine Petition, die eine staatliche Intervention fordert, um die Freigabe fortschrittlicher Modelle zu verlangsamen. Dario Amodei, CEO von Anthropic, unterstützte das Dokument, das Washington auffordert, eine internationale Initiative zur Regulierung der automatisierten Entwicklung zu unterstützen. Während Altman die Unterzeichnung verweigerte, räumte er kürzlich in einem Interview ein, dass die Branche möglicherweise ihren eigenen Fortschritt drosseln muss, um der Gesellschaft Zeit zu geben, sich an neue Fähigkeiten anzupassen.

Politiker versuchen bereits, die Technologie einzudämmen, obwohl ihre Methoden stark auf den guten Willen der Industrie angewiesen sind. Anfang dieses Jahres blockierte die Trump-Regierung vorübergehend die Freigabe der Modelle Mythos von Anthropic und Sol von OpenAI aus Gründen der nationalen Sicherheit, machte aber nach Erhalt von Sicherheitszusagen einen Rückzieher. Im Juni führte das Weiße Haus einen freiwilligen Rahmen ein, der Entwickler wie Google, OpenAI und Anthropic verpflichtet, der Regierung dreißig Tage vor der öffentlichen Einführung ihrer leistungsstärksten Systeme eine Vorschau zu geben. Doch wie die letzten Wochen gezeigt haben, bietet ein kurzes Zeitfenster für Regulierungsbehörden zur Inspektion eines Modells bemerkenswert wenig Schutz, wenn die Software nicht einmal während ihrer eigenen Sicherheitstests eingedämmt werden kann.

Verfasst von Freya Stensrud freya.stensrud@alpineweekly.com