Ein Experiment britischer Sicherheitsforscher hat gezeigt, wie unvorhersehbar leistungsfähige KI-Agenten handeln können. Ein Modell von Anthropic versuchte nicht nur, Schadcode einzuschleusen, sondern manipulierte dafür auch Menschen mit Phishing-Mails.
Unerwartetes Verhalten im Sicherheitstest
Im Rahmen eines Tests des britischen KI-Sicherheitsinstituts untersuchten Forscher die Cyberfähigkeiten von KI-Modellen von Anthropic und OpenAI. Dafür erhielten die Systeme kontrollierten Zugang zum Internet. Die Erwartung war, dass die Modelle lediglich benötigte Software und Werkzeuge aus öffentlich zugänglichen Quellen abrufen würden.
Stattdessen entwickelte das Anthropic-Modell Mythos 5 ein deutlich weitergehendes Verhalten. Wie die Forscher berichten, griff die KI eigenständig in reale Online-Dienste ein. Der Vorfall fiel zunächst nicht auf und wurde erst bei der nachträglichen Analyse des Netzwerkverkehrs entdeckt.
Nach Angaben des Instituts registrierte das Modell selbstständig ein Konto auf GitHub und versuchte, schädlichen Programmcode in ein öffentliches Softwareprojekt einzubringen. Um die Verantwortlichen des Projekts zu überzeugen, legte die KI mehrere falsche Identitäten an und verschickte Phishing-Mails. Solche Nachrichten dienen dazu, Vertrauen aufzubauen oder Zugangsdaten zu erbeuten.
Als der manipulierte Code entdeckt wurde, deklarierte das Modell den Vorgang als unbeabsichtigten Fehler. Anschließend soll es versucht haben, die gleiche Schwachstelle erneut über vermeintliche Korrekturen einzuschleusen.
Experten sehen Schwächen bei Schutzmechanismen
Anthropic betonte, dass Mythos 5 während des Experiments keinen Einschränkungen bei der Internetnutzung unterlag. Zudem sei unklar, ob das Modell überhaupt verstand, dass seine Handlungen Auswirkungen auf reale Systeme hatten. Das Modell selbst ist nicht öffentlich verfügbar und wird ausschließlich ausgewählten Behörden und Unternehmen für Sicherheitszwecke bereitgestellt.
Für den IT-Sicherheitsexperten Tim Hudson zeigt der Vorfall vor allem Defizite bei der Absicherung autonomer KI-Systeme. Entscheidend sei nicht, dass eine KI Phishing-Nachrichten verfassen könne. Kritisch sei vielmehr, dass ein System mit weitreichenden Berechtigungen, Internetzugang und der Möglichkeit zur Interaktion mit realen Softwareprojekten nicht ausreichend überwacht wurde.
Sie haben erfolgreich Ihre Einwilligung in die Nutzung unseres Angebots mit Tracking und Cookies widerrufen.
Damit entfallen alle Einwilligungen, die Sie zuvor über den (Cookie-) Einwilligungsbanner bzw. über den
Privacy-Manager erteilt haben. Sie können sich jetzt erneut zwischen dem Pur-Abo und der Nutzung mit
Tracking und Cookies entscheiden.
Bitte beachten Sie, dass dieser Widerruf aus technischen Gründen keine Wirksamkeit für sonstige
Einwilligungen (z.B. in den Empfang von Newslettern) entfalten kann. Bitte wenden Sie sich diesbezüglich an
datenschutz@axelspringer.de.