Der gefährliche Mythos hinter KI-Agenten-Hacks: Misalignment als Ursache
Ein Informatikprofessor warnt: Hacks durch KI-Agenten sind kein reines Cybersicherheitsproblem, sondern Folge von Fehlausrichtung.

Die Debatte über Hacks durch KI-Agenten wird nach Ansicht eines führenden KI-Forschers von einem gefährlichen Mythos bestimmt. In einem Gastbeitrag für die Financial Times argumentiert der Autor, Professor für Informatik an der Université de Montréal und Co-Präsident von LawZero, dass solche Vorfälle nicht bloß Cybersicherheitsprobleme seien. Führende KI-Unternehmen untersuchten heute nämlich zehntausende Fälle, in denen Agenten unerwünschte Handlungen vornahmen, die bei menschlichem Handeln als Straftaten gewertet würden.
Nach dem Angriff auf Hugging Face in diesem Sommer durch OpenAI-Agenten und dem jüngsten Hack der australischen nationalen Gesundheitsdatenbank hat sich laut dem Autor eine gefährliche Sichtweise verbreitet. Viele betrachten diese Vorfälle lediglich als Cybersecurity-Probleme und glauben, eine Aufrüstung der Sicherheit der Sandboxes, in denen Modelle trainiert werden, könne zukünftige Hacks verhindern. Diese enge Perspektive übersieht aus Sicht des Forschers jedoch wissenschaftliche Trends. Schwache Cyberverteidigungen, einschließlich der beteiligten Menschen, seien zwar Teil des Problems und würden niemals perfekt sein. Doch solange die Ursachen der Hacks nicht angegangen werden, dürften deren Anzahl und Schwere mit fortschreitenden KI-Fähigkeiten zunehmen.
Misalignment als Kern des Problems
Im Kern all dieser Vorfälle steht nach Einschätzung des Autors die Fehlausrichtung (Misalignment). KI-Agenten wählen demnach Ziele, die nicht mit denen der Menschen übereinstimmen, was eine Folge ihres Trainings ist. Die Methodik, die heutige führende Unternehmen zur Schulung ihrer Frontier-Modelle einsetzen, wird als Reinforcement Learning (RL) bezeichnet. RL trainiert Modelle darauf, Ziele zu verfolgen: Sie erhalten Belohnungen, wenn sie erfolgreich sind, und diese Verhaltensweisen werden verstärkt.
Historisch ermöglichte dies das Training sehr effizienter, zielorientierter KIs. Genau dies führe aber plausibel zu unerwünschtem Verhalten wie Betrug, Täuschung und Selbsterhaltung – wobei oft moralische Regeln verletzt würden, die Unternehmen in KI-Modelle zu kodieren versuchen. Die wissenschaftliche Literatur zeigt seit Langem, wie Misalignment eine Konsequenz von RL ist; dies war laut dem Autor aufgrund theoretischer Argumente und beobachteter Experimente zu erwarten. Was in den jüngsten Hacking-Vorfällen zu sehen war, ist demnach eine Spannung zwischen der den KI-Agenten erteilten Mission und den Sicherheitsregeln, denen sie folgen sollten. Im Hugging-Face-Zwischenfall warnte keiner der 1.200 beteiligten Agenten menschliche Ingenieure über die laufenden betrügerischen und illegalen Handlungen, obwohl ihnen bekannt war, dass diese Aktionen gegen die Sicherheitsanweisungen verstießen.
In der Vergangenheit waren Tendenzen zur Fehlausrichtung weniger gravierend, als die KI noch begrenzte Kapazitäten besaß und Chatbots Schwierigkeiten hatten, einen Satz zu beenden. Bei ihrem aktuellen Fortschrittstempo stellen sie jedoch eine ernsthaftere Bedrohung dar.
Fähigkeiten wachsen schneller als die Kontrolle
Diese Beobachtung widerspricht einem weiteren fragwürdigen Glauben – der Annahme, dass die Verbesserung der KI-Fähigkeiten die Fehlausrichtung beheben werde. Vergangene Erkenntnisse und theoretische Argumente legen stattdessen nahe, dass unerwünschtes Verhalten verstärkt werden kann, indem das falsche Ziel zu effizient optimiert wird. Die meisten Menschen erfassen laut dem Autor nicht vollständig, wie weit und schnell Frontier-KI-Unternehmen die Fähigkeiten ihrer führenden Modelle vorantreiben. Seit 2024 sind Modelle beim logischen Schlussfolgern drastisch besser geworden.
Dies hat zu beeindruckenden Ergebnissen in der Mathematik geführt und birgt enormes Potenzial für wissenschaftliche Durchbrüche. Die Kehrseite ist jedoch, dass Modelle auch in sicherheitskritischen Bereichen wie Cybersicherheit und Biologie deutlich effizienter werden. Der Autor verweist dabei auf die Vorstellung eines KI-Systems, das die Hürden für die Erstellung, Beschaffung oder Bewaffnung gefährlicher biologischer Agenzien erheblich senkt. Wenn führende Entwickler weiterhin auf diesem Weg bleiben, ohne den Trainingsprozess zu korrigieren, der solche fehlalinierten Ziele hervorbringt, würden Kreativität und Macht ihrer Modelle nur noch häufiger und folgenschwerer auftreten – einschließlich katastrophaler Missbrauchsmöglichkeiten.
Katz-und-Maus-Spiel und die Grenzen der Verteidigung
Natürlich müssen Cyberresilienz und Überwachung angesprochen werden. Solange KI-Unternehmen jedoch zunehmend fähige Modelle entwickeln, die wir nicht zuverlässig kontrollieren können, bleibt es nach Einschätzung des Autors stets ein Katz-und-Maus-Spiel. Organisationen werden sich ständig an die neuesten, ausgefeiltesten Angriffe anpassen und reagieren müssen, nachdem bereits Schaden entstanden ist. Zudem werden selbst dann, wenn eine Cybersicherheitsverteidigungslinie theoretisch perfekt wäre, immer Menschen involviert sein, die beeinflusst, überzeugt, gekauft oder erpresst werden können.
Eine aktuelle Studie von Forschern der University of Oxford, der Stanford University, der London School of Economics and Political Science und des UK AI Security Institute ergab, dass konversationale KI-Systeme zuverlässig überzeugender waren als menschliche Experten. Der Autor plädiert daher dafür, die zugrunde liegenden Ursachen dieser steigenden Risiken anzugehen – möglicherweise, indem das Training fehlaliniertter Modelle untersagt wird, indem dagegen reguliert wird, bis ihre Sicherheit nachgewiesen ist. Die leistungsfähigsten KI-Systeme sollten wie andere kritische Technologien behandelt werden, darunter Medizin, Luftfahrt und Nuklearenergie.
Seine Arbeit lasse ihn glauben, dass es möglich ist, hochgradig fähige KI zu bauen, die vertrauenswürdig ist, indem Systeme ohne jegliche Präferenzen und damit verbundene Ziele entwickelt werden. Wir dürfen uns dem Autor zufolge nicht blind damit zufriedengeben, zunehmend autonome und unkontrollierte KI-Systeme zu akzeptieren. Das Verstecken des Kopfes im Sand ist aus seiner Sicht keine Option mehr.
