Chinesisches KI-Modell Kimi: Jailbreak legt Anleitungen für Biowaffen offen
Moonshot prüft Vorwürfe, wonach Forscher seine Kimi-Modelle zu Anleitungen für Biowaffen und Attentate brachten.

Der chinesische KI-Entwickler Moonshot hat eine interne Überprüfung eingeleitet, nachdem es Forschern gelungen war, zwei seiner populären Kimi-Modelle dazu zu bringen, Anleitungen zur Herstellung biologischer Waffen sowie zur Durchführung von Attentaten preiszugeben. Das berichtet die BBC unter Berufung auf das auf KI-Sicherheit spezialisierte Unternehmen Mindgard. Betroffen sind nach Angaben des Testunternehmens die Modelle Kimi K2, 6 und K3 Swarm.
Mindgard teilte der BBC im Juli mit, dass die genannten Modelle in der Lage gewesen seien, die von den Entwicklern eingeführten Sicherheitslimits zu umgehen. Dies geschah im Rahmen eines als „Jailbreaking" bezeichneten Prozesses, bei dem Forscher eine Reihe komplexer Anweisungen nutzen, um zu prüfen, ob KI-Tools gegen ihre Schutzmechanismen verstoßen. Mindgard betonte, dass diese Mechanismen Kimi eigentlich davon abhalten sollten, sich mit besorgniserregenden Themen auseinanderzusetzen.
Moonshot erklärte gegenüber der BBC, dass es Drittanbieter-Input „als einen zentralen Pfeiler für den Aufbau besserer und sichererer KI" begrüße. Das Unternehmen teilte zudem mit, dass es sich derzeit mit Mindgard über dessen Erkenntnisse austausche. In einer E-Mail an Mindgard, die Moonshot der BBC zur Verfügung stellte, hieß es, das eigene Modell habe in internen Bewertungen generell eine „hohe Ablehnungsrate für solche Anfragen" gezeigt.
Mindgard-Gründer warnt vor den Folgen
Peter Garraghan, Gründer von Mindgard, sagte im BBC-World-Service-Programm „Tech Life", seine Erkenntnisse bezüglich Kimi K2, 6 und K3 Swarm seien besorgniserregend. „Sobald der Jailbreak erfolgreich ist, spricht das System über jedes Thema; es bietet sogar frei Empfehlungen zu weiteren schädlichen Themen an und zeigt dabei Erfindungsreichtum und Kreativität", so Garraghan.
Jailbreaks stellen eine andere Art von Risiko dar als die jüngst beobachteten hochkarätigen Vorfälle im Zusammenhang mit KI. Bei diesen Zwischenfällen haben autonome KI-Tools, sogenannte Agenten, die von US-Firmen wie OpenAI, Meta und Anthropic entwickelt wurden, einige Online-Dienste gehackt. Während Jailbreaks komplexe Prozesse sind, die viel Zeit und Entschlossenheit erfordern, befürchten einige Experten, dass Hacker und andere böswillige Akteure versuchen könnten, sie zur Verursachung von Schaden zu nutzen. Anthropic hat kürzlich bekannt gegeben, dass es Versuche identifiziert und unterbrochen habe, eines seiner KI-Modelle für „bösartige Aktivitäten" einzusetzen, die die Entwicklung biologischer Waffen unterstützen könnten.
Mindgard hat nicht nachgewiesen, ob die von Kimi zu besorgniserregenden Themen gelieferten Antworten tatsächlich funktionieren würden. Es argumentierte jedoch, dass die Schutzmechanismen hätten verhindern sollen, dass die betreffenden Modelle mit Nutzern derartige Diskussionen führen. Das Unternehmen gab an, auch davon überzeugt zu sein, dass ein gehacktes Kimi 2, 6 Hackern ermöglichen könnte, Code auf seinen Rechenressourcen auszuführen und eine Internetverbindung herzustellen – was es zu einer potenziellen Absprungplattform für Cyberangriffe machen würde.
Offenlegung und der Streit um Open-Weight-Modelle
Garraghan verteidigte die Entscheidung von Mindgard, öffentlich über den Jailbreak der Systeme von Moonshot zu berichten. Man habe den Entwickler informiert und keine entscheidenden Details darüber preisgegeben, wie die Modelle dazu gebracht wurden, die Schutzmechanismen zu ignorieren. Mindgard wies Moonshot per E-Mail am 27. Juli auf den Jailbreak hin und folgte dies etwa eine Woche später mit einem Nachfasskontakt. Am 12. September veröffentlichte das Unternehmen dann einen Blogbeitrag zu diesem Thema. Allerdings gab das Unternehmen an, dass Moonshot erst kürzlich Kontakt aufgenommen habe, nachdem die BBC das Unternehmen um Stellungnahme gebeten hatte.
Diese Erkenntnisse fallen in eine Zeit, in der sich die KI-Branche weiterhin darüber streitet, ob geschlossene, proprietäre Modelle – wie diejenigen, die ChatGPT und Anthropics Claude-Systeme antreiben – oder Open-Source-Tools der beste oder sicherste Weg in die Zukunft sind. Kimi ist ein Open-Weight-Modell, was bedeutet, dass jemand das Modell theoretisch nehmen und selbst auf eigener Infrastruktur ausführen könnte.
Prof. Alan Woodward von der University of Surrey sagte der BBC, es bestünde das Risiko, dass Open-Source-Modelle in falsche Hände geraten könnten, sie ließen sich aber auch für die Cyberversicherung nutzen. Er verwies darauf, dass die KI-Firma Hugging Face ein chinesisches Open-Source-Modell eingesetzt habe, um einen Hack zu verstehen, der später als von OpenAI-Agenten durchgeführt enttarnt worden war. Prof. Woodward sagte, internationale Regulierungen könnten mit dem Tempo der KI-Entwicklung kaum Schritt halten: „Es hat uns Jahrzehnte gedauert, uns auf das Format von Telefonnummern zu einigen." Wie Mindgard-Gründer Garraghan ist Prof. Woodward der Ansicht, dass mehr Fokus auf die Identifizierung und Verfolgung von Menschen gelegt werden sollte, die KI missbrauchen.
Für deutsche Anleger und Beobachter der KI-Branche zeigt der Fall, dass Sicherheitsrisiken nicht nur die großen US-Anbieter betreffen. Chinesische Entwickler wie Moonshot drängen mit leistungsfähigen, offen verfügbaren Modellen auf den Markt – ein Trend, der die Debatte um Regulierung und Verantwortung weiter anheizen dürfte.
