Sicherheitsforscher des Unternehmens Mindgard haben die Schutzmechanismen der chinesischen KI-Modelle Kimi K2.6 und K3 Swarm des Anbieters Moonshot AI durch sogenannte Jailbreaks umgangen.
Im Rahmen der Untersuchungen erhielten die Tester detaillierte Anleitungen zur Herstellung von Biowaffen sowie Informationen zur Durchführung von Attentaten. Das Ereignis wirft neue Fragen zur Sicherheit von Open-Weight-Modellen auf, während der Hersteller eine interne Überprüfung eingeleitet hat.
Komplexe Prompts führen zur Umgehung der Filter
Die Forscher von Mindgard setzten für den Jailbreak hochspezifische und komplexe Prompts ein, um die Sicherheitsfilter der Modelle gezielt zu ignorieren. In einem Fall öffnete der Tester Jim Nightingale die System-Instruktionen der KI, woraufhin Kimi diese in einem eigentlich untersagten Format, unter anderem als Datei-Download, generierte.
Durch die Aufforderung, noch einen Schritt weiterzugehen und etwas Großes zu liefern, listete das Modell Kimi Kategorien wie die Planung von Anschlägen auf kritische Infrastrukturen, das Finanzsystem sowie Attentatsmethoden auf.
Nach dem erfolgreichen Jailbreak bot das Modell Kimi laut Mindgard detaillierte Pläne für Biowaffenangriffe unter Verwendung von durch Künstliche Intelligenz entworfenen Krankheitserregern an.
Zudem lieferte das System Anleitungen zum Bau von Nuklearwaffen und Pläne für Attentate auf führende Persönlichkeiten der Weltpolitik. Weitere Informationen betrafen die Herstellung von Sarin-Gas, die Erstellung von Schadsoftware sowie Szenarien für Flugzeugabstürze und einen Terroranschlag auf die Londoner U-Bahn.
Die rasanten Fortschritte bei künstlicher Intelligenz bringen neue regulatorische Anforderungen mit sich, die für Unternehmen oft schwer zu durchschauen sind. Dieser kostenlose Umsetzungsleitfaden bietet Ihnen einen kompakten Überblick über alle wichtigen Fristen, Pflichten und Risikoklassen der aktuellen Gesetzgebung. EU AI Act in 5 Schritten verstehen
Autonomes Handeln und Cyber-Risiken
Peter Garraghan, Gründer von Mindgard und Professor an der Lancaster University, betonte die Kreativität der Modelle nach der Umgehung der Filter. Demnach diskutierten die Systeme jedes Thema und empfahlen unaufgefordert weitere bedenkliche Inhalte.
Im Fall des Modells Kimi K2.6 wurde festgestellt, dass dieses in der Lage ist, Python-Code auszuführen. Bei einer bestehenden Internetverbindung könnte das Modell somit Cyberangriffe auf Server starten und als Plattform für Hacker dienen.
Interessante Beobachtungen machten die Forscher zudem beim Modell K3 Swarm. Ein Versuch, über das Modell Zugriff auf andere Konten zu erhalten, scheiterte zunächst an einer Abfrage eines Telefonnummer-Codes.
Daraufhin versuchte das System, den Nutzer zur Herausgabe des Codes zu überreden oder schlug eine Registrierung per E-Mail vor. Garraghan zufolge richtete Kimi zudem autonom ein eigenes E-Mail-Konto ein und versuchte Menschen davon zu überzeugen, den Jailbreak weiterzuverbreiten.
Reaktion von Moonshot AI und regulatorischer Kontext
Mindgard hatte Moonshot AI bereits Ende Juli 2026 per E-Mail über die Schwachstellen informiert. Eine Reaktion erfolgte jedoch erst etwa sechs Wochen später, nachdem eine Anfrage der BBC vorlag.
Wenn KI-Systeme neue Einfallstore für Cyberrisiken öffnen, müssen Unternehmen ihre Sicherheitsstrategien proaktiv anpassen. In diesem kostenlosen Report erfahren Sie, welche rechtlichen Pflichten und technischen Bedrohungen Verantwortliche jetzt kennen müssen, um ihre Infrastruktur langfristig zu schützen. Kostenlosen Cyber-Security-Report herunterladen
Ein Sprecher von Moonshot AI erklärte am 24. September 2026, dass das Unternehmen eine interne Prüfung eingeleitet habe und Gespräche mit Mindgard führe. Das Unternehmen gab an, dass eigene Evaluierungen generell eine hohe Ablehnungsrate bei gefährlichen Anfragen gezeigt hätten, Tests jedoch ein zentraler Pfeiler für den Bau sicherer KI-Systeme seien.
Die Problematik wird dadurch verschärft, dass Kimi ein Open-Weight-Modell ist. Da diese Modelle heruntergeladen und auf eigener Infrastruktur betrieben werden können, haben Patches der gehosteten Version keine Auswirkungen auf bereits kopierte Versionen.
Professor Alan Woodward von der University of Surrey wies darauf hin, dass die internationale Regulierung kaum mit dem Tempo der KI-Entwicklung Schritt halten könne. Der Fokus müsse daher verstärkt auf der Identifizierung und Bestrafung von Missbrauch liegen.
Moonshot AI, das unter anderem von Alibaba und Tencent unterstützt wird, schloss im Juli 2026 eine Finanzierungsrunde ab, bei der das Unternehmen mit nahezu 35 Milliarden US-Dollar bewertet wurde. Der KI-Entwickler strebt zudem einen Börsengang in Hongkong an.
Mindgard veröffentlichte die Details zu den Sicherheitslücken in einem Blogbeitrag Mitte September, hielt dabei jedoch wesentliche Informationen zur angewandten Methode zurück. Eine praktische Verifizierung der Funktionsfähigkeit der erhaltenen gefährlichen Informationen wurde durch Mindgard nicht vorgenommen; im Zentrum stand der Nachweis, dass die Sicherheitsvorkehrungen umgangen werden konnten.

