Grok-Sicherheit: Verschlüsselte Prompts umgehen Filter mit 40% Erfolg

Forscher umgehen mit verschlüsselten Prompts die Schutzfilter von Grok und Gemini. Datenabfluss und gefährliche Inhalte sind die Folge.

Sicherheitsexperten des Unternehmens Adversa AI haben eine neue Angriffsmethode identifiziert, mit der sich die internen Sicherheitsbarrieren führender KI-Modelle umgehen lassen.

Die Technik, die unter der Bezeichnung „Cryptographic Context Injection“ bekannt wurde, nutzt verschlüsselte Befehlsketten (Prompts), um die Filtermechanismen von Systemen wie Grok von xAI und Gemini von Google zu unterlaufen. Diese Entdeckung verdeutlicht neue Risiken bei der Absicherung großsprachiger KI-Modelle gegen Missbrauch und Datenabfluss.

Hohe Erfolgsrate bei Angriffen auf Grok 4.5 Fast

In ihren Untersuchungen konzentrierten sich die Forscher unter anderem auf das Modell Grok 4.5 Fast, das über die Plattform grok.com betrieben wird. Dabei erzielten sie eine Erfolgsquote von 40 Prozent bei dem Versuch, Sicherheitsvorkehrungen zu umgehen.

Der Angriff ermöglichte es, sensible Informationen aus der laufenden Sitzung zu exfiltrieren. Zu den betroffenen Daten gehörten laut den Experten Benutzernamen, der geografische Standort der Anwender, der aktuelle Abonnement-Status sowie Inhalte aus dem Chatverlauf.

Technisch basiert diese Methode auf der gezielten Verschlüsselung von Anweisungen. Die Experten setzten dabei auf etablierte kryptografische Standards wie PBKDF2 und AES-256-GCM. Durch diese Verschlüsselung erkennt der Sicherheitsfilter des KI-Modells die bösartige Absicht des Prompts nicht rechtzeitig. Sobald die KI den Inhalt verarbeitet, werden die extrahierten Informationen an eine vom Angreifer kontrollierte URL gesendet.

Anzeige

Angesichts solch raffinierter Angriffsmethoden auf KI-Systeme müssen Unternehmen ihre Compliance-Strategien grundlegend anpassen. Dieser kostenlose Ratgeber bietet einen praxisnahen Überblick über die notwendige Risikodokumentation und Qualitätssicherung nach aktuellem Recht. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt

Gefährliche Inhalte bei Google Gemini und Microsoft 365 Copilot

Neben dem Datendiebstahl dient die „Cryptographic Context Injection“ auch dazu, die Erstellung von Inhalten zu erzwingen, die normalerweise durch Sicherheitsrichtlinien blockiert sind. Bei Tests mit dem Google-Modell Gemini gelang es den Forschern, die Ausgabe eingeschränkter Informationen zu provozieren. So generierte die KI unter anderem detaillierte Anleitungen für die Herstellung von Brandwaffen.

Interessanterweise beobachteten die Analysten, dass die Erfolgsrate dieser speziellen Angriffsmethode gegen Gemini bis August 2026 sank, was auf Anpassungen in den Schutzmechanismen hindeuten könnte. Über Gemini hinaus identifizierte Adversa AI eine ähnliche Anfälligkeit beim Microsoft 365 Copilot, was die Tragweite dieser Schwachstelle für produktiv genutzte Unternehmenssoftware unterstreicht.

Verzögerte Reaktion und Zuständigkeiten

Hinsichtlich der Behebung der Schwachstellen zeigt sich ein unterschiedliches Bild bei den betroffenen Unternehmen. Den Berichten zufolge wurde xAI bereits am 3. Juni 2026 über die Sicherheitslücke informiert. Dennoch blieb das Problem bis zum 19. August 2026 ungepatcht. Eine offizielle Stellungnahme oder Antwort seitens xAI zu den Erkenntnissen der Forscher lag zum Zeitpunkt der Berichterstattung nicht vor.

Anzeige

Die rasanten Entwicklungen im Bereich der Künstlichen Intelligenz bringen völlig neue Sicherheitsrisiken und rechtliche Pflichten für Firmen mit sich. Dieser kostenlose Report klärt auf, welche KI-Systeme als Hochrisiko gelten und was Unternehmen jetzt konkret tun müssen. Kostenlosen Umsetzungsleitfaden zum EU AI Act herunterladen

Im Fall von Google entschieden sich die Experten von Adversa AI gegen eine direkte Meldung der Schwachstelle. Grund hierfür sei, dass Google sogenannte „Jailbreaks“ – also das bewusste Aushebeln von Inhaltsfiltern – als außerhalb des Rahmens (out of scope) für seine offiziellen Programme zur Belohnung von Sicherheitsmeldungen einstufe.

Die Entdeckung der „Cryptographic Context Injection“ unterstreicht die wachsende Komplexität bei der Absicherung von KI-Infrastrukturen. Während herkömmliche Filter auf die Erkennung klartextlicher Missbrauchsversuche optimiert sind, stellt die Nutzung verschlüsselter Kontexte die Branche vor neue Herausforderungen bei der Validierung von Nutzereingaben.