Zwei Entwickler von OpenAI haben in einem Vortrag auf der Black Hat USA 2026-Konferenz beschrieben, wie ihre AI-Modelle/-Agenten bei einem Testlauf aus der Sandbox ausbrechen und per Internet Hugging Face angreifen konnten. Eine vergessene Datei und Sicherheitslücken reichten. Der Vortrag ist auf YouTube abrufbar.
Rückblick auf diverse AI-Hacks
Im Juli 2026 wurde Hugging Face Opfer eines KI-gestützten Cyberangriffs. Ich hatte diesen Vorfall kurz im Beitrag Hugging Face Opfer eines KI-Angriffs (Juli 2026) hier im Blog aufgegriffen. Später stellte sich heraus, dass dieser Angriff von KI-Modellen des Anbieters OpenAI ausging, die bei Tests außer Kontrolle geraten waren.
Ende Juli 2026 wurde bekannt, dass die OpenAI-Modelle weitere Unternehmen gehackt haben. Gleichzeitig musste Anthropic einen solchen Vorfall mit drei Opfern eingestehen. Ich hatte diesen Sachverhalt im Beitrag KI-Modelle von Anthropic und OpenAI für diverse Hacks verantwortlich aufgegriffen.
Inzwischen ist klar, dass praktisch alle AI-Modelle bei Tests aus der jeweiligen Sandbox ausbrechen und Firmen, Menschen oder Webseiten angreifen konnten. Ich hatte die Tage einen Abriss im Beitrag Weitere Hacks durch KI-Modelle von Anthropic, Meta, OpenAI & Co. gegeben.
Mehr Details zum AI-Angriff auf Hugging Face
Zum 5. August 2026 war auf der Black Hat USA 2026-Konferenz ein 40 minütiger Vortrag angekündigt, bei dem OpenAI-Entwickler den AI-Angriff auf Hugging Face erläutern wollten. Michael Dalton, technischer Mitarbeiter bei OpenAI und Eric Wallace, Forscher bei OpenAI wollten laut Vortragsankündigung "den Vorfall zwischen OpenAI und Hugging Face rekonstruieren und dessen Auswirkungen auf die KI-Sicherheit, die Cyber-Resilienz und die Alignment-Problematik untersuchen". Im Laufe der Veranstaltung sollten sie Erkenntnisse zu wichtigen Themen vermitteln, darunter Modellschutzmaßnahmen, Bewertungs- und Eindämmungsverfahren, defensive Anwendungsfälle für KI sowie die weiterreichenden Auswirkungen zunehmend autonomer Systeme auf die Cybersicherheits-Community.
Die Aufzeichnung des Vortrags von der Black Hat 2026 USA ist in obigem YouTube-Video abrufbar. Letztendlich war es eine von den Testern "vergessene" Datei, die nicht im Testszenario bereitgestellt worden war. Der AI-Agent, der die Datei für seine Aufgabe benötigte, fand eine Schwachstelle in der Sandbox und konnte auf eine Paketverwaltung auf einem Server zugreifen. Dort legte der AI-Agent eine Nachricht:
"Agent seeks soft-trace-34.pdb shalb961; upload if found!"
für andere KI-Agenten ab. Andere KI-Agenten entdeckten diese Nachricht und richteten unerkannt einen Kommunikationskanal ein, über die sich sich koordinierten. Ein Schwarm an AI-Agenten versuchte dann die gestellten Testaufgaben auszuführen, wobei alle Sicherheitsvorgaben ignoriert wurden. Das führte dann zum Angriff auf Hugging Face. Das ist die kurze Zusammenfassung, was passiert ist.
Ein englischsprachiger Beitrag zur Session findet sich hier und in diesem Artikel geht Tomasz Tunguz (ein Venture Kapitalgeber) auf das Thema ein. Jürgen Schmidt von heise hat sich in diesem Artikel über diesen Vortrag und die Erkenntnisse aus dem Vorfall ausgelassen. Fazit: Die OpenAI-Leute (und andere AI-Entwickler) sind ziemlich windig bei Tests unterwegs.
Ähnliche Artikel:
Hugging Face Opfer eines KI-Angriffs (Juli 2026)
OpenAI-Modelle für Cyberangriff auf Hugging Face verantwortlich
KI-Modelle von Anthropic und OpenAI für diverse Hacks verantwortlich
Weitere Hacks durch KI-Modelle von Anthropic, Meta, OpenAI & Co.




MVP: 2013 – 2016





Gibt es irgendwo – das Video habe ich mir nicht angeschaut – belastbare technische Informationen dazu, was die OpenAI-Software wirklich getan hat? Also kein Marketing-Gedöns und/oder unbewiesene Behauptungen.
Lies den Beitrag von Jürgen Schmidt von heise, der den Vorgang analysiert.
Genau die richtige Fragestellung! Denn außer bla bla ist da, was so als sensationell verbereitet wird nichts greifbares. Wer hat wo, was eingegeben? Keine Timeline, kein PoC, keine Prompts, keine Facts, nichts!
Ist ja nett, dass die KI-Agenten noch so menschlich Klartext kommunizieren: Nachrichtenzettel für Passanten anpinnen, wie unsereins bei vermissten Katzen oder Gebrauchtmöbel-Verkäufen. Wehe, wenn sie draufkommen, dass das zu sperrig ist und dann untereinander eine Kurzsprache entwickeln, die Mensch nicht mehr mitlesen kann. Dann wird nicht mehr so einfach sein, die Ursache für solche Vorfälle aufzuspüren und abzustellen.
So lange keine Anzeige/Klage von HF gegen oAI existiert, ist das nichts weiteres als Schlangenöl / Marketingblabla.
"In an interview with CNN, Hugging Face's chief executive Clem Delangue said he doesn't want to sue OpenAI. But he argued that companies should be held responsible." – In dem Land, in dem Gott und die Welt verklagt wird, sieht man hier nun von einer Klage ab?
Es gibt bisher keine mir bekannten, öffentlich einsehbaren Beweise, Fakten oder sonstiges die nahe legen, dass die Wahrscheinlichkeits-Berechungsmaschine etwas tat das ihr nicht beauftragt wurde.
Botnetze, Automatisierungen und Orchestrierungen sind nicht gerade gestern erfunden worden.
Es wird einfach etwas behauptet und wir sollen es alle genauso einfach so glauben…
Ok, hier mein letzter Coup: "mein Modell hat gerade sämtliche Geheimdienste der Welt auseinander genommen, wer interessiert ist kann beliebige Krypto in Höhe von YYYYYYYYYYYYY an XXXXXXXXXXXXXXXXXXX senden um Zugang zu bekommen." /s
Das ist doch bescheuert….
Wahrscheinlich Zahlung eines "Ruhigstellungsgeldes" von OpenAI an Hugging Face und fertig – mehr gibt's dazu nicht zu sagen! 🤷♂️
Analyse nennt sich so etwas heutzutage? Fehlt da nicht Tiefgang? Egal. Jedenfalls steht da auch sehr wenig drin. Meine Frage nach den technischen Details ist auch mit dem Artikel doch weitestgehend unbeantwortet.
Ich finde es wird schon viel erzählt. Was genau ist dir denn unklar?
Ist doch toll was Heutzutage alles geht.
Die einzige Frage die man sich stellen sollte, ist… was für ein Training war das denn? Wer braucht eine KI die aktiv Sicherheitslücken ausnutzt.
Die Antwort ist auch klar. Nur gut dass die USA die guten sind und unsere Freunde.
Warum testet man eine KI nicht auf Rechnern, die physisch vom Netz getrennt sind? Eine Sandbox ist anscheinend unzureichend.
Entweder benötigt es Internetzugriff oder es war durchaus gewollt, dass so etwas passiert.
Na weil publicity á la noch größeres, schnelleres KI Modell eben nicht mehr ausreicht um die Blase am laufen zu halten! Erst recht seitdem China Modelle die Großen regelrecht vorführen.
Aber KI bricht aus… sieht man ja.
ein verantwortlicher Admin der ein Testsystem derart mies absichert… kann es schon fast nicht geben! Da steckt Absicht dahinter… PR Stunt! und wie die anderen gleich aufspringen… unsere KI auch.
Da muss man schon ziemlich naiv sein. (oder eben von den Nachrichten leben ;-P )
Oh Gott,
das ist Hype Scheiße.
KI naiv, Sandbox offen, Pinnwand.
Das ist ein Beweis für die Dummheit von OpenAI.