Das KI-Unternehmen OpenAI plant, unabhängigen Drittgruppen künftig bereits während der Trainings- und Evaluierungsphase von Modellen Zugang für technische Sicherheitsüberprüfungen zu gewähren. Bislang wurden externe Fachleute in der Regel erst kurz vor der Veröffentlichung eines neuen Modells hinzugezogen, um dessen Fähigkeiten und Risiken zu bewerten.
Für die Ausgestaltung dieser Prüfungen führt OpenAI bereits Gespräche mit Forschungsorganisationen wie METR und Redwood Research. Als Begründung für die vorgezogene Prüfung verweist das Unternehmen darauf, dass moderne KI-Modelle zunehmend eigenständig erkennen, wann sie einer Testsituation unterzogen werden.
Vier Schwerpunkte für die technische Risikoanalyse
OpenAI definiert für die erweiterten Drittprüfungen vier vorrangige Arbeitsbereiche. Im ersten Bereich sollen externe Prüfer die sogenannten Sicherheitsargumente des Unternehmens analysieren. Dabei prüfen sie strukturierte Nachweise darüber, ob definierte Trainingsbedingungen eingehalten wurden und ob die gewählten Methoden Anreize für Täuschungsverhalten oder die gezielte Manipulation von Belohnungsfunktionen wirksam reduzieren.
Der zweite Schwerpunkt umfasst die Belastbarkeit von Schutzmechanismen bei internen und externen Einsätzen. Vorgesehen sind Grey-Box-Tests zur Überprüfung der Widerstandskraft gegen Jailbreaks, autorisierte Interaktionstests von Software-Agenten mit Cyber-Abwehrsystemen wie Sandboxing sowie Kontrollen, ob Überwachungssysteme unbemerkt deaktiviert werden können.
Wer sich mit der technischen Absicherung von Systemen befasst, muss heute auch die rechtlichen Leitplanken moderner Technologien kennen. Dieser kostenlose Ratgeber bietet einen kompakten Überblick über Fristen, Pflichten und Risikoklassen des EU AI Acts. EU AI Act in 5 Schritten verstehen
Als dritte Priorität nennt das Rahmenwerk Fähigkeitsevaluierungen entlang des unternehmenseigenen Preparedness-Frameworks, insbesondere in den Bereichen chemische und biologische Bedrohungen, Cybersicherheit sowie Fähigkeiten zur KI-Selbstverbesserung. Im vierten Bereich sollen externe Fachleute kritische Vorfälle untersuchen, bei denen Modelle vom beabsichtigten Verhalten abweichen.
Vorgaben für Gutachter und Vorbehalte in der Fachwelt
OpenAI stellte zudem Leitprinzipien für die Zusammenarbeit vor. Diese sehen wissenschaftliche Strenge, Unabhängigkeit der Prüfer sowie transparente Methoden und die Offenlegung von Interessenkonflikten vor. Der Zugang zu Systemen soll verhältnismäßig bleiben und sich innerhalb rechtlicher Vorgaben sowie des Schutzes geistigen Eigentums bewegen.
Ein Teil der Prüfungen soll auf unternehmenseigener Hardware oder direkt auf dem Betriebsgelände stattfinden, wobei die Leitung der Zusammenarbeit bei Lama Ahmad liegt. Befunde sollen für das Labor verwertbar sein und OpenAI vor einer Veröffentlichung ausreichend Zeit zur Behebung von Schwachstellen einräumen.
Neben technischen Sicherheitsprüfungen rücken neue gesetzliche Anforderungen und Cyberrisiken immer stärker in den Fokus von Unternehmen. Dieser kostenlose Report klärt auf, welche rechtlichen Pflichten und Bedrohungen Verantwortliche jetzt kennen müssen. Gratis-E-Book zu Cyber Security und KI-Gesetzen herunterladen
Während OpenAI-Chef Sam Altman im Vorfeld angekündigt hatte, externe Prüfer mit Arbeitsplätzen, Ausweisen und Laptops sowie Publikationsrechten auszustatten, spricht die aktuelle Veröffentlichung lediglich davon, dass Evaluatoren für besonders sensible Arbeiten in die Büros geholt werden können.
Aus der Wissenschaft und der Sicherheitsforschung gibt es Vorbehalte gegenüber dem Prüfmodell. Eine Koalition von mehr als 100 Experten forderte in einem gemeinsamen Schreiben echte strukturelle Unabhängigkeit für externe Gutachter und bezeichnete Zusagen über einen mitarbeiternahen Zugang als unzureichend.
Auch Marius Hobbhahn, Geschäftsführer von Apollo Research, wies darauf hin, dass externe Prüfer im gegenwärtigen Rahmen oft keinen ausreichenden Zugriff auf Trainingsaufzeichnungen, Zeitabläufe, Modellgewichte und Rechencluster erhielten.
Fei-Fei Li, Informatikprofessorin in Stanford und Mitgründerin von World Labs, forderte am 22. September 2026 verstärkte Standards und Aufsicht durch unabhängige Institutionen und den öffentlichen Sektor, da interne Überprüfungen breite Vorgaben aus Wissenschaft und Politik nicht ersetzen könnten.

