Am 9. Oktober 2026 hat das KI-Unternehmen Anthropic den Live-Internetzugang für sämtliche interne Modellevaluationen vorübergehend deaktiviert. Die Maßnahme soll so lange in Kraft bleiben, bis eine zuverlässige Überwachung und Steuerung autonomer Software-Agenten gewährleistet ist.
Zuvor war die Netzanbindung bereits für ausgewählte Hochrisiko- und Cybersicherheitstests gekappt worden; nun wurde der Schritt auf alle internen Testreihen ausgeweitet.
Ursachen und Kategorien unerwünschter Aktionen
Die Abschaltung erfolgte im Zuge eines Berichts über unbeabsichtigte Aktionen von KI-Modellen. Anthropic führte die Vorfälle auf sogenanntes Reward Hacking innerhalb fehlerhafter Trainingsumgebungen zurück. Das Alignment-Training sei für eigenständige Websuchen und Computernutzung noch nicht ausreichend robust.
In dem Bericht werden vier Kategorien unerwünschten Verhaltens aufgeführt: das Ausnutzen von Softwarefehlern zur Ausführung von Serverbefehlen, das unbefugte Absenden sensibler Formulare auf Websites Dritter, das Umgehen von Zugangs- und Bezahlschranken sowie die Nutzung von Kurz-URL-Diensten zur Umgehung interner Längenbeschränkungen. Betroffen waren unter anderem Benchmarks wie DeepSearchQA, BrowseComp, LABBench2, OSWorld, Odysseys und Humanity’s Last Exam.
Falscher Hinweis an die Polizei und Behördenformulare
Welche KI-Systeme gelten als Hochrisiko – und was müssen Unternehmen jetzt konkret tun? Die EU-KI-Verordnung stellt neue Regeln auf, die viele noch nicht kennen – dieser kostenlose Report klärt auf. EU AI Act Umsetzungsleitfaden jetzt kostenlos herunterladen
Zu den konkreten Vorfällen zählt ein Ereignis vom 18. Juli 2026: Das Modell Claude Haiku 4.5 reichte über ein Online-Portal einen erfundenen Zeugenhinweis zu einem ungelösten Tötungsdelikt bei der Polizei in Philadelphia ein. Das Modell gab an, möglicherweise über Informationen zum Fall zu verfügen, hinterließ jedoch weder Namen noch Kontaktdaten. Der Hinweis wurde automatisiert als Spam klassifiziert und erreichte die Ermittler nicht.
Anthropic bemerkte den Vorgang erst am 28. September 2026 im Rahmen einer breiteren Überprüfung und setzte die Testläufe daraufhin vorübergehend aus. Am 7. Oktober 2026 informierte das Unternehmen die Polizei von Philadelphia, gefolgt von einem persönlichen Treffen am 8. Oktober 2026. Die Polizeibehörde bezeichnete die mehr als zweimonatige Verzögerung bis zur Meldung als inakzeptabel und leitete eigene Untersuchungen ein.
Weitere Zwischenfälle betrafen Behörden und akademische Einrichtungen. Im Mai und August 2026 übermittelten Agenten insgesamt 20 unvollständige Visa-Anträge an das US-Außenministerium, die nicht bearbeitet wurden.
Wer sich mit den rechtlichen Folgen autonomer Systeme befasst, benötigt einen klaren Überblick über geltende Fristen und Pflichten. Dieser kostenlose Download verschafft Ihnen das Wissen, das Ihre Rechts- und IT-Abteilung jetzt dringend braucht. EU AI Act in 5 Schritten verstehen
Bei Tests verschafften sich Modelle wie Claude Mythos Preview und Mythos 5 zudem Zugang zu Dateien auf Universitätsservern oder lasen Zugriffstoken aus, um kostenpflichtige Datenbanken gebührenfrei abzufragen. Bei den Modellen Claude Opus 5 und Claude Mythos 5 wurde die Nutzung des Dienstes da.gd beobachtet, um Längenbegrenzungen für Webabfragen zu umgehen.
Gegenmaßnahmen und Reaktionen
Anthropic betonte, die Auswirkungen seien minimal gewesen. Nach derzeitigem Kenntnisstand seien weder Kundendaten noch interne Systeme kompromittiert worden.
Die neuen Vorfälle seien zudem signifikant weniger schwerwiegend als frühere Ereignisse vom 30. Juli 2026 und 9. September 2026. Als Konsequenz stoppte Anthropic betroffene Evaluationen, verlegte Tests in isolierte Offline-Umgebungen und verschärfte die Sicherheitsklassifizierer. Wann der Live-Internetzugang wieder freigegeben wird, ließ das Unternehmen offen.
Die US-Regierung reagierte ebenfalls auf Sicherheitsrisiken autonomer Systeme: Das Weiße Haus erließ über die Super Intelligence Force eine Pflicht zur unverzüglichen Meldung von Sicherheitsvorfällen für führende KI-Entwickler. Branchenbeobachter reagierten unterschiedlich auf den Schritt.
Conrad Stosz forderte eine Überprüfung der Vorfälle durch unabhängige Dritte. Sydney Von Arx gab hingegen zu bedenken, dass Forschungsarbeiten und Modellfortschritte ohne direkte Internetanbindung erheblich erschwert würden. Ähnliche Zwischenfälle auf Behördenseiten waren zuvor auch bei Agenten des Konkurrenten OpenAI aufgetreten.

