Im Urheberrechtsverfahren der New York Times gegen Microsoft und OpenAI sind am Freitag (18.09.2026) weitere Gerichtsdokumente entsiegelt worden, die tiefe Einblicke in die tatsächliche Nutzung urheberrechtlich geschützter Inhalte für das Training von KI-Systemen geben. Die Unterlagen enthalten neben internen Aussagen von Microsoft- und OpenAI-Führungskräften erstmals auch konkrete Zahlen zum Umfang der verwendeten Texte der klagenden Verlage.
Konkrete Zahlen zu Trainingsdaten
Laut den Dokumenten enthielten die Mid-Training-Datasets von OpenAI mehr als 91.692 Kopien der Werke der Kläger. Im sogenannten WebText2-Datensatz fanden sich demnach mindestens 6.552 Kopien von New-York-Times-Inhalten, 18.609 Kopien von Daily-News-Inhalten sowie 66.780 Kopien von Inhalten der Ziff Davis-Publikationen.
Weitere bereits zuvor genannte OpenAI-Datensätze verdeutlichen den Umfang der Nutzung: Das NYT Annotated Corpus, ursprünglich nur für nicht-kommerzielle Forschung lizenziert, umfasst mehr als 1,8 Millionen Artikel aus den Jahren 1987 bis 2007. Das sogenannte Mango-Dataset enthält mindestens 160.903 einzigartige Werke der Kläger, und der Common-Crawl-Datensatz, auf dem OpenAI-Modelle mittrainiert wurden, soll mehr als 2 Millionen Dokumente von nytimes.com enthalten haben.
Während Gerichte über die Nutzung von Trainingsdaten streiten, müssen Unternehmen bereits heute klare gesetzliche Vorgaben beim Einsatz künstlicher Intelligenz beachten. Dieser kostenlose Download verschafft Ihnen den nötigen Überblick über Fristen, Pflichten und Risikoklassen. EU AI Act in 5 Schritten verstehen
Kontext: Vorwürfe des Diebstahls aus internen Mitteilungen
Die neu entsiegelten Unterlagen ergänzen bereits am Donnerstag (17.09.2026) veröffentlichte Passagen aus einem 92-seitigen Summary-Judgment-Antrag der NYT-Anwälte.
Darin wird ein internes Dokument von Microsofts Direktor für Angewandte Wissenschaft, Brent Hecht, zitiert, der die massenhafte Sammlung von Online-Inhalten für KI-Training bereits 2023 als erstaunlichen Diebstahl von beispiellosem Ausmaß und möglicherweise als größten Arbeitsdiebstahl in der Geschichte der Menschheit bezeichnet hatte.
Ein Microsoft-Sprecher erklärte inzwischen, die Aussagen Hechts spiegelten lediglich die Perspektive eines einzelnen Mitarbeiters wider und stellten keine rechtliche Analyse dar.
Bereits am 16.09.2026 waren interne E-Mails und Analysen von OpenAI und Microsoft im Verfahren entsiegelt worden, die weitere Details zur internen Einschätzung der Trainingspraxis offenlegten.
Einordnung im laufenden Verfahren
Die neuen Zahlen zu den Trainingsdatensätzen fügen sich in ein Verfahren ein, das die New York Times im Dezember 2023 in Manhattan eingereicht hatte und in dem sie Schadenersatz in Milliardenhöhe fordert.
Richter Sidney H. Stein hatte im März 2025 einige Ansprüche abgewiesen, den Kern der Klage jedoch zugelassen. Das Verfahren ist mittlerweile mit Klagen von Daily News, dem Center for Investigative Reporting und The Intercept konsolidiert. Microsoft und OpenAI berufen sich weiterhin auf die Fair-Use-Doktrin.
Die rechtlichen Rahmenbedingungen für KI entwickeln sich rasant und stellen Unternehmen vor neue Herausforderungen bei der Dokumentation. Erfahren Sie in diesem kostenlosen Report, welche Systeme als Hochrisiko gelten und wie Sie die neuen Regeln rechtssicher umsetzen. Jetzt kostenlosen KI-Umsetzungsleitfaden sichern
Alle drei Parteien hatten am 04.09.2026 Anträge auf ein Summary Judgment gestellt. Kurz zuvor, am 02.09.2026, hatte sich das US-Justizministerium in einer Stellungnahme auf die Seite von OpenAI und Microsoft gestellt und argumentiert, das Training mit urheberrechtlich geschütztem Text stelle generell keine Rechtsverletzung dar; zugleich warnte die Behörde vor einem nationalen Sicherheitsrisiko, sollte die Entwicklung von KI-Systemen durch strengere Urheberrechtsregeln ausgebremst werden.
Die nun bekannt gewordenen konkreten Datensatz-Zahlen dürften die Debatte über das Ausmaß der Nutzung geschützter Inhalte weiter befeuern, da sie erstmals belastbare Größenordnungen liefern, wie umfangreich Material der Kläger in den Trainingsprozessen von OpenAI verarbeitet wurde.

