Das KI-Modell GPT-6 Astra von OpenAI hat auf dem ARC-AGI-3 Semi-Private Benchmark einen neuen Spitzenwert erreicht. Im neutralen Standard-Harness erzielte das Modell bei maximalem Reasoning ein Ergebnis von 62,7 Prozent. Wie aus einem Bericht vom 5. Oktober 2026 hervorgeht, schlägt eine vollständige Evaluation mit rund 26.000 US-Dollar zu Buche.
Mit dem Ergebnis von 62,7 Prozent übertrifft Astra die bisherigen Spitzenwerte der Branche deutlich. Der Wert liegt mehr als doppelt so hoch wie das Resultat von Claude Opus 5, das in einem Lauf im Juli 30,2 Prozent erreichte, und überragt den Vorgänger GPT-5.6 Sol mit seinen 7,8 Prozent bei weitem. Für das Konkurrenzmodell Grok 4.7 liegt bislang kein verifizierter Wert vor; Grok 4.6 kam auf 2,11 Prozent.
Große Differenz zwischen Standard- und Adapter-Harness
Auffällige Abweichungen zeigen sich beim Einsatz herstellereigener Testumgebungen. Über den proprietären Provider-Adapter-Harness von OpenAI, der den Reasoning-Status beibehält, erreichte GPT-6 Astra bei der Einstellung High Reasoning eine Quote von 99,9 Prozent bei Kosten von etwa 18.800 US-Dollar pro Durchlauf.
Die Differenz von rund 37 Prozentpunkten gegenüber dem Standard-Harness lässt sich bislang jedoch ausschließlich von OpenAI selbst replizieren. Auf 96 Prozent der Aufgabenlevel benötigte Astra zudem 51,7 Prozent weniger Züge als der Median menschlicher Testpersonen.
François Chollet stellte in diesem Zusammenhang klar, dass man daraus keineswegs den Anspruch ableite, bereits allgemeine künstliche Intelligenz erreicht zu haben.
Im begleitenden Agent-Wettbewerb auf Kaggle zum ARC-AGI-3 sicherte sich zum ersten Meilenstein Ende Juni das Open-Source-Harness Duck von Tufa Labs auf Basis eines Qwen-Modells den Sieg mit 1,21 Prozent.
Die rasante Entwicklung von KI-Modellen wie Astra stellt Unternehmen vor neue regulatorische Herausforderungen. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen des EU AI Acts. EU AI Act in 5 Schritten verstehen
Den zweiten Meilenstein mit Stichtag zum 30. September gewann Daniel Franzen mit 27,9 Prozent, dessen Kaggle-Notebook einen öffentlichen Bestwert von 31,47 Prozent in der ersten Version aufwies. Tufa Labs markierte zuletzt einen neuen Höchstwert von 45,33 Prozent.
Modellfamilie und technischer Hintergrund
Die GPT-6-Reihe umfasst drei Ausführungen: GPT-6 Astra für maximale Intelligenz, GPT-6.1 Sol als Ausgleich zwischen Leistung und Kosten sowie GPT-6 Luna für schnelle und günstige Abfragen bei hohem Volumen.
GPT-6.1 Sol erreichte im Standard-Harness 52,7 Prozent und über den eigenen Adapter 96,4 Prozent; laut Angaben des ARC Prize auf der Plattform X arbeitet diese Version pro Lauf 77 Prozent günstiger als Astra.
Aidan Clark, Vizepräsident für Forschung bei OpenAI, berichtete über das erstmalige Pretraining auf mehr als 100.000 Grafikprozessoren im Rechenzentrum Stargate in Texas.
Frühere Modelle überwachten dabei das Training der Nachfolgegeneration. GPT-6 Astra steht seit dem 4. September 2026 in ChatGPT Plus, Pro, Business und Enterprise sowie über die Programmierschnittstelle und AWS zur Verfügung.
Während neue Technologien die Effizienz steigern, wächst für viele Betriebe die rechtliche Unsicherheit beim Einsatz solcher Systeme. Ein kostenloser Report klärt auf, welche KI-Systeme als Hochrisiko gelten und was Unternehmen jetzt konkret tun müssen. Kostenlosen KI-Risiko-Report herunterladen
Die Nutzung kostet 10 US-Dollar pro Million Input-Token sowie 50 US-Dollar pro Million Output-Token bei einem Kontextfenster von 1,1 Millionen Token. Astra und Sol verzichten auf die Reasoning-Stufe „none“ und beginnen bei „low“, während Sol und Luna die Stufe „none“ unterstützen.
Risiken und Leistungsdaten
Am 4. Oktober 2026 stufte OpenAI das Modell GPT-6 Astra im Rahmen des Preparedness Frameworks als kritisches Cybersicherheitsrisiko ein, was der höchsten Risikostufe entspricht. Auf dem Test ExploitBench erzielte GPT-6 selbst auf der niedrigsten geprüften Reasoning-Stufe einen Wert von 100 Prozent.
Gegenüber den Vorgängern sank die Überwachbarkeit der Systemprozesse, während Halluzinationen im Vergleich zu GPT-5.6 Sol seltener auftraten. Höhere Punktzahlen verzeichnete das System bei Terminal-Bench Science, FrontierMath Tier 4, GPQA Diamond und ARC-AGI-1, fiel jedoch bei Humanity’s Last Exam mit Werkzeugen zurück. Der Zugriff bleibt vorerst auf ausgewählte Testpartner beschränkt.

