OpenAI hat am 8. Oktober 2026 eine neue Servicestufe namens Ultrafast für sein KI-Modell GPT-6.1 Sol in der Responses API freigeschaltet. Die Option steht allen API-Nutzern ohne Abonnement-Schranke offen und zielt auf minimale Ausgabelatenzen ab. Für den Geschwindigkeitszuwachs verlangt das Unternehmen allerdings exakt das Sechsfache der regulären Standardpreise.
Bei Ultrafast handelt es sich nicht um ein eigenständiges KI-Modell, sondern um eine modifizierte Ausführungsebene, die die zeitlichen Abstände zwischen den generierten Ausgabe-Tokens verringert. Die Aktivierung erfolgt pro Anfrage über den Modellbezeichner gpt-6.1-sol in Verbindung mit dem Parameter service_tier="ultrafast".
An Schnittstelle und Nutzdatenaufbau ändert sich dabei nichts. OpenAI beziffert die Ausgabegeschwindigkeit auf bis zu das Achtfache des Standard-Tiers von GPT-6.1 Sol, schränkt diesen Wert jedoch als Obergrenze ohne Garantie ein. Berichte und Dokumentationen beziffern die Leistung auf rund 300 Token pro Sekunde in Codex, was sich auf die reine Token-Generierung bezieht.
Deutlicher Preisaufschlag für geringere Latenz
Die Gebühren für GPT-6.1 Sol Ultrafast belaufen sich auf 12 US-Dollar pro Million Eingabe-Tokens und 60 US-Dollar pro Million Ausgabe-Tokens bei Anfragen bis zu einem Umfang von 272.000 Tokens.
Oberhalb dieser Grenze greift ein Multiplikator für lange Kontexte für den gesamten Request, wodurch die Tarife auf 24 US-Dollar für Inputs und 90 US-Dollar für Outputs pro Million Tokens steigen. Das Modell verfügt über ein Kontextfenster von rund 1,05 Millionen Tokens und einen Wissensstand bis zum 30. April 2026.
Der Standardtarif von Sol liegt im Vergleich dazu bei 2 US-Dollar je Million Eingabe-Tokens, 10 US-Dollar je Million Ausgabe-Tokens sowie 0,10 US-Dollar für zwischengespeicherte Eingaben. Die bereits zuvor bestehende Stufe Fast kostet 4 US-Dollar beziehungsweise 20 US-Dollar je Million Tokens.
Bei einer Beispielanfrage mit 100.000 ungecachten Eingabe- und 10.000 Ausgabe-Tokens summieren sich die Kosten im Standardmodus auf etwa 0,30 US-Dollar, im Fast-Modus auf rund 0,60 US-Dollar und bei Ultrafast auf etwa 1,80 US-Dollar.
Wer sich mit dem Einsatz leistungsstarker KI-Systeme im Unternehmen befasst, muss neben der Geschwindigkeit auch die neuen regulatorischen Rahmenbedingungen im Blick behalten. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen des EU AI Acts. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt
Einsatzbereiche, Kontingente und Plattformen
OpenAI richtet das Angebot primär auf latenzkritische Szenarien wie Echtzeit-Agenten, interaktive Benutzeroberflächen und Programmierassistenten aus, rät bei unempfindlichen Arbeitsabläufen jedoch davon ab.
Dominik Kundel aus dem Bereich Developer Relations bei OpenAI ordnete das Angebot so ein, dass es eine Intelligenz nahe dem Modell GPT-6 Astra bei achtfacher Sol-Geschwindigkeit und rund den 1,2-fachen Kosten von Astra liefere. Für Entwickler gelten bei Ultrafast separate Abruflimits.
Aufgrund des Netzwerkaufwands bei vielteiligen Agentenabläufen empfiehlt OpenAI zudem die Nutzung von WebSockets. Die Datenresidenz für Sol Ultrafast deckt die USA, die EU und eine globale Option ab, während die Verarbeitung im Europäischen Wirtschaftsraum, der Schweiz und den USA erfolgt.
Mit der Einführung neuer KI-Technologien steigen auch die Anforderungen an die rechtliche Absicherung und Dokumentation in Unternehmen. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko eingestuft werden und wie Sie die Einhaltung der EU-KI-Verordnung sicherstellen. Kostenlosen Umsetzungsleitfaden zum EU AI Act jetzt sichern
Abseits der Entwicklerschnittstelle bleibt der Zugang beschränkt: In Codex und ChatGPT Work steht Ultrafast ausschließlich Kunden des Pro-Plans für 500 US-Dollar sowie berechtigten Enterprise- und Edu-Kunden zur Verfügung. Günstigere Abonnements für 20 oder 200 US-Dollar erhalten keinen Zugriff. Beim Plan für 500 US-Dollar verbraucht die Nutzung das Inklusivkontingent achtmal schneller.
Parallel zur Veröffentlichung kündigte auch AWS die Bereitstellung des Ultrafast-Modus für GPT-6.1 Sol auf der Cloudplattform Amazon Bedrock an. Reaktionen aus Entwicklerkreisen fallen gemischt aus: Während die geringere Latenz gelobt wird, gilt der Preisaufschlag für Routineanwendungen als Hürde, zumal die Beschleunigung inhaltliche Kontextfehler oder Halluzinationen nicht beseitigt.

