Im Bereich der spezialisierten KI-Hardware ist ein bedeutender Fortschritt bei der Effizienz von Videomodellen gelungen. Am 25. September 2026 erreichte das Videomodell „Rolling Forcing“ auf der AWS-Trainium-Plattform Echtzeit-Geschwindigkeit.
Dieser Erfolg markiert einen Wendepunkt, da die Rechenlast ohne den Einsatz von NVIDIA-Hardware bewältigt wurde. Maßgeblich für diesen Leistungssprung war die Implementierung maßgeschneiderter NKI-Kernels (Neuron Kernel Interface), die spezifische Rechenprozesse drastisch beschleunigten.
Massive Performance-Gewinne durch maßgeschneiderte NKI-Kernels
Die Optimierung durch die NKI-Kernels ermöglichte es, kritische Engpässe in der Architektur des Videomodells zu beseitigen. So konnte die Verarbeitungszeit für 3D-RoPE (Rotary Positional Embedding) von ursprünglich 5 Sekunden auf lediglich 1,8 Millisekunden reduziert werden, was einer Beschleunigung um den Faktor 2.778 entspricht. Auch die Kopierprozesse im KV-Cache wurden optimiert: Diese sanken von 23 Millisekunden auf 1,9 Millisekunden pro Schicht.
Für eine interaktive Wiedergabe benötigt das Rolling-Forcing-Modell eine Bildrate von mindestens 16 Bildern pro Sekunde. Die Self-Attention-Mechanismen, die rund 70 % der gesamten Rechenzeit beanspruchen, umfassen dabei 23.400 Query- und 32.760 Kontext-Tokens.
Ein entscheidender Faktor für die erfolgreiche Ausführung war zudem das Speichermanagement. Während die Standard-Eager-Ausführung aufgrund von Speicherbeschränkungen scheiterte, beanspruchte der optimierte Lauf lediglich 11 GB HBM (High Bandwidth Memory).
Wirtschaftliche Offensive: Trainium-Chips vor dem Direktverkauf
Parallel zu den technischen Fortschritten plant Amazon Web Services (AWS) offenbar eine Neuausrichtung seiner Hardware-Strategie. Laut Berichten verhandelt der Cloud-Anbieter über den Direktverkauf seiner hauseigenen Trainium-KI-Chips an externe Rechenzentren. Peter DeSantis, KI-Chef bei Amazon, begründete diesen Schritt mit der weltweit stark wachsenden Nachfrage nach Rechenkapazitäten.
Während die Hardware-Entwicklung rasant voranschreitet, müssen Unternehmen auch die rechtlichen Rahmenbedingungen für den Einsatz solcher Technologien im Blick behalten. Dieser kostenlose Ratgeber erläutert die neuen Regeln der EU-KI-Verordnung und was für die Compliance jetzt wichtig ist. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt
Besonders die kommende Hardware-Generation stößt auf hohes Interesse. Die Trainium3-Chips gelten bereits als größtenteils ausverkauft, während für den im nächsten Jahr erwarteten Nachfolger Trainium4 bereits frühzeitige Anfragen vorliegen.
Branchenberichten zufolge bietet die Trainium3-Generation, die in einem 3-Nanometer-Verfahren bei TSMC gefertigt werden soll, eine bis zu 4,4-fache Rechenleistung gegenüber dem Vorgängermodell Trainium2. Mit einer Ausstattung von 144 GB HBM pro Chip und der Möglichkeit, bis zu 144 Einheiten in einem UltraServer-Gehäuse zu bündeln, sollen die Trainingskosten im Vergleich zu herkömmlichen GPU-Lösungen um 50 % sinken.
Laut dem Software-Unternehmen Decart erzeugt Trainium3 Frames bis zu viermal schneller als vergleichbare NVIDIA-Konfigurationen bei halbierten Kosten.
Markttrend zur Hardware-Spezialisierung: Wettbewerb durch OpenAI und Google
Die Entwicklung bei AWS ist Teil eines breiteren Branchentrends, bei dem führende KI-Unternehmen verstärkt auf eigenes Silizium setzen. OpenAI stellte im August 2026 den Inferenzchip „Jalapeño“ vor.
Der technologische Wettbewerb bringt neue regulatorische Anforderungen mit sich, die insbesondere IT- und Rechtsabteilungen vor Herausforderungen stellen. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko eingestuft werden und welche Dokumentationspflichten auf Unternehmen zukommen. Umsetzleitfaden zur EU-KI-Verordnung jetzt kostenlos herunterladen
Richard Ho, Hardware-Vizepräsident bei OpenAI, betonte, dass der Entwurf des Chips von der Spezifikation bis zum Tape-out lediglich neun Monate dauerte – eine signifikante Verkürzung gegenüber dem bisherigen Branchenstandard von bis zu zwei Jahren.
Jalapeño wurde speziell für die effiziente Inferenz eigener Modelle optimiert und im internen Betrieb bereits mit Modellen wie GPT-OSS und DeepSeek R1 getestet.
Auch Google verzeichnet Fortschritte mit seiner TPU-Serie. Benchmark-Ergebnisse vom 23. September 2026 zeigen, dass 16 Einheiten der Google TPU v7 „Ironwood“ bei der Ausführung des Modells Kimi K3 eine Geschwindigkeit von 709 Tokens pro Sekunde erreichten. Dies entspricht einer Leistungssteigerung von rund 57 % gegenüber einer vergleichbaren Konfiguration mit 16 NVIDIA GB200-Systemen.
Zusätzlich drängen spezialisierte Anbieter wie EdgeCortix mit der RAIDEN-Plattform auf den Markt, die auf „Physical AI“ in der Luftfahrt und Verteidigung abzielt, während Start-ups wie Architect Labs behaupten, Designs für Inferenzchips mithilfe von KI-Unterstützung in weniger als zwei Wochen fertigstellen zu können.
Diese Entwicklungen unterstreichen den zunehmenden Wettbewerbsdruck auf etablierte Hardware-Hersteller und die wachsende Bedeutung von Co-Design zwischen Software-Modellen und spezialisierter Hardware.

