Huawei Atlas 960E: Neuer SuperPoD bündelt 4.096 NPUs für KI-Modelle

Der Atlas 960E bündelt bis zu 4.096 NPUs; Huaweis Leistungs- und Effizienzangaben sind bislang nicht unabhängig bestätigt.

•

Huawei hat auf der HUAWEI CONNECT 2026 in Shanghai mit dem Atlas 960E SuperPoD nach eigenen Angaben den weltweit ersten NPO-basierten (Network-on-Package) SuperPoD vorgestellt.

Das System wurde von David Wang, Deputy Chairman und Rotating Chairman des Unternehmens, präsentiert und soll für Training und Inferenz von Modellen mit bis zu 10 Billionen Parametern ausgelegt sein. Der Vorstoß fügt sich in eine Reihe von Ankündigungen ein, mit denen Huawei seine Position im Wettlauf um KI-Infrastruktur untermauern will.

Technische Eckdaten des Atlas 960E

Ein einzelner Atlas 960E SuperPoD skaliert auf 4.096 NPUs und erreicht 8 EFLOPS bei FP8-Präzision sowie 16 EFLOPS bei FP4. Kernstück ist die neue Hi-ONE 7.2T NPO-Engine in Kombination mit der UnifiedBus-Interconnect-Architektur. Pro Einheit stehen bis zu 1 Petabyte High-Bandwidth-Memory zur Verfügung.

Nach Angaben von Huawei ersetzen 5.500 Hi-ONE-Einheiten mit 7,2 Tbit/s Übertragungsrate rund 48.000 konventionelle 800G-Optikmodule. Huawei bezeichnet Hi-ONE als den weltweit ersten massengefertigten NPO-Lichtmotor und als einzige NPO-Lösung mit integrierter Lichtquelle.

Effizienzversprechen und offene Verifikation

Laut Huawei senkt der Einsatz der Hi-ONE-Einheiten den Stromverbrauch um über 550 Kilowatt, verdoppelt die fehlerfreie Betriebszeit und erreicht eine Systemverfügbarkeit von 99,8 Prozent. Huawei verweist zudem darauf, dass Kommunikation in konventionellen Clustern mit 100.000 NPUs über 40 Prozent der Trainingszeit beanspruchen kann.

Simulationen der unternehmenseigenen Markov-Labs zeigen für 4.000-NPU-SuperPoD-Cluster eine 2,75-fache Model-FLOPs-Utilization gegenüber Clustern aus konventionellen 8-NPU-Servern. Unabhängige Fachmedien weisen darauf hin, dass diese Leistungs- und Zuverlässigkeitsangaben von Huawei bislang einer unabhängigen Verifikation bedürfen.

Einordnung in die Clusterstrategie

Der SuperPoD-Ansatz ist Teil einer größer angelegten Skalierungsstrategie: SuperCluster-Systeme sollen laut Huawei auf bis zu 512.000 NPUs in einer zweistufigen Vier-Ebenen-Clos-Architektur wachsen, mit einer Multi-Rail-Konfiguration für bis zu 1 Million NPUs.

Anzeige

Wer KI-Cluster jenseits der 4.096 NPUs plant, stößt auf einen Engpass, den Huawei mit UnifiedBus adressiert: Interconnect-Latenz und Bandbreite entscheiden über Trainingszeit. Der neue Atlas 960E SuperPoD setzt auf NPO statt klassischer Optikmodule — was das für Ihre Architektur bedeutet, ordnet dieser Report ein. Kostenlosen Architektur-Report anfordern

Diese Multi-Rail-Variante mit bis zu 1 Million NPO-Engines wurde bereits auf der CIOE-Messe in Shenzhen demonstriert. Die SuperPoD-basierten SuperCluster bilden nach Unternehmensangaben die erste Produktgeneration auf Basis der neuen Peerium Computing Architecture, die auf die Koordination von bis zu 1 Million Prozessoren als ein einziges Rechensystem zielt.

Zentrales Bindeglied ist UnifiedBus, das laut Yang Chaobin, CEO der ICT Business Unit, zehn verschiedene Protokolle in einer Architektur zusammenführt, die Round-Trip-Latenz von 7 Millisekunden auf 2 Millisekunden senkt und die Interconnect-Bandbreite von 100 Gbit/s auf 1 Tbit/s erhöht.

David Wang ergänzte, dass konventionelle Inter-Server-Latenzen im Bereich von hunderten Nanosekunden gegenüber zehnfachen Mikrosekunden bei Intra-Server-Verbindungen liegen – ein Engpass, den UnifiedBus über ein einheitliches Protokoll, gemeinsame Speicher-Semantik, heterogene Compute-Kollaboration, gestuften Speicher mit globalem Pooling und optoelektronische Verbindungen adressieren soll. Als weitere Komponente nannte Huawei DDRM als alternative Speicherquelle für NPUs, die die Vektor-Retrieval-Performance verdoppeln soll.

Weitere Produkte und Ökosystem-Öffnung

Neben dem Atlas 960E präsentierte Huawei den TaiShan 950 SuperPoD für General Computing mit bis zu 4.096 Knoten und einem 256-Terabyte-großen Unified-Memory-Pool sowie den OceanStor M900 mit einem Petabyte-KV-Cache für die Anwendungsstufe L3.5. Zudem wurde die CANN-Plattform als Open Source freigegeben – David Wang bekräftigte damit das Bekenntnis des Unternehmens zu einem offenen Computing-Ökosystem.

Eric Xu, ebenfalls Rotating Chairman bei Huawei, formulierte als Ziel, Rechenleistung flächendeckend verfügbar zu machen. Während der Atlas 950 SuperCluster mit 256.000 Karten bereits ausgerollt werde, befinde sich der Atlas 960 mit NPO-Technologie noch in der Testphase.

NPO als Alternative zu CPO

Branchenbeobachter ordnen Huaweis Hi-ONE-Lichtmotor als erstes NPO-Produkt ein, das in Serienfertigung geht. NPO positioniert sich damit als wartungsfreundlichere und skalierbarere Alternative zum CPO-Ansatz (Co-Packaged Optics), wie ihn etwa Nvidia verfolgt – wobei Keramiksubstrate aus Aluminiumnitrid für beide Routen als Kernmaterial gelten.

Anzeige

Stromverbrauch und Kühlung werden zum limitierenden Faktor im Rechenzentrum: 5.500 NPO-Einheiten sollen laut Huawei rund 48.000 800G-Optikmodule ersetzen und über 550 Kilowatt einsparen. Wie sich das auf Ihre RZ-Planung und Beschaffungsstrategie auswirkt, fasst dieser Report zusammen. RZ-Planungsleitfaden jetzt sichern

Das Optical Internetworking Forum arbeitet derzeit an branchenweiten NPO-Standards; Huawei ist an diesem Prozess beteiligt. Weiteren Berichten zufolge testet Huawei den SuperPoD-KI-Compute-Stack aus UnifiedBus und Near-Packaged Optics bereits und zieht den Start seiner nächsten AI-Chip-Generation vor.