F5 China hat eine neue Technologie zur Lastverteilung für heterogene GPU-Cluster vorgestellt. Das als Token Based Load Balancing (TBLB) bezeichnete Verfahren soll die Effizienz beim Betrieb von KI-Infrastrukturen mit unterschiedlichen Grafikprozessoren deutlich steigern. Nach Angaben von F5 China verbessert die Technologie die Konkurrenzleistung – also die Fähigkeit, gleichzeitig mehr Anfragen parallel zu verarbeiten – um bis zu 75 Prozent.
Praxisbeispiele aus drei Branchen
F5 China untermauert die Ankündigung mit mehreren dokumentierten Anwendungsfällen aus unterschiedlichen Branchen. Im Automobilsektor kam TBLB in einem Cluster mit sechs NVIDIA-A40- und acht NVIDIA-L20-Grafikprozessoren zum Einsatz. Dort steigerte die Technologie die Token-Generierung um 30,3 Prozent, während sich die End-to-End-Antwortzeit um 48 Prozent verbesserte.
Im Finanzsektor testete F5 China TBLB in einer Kombination aus Ali-PPU- und NVIDIA-H20-Chips. Hier verzeichnete das Unternehmen eine Steigerung der Token-Generierung um 42 Prozent. In beiden Szenarien gibt F5 China zudem an, dass sich die GPU-Auslastung auf bis zu 60 Prozent erhöhen ließ.
Der deutlichste Effekt zeigte sich laut F5 China im Telekommunikationsbereich. In einem Cluster mit Huawei-Ascend-910B-Chips steigerte TBLB die Konkurrenzleistung um 75 Prozent und die Token-Geschwindigkeit um 99 Prozent – die höchsten von F5 China berichteten Werte unter den vorgestellten Fällen.
Hintergrund: Heterogene Cluster als Herausforderung
Der Anwendungsfall macht deutlich, worum es bei TBLB im Kern geht: Rechenzentren für KI-Workloads setzen zunehmend nicht mehr ausschließlich auf einheitliche GPU-Modelle eines Herstellers, sondern kombinieren unterschiedliche Chip-Generationen und -Anbieter – etwa NVIDIA-, Huawei- oder Ali-PPU-Hardware innerhalb desselben Clusters.
Wer sich mit der Skalierung digitaler Infrastrukturen befasst, muss auch die damit verbundenen Risiken durch moderne Cyberbedrohungen im Blick behalten. Dieses kostenlose E-Book unterstützt Sie dabei, Sicherheitslücken effektiv zu schließen und neue gesetzliche Vorgaben umzusetzen. Gratis-E-Book: Cyber Security Trends jetzt herunterladen
Eine solche Heterogenität erschwert die effiziente Verteilung von Rechenlasten, da unterschiedliche Chips unterschiedliche Leistungsprofile aufweisen.
Klassische Lastverteilungsverfahren, die etwa auf reiner Anfragenanzahl basieren, stoßen in solchen Umgebungen an ihre Grenzen. Die tokenbasierte Verteilung setzt stattdessen an der tatsächlichen Verarbeitungseinheit von Sprachmodellen an, dem Token, um Ressourcen gezielter zuzuweisen.
Strategisches Signal: „Innovate in China, Connect Globally“
F5 China ordnet die Einführung von TBLB in ein umfassenderes strategisches Upgrade ein, das das Unternehmen unter dem Motto „Innovate in China, Connect Globally“ zusammenfasst. Damit positioniert sich die China-Einheit von F5 als Entwicklungsstandort für Technologien, die zunächst im heimischen Markt mit seiner spezifischen Hardware-Vielfalt erprobt und anschließend für den internationalen Einsatz weiterentwickelt werden sollen.
Die vorgestellten Praxisfälle mit Chips von NVIDIA, Huawei und Ali-PPU deuten darauf hin, dass F5 China die Lösung gezielt für Umgebungen entwickelt hat, in denen Betreiber aus Kostengründen, Verfügbarkeitsengpässen oder regulatorischen Vorgaben auf einen Mix verschiedener Hardware-Anbieter setzen müssen.
Mit der zunehmenden Nutzung von KI und neuen Hardware-Strukturen entstehen auch neue Anforderungen an die digitale Sicherheit von Unternehmen. Erfahren Sie in diesem kostenlosen Report, welche rechtlichen Pflichten und technischen Bedrohungen für Ihre IT-Sicherheit jetzt relevant sind. Kostenlosen Cyber-Security-Report für Unternehmen sichern
Für Betreiber von Rechenzentren, die mit begrenzten GPU-Kontingenten unterschiedlicher Generationen arbeiten, verspricht eine bessere Auslastung bestehender Hardware wirtschaftliche Vorteile, ohne dass zusätzliche Chips beschafft werden müssen.
Konkrete Angaben zu einer breiteren kommerziellen Verfügbarkeit von TBLB außerhalb der genannten Testfälle liegen bislang nicht vor.

