Google TPU v7 Ironwood: Inferact misst 57 Prozent mehr KI-Durchsatz

Inferacts Tests zeigen höhere Tokenraten für Googles TPU-Plattform; die Modellgenauigkeit entsprach der von Nvidias System.

•

Ein neuer Benchmark des Startups Inferact stellt die Leistungsfähigkeit von Googles TPU v7 Ironwood im Vergleich zu Nvidias GB200-Plattform bei der KI-Inferenz heraus.

Wie qbitai.com und ifeng.com berichteten, erreichten 16 TPU-v7-Ironwood-Chips bei dem Modell Kimi K3 unter Einsatz von vLLM einen Durchsatz von 709 Token pro Sekunde – gegenüber 452 Token pro Sekunde bei 16 Nvidia-GB200-Einheiten. Das entspricht einem Leistungsvorsprung von 57 Prozent zugunsten der Google-Hardware.

Inferact wurde von Mitgliedern des Gründungsteams von vLLM ins Leben gerufen, einem verbreiteten Open-Source-Framework für die Inferenz großer Sprachmodelle.

Speculative Decoding als Schlüsseltechnik

Der Vorsprung basiert unter anderem auf dem Einsatz des DeepSeek-Frameworks DSpark, das im Benchmark eine Acceptance Length von 6 sowie einen Decode-Schritt von rund 8,5 Millisekunden erzielte.

Auch ohne Speculative Decoding zeigte sich laut dem Bericht ein Vorteil für die TPU-Plattform: Bei einer Batch-Größe von 1 kam die TPU auf 249 Token pro Sekunde gegenüber 127 Token pro Sekunde beim GB200-System, bei Batch-Größe 8 auf 865 gegenüber 636 Token pro Sekunde.

Anzeige

Wer sich mit dem Einsatz hochperformanter KI-Infrastruktur befasst, muss auch die rechtlichen Rahmenbedingungen der neuen EU-Verordnungen im Blick behalten. Dieser kostenlose Umsetzungsleitfaden bietet Unternehmen einen kompakten Überblick über alle neuen Pflichten und Fristen des EU AI Acts. EU AI Act in 5 Schritten verstehen

Für das Modell Qwen 3.8 27B ermittelte Inferact auf vier TPU-v7-Chips einen Durchsatz von 1515 Token pro Sekunde, während das GB200-System 695 Token pro Sekunde erreichte.

Bei der Modellgenauigkeit gab es laut den Testergebnissen keine Unterschiede zwischen den Plattformen: Beide erzielten auf dem GPQA-Diamond-Benchmark 94,4 Prozent und auf GSM8K 97,2 Prozent.

Hardware-Spezifikationen im Detail

Bemerkenswert ist, dass die reine Speicherbandbreite nicht der entscheidende Faktor für den gemessenen Vorsprung war: Die HBM-Bandbreite der TPU v7 liegt laut den Angaben bei 7380 Gigabyte pro Sekunde und damit unter den 8000 Gigabyte pro Sekunde des GB200-Systems. Der Leistungsvorteil resultiert demnach eher aus Software- und Architekturoptimierungen als aus reiner Speicherdurchsatzleistung.

Anzeige

Während die Hardware-Entwicklung rasant voranschreitet, stellen neue Regeln wie die EU-KI-Verordnung viele Unternehmen vor große Herausforderungen bei der Risikodokumentation. Erfahren Sie in diesem praxisnahen E-Book, welche KI-Systeme als Hochrisiko gelten und wie Sie die Compliance in Ihrem Unternehmen sicherstellen. Kostenlosen Leitfaden zur KI-Verordnung herunterladen

Ein zentraler Baustein dafür ist laut dem Bericht der Einsatz eines sogenannten Megakernels auf Basis von Pallas, der 92 MoE-Layer in einem einzigen Programm zusammenfasst und damit die zuvor genutzte XLA-Kompilierung ablöst. Dieser Ansatz habe die Kompilierzeit von zuvor mehr als 30 Minuten auf unter 90 Sekunden reduziert. Der zugehörige Code wurde nach Angaben der Quellen als Open Source veröffentlicht.

Einordnung in den Inferenz-Wettbewerb

Der Benchmark reiht sich in eine Reihe aktueller Vergleichstests zur Inferenz-Hardware großer Sprachmodelle ein, bei denen verschiedene Anbieter ihre jeweiligen Plattformen und Software-Stacks gegeneinander antreten lassen. Für Inferact als Unternehmen aus dem Umfeld der vLLM-Entwicklung dürfte der Test auch dazu dienen, die eigene technische Kompetenz im Bereich Inferenz-Optimierung zu unterstreichen.

Die vorgelegten Zahlen sind unternehmenseigene Benchmark-Ergebnisse und wurden nach aktuellem Kenntnisstand nicht durch unabhängige Dritte validiert. Für Unternehmen, die über den Einsatz von KI-Inferenz-Infrastruktur entscheiden, liefern derartige Vergleichstests dennoch wichtige Anhaltspunkte darüber, wie sich Kombinationen aus Hardware und Software-Stack in der Praxis unterscheiden können – insbesondere im Hinblick auf Techniken wie Speculative Decoding, die zunehmend als Hebel für höhere Durchsatzraten bei gleichbleibender Modellgenauigkeit gelten.