GLM-5.3-Flash: Z.ai veröffentlicht multimodales KI-Modell mit 320 Mrd. Parametern

Z.ai bringt GLM-5.3-Flash mit 320 Milliarden Parametern heraus. Chinesische Rivalen legen ebenfalls neue offene KI-Modelle vor.

Das Technologieunternehmen Z.ai hat mit der Veröffentlichung von GLM-5.3-Flash ein neues, nativ multimodales KI-Modell unter der Open-Source-Lizenz MIT bereitgestellt. Das Modell, das ab sofort auf der Plattform Hugging Face verfügbar ist, markiert einen bedeutenden Entwicklungsschritt in der GLM-5-Serie.

Zeitgleich präsentierten weitere führende chinesische Akteure wie Alibaba, Tencent und Moonshot AI neue leistungsstarke Modelle mit offenen Gewichten, was den Wettbewerb im Bereich der großskaligen Sprachmodelle (LLMs) weiter verschärft.

GLM-5.3-Flash: Multimodalität und Effizienz

Das neue Modell GLM-5.3-Flash verfügt über insgesamt 320 Milliarden Parameter, von denen 18 Milliarden pro Rechenschritt aktiv sind. Es zeichnet sich durch ein Kontextfenster von einer Million Token sowie eine Kapazität von 131.072 Output-Token aus.

Trainiert wurde das System auf einem Korpus von 30 Billionen Token. Wie Z.ai bestätigte, handelt es sich bei GLM-5.3-Flash um das identische Modell, das zuvor unter dem Codenamen Ox Alpha auf der Plattform OpenRouter getestet wurde.

In technischen Benchmarks erreichte das Modell beim DeepSWE-Test einen Wert von 63 Prozent (Pass@1). In den ersten sechs Tagen nach der Bereitstellung verarbeitete die Architektur laut Unternehmensangaben 62 Billionen Token, wovon allein elf Billionen in den ersten drei Tagen anfielen.

Auf OpenRouter konnte das Modell bereits 31 Prozent des Coding-Volumens auf sich vereinen. Die Preisgestaltung für die API-Nutzung liegt bei 0,15 US-Dollar pro Million Input-Token und 0,50 US-Dollar pro Million Output-Token.

Technologische Basis und Hardware-Infrastruktur

Ein wesentliches Merkmal der Veröffentlichung ist der Rückgriff auf heimische Hardware. GLM-5.3-Flash wurde über sechs Tage hinweg auf chinesischen Chips der Hersteller Huawei, Hygon und Moore Threads betrieben. Moore Threads gab an, dass sein Beschleuniger MTT S5000 die Inferenz des Modells unmittelbar unterstütze.

Architektonisch nutzt das Modell eine hybride Aufmerksamkeitsstruktur (Hybrid-Attention) im Verhältnis 3:1 zwischen linearer und vollständiger Aufmerksamkeit sowie einen Muon-Optimierer. Im Gegensatz zu den Modellen der Qwen-Reihe verzichtet Z.ai bei der GLM-Architektur auf die Verwendung von Rotary Positional Embeddings (RoPE).

Anzeige

Wer sich mit der Implementierung neuer KI-Modelle befasst, muss auch die damit verbundenen Sicherheitsrisiken im Blick behalten. Dieses kostenlose E-Book klärt darüber auf, welche rechtlichen Pflichten und neuen Bedrohungen Unternehmer jetzt kennen müssen. Gratis-Report zu KI-Gesetzen und Cyberrisiken anfordern

Neben der Flash-Variante stellte Z.ai zudem das vollständige GLM-5.3-Modell vor. Dieses umfasst 753 Milliarden Parameter (40 Milliarden aktiv) und erreichte Spitzenwerte in Sicherheitsbenchmarks, darunter 84,5 Prozent auf CyberGym und 54,4 Prozent auf ExploitBench.

Letzteres entspricht mehr als einer Verdopplung der Leistung gegenüber der Vorgängerversion GLM-5.2. Die Veröffentlichung der Gewichte für dieses Modell verzögert sich aufgrund von Cybersicherheitsprüfungen jedoch um etwa zwei Wochen. Die Marktreaktion fiel positiv aus: Die Aktie von Z.ai stieg um 12 Prozent auf 1.160 HK-Dollar.

Wettbewerber Alibaba, Tencent und Moonshot AI ziehen nach

Parallel zu Z.ai veröffentlichte Alibaba das Modell Qwen3.8-Flash-Next als Vorschau auf die kommende Qwen4-Architektur. Mit 125 Milliarden Parametern (6 Milliarden aktiv) benötigt dieses Modell laut Alibaba lediglich ein Neuntel der Trainingsressourcen des Vorgängers Qwen3.7-Plus. Es ist unter der qwen-community-1.0-Lizenz verfügbar und bietet ein auf bis zu eine Million Token erweiterbares Kontextfenster.

Anzeige

Die rasante technologische Entwicklung macht Unternehmen zunehmend zur Zielgruppe für Cyberangriffe. Wie Sie Ihre IT-Infrastruktur proaktiv absichern und Sicherheitslücken schließen, ohne hohe Investitionen tätigen zu müssen, erfahren Sie in diesem Leitfaden. Kostenloses E-Book für IT-Sicherheit herunterladen

Die API-Preise für Qwen3.8-Flash-Next belaufen sich auf umgerechnet etwa 0,16 US-Dollar für den Input und 0,47 US-Dollar für den Output pro Million Token.

Tencent beteiligte sich ebenfalls am Veröffentlichungszyklus und präsentierte eine Vorschau von Hy4. Das Modell mit 770 Milliarden Parametern (49 Milliarden aktiv) soll eine um 31,8 Prozent gesteigerte Durchsatzrate bieten und wird für einen begrenzten Zeitraum kostenlos auf den hauseigenen Plattformen WorkBuddy und CodeBuddy angeboten.

Abgerundet wird die aktuelle Marktdynamik durch Moonshot AI. Das Unternehmen gab die Gewichte für sein Modell Kimi K3 frei, das mit 2,8 Billionen Parametern eine der bislang umfangreichsten Architekturen darstellt. Das im Juli 2026 mit 35 Milliarden US-Dollar bewertete Unternehmen zielt mit seiner Preisstrategie darauf ab, US-amerikanische Konkurrenten zu unterbieten. In unabhängigen Indizes belegt Kimi K3 derzeit Spitzenplätze neben den Modellen von Z.ai.