In der aktuellen Forschung zur künstlichen Intelligenz rückt das Gleichgewicht zwischen hoher Modellleistung und Recheneffizienz zunehmend in das Zentrum der Entwicklung. Wissenschaftler untersuchen dabei Sprachmodelle mit 66 Milliarden Parametern, die gezielt darauf ausgelegt sind, auf bereits existierender Hardware eine optimale Auslastung zu erreichen.
Dieser Trend zur Effizienzsteigerung spiegelt sich in einer Reihe aktueller Branchenentwicklungen wider, bei denen neue Architekturen und spezialisierte Prozessoren den Ressourcenverbrauch massiv senken sollen.
Xiaomi präsentiert HySparse2-Architektur für MiMo-V3
Ein zentrales Beispiel für diesen Fokus auf Hardware-Effizienz ist die Ankündigung von Xiaomi bezüglich des neuen Modells MiMo-V3. Wie Luo Fuli, Lead für MiMo bei Xiaomi, in einem Bericht vom 24. September 2026 darlegte, kommt in dieser Version die neue HySparse2-Architektur zum Einsatz. Diese Technologie soll insbesondere bei langen Kontexten von bis zu einer Million Token ihre Vorteile ausspielen.
Den Angaben zufolge reduziert HySparse2 die notwendige Prefill-Berechnung um das 5,02-fache, während der Bedarf an KV-Cache (Key-Value-Cache) um das 4,5-fache sinkt. Konkret verbraucht das Modell bei einer Million Token Kontext lediglich 2,69 GB KV-Cache, verglichen mit 6,72 GB bei der Vorgängerversion HySparse und 12,09 GB bei Hybrid SWA.
Auch in Leistungsbenchmarks wie RULER-v2 (256K Kontext) konnte das System mit einem Score von 58.45 überzeugen, was eine deutliche Steigerung gegenüber den 32.61 Punkten der Vorversion darstellt.
Qualcomm bringt 2nm-Chips für mobile Mixture-of-Experts-Modelle
Parallel zur Software-Architektur schreitet die Hardware-Entwicklung voran. Qualcomm stellte im Rahmen des Snapdragon Summits im September 2026 den Snapdragon 8 Elite Gen 6 sowie eine leistungsstärkere Extreme-Variante vor. Beide Chips werden im 2nm-Verfahren gefertigt und verfügen über eine neu gestaltete Oryon-CPU, die laut Herstellerangaben weltweit erstmals Taktraten von bis zu 5 GHz erreicht.
Besonders relevant für die KI-Effizienz ist die integrierte Hexagon-NPU, die über einen Element Accelerator für Transformer-Workloads verfügt. Die Extreme-Variante ist laut Qualcomm in der Lage, Mixture-of-Experts-Modelle (MoE) mit über 30 Milliarden Parametern auszuführen, wobei pro Rechenschritt jeweils nur ein Teil der Parameter aktiviert wird.
Lange Kontexte sind der größte Kostentreiber in der KI-Inferenz — der KV-Cache wächst mit jedem Token. Eine neue Architektur zeigt, wie sich der Speicherbedarf bei einer Million Token von 12,09 GB auf 2,69 GB senken lässt. Unser kostenloser Leitfaden zeigt Ihnen die konkreten Hebel: KV-Cache-Optimierung: Der Praxis-Leitfaden
Gegenüber der Vorgängergeneration soll die NPU-Leistung um 35 Prozent gestiegen sein, während die KI-Leistung pro Watt um 33 Prozent verbessert wurde. Erste Flaggschiff-Geräte von Partnern wie Xiaomi, Honor und Motorola wurden bereits bestätigt.
Liquid AI und die Beschleunigung durch Draft-Modelle
Einen weiteren Ansatz verfolgt Liquid AI mit der Veröffentlichung des DSpark-Draft-Modells für das Basismodell LFM2.5-VL-3B. Dieses Draft-Modell umfasst lediglich 279,5 Millionen Parameter – was etwa 8,9 Prozent des Zielmodells entspricht – und dient dazu, die Inferenzgeschwindigkeit durch spekulatives Decoding zu erhöhen.
In Tests auf einem Apple M5 Max mit MLX-VLM konnte laut Berichten vom 24. September 2026 eine Beschleunigung des Decodings um den Faktor 2,30 bis 3,13 erreicht werden. Auf NVIDIA-H100-Systemen lag der Speedup beim Decoding zwischen dem 2,04-fachen und 2,66-fachen. Das Training dieses Modells erfolgte über zehn Epochen auf AMD-Hardware unter Verwendung spezieller Vision-Language-Daten.
NVIDIA und DeepSeek setzen auf massive Skalierung und neue Metriken
Auch im Bereich der Rechenzentren verschieben sich die Maßstäbe. NVIDIA stellte das BioNeMo-MoE-Rezept für biologische Foundation-Modelle vor, das durch den Einsatz der Transformer Engine einen bis zu 2,21-fach höheren Trainingsdurchsatz ermöglichen soll.
Zudem präsentierte NVIDIA-Vizepräsident Ian Buck auf dem AI Infrastructure Summit im September 2026 eine neue Metrik für die Branche: „agentic tokens per megawatt“. Dies unterstreicht den Fokus auf Energieeffizienz im Verhältnis zur erbrachten KI-Leistung.
Energieeffizienz wird zum Engpass im Rechenzentrum — die Branche misst längst in Token pro Megawatt. Wer seinen KV-Cache nicht optimiert, zahlt doppelt: bei Strom und bei Hardware. Unser kostenloser Leitfaden zeigt in 5 Schritten, wie Sie Speicherbedarf und Inferenzkosten senken. Inferenzkosten senken: Die 5 Schritte
Gleichzeitig demonstrierte DeepSeek mit dem Modell V4-Pro, wie enorme Parameterzahlen handhabbar bleiben. Trotz insgesamt 1,6 Billionen Parametern wurde die KV-Cache-Größe für eine Million Token durch Quantisierung auf 9,62 GiB reduziert, während das Modell DeepSeek-V3.2 dafür noch 83,9 GiB benötigte.
Durch Techniken wie Kernel Fusion konnten zudem Geschwindigkeitsvorteile von bis zum 20-fachen bei bestimmten Rechenoperationen erzielt werden. Die Hardware-Basis für solche Operationen wird durch neue Systeme wie NVIDIAs Vera Rubin NVL72 erweitert, die in Benchmarks einen deutlich höheren Durchsatz als bisherige Blackwell-Lösungen zeigten.

