Am 7. Oktober 2026 hat Microsoft das Modell MAI-Code-1.1-Flash für die lokale Ausführung freigegeben. Das Programmierwerkzeug aus der offenen MAI-Modellfamilie lässt sich direkt auf Endgeräten betreiben, stellt allerdings erhebliche Anforderungen an die Systemressourcen: Für die beste Performance empfiehlt Microsoft eine Hardware-Konfiguration mit mehr als 120 GB Arbeitsspeicher.
Architektur und drastische Speicheranforderungen
MAI-Code-1.1-Flash basiert auf einer Mixture-of-Experts-Architektur und umfasst 137 Milliarden Gesamtparameter sowie 6,8 Milliarden aktive Parameter. Eine im August veröffentlichte Modellkarte wies abweichend noch 138 Milliarden Gesamt- und 5 Milliarden aktive Parameter aus.
Um den Betrieb auf lokalen Systemen zu ermöglichen, setzt Microsoft auf eine gemischte Präzision von rund 3,3 Bit pro Gewicht sowie DFlash2 Speculative Decoding über Windows ARM64 llama.cpp CUDA.
Durch diese 3-Bit-Quantisierung sinkt die Dateigröße auf 53 GB, was einer Reduktion von 80 Prozent gegenüber der Bfloat16-Cloud-Variante entspricht. Der Spitzen-Speicherbedarf beläuft sich bei Ausnutzung des vollen Kontextfensters von 256K auf 75,5 GB.
Für herkömmliche Mittelklasse-Laptops und ältere Desktop-Rechner ist der lokale Einsatz des Modells daher nicht ausgelegt. Als Referenzplattform dient das am 7. Oktober 2026 vorgestellte Surface Laptop Ultra, das ab dem 16. Oktober 2026 ausgeliefert wird.
Ausgestattet mit einem Nvidia-RTX-Spark-Superchip, einer bis zu 20-Core Grace CPU und bis zu 128 GB Unified Memory reicht dessen Rechenleistung an ein Petaflop heran. Während das Einstiegsmodell mit 24 GB Arbeitsspeicher für das Coding-Modell nicht ausreicht, bewegen sich die Preise der Gerätereihe zwischen 2.599 US-Dollar und 5.899 US-Dollar in der Spitzenkonfiguration.
Wer sich mit der Einführung neuer Microsoft-Technologien befasst, sollte auch die rechtlichen Rahmenbedingungen für den Einsatz künstlicher Intelligenz kennen. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Überblick über Fristen, Pflichten und Risikoklassen der aktuellen Gesetzgebung. EU AI Act in 5 Schritten verstehen
Hohe Verarbeitungsgeschwindigkeit und Benchmark-Ergebnisse
Bei Tests am 5. Oktober 2026 erzielte das Modell bei synthetischen Programmier-Workloads beachtliche Geschwindigkeiten. Beim Prompt-Processing erreicht das System 923,5 Tokens pro Sekunde bei 64K-Kontext und 769,8 Tokens pro Sekunde bei 128K-Kontext.
Die Generierungsleistung liegt bei rund 63 Tokens pro Sekunde bei kurzen Prompts und sinkt bei vollem 256K-Kontext auf knapp unter 40 Tokens pro Sekunde. Laut Microsoft verarbeitet das Modell Tokens um 25 Prozent schneller und benötigt 25 Prozent weniger Tokens pro Aufgabe als der Vorgänger MAI-Code-1.0.
In standardisierten Leistungsvergleichen liegt die quantisierte Offline-Variante nahezu gleichauf mit der Cloud-Version. Im Benchmark SWE-Bench Verified erreichte die lokale Variante 70,80 Prozent gegenüber 72,6 Prozent in der Cloud und übertraf Vergleichsmodelle wie GPT-OSS-120B mit 32,0 Prozent deutlich.
Die rasante Entwicklung bei KI-Modellen stellt Unternehmen nicht nur vor technische, sondern auch vor neue regulatorische Herausforderungen. Ein kostenloser Experten-Report klärt darüber auf, welche rechtlichen Pflichten und potenziellen Risiken für Betriebe jetzt besonders relevant sind. Kostenlosen Report zu KI-Gesetzen und Cyberrisiken anfordern
Im Terminal-Bench 2.1 schnitt die lokale Fassung mit 66,29 Prozent sogar besser ab als die Cloud-Instanz mit 62,9 Prozent. Microsoft positioniert die Neuentwicklung vor allem als Alternative zu Modellen wie Claude Haiku 5.5 und GPT-6 Luna.
Datenschutz durch On-Device-Betrieb und Sicherheitsisolation
Ein wesentlicher Vorteil der lokalen Bereitstellung liegt im Datenschutz. Bei Demonstrationen im Flugmodus verließen weder Quellcode noch Prompts oder Modellausgaben das jeweilige Endgerät.
Der Rollout für eine begrenzte Nutzergruppe in GitHub Copilot ist über die Copilot-App, das Command-Line-Interface und die VS-Code-Integration bis Ende Oktober 2026 geplant. Die Steuerung erfolgt künftig entweder über die HydraFusion-Orchestrierung oder durch gezielte Auswahl lokaler Endpunkte über den Windows ML Provider.
Für die Ausführungssicherheit stellt Microsoft die Execution Containers unter Windows 11 nun allgemein zur Verfügung. Diese kapseln Agenten-Aktionen über betriebssystemeigene Schutzmechanismen wie Windows-Container, macOS Seatbelt oder Linux bubblewrap ab, sodass KI-Agenten als separate Nutzer mit eigenen Berechtigungen agieren. Integrationen in Microsoft Entra, Agent 365 und Intune stehen für lokale Umgebungen allerdings noch aus.

