Zwei Open-Source-Projekte zeigen, wie weit sich das Software-Ökosystem rund um Apple-Silicon-Macs seit der Einführung der M-Chip-Generationen entwickelt hat: der LLM-Inferenzserver oMLX und der Windows-Kompatibilitätslayer Whisky.
Beide Werkzeuge verfolgen unterschiedliche Ziele, treffen sich aber in einem gemeinsamen Anspruch – Apples eigene Hardware- und Software-Schnittstellen so effizient wie möglich zu nutzen, statt auf Emulation oder klassische Virtualisierung zu setzen.
oMLX: Nativer Inferenzserver für Sprachmodelle
oMLX ist ein Inferenzserver, der speziell für das MLX-Framework von Apple entwickelt wurde und auf der gesamten Bandbreite der Apple-Silicon-Chips von M1 bis M5 läuft. Kernstück ist ein zweistufiges Cache-System für Key-Value-Daten: Ein RAM-Hot-Tier hält häufig genutzte Daten im Arbeitsspeicher vor, während ein SSD-Cold-Tier im safetensors-Format Daten auch über Neustarts hinweg persistent speichert.
Für die parallele Verarbeitung mehrerer Anfragen setzt oMLX auf Continuous Batching über den sogenannten BatchGenerator aus mlx-lm, gesteuert durch ein First-Come-First-Served-Scheduling im Modul omlx/scheduler.py.
Laut Benchmarks steigert eine Erhöhung der Batch-Größe von 1x auf 8x die Generierungsgeschwindigkeit von 34,0 auf 89,3 Token pro Sekunde – ein bis zu 2,63-facher Durchsatz. Ergänzend kommt Block-Level-Prefix-Sharing mit Copy-on-Write zum Einsatz, dessen Cache-Effizienz laut einem offiziellen Screenshot der Entwickler bei über 85 Prozent liegt.
Nach Angaben der Autoren selbst verkürzte sich ein 8K-Kontext-Prefill auf einem M3 Ultra von rund 49 Sekunden auf 1,7 Sekunden, ein Faktor von etwa 29. Ein eigens entwickelter Metal-Custom-Kernel soll beim Modell GLM-5.2 mit fused DSA Prefill 845 Token pro Sekunde erreichen, verglichen mit 29 Token pro Sekunde ohne den Kernel – ein Unterschied um den Faktor 30. Diese Werte stammen jedoch aus Selbstmessungen der Entwickler und wurden nicht unabhängig verifiziert.
Für den praktischen Betrieb bringt oMLX eine in Swift und SwiftUI geschriebene macOS-Menüleisten-App mit, die als Speicherwächter fungiert: Ein Default-Limit von „System-RAM minus 8 GB“ verhindert Überlastung, während LRU-Eviction, TTL-basiertes Entladen und Model Pinning die Speicherverwaltung steuern.
Die Programmierschnittstelle ist kompatibel zu den Standards von OpenAI und Anthropic und bedient sowohl /v1/chat/completions als auch /v1/messages über Port 8000, ergänzt durch ein Admin-Panel in acht Sprachen.
Unterstützt werden Multi-Modell-Serving für LLMs, Vision-Language-Modelle, Embedding- und Reranker-Modelle, eine Adaption für Claude Code sowie eine Anbindung über das Model Context Protocol per pip install mcp.
Voraussetzung ist macOS 15.0 Sequoia mit Python 3.11 bis 3.13 auf Apple-Silicon-Hardware; die Installation erfolgt über ein macOS-DMG, Homebrew (jundot/omlx) oder pip install -e ., wobei der Bau aus dem Quellcode eine vollständige Xcode-Installation voraussetzt.
Unterstützt wird ausschließlich das MLX-Format, GGUF-Modelle bleiben außen vor. Experimentell bietet das Projekt zudem verteilte Inferenz über mehrere Macs hinweg via Thunderbolt RDMA und Ring-Topologie an.
Die im August 2026 veröffentlichte Version 0.6.1 brachte laut Angaben ein um 34 Prozent gesteigertes Decode-Throughput bei einem Kontext von 16K Token.
Wer als neuer Apple-Nutzer das volle Potenzial seines Computers ausschöpfen möchte, findet in diesem kostenlosen Ratgeber die wichtigsten Einstellungen für einen optimalen Start. Gratis PDF-Starterpaket für den Mac jetzt herunterladen
Whisky: Windows-Anwendungen ohne Virtualisierung
Während oMLX auf KI-Workloads zielt, adressiert Whisky ein anderes Problem der Apple-Silicon-Nutzung: den Betrieb von Windows-Software. Der auf SwiftUI basierende Wrapper führt Windows-Anwendungen auf M1- bis M4-Macs aus, ohne eine vollständige Virtualisierung zu benötigen. Die Grundlage bilden CrossOver 22.1.1 sowie Apples Game Porting Toolkit, das DirectX-Aufrufe in Metal-Befehle übersetzt.
Der Vergleich zu klassischen virtuellen Maschinen fällt laut den vorliegenden Angaben deutlich aus: Whisky benötigt demnach 200 bis 500 MB RAM statt 4 bis 8 GB, startet in 3 bis 5 Sekunden statt in 30 bis 60 Sekunden und beansprucht Speicherplatz bedarfsabhängig statt eines festen Images von 20 GB oder mehr.
Durch native Metal-Beschleunigung soll zudem der für Virtualisierung typische Leistungsverlust von rund 30 Prozent entfallen – in der Summe wird ein um über 60 Prozent reduzierter Performance-Verlust gegenüber Virtualisierungslösungen angegeben.
Für den Betrieb werden mindestens 8 GB RAM (empfohlen 16 GB oder mehr) sowie mindestens 10 GB freier Speicher (empfohlen 20 GB oder mehr) unter macOS Sonoma 14.0 oder neuer vorausgesetzt.
Die Installation erfolgt per Homebrew-Befehl brew install –cask whisky oder aus dem Quellcode; das Projekt steht unter der GPLv3-Lizenz. Sogenannte Bottles isolieren einzelne Windows-Umgebungen voneinander, während ein CLI-Werkzeug namens whisky-cmd Automatisierung und CI/CD-Integration ermöglicht.
Konkrete Testwerte auf einem M1-Mac zeigen für einzelne Spiele durchaus praxistaugliche Ergebnisse: CS:GO erreichte bei 1920×1080 Pixeln mit DXVK und mittlerer Qualität 60 bis 80 Bilder pro Sekunde, Minecraft bei 2560×1440 Pixeln 90 bis 120 Bilder pro Sekunde, Stardew Valley konstant 60 Bilder pro Sekunde und Portal 2 zwischen 70 und 90 Bildern pro Sekunde.
Im direkten Vergleich der Startzeiten und des Speicherbedarfs schnitt Whisky mit 3 bis 5 Sekunden und unter 1 GB RAM besser ab als CrossOver (10 bis 20 Sekunden, 1 bis 2 GB) und deutlich besser als eine klassische VM-Lösung (30 bis 60 Sekunden, 2 bis 4 GB).
Um die tägliche Arbeit am Mac noch effizienter zu gestalten, hilft die Nutzung spezieller Tastenkombinationen, die unnötige Klickwege im System ersparen. Die 19 besten Mac-Shortcuts als kostenlose Übersicht sichern
Gemeinsamer Nenner: Effizienz statt Umweg
Sowohl oMLX als auch Whisky verdeutlichen einen Trend in der Software-Entwicklung für Apple Silicon: Statt bestehende Systeme über Emulationsschichten oder vollständige Virtualisierung nachzubilden, setzen beide Projekte auf native Schnittstellen wie Metal und MLX, um Ressourcen effizienter zu nutzen.
Für Anwender bedeutet das potenziell geringeren Speicherbedarf, kürzere Ladezeiten und höhere Geschwindigkeiten – sowohl beim Betrieb lokaler Sprachmodelle als auch bei der Ausführung von Windows-Software auf Mac-Hardware.

