Backburner: iPhone 17 Pro Max erweitert Mac-KI-Kontext auf bis zu 229.000 Token

Ein iPhone steigert bei langen Eingabekontexten die Vorverarbeitung und erweitert den nutzbaren Speicher für lokale KI-Modelle.

•

Ein Entwickler hat ein Werkzeug veröffentlicht, das iPhones und iPads mit Apple-Silicon-Chips per USB-C-Kabel als zusätzliche Rechenleistung für lokale KI-Modelle auf dem Mac nutzbar macht. Die MIT-lizenzierte Software namens Backburner stammt vom GitHub-Nutzer StayLameBro, der unter dem Reddit-Namen u/StayLameBro bekannt ist, und basiert auf einem Fork von llama.cpp.

Wie traictory.com und wccftech.com berichteten, koppelte der Entwickler ein iPhone 17 Pro Max über ein 10-Gb/s-USB-C-Kabel an ein MacBook Pro mit M4 Pro Chip und 24 GB Unified Memory, um das Sprachmodell Qwen3.8-27B zu beschleunigen.

Deutliche Prefill-Gewinne, Decode bleibt unverändert

Die Messungen erfolgten auf einem MacBook Pro M4 Pro mit 24 GB Arbeitsspeicher unter macOS 26.2 mit dem Modellformat IQ4_XS. Bei der Prefill-Phase, also der Verarbeitung des Eingabekontexts, zeigten sich klare Verbesserungen: Bei 16.000 Token Kontext stieg die Geschwindigkeit von 109 auf 157 Token pro Sekunde, ein Plus von 44 Prozent. Bei 32.000 Token wuchs der Wert von 101 auf 130 Token pro Sekunde (+29 Prozent), bei 48.000 Token von 87 auf 113 Token pro Sekunde (+30 Prozent).

In einer kompletten Agenten-Sitzung mit 26.849 Token dauerte der kalte Start mit Standard-llama.cpp 245 Sekunden. Mit dem Fork allein auf dem Mac verkürzte sich die Zeit auf 228 Sekunden, mit zusätzlicher iPhone-Unterstützung auf 168 Sekunden.

Die Dekodierung, also die eigentliche Textgenerierung, blieb bei einem Kontext unter 64.000 Token praktisch unverändert bei 25,0 gegenüber 25,1 Token pro Sekunde. Laut wccftech.com bleibt diese Aufgabe unter 64K also weiterhin dem Mac vorbehalten, das iPhone liefert hier keinen Geschwindigkeitsvorteil.

Anzeige

Wer sein iPhone für solche fortgeschrittenen Funktionen nutzt, sollte auch die grundlegende Fachsprache von Apple sicher beherrschen. Dieses kostenlose Lexikon erklärt 53 wichtige Begriffe verständlich und kompakt. Gratis iPhone-Lexikon jetzt anfordern

Größeres Kontextfenster durch iPhone-Speicher

Neben der reinen Geschwindigkeit erweitert die Kopplung auch das nutzbare Kontextfenster. Ein 24-GB-Mac erreicht bei 8-Bit-Quantisierung allein 64.000 Token Kontext. Mit einem iPhone 17 Pro Max als Ergänzung wächst dieser Wert auf 196.000 bis 229.000 Token bei 8-Bit.

Technisch teilt Backburner die Modell-Layer auf: Das MacBook Pro übernimmt die Layer 1 bis 40 in 256-Token-Batches, während die GPU des iPhone-Chips A19 Pro die Layer 41 bis 64 verarbeitet. Laut wccftech.com macht diese Aufteilung das iPhone rund 2,4-mal schneller, als es ohne diese Kombination wäre.

Ein weiterer Mechanismus nutzt die Neural Engine des iPhones: Sie kompiliert je 16.000 Token alten Kontext in ein eigenes Modell. Dadurch sinkt die Schreibzeit pro Token bei 140.000 Kontext von 279 Millisekunden auf 176 Millisekunden im Vergleich zur alleinigen Nutzung der A19-Pro-GPU.

Grenzen und Ausblick

Die Einschränkung bleibt: Unterhalb von 64.000 Token Kontext beschleunigt das iPhone die reine Textgenerierung nicht, diese Aufgabe verbleibt beim Mac. Für zukünftige Generationen sehen die Entwickler weiteres Potenzial – der kommende A20 Pro-Chip im iPhone 18 Pro mit einer Dual-16-Kern-Neural-Engine könnte laut wccftech.com mehr Spielraum für solche Beschleunigungstechniken bieten.

Anzeige

Um das volle Potenzial Ihres iPhones auszuschöpfen, helfen oft schon einfache Kniffe im Alltag. Dieser kostenlose Intensivkurs zeigt Ihnen die besten Tipps und versteckten Funktionen für Ihr Gerät. Kostenlosen iPhone-Report herunterladen

Parallelentwicklungen bei Inferenz-Engines für Apple Silicon

Neben Backburner existieren weitere Ansätze zur Optimierung lokaler Sprachmodelle auf Apple-Hardware. So hat das Unternehmen Inco AI mit Splash 1.1.0 eine unter Apache 2.0 lizenzierte Inferenz-Engine veröffentlicht, die auf spekulativem Decoding namens DFlash 2 sowie eigenen Metal-Kernels basiert.

Laut Entwicklertests erreicht das Modell Qwen3.8-27B in der Quantisierung Unsloth UD-Q4_K_M auf einem M5 Pro rund 74 Token pro Sekunde gegenüber 27 Token pro Sekunde bei llama.cpp, was etwa einer 2,7-fachen Beschleunigung entspricht.

Bei exakt wiederholten Anfragen mit 32.000 Token Länge sinkt die Zeit bis zum ersten Token auf einem M5 Pro mit 16 GPU-Kernen und 48 GB Speicher laut dzen.guru auf 282 Millisekunden, verglichen mit 96 Sekunden bei einer neuen Anfrage gleicher Länge.

Splash setzt dabei mindestens einen Mac mit M3-Chip oder neuer, macOS 26.4 oder höher sowie mindestens 24 GB RAM voraus; für 4-Bit-Quantisierung werden ab 36 GB empfohlen, idealerweise 48 GB. Unterstützt werden derzeit nur die Modelle Qwen3.8-27B und Qwen3.6-35B-A3B. Auf einem 48-GB-M5-Pro erreicht Splash beim Modell Qwen3.6-35B-A3B laut startupfortune.com 210 Token pro Sekunde.

Der Tradeoff solcher modellspezifischer Engines liegt laut startupfortune.com darin, dass sie jeweils an ein Modell und eine GPU-Familie gebunden sind – wechselt ein Nutzer das Modell oder erscheint eine neue Qwen-Version, kann der Support entfallen.