Qwen3.8-27B: Alibabas KI-Modell schlägt Claude in Coding-Tests

Alibaba veröffentlicht mit Qwen3.8-27B ein Open-Source-Modell für lokale Systeme, das in Benchmarks teils etablierte Konkurrenz übertrifft, aber beim Reasoning Grenzen zeigt.

Alibaba hat mit Qwen3.8-27B ein neues multimodales Sprachmodell vorgestellt, das unter der Open-Source-Lizenz Apache 2.0 veröffentlicht wurde. Das Modell verfügt über 27 Milliarden Parameter und ist darauf ausgelegt, lokal auf leistungsstarker Hardware wie dem MacBook Pro, dem Mac Studio oder PC-Systemen mit Grafikkarten ab 24 Gigabyte Videospeicher (VRAM) zu laufen. Damit positioniert das Unternehmen eine leistungsfähige Alternative für Entwickler, die auf On-Premise-Lösungen setzen.

Benchmarks und Leistungsvergleiche

Nach Angaben von Alibaba erzielt Qwen3.8-27B in verschiedenen Fach-Benchmarks Ergebnisse, die teilweise etablierte Modelle übertreffen. Im sogenannten SWE-bench Pro erreichte das Modell einen Wert von 61,7, womit es über dem Ergebnis von Claude Opus 4.6 Max liegt, das dort mit 53,4 gelistet wird.

Auch im LiveCodeBench zeigt sich das Modell mit 90,3 Punkten leistungsstark. Im TerminalBench 2.1 wird ein Wert von 73,0 angegeben, was das Modell deutlich vor Meta Muse Glimmer-30B positioniert, das hier auf 51,7 kommt.

Trotz dieser Erfolge in Programmier- und Software-Benchmarks gibt es Bereiche, in denen Qwen3.8-27B hinter der Konkurrenz zurückbleibt. Bei den Tests Terminal Bench 2.1 und GPQA Diamond unterlag das Modell laut den von Alibaba veröffentlichten Daten dem Konkurrenten Opus 4.6 Max.

Branchenbeobachter wie Piotr Migdał wiesen darauf hin, dass eine unabhängige Verifizierung dieser Benchmarks noch ausstehe, wenngleich erste Tests zur Quantisierung darauf hindeuteten, dass Versionen ab 4-Bit nahezu die Präzision der vollen Modellgröße beibehalten.

Praxistests und Herausforderungen beim Reasoning

Erste Praxistests durch Fachredaktionen wie Heise lieferten konkrete Einblicke in die Leistungsfähigkeit auf moderner Hardware. In einem Test auf einer RTX Pro 6000 Blackwell erstellte das Modell eine REST-API innerhalb von 12 Minuten. Der generierte Code habe beim ersten Versuch ohne Rückfragen kompiliert, womit die Performance mit Modellen von Claude vergleichbar sei.

Anzeige

Wer sich mit dem Einsatz solch leistungsfähiger KI-Systeme befasst, muss auch die rechtlichen Rahmenbedingungen in Europa kennen. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der EU-KI-Verordnung. EU AI Act in 5 Schritten verstehen: Jetzt E-Book kostenlos sichern

Der Software-Entwickler Simon Willison berichtete jedoch von Herausforderungen bei der Nutzung des maximalen Denkaufwands (Reasoning Effort). In der Standardeinstellung „xhigh“ neigte das Modell zu extremem „Overthinking“. So habe die Erstellung einer Grafik eines Pelikans im SVG-Format 21 Minuten gedauert und dabei 22.276 Reasoning-Tokens verbraucht.

Mit deaktivierter Reasoning-Funktion sei die gleiche Aufgabe in zwei Minuten erledigt worden. Willison empfahl daher, den Reasoning-Effort in der Praxis zu senken. Dennoch lobte er das Modell für seine exzellenten Fähigkeiten bei Bounding-Box-Aufgaben und der Erstellung von Offline-Tools.

Technische Spezifikationen und Hardware-Anforderungen

Die Architektur von Qwen3.8-27B basiert auf einer Hybrid-Attention-Struktur mit 48 linearen und 16 Full-Attention-Layern. Das Modell bietet einen nativen Kontext von 262.144 Token, der mittels YaRN-Technologie auf bis zu eine Million Token erweiterbar ist. Ein voller Kontext von 262.000 Token belegt laut technischen Daten etwa 17,18 Gigabyte Arbeitsspeicher.

Anzeige

Während die technische Integration von KI-Modellen voranschreitet, stellen neue Regulierungen viele Unternehmen vor Compliance-Herausforderungen. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko gelten und was Unternehmen nun konkret tun müssen. Kostenlosen Leitfaden zur KI-Verordnung herunterladen

Für den lokalen Betrieb wurden bereits verschiedene quantisierte Versionen bereitgestellt:
– Die Q5_K_M-Variante benötigt etwa 22 Gigabyte VRAM.
– Eine NVFP4-Version kann mit 16 Gigabyte VRAM betrieben werden.
– Die 4-Bit-Datei (Q4_K_M) ist 17,9 Gigabyte groß und läuft laut Nutzerberichten stabil in LM Studio mit 17 Gigabyte RAM.

Bei der Geschwindigkeit wurden auf einem M5 Max MacBook etwa 30 Token pro Sekunde gemessen. Optimierungen durch MLX sollen auf Apple-Silicon-Systemen eine Steigerung um bis zu 153 Prozent gegenüber der Basisversion ermöglichen.

Auf High-End-Grafikkarten wie der NVIDIA RTX 5090 wurden unter Nutzung von SGLang Geschwindigkeiten von bis zu 206,1 Token pro Sekunde erreicht. Das Tool Ollama hat Qwen3.8-27B ebenfalls bereits integriert, wobei auf NVIDIA-Blackwell-Systemen Raten von über 131 Token pro Sekunde gemeldet wurden.

Parallel zur 27B-Version hat Alibaba zudem die Gewichte für eine deutlich größere Variante, das Qwen3.8-2.4T-A95B, zugänglich gemacht.