Whistle von Cactus Compute: Spracherkennung passt in 16,9 MB

Whistle verarbeitet Sprache lokal in sieben Sprachen und erzielt in CPU-Tests hohe Tokenraten; unabhängige Bestätigung der Messwerte fehlt.

•

Das Entwicklungsunternehmen Cactus Compute hat am 2. Oktober 2026 das Modell Whistle vorgestellt. Das Open-Weight-System zur automatischen Spracherkennung umfasst als einzelne Datei 16,9 MB (16.919.407 Bytes) und wurde für den direkten Einsatz auf Edge-Hardware wie Smartwatches sowie in Webbrowsern konzipiert. Whistle deckt sieben Sprachen ab: Deutsch, Englisch, Französisch, Spanisch, Italienisch, Niederländisch und Polnisch.

Lokale Verarbeitung ohne Abhängigkeiten

Whistle arbeitet rein auf der CPU und benötigt keine externen Abhängigkeiten. Das Modell greift auf dieselbe C++-Engine, dasselbe .cact-Container-Format sowie dieselbe Quantisierungsmethode zurück wie das Schwesterprojekt Needle des Anbieters.

Cactus Compute veröffentlichte das von Jakub Mroz und Henry Ndubuaku signierte Modell unter der Apache-2.0-Lizenz auf Hugging Face; die Installation erfolgt über den Python-Paketmanager mit dem Befehl pip cactus-needle.

Die Audioverarbeitung findet vollständig lokal auf dem jeweiligen Endgerät statt, sodass eingehende Audiodaten die Hardware nicht verlassen. Als Zielplattformen nennt das Unternehmen Mobiltelefone, Wearables, Robotik, Smart-Home-Anwendungen, die Automobilbranche sowie Mikrocontroller.

Vorkompilierte Binärdateien stehen für 17 Zielumgebungen bereit, darunter macOS, Linux, Android, iOS, watchOS, Windows on ARM, RISC-V, WebAssembly im Browser, WASI sowie Embedded-Systeme.

Anzeige

Wer sich mit dem Einsatz solcher KI-Systeme befasst, muss neben der technischen Performance auch die rechtlichen Rahmenbedingungen im Blick behalten. Dieser praxisnahe Leitfaden unterstützt Unternehmen dabei, die Anforderungen der neuen EU-Gesetzgebung an Risikodokumentation und Qualitätssicherung rechtssicher umzusetzen. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt

Neben der Transkription von 16-kHz-Monosignalen bis zu einer Dauer von 30 Sekunden pro Durchgang und einer Begrenzung auf 320 Tokens bietet Whistle automatische Spracherkennung, Wort-Zeitstempel mit Wahrscheinlichkeitsangaben, Sprach-Embeddings im Takt von 80 Millisekunden, eine Stilleerkennung sowie Keyword-Biasing.

Architektur und Benchmark-Vergleiche

Der Full-Precision-Checkpoint des Modells umfasst rund 55,15 Millionen Parameter, wovon knapp 20 Millionen auf zwei Engram-Lookup-Tabellen entfallen. Die Modellarchitektur besteht aus acht Simple-Attention-Encoder-Blöcken, acht Laddered-Decoder-Blöcken, fünf Beams und einem Vokabular von 8.192 Tokens.

Die Decodertiefe lässt sich über den Parameter –audio-depth anpassen. Durch eine Quantisierung mit überwiegend 2-Bit-Gewichten, 4-Bit-Embeddings und 8-Bit-Aktivierungen schrumpft der Speicherbedarf auf 16,9 MB, ergänzt um eine Laufzeitumgebung von etwa 1 MB.

In Tests auf der CPU eines Apple M4 Pro verzeichnete Cactus Compute bei einem zehnsekündigen Audioclip eine Zeit bis zum ersten Token von 11,1 Millisekunden bei einer Verarbeitungsgeschwindigkeit von 1.319 Tokens pro Sekunde.

Im selben Versuchsaufbau erreichte Whisper base bei einer Modellgröße von 145,3 MB Werte von 73,2 Millisekunden sowie 266 Tokens pro Sekunde, während Moonshine tiny v2 bei 41,9 MB auf 22,8 Millisekunden und 262 Tokens pro Sekunde kam.

Anzeige

Die Entwicklung spezialisierter KI-Anwendungen stellt Unternehmen vor neue Herausforderungen bei der Einhaltung von Compliance-Vorgaben. Erfahren Sie in diesem kostenlosen Report, welche Pflichten für verschiedene Risikoklassen gelten und wie Sie empfindliche Strafen proaktiv vermeiden. Jetzt kostenlosen Umsetzungsleitfaden zum EU AI Act sichern

Bezüglich der Wortfehlerrate beziffert Cactus Compute die Werte auf dem Datensatz LibriSpeech mit 4,31 Prozent im Bereich test-clean und 10,49 Prozent bei test-other. Bei 86.174 getesteten Äußerungen erzielte Whistle bessere Ergebnisse auf LibriSpeech, SPGISpeech, Earnings-22 und dem FLEURS-Durchschnitt, während Whisper base auf TED-LIUM, AMI und dem MLS-Durchschnitt vorne lag.

Rückmeldungen aus der Praxis und Einschränkungen

Trotz der geringen Latenz weist das Modell funktionale Einschränkungen auf. Während Whisper base 99 Sprachen verarbeitet, bleibt Whistle auf sieben begrenzt. Zudem basieren alle Leistungsangaben auf unternehmenseigenen Messungen und sind nicht unabhängig bestätigt worden.

Nach der Veröffentlichung erreichte ein Beitrag zu Whistle auf der Plattform Hacker News am 8. Oktober 2026 mehr als 600 Punkte und 140 Kommentare. Mehrere Anwender berichteten dort über schwächere Ergebnisse bei der Erkennung spanischer und polnischer Spracheingaben. Zudem existiert eine Vorlage für die Cloud-Plattform Railway, die das Modell in eine OpenAI-kompatible Schnittstelle einbettet und dabei rund 120 MB Arbeitsspeicher benötigt.