Microsoft-Decision-1: 83,5 Prozent Genauigkeit in 36 Benchmarks erreicht

Microsoft meldet 83,5 Prozent Genauigkeit in internen Tests und setzt das Modell bereits für mehrere Aufgaben ein.

•

Der US-Technologiekonzern Microsoft hat mit Microsoft-Decision-1 ein spezialisiertes KI-Modell der Neun-Milliarden-Parameter-Klasse vorgestellt. Anders als herkömmliche Sprachmodelle dient das System nicht der fortlaufenden Generierung von Texten, sondern der schnellen und strukturierten Bewertung vorgegebener Auswahlmöglichkeiten. Das Modell baut auf dem quelloffenen System Qwen3.5-9B von Alibaba Cloud auf und wurde nachträglich für gezielte Entscheidungsaufgaben trainiert.

Schnelle Wahrscheinlichkeiten für strukturierte Abläufe

Microsoft-Decision-1 liefert in einem Durchlauf kalibrierte Wahrscheinlichkeitswerte für geschlossene Optionssets und unterstützt Formate wie Ja-Nein-Abfragen, Multiple-Choice-Auswahlen, Ratingskalen sowie Rubriken-Bewertungen.

Das System verarbeitet reine Texteingaben mit einem Kontextfenster von bis zu 32.768 Tokens und gibt strukturierte JSON-Daten aus. Für Entwickler und Unternehmenskunden steht das Modell in Microsoft Foundry zur Verfügung; zudem ist eine Bereitstellung über die Plattform OpenRouter vorgesehen.

Als primäre Einsatzgebiete nennt der Konzern Aufgaben wie Modell-Routing, Text- und Datenklassifikation, Priorisierungen, Verifikationsprozesse und die automatisierte Steuerung von Arbeitsabläufen. Langfristig plant Microsoft, die technische Basis von Qwen3.5-9B perspektivisch auch auf eigene Modelle aus dem Bereich Microsoft MAI sowie auf Architekturen des Partners OpenAI zu übertragen.

Interne Nutzung und Leistungsvergleiche

Nach Angaben des Konzerns erreichte Microsoft-Decision-1 in einer internen Testreihe über 36 Benchmarks mit fast 150.000 zurückgehaltenen Fragen eine durchschnittliche Genauigkeit von 83,5 Prozent.

Die mittlere Latenz (P50) liege bei rund 85 Millisekunden. Damit sei das System rund 35-mal schneller als das Referenzmodell GPT-6 Sol auf denselben Aufgaben und 4,5-mal schneller als das zweitplatzierte Quyet-1.0-Large.

Anzeige

Wer sich mit dem Einsatz solcher KI-Systeme befasst, muss auch die rechtlichen Rahmenbedingungen in Europa im Blick behalten. Dieser kostenlose Leitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der EU-KI-Verordnung. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt

Bei Störungstests zeigte sich das Modell robust: In Tests mit acht Varianten derselben Anfrage änderte sich die getroffene Entscheidung im Schnitt bei lediglich 1,3 Prozent der Fälle. Sicherheitsprüfungen umfassten 5.250 Anfragen über elf Benchmarks gegen Prompt Injection, Jailbreaks und schädliche Inhalte.

Der Vorstandsvorsitzende Satya Nadella erklärte auf der Plattform X, das Modell liefere Spitzenwerte bei strukturierten Entscheidungsaufgaben und übertreffe andere Ansätze in Latenz und Qualität. Microsoft setze das System intern bereits für Incident Response, die Qualitätskontrolle und die wissenschaftliche Forschung ein.

Bei Xbox Research klassifizierte das System über 10.000 Feedback-Einträge von Spielern aus Umfragen, von Steam und von X. Nach Unternehmensangaben geschah dies mit einer zu GPT-6 Sol vergleichbaren Genauigkeit, jedoch mehr als 14-mal schneller und rund 200-mal günstiger. Das Copilot-Team verzeichnete bei der Qualitätsbewertung von Antworten ähnliche Resultate wie mit GPT-5.6 Luna bei hundertfacher Geschwindigkeit.

Anzeige

Die neuen Regeln für KI-Systeme werfen oft die Frage auf, welche Anwendungen konkret als Hochrisiko eingestuft werden und welche Dokumentationspflichten daraus entstehen. Dieser praxisnahe Report klärt Unternehmen darüber auf, wie sie KI-Systeme rechtssicher entwickeln und nutzen können. Umsetzungsleitfaden zum EU AI Act jetzt kostenlos herunterladen

Wachsender Markt für Entscheidungsmodelle

Mit der Veröffentlichung betritt Microsoft ein Segment, das sich im Herbst dynamisch entwickelt hat. Nachdem TypeSafe AI die Kategorie Mitte September mit dem Modell Jev begründete, existieren inzwischen zahlreiche alternative Ansätze, darunter Angebote von Cloudflare, Liquid AI, Perplexity, Snowflake und H2O. Auch OpenAI öffnete kürzlich eine eigene Decisions-Schnittstelle.

Microsoft setzt beim Preismodell auf eine reine Abrechnung der Eingabe: Das Modell kostet 0,042 US-dollar pro eine Million Input-Tokens, während ausgegebene Antwort-Tokens kostenlos sind. Dies entspricht den Preisen von TypeSafe AI, während OpenAI für seinen Luna-Endpunkt 0,10 US-Dollar pro Million Tokens ansetzt.

Microsoft verweist in den Dokumentationen zugleich darauf, dass das Modell nicht als alleiniger automatisierter Entscheider bei sensiblen Feldern wie Krediten, Beschäftigung, Wohnraum, Gesundheit oder Rechtsansprüchen eingesetzt werden darf. Detaillierte externe Datensätze zur Reproduktion der 36 Benchmarks wurden bislang nicht veröffentlicht.