Microsoft-Decision-1: Neues KI-Modell erreicht 83,5 Prozent Genauigkeit

Microsofts Decision-Scoring-Modell erreichte in 36 Benchmarks 83,5 Prozent Genauigkeit und ist für strukturierte Aufgaben ausgelegt.

•

Microsoft hat mit Microsoft-Decision-1 ein spezialisiertes Decision-Scoring-Modell vorgestellt, das für Aufgaben wie Routing, Klassifizierung, Priorisierung, Verifikation und Workflow-Steuerung konzipiert ist. Das System steht Entwicklern in Microsoft Foundry sowie über OpenRouter zur Verfügung.

Im Gegensatz zu klassischen Sprachmodellen erzeugt Microsoft-Decision-1 keinen freien Text, kein Bild-, Audio- oder Videomaterial. Stattdessen liefert das System kalibrierte Wahrscheinlichkeiten für vordefinierte Antwortoptionen. Unterstützt werden unter anderem Ja-Nein-Abfragen, Multiple-Choice-Formate, Ratingskalen, Bewertungsraster, Relevanzurteile sowie eine explizite Option für Fälle, in denen keine Entscheidung getroffen werden kann.

Technische Basis und Preismodell

Das Modell basiert auf einem Post-Training des 9-Milliarden-Parameter-Basismodells Qwen3.5-9B von Alibaba. Microsoft plant künftig eine Umstellung auf Grundlagen von Microsoft AI sowie OpenAI. Die Veröffentlichung wurde von Microsoft-Vizepräsident Achint Srivastava geleitet, der zuvor Mitgründer von Pi Labs war.

Konzernchef Satya Nadella kündigte das Modell auf der Plattform X an und betonte, dass es bei strukturierten Entscheidungsaufgaben im Hinblick auf Latenz und Qualität sowohl klassische Sprachmodelle als auch andere Entscheidungsmodelle übertreffe.

Laut Listing in Microsoft Foundry verarbeitet das Modell Texteingaben mit bis zu 32.768 Tokens und liefert strukturierte JSON-Ausgaben. Die Kosten liegen bei 0,042 US-Dollar pro Million Input-Tokens, während die Ausgabe ohne zusätzliche Gebühren bleibt.

Ein Prüfvorgang über das maximale Fenster von 32.768 Tokens kostet rund 0,0014 US-Dollar, 1.000 Abfragen dieses Umfangs belaufen sich auf rund 1,38 US-Dollar. Zum Vergleich verlangt OpenAI für Luna Decisions 0,10 US-Dollar pro Million Input-Tokens, während das Konkurrenzmodell Jev ebenfalls bei 0,042 US-Dollar liegt.

Leistungswerte und interne Erprobung

Nach Angaben des Konzerns vom 9. Oktober 2026 erzielte das Modell in einer trainingsblinden Auswertung über 36 Benchmarks mit fast 150.000 Fragen eine durchschnittliche Genauigkeit von 83,5 Prozent. Damit lag es vor Quyet-1.0-Large mit 81,9 Prozent, GPT-6 Luna Decisions mit 79,4 Prozent und H2O-Lightning-4B mit 77,2 Prozent.

Die Median-Latenz beziffert Microsoft auf rund 85 Millisekunden. Damit arbeite das System 35-mal schneller als GPT-6 Sol, 4,5-mal schneller als Quyet-1.0-Large und 2,5-mal schneller als H2O-Lightning-4B v1.1. In Robustheitstests mit acht Perturbationen derselben Anfrage änderte sich das Ergebnis laut Unternehmensangaben in 1,3 Prozent der Fälle, wobei Paraphrasierungen oder Umsortierungen keine Abweichungen verursachten. Die Sicherheitsprüfungen umfassten 5.250 Testanfragen über elf Benchmarks zu schädlichen Inhalten, Jailbreaks und Prompt Injections.

Anzeige

Der technologische Fortschritt bei KI-Systemen stellt Unternehmen vor neue rechtliche Herausforderungen. Dieser kostenlose Download verschafft Ihnen den Überblick über Fristen, Pflichten und Risikoklassen, den Ihre Rechts- und IT-Abteilung jetzt dringend braucht. EU AI Act in 5 Schritten verstehen

Konzernintern setzte die Forschungsabteilung von Xbox das Modell ein, um mehr als 10.000 Feedback-Einträge und Spielerbewertungen zu kategorisieren – nach Unternehmensangaben 14-mal schneller und 200-mal günstiger als mit GPT-6 Sol bei vergleichbarer Qualität.

Das Copilot-Team verzeichnete im Vergleich zu GPT-5.6 Luna ein 100-fach höheres Tempo, während in der wissenschaftlichen Forschung eine 46-mal höhere Konsistenz und eine rund viermal schnellere Neuplanung gemeldet wurden. Diese Werte stammen aus unternehmenseigenen Tests und wurden nicht unabhängig überprüft; auch Testdatensätze und Latenzbedingungen wurden nicht veröffentlicht.

Marktumfeld und Einsatzgrenzen

Die noch junge Modellkategorie entstand Mitte September, als TypeSafe AI das Modell Jev einführte. Innerhalb eines Monats folgten mehr als 90 Konkurrenten auf dem Benchmark JevBench, während OpenAI seine Variante am 6. Oktober auf Basis von GPT-6 Luna öffnete.

Anzeige

Während neue Modelle die Effizienz steigern, warnen Compliance-Experten davor, die rechtlichen Rahmenbedingungen zu ignorieren. Sichern Sie sich jetzt den kostenlosen Umsetzungsleitfaden zum EU AI Act inklusive aller relevanten Übergangsfristen. Kostenloses KI-Verordnung E-Book herunterladen

Microsoft bietet das Modell ausschließlich gehostet über eine spezialisierte Decisions-Schnittstelle ohne Offenlegung der Gewichte an. In Foundry warnt das Unternehmen davor, das Modell als alleinigen Entscheidungsträger in sensiblen Bereichen wie Beschäftigung, Kreditvergabe, Wohnen, Gesundheit oder Rechtsansprüchen einzusetzen.