Microsoft MAI-Transcribe: Erste Transkript-Hypothesen nach 100 Millisekunden

Drei MAI-Modelle ergänzen Microsofts KI-Portfolio; die Transkription startet mit 0,54 US-Dollar je Audiostunde in der Public Preview.

•

Microsoft AI hat sein Portfolio an künstlicher Intelligenz um drei neue Modelle der MAI-Serie erweitert. Mit der Einführung von MAI-Transcribe-2-Streaming präsentiert das Unternehmen sein erstes Modell für die Streaming-Transkription. Ergänzt wird die Veröffentlichung durch die Sprachausgabemodelle MAI-Voice-2.1 und MAI-Voice-2.1-Flash, die auf unterschiedliche Anforderungen an Qualität und Reaktionsgeschwindigkeit optimiert wurden.

Hohe Präzision und geringe Latenz bei der Transkription

Das neue Modell MAI-Transcribe-2-Streaming unterstützt 60 Sprachen, darunter auch Japanisch. Es verfügt über eine automatisierte Spracherkennung, die einen Wechsel der Sprache während des Audiostreams identifizieren kann.

In unabhängigen Analysen von Artificial Analysis belegte das Modell den ersten Platz bei der Genauigkeit für finale und partielle Transkripte. Die Fehlerrate (Word Error Rate, WER) wird im entsprechenden Leaderboard mit 2,5 Prozent für finale Transkripte und 2,8 Prozent für die erste partielle Erfassung angegeben.

Besonderes Augenmerk liegt auf der Geschwindigkeit der Verarbeitung. Während Wettbewerber für die Anzeige von Wörtern nach dem Sprechen oft mehr als 500 Millisekunden benötigen, liefert das Microsoft-Modell erste Hypothesen in etwa 100 Millisekunden.

Wörter werden nach rund 320 Millisekunden angezeigt. Damit erreiche das System laut internen Tests eine doppelt so hohe Ausgabegeschwindigkeit wie der nächste Wettbewerber. Die Zeit bis zum finalen Transkript liegt bei 0,13 Sekunden.

Im Vergleich mit 38 weiteren Modellen im Benchmark von Artificial Analysis positioniert sich Microsoft vor Mitbewerbern wie Grok Voice Transcribe 2.0 (WER 2,7 Prozent bei 0,49 Sekunden) oder ElevenLabs Scribe v2 Realtime (WER 3,6 Prozent bei 0,14 Sekunden). Einzig Cartesia Ink Preview weist mit 0,11 Sekunden eine geringere Latenz auf, bei einer Fehlerrate von 3,1 Prozent.

Neue Standards für synthetische Sprachausgabe

Für die Sprachgenerierung bietet Microsoft nun MAI-Voice-2.1 und eine kostenoptimierte Flash-Version an. MAI-Voice-2.1 unterstützt 23 Sprachen und 26 lokale Varianten mit einem einheitlichen Stimmprofil. In einem Turing-Test mit 4.000 Zuhörern bewerteten 50,3 Prozent der Teilnehmer die generierte Sprache als ebenso natürlich oder menschlicher als reale Aufnahmen.

Naomi Moneypenny, Senior Director Product Development bei Microsoft Foundry Models, erklärte hierzu, dass Entwickler künftig zwischen der hohen Ausdrucksqualität von MAI-Voice-2.1 und der Reaktionsfähigkeit sowie Kosteneffizienz der Flash-Variante wählen könnten.

Anzeige

Wer sich mit dem Einsatz solch leistungsfähiger KI-Systeme befasst, muss neben der technischen Performance auch die rechtlichen Rahmenbedingungen im Blick behalten. Dieser kostenlose Umsetzungsleitfaden bietet Unternehmen einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der neuen EU-KI-Verordnung. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt

MAI-Voice-2.1-Flash verarbeitet Audioabschnitte von 45 Sekunden mit einer Ende-zu-Ende-Latenz von 150 Millisekunden. Die Inferenzgeschwindigkeit sei damit um 55 Prozent höher als beim Standardmodell.

Beide Sprachmodelle ermöglichen das sogenannte Voice-Cloning auf Basis weniger Sekunden Referenzmaterial. Microsoft betonte in diesem Zusammenhang den Einsatz von Sicherheitsvorkehrungen (Consent-Guardrails), um eine unautorisierte Verwendung von Stimmen zu verhindern.

Preise und Verfügbarkeit im Markt

Die neuen Modelle sind ab sofort in der Public Preview über Microsoft Foundry sowie weitere Plattformen wie Azure Voice Live verfügbar. Der Einführungspreis für MAI-Transcribe-2-Streaming liegt bis zum Ende des Jahres bei 0,54 US-Dollar pro Audiostunde. Das zugrundeliegende Batch-Modell, MAI-Transcribe-2, wird in einem zeitlich begrenzten Angebot für 0,10 US-Dollar pro Audiostunde bereitgestellt.

Anzeige

Die rasante Entwicklung bei der Sprachgenerierung und beim Voice-Cloning wirft neue Fragen zur Compliance und zum Schutz vor Missbrauch auf. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko gelten und was Unternehmen jetzt konkret tun müssen, um rechtssicher zu agieren. Welche KI-Systeme gelten als Hochrisiko – und was müssen Unternehmen jetzt konkret tun?

Die Kosten für die Sprachausgabe belaufen sich auf 22 US-Dollar pro einer Million Zeichen für das Standardmodell und 15 US-Dollar für die Flash-Version. Als Zielmärkte nennt Microsoft unter anderem den Kundenservice, interaktive Lernanwendungen sowie die Erstellung von Live-Untertiteln und Echtzeit-Meeting-Transkriptionen.

Analysten an der Wall Street bewerten die Aktie von Microsoft derzeit mehrheitlich als Kaufempfehlung mit einem durchschnittlichen Kursziel von 575,91 US-Dollar.

Kritische Stimmen weisen jedoch darauf hin, dass Microsoft die spezifischen Benchmarks für die Spitzenplatzierungen bislang nicht vollständig öffentlich zugänglich gemacht hat. Auch Details zu den exakten Anforderungen für das Voice-Cloning und die Wirksamkeit der Sicherheitsmaßnahmen blieben in den ersten Berichten teilweise ungenannt.