MAI-Transcribe-2-Streaming: Microsoft startet Echtzeit-Transkription in 60 Sprachen

Die MAI-Neuheiten decken Streaming-Transkription und Sprachgenerierung ab; Microsoft nennt Tempo- und Kostenvorteile, unabhängige Tests weichen jedoch ab.

•

Microsoft hat neue KI-Modelle für Sprachverarbeitung vorgestellt: das Streaming-Transkriptionsmodell MAI-Transcribe-2-Streaming sowie die Sprachmodelle MAI-Voice-2.1 und MAI-Voice-2.1-Flash. Die Modelle sollen in der Transkriptionsgeschwindigkeit und bei den Kosten gegenüber bestehenden Angeboten deutliche Vorteile bieten.

Schnelle Transkription mit breiter Sprachabdeckung

MAI-Transcribe-2-Streaming liefert nach Angaben von Microsoft erste vorläufige Wörter in etwas über 100 Millisekunden und unterstützt 60 Sprachen mit automatischer Spracherkennung.

Microsoft zufolge belegt das Modell bei Artificial Analysis Platz 1 bei partieller und finaler Transkriptgenauigkeit; interne Tests hätten gezeigt, dass Wörter im Transkript doppelt so schnell erscheinen wie beim nächsten Wettbewerber.

Im AA-WER-Streaming-Benchmark führt Artificial Analysis das Modell demnach unter 38 Modellen auf Rang 1 bei finaler und erster partieller Transkriptgenauigkeit, mit einer Wortfehlerrate (WER) von 2,5 Prozent beim finalen Transkript nach 0,13 Sekunden sowie ebenfalls 2,5 Prozent WER beim ersten Teiltranskript nach 0,12 Sekunden.

Allerdings war der Spitzenplatz bei Artificial Analysis öffentlich nicht unabhängig bestätigt. Während Microsoft die genannte WER von 2,5 Prozent auf einem internen Benchmark ausweist, stellten Johns Hopkins und Partner in realen Einsatztests eine WER von über 13,73 Prozent in allen untersuchten Bereichen fest – ein deutlicher Unterschied zu Microsofts eigenen Werten.

Für die Nutzung gilt bis zum 31. Dezember 2026 ein Einführungspreis von 0,54 US-Dollar je Audiostunde beziehungsweise 9 US-Dollar je 1.000 Minuten für die Streaming-Transkription. Das Batch-Modell MAI-Transcribe-2, dessen Einführungspreis seit dem 3. September 2026 gilt, kostet dagegen 0,10 US-Dollar je Audiostunde.

Anzeige

Wer sich mit dem Einsatz solch innovativer KI-Systeme befasst, muss auch die rechtlichen Rahmenbedingungen der neuen EU-KI-Verordnung im Blick behalten. Dieser kostenlose Umsetzungsleitfaden bietet Unternehmen einen kompakten Überblick über alle neuen Anforderungen, Pflichten und Fristen. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt

Azure führt die Streaming-Transkription derzeit als Public Preview ohne Service-Level-Agreement und rät von einem Einsatz in Produktionsumgebungen ab. Erforderlich ist das Azure Speech SDK Version 1.52.0. Verfügbar ist die Funktion in den Regionen Sweden Central, Central US und Southeast Asia; East US 2 ist als weitere Region geplant.

Neue Sprachmodelle für Stimmklonen und Sprachagenten

MAI-Voice-2.1 unterstützt 23 Sprachen und 26 Locales bei gleichbleibender Stimmidentität und lokalem Akzent und kostet 22 US-Dollar je 1 Million Zeichen. Die schnellere Variante MAI-Voice-2.1-Flash erzeugt 45 Sekunden Audio bei einer End-to-End-Latenz von 150 Millisekunden.

Laut Microsoft arbeitet das Modell 55 Prozent schneller und ist rund 60 Prozent günstiger als vergleichbare Lösungen; der Preis liegt bei 15 US-Dollar je 1 Million Zeichen. Mustafa Suleyman bezifferte diesen Geschwindigkeits- und Kostenvorteil konkret im Vergleich zu Angeboten von ElevenLabs. Sprachklonen ist bereits mit einer fünfsekündigen Audioreferenz möglich.

Anzeige

Während neue Technologien wie das Stimmklonen beeindruckende Möglichkeiten eröffnen, stellen sie Unternehmen gleichzeitig vor neue Herausforderungen bei der Risikodokumentation und Kennzeichnung. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko eingestuft werden und was Verantwortliche jetzt konkret tun müssen. Kostenlosen Umsetzungsleitfaden zum EU AI Act jetzt herunterladen

Zusammen mit MAI-Voice-2.1-Flash und Azure Voice Live ermöglicht das Streaming-Transkriptionsmodell laut Microsoft eine eigene Azure-Pipeline für Sprachagenten. Die neuen Modelle sind über Microsoft Foundry, den MAI Playground, Vercel, Azure Voice Live, Azure AI Speech und OpenRouter verfügbar; im MAI Playground steht zudem eine Chatter-Demo bereit.

Die Veröffentlichung reiht sich in Microsofts Ausbau eigener MAI-Modelle ein, den Suleyman bereits im Juli betont hatte.