Microsoft MAI-Transcribe-2-Streaming für Sprachagenten
Microsoft hat seine MAI-Familie um drei neue Modelle erweitert, die alle dasselbe Ziel verfolgen: Sprachagenten, die ein Gespräch ohne unangenehme Pausen führen können. Im Mittelpunkt steht MAI-Transcribe-2-Streaming, das erste Streaming-Transkriptionsmodell des Konzerns. Dazu kommen zwei Text-to-Speech-Modelle, MAI-Voice-2.1 und MAI-Voice-2.1-Flash.
Die Zielgruppe sind Entwickler. Microsoft will, dass sie Agenten bauen, die einem Sprecher zuhören und fast sofort antworten. Das soll eher dem Rhythmus eines menschlichen Gesprächs entsprechen als dem Sprechen-und-Warten-Muster vieler heutiger Assistenten.
So funktioniert das Streaming-Modell
MAI-Transcribe-2-Streaming empfängt Sprache über eine WebSocket-Verbindung und liefert ein Transkript, das sich laufend aktualisiert, während die Person noch spricht. Hört der Sprecher auf, markiert das Modell das Transkript als endgültig.
Laut Microsoft ist das für zwei Arten von Anwendungen wichtig:
- Live-Untertitel, bei denen der Text erscheinen muss, während jemand spricht.
- Frühe Verarbeitung, bei der ein Agent schon mit einer Anfrage beginnen kann, bevor der Nutzer den Satz beendet hat.
Das Modell unterstützt mehr als 60 Sprachen und erkennt die gesprochene Sprache selbstständig. Nach Angaben von Microsoft liefert es seine ersten Transkript-Hypothesen im Schnitt nach 320 Millisekunden. Der Konzern schränkt allerdings ein: Diese Geschwindigkeit könne er nicht in jedem Fall zusagen, weil die gesamte Antwortzeit auch von der Netzwerkverbindung und dem KI-System abhängt, das die Antwort formuliert.
Auf Microsofts Vercel AI Gateway ist das Modell für 54 Cent pro Audiostunde gelistet.
Warum Streaming mehr kostet
Microsoft hat bereits ein Transkriptionsmodell ohne Streaming im Angebot. Im vergangenen Monat brachte der Konzern MAI-Transcribe-2 für 10 Cent pro Audiostunde auf den Markt. Die neue Variante ist damit mehr als fünfmal so teuer.
Der Unterschied liegt im Rechenaufwand. Das Standardmodell wartet, bis der Sprecher fertig ist, und verarbeitet das Audio dann in einem Durchgang. Die Streaming-Version arbeitet dagegen schon, während noch Audio eintrifft, und schickt fortlaufend vorläufige Ergebnisse zurück. Mehr Verarbeitung bedeutet einen höheren Preis, und Entwickler müssen abwägen, ob sich die geringere Latenz für ihren Anwendungsfall lohnt.
Zwei Stimmen, zwei Preisstufen
Bei der Sprachausgabe lässt Microsoft die Wahl zwischen Qualität und Tempo:
- MAI-Voice-2.1 ist als Option für ausdrucksstärkere Sprache in höherer Wiedergabetreue gedacht. Es kostet auf dem Vercel AI Gateway 22 US-Dollar pro Million Zeichen.
- MAI-Voice-2.1-Flash verzichtet auf einen Teil dieser Ausdruckskraft zugunsten schnellerer Antworten und eines niedrigeren Preises von 15 US-Dollar pro Million Zeichen.
Beide unterstützen laut Microsoft 23 Sprachen. Das liegt deutlich unter den mehr als 60 Sprachen des Transkriptionsmodells. Ein Agent versteht also womöglich mehr Sprachen, als er in ihnen antworten kann.
Der komplette Sprach-Stack
Ein funktionierender Sprachagent muss drei Dinge leisten: verstehen, was gesagt wurde, entscheiden, was zu tun ist, und eine Antwort aussprechen. Mit dieser Veröffentlichung deckt Microsoft nun alle drei Schritte mit eigenen Modellen ab.
MAI-Transcribe-2-Streaming übernimmt das Zuhören, die MAI-Voice-Modelle das Sprechen. Dazwischen sitzt Mai-Thinking-1, Microsofts Reasoning-Modell. Es ist ein gewöhnliches großes Sprachmodell, das das Transkript liest und entscheidet, wie der Agent reagieren soll.
Die Aufteilung der Verarbeitungskette auf drei getrennte Modelle gibt Entwicklern mehr Kontrolle. Sie können Qualität, Latenz und Kosten bei jedem Schritt einzeln abstimmen, statt ein Gesamtpaket hinnehmen zu müssen. Dieser modulare Ansatz taucht auch anderswo auf, etwa bei AWS mit seinem offenen Entscheidungsmodell für Agenten.
Die Strategie hinter dem Start
Die Veröffentlichung passt auch zu einem größeren Kurswechsel bei Microsoft. Der Konzern ist ein bedeutender Investor sowohl bei OpenAI als auch bei Anthropic, entwickelt aber eigene Modelle, um weniger von ihnen abhängig zu sein.
Im Juli hieß es in Berichten, Microsoft-AI-Chef Mustafa Suleyman sei wegen der Kosten für die Spitzenmodelle von OpenAI und Anthropic besorgt. Er soll seine Forscher angewiesen haben, sich auf die MAI-Familie zu konzentrieren. Ziel sei es, Copilot-Agenten in Produkten wie Excel und Outlook irgendwann mit Microsofts eigenen Modellen zu betreiben. "Wir zahlen Anthropic viel Geld, deshalb ist unser Ziel, diese Kosten zu senken und letztlich ganz abzuschaffen", sagte Suleyman zu Bloomberg.
Unsere Einschätzung
Für Entwickler dürfte die Preistransparenz der nützlichste Teil dieses Starts sein. Wenn Batch-Transkription für 10 Cent, Streaming für 54 Cent und zwei Sprachausgabe-Stufen nebeneinander aufgelistet sind, lässt sich leichter durchrechnen, was ein Sprachagent tatsächlich kosten wird, bevor man ihn baut. Auch der Zielkonflikt ist klar: Reaktion in Echtzeit kostet deutlich mehr, als zu warten, bis ein Sprecher fertig ist.
Die Veröffentlichung deutet außerdem darauf hin, dass Sprache zu einem eigenen Wettbewerbsfeld wird. Spezialisten wie ElevenLabs haben großes Interesse bei Investoren geweckt, das Unternehmen hat seine Bewertung zuletzt auf 22 Milliarden US-Dollar verdoppelt. Dass Microsoft nun einen kompletten Stack aus eigener Hand anbietet, setzt diesen Markt unter Druck, vor allem bei Kunden, die ohnehin schon in Microsofts Ökosystem arbeiten.
Offene Fragen bleiben. Microsofts Wert von 320 Millisekunden ist ein Durchschnitt, und der Konzern sagt selbst, dass die Latenz im Alltag von Faktoren abhängt, die er nicht kontrolliert. Der Unterschied bei der Sprachabdeckung zwischen Transkription und Sprachausgabe könnte manche internationalen Einsätze einschränken. Spannend wird, ob unabhängige Entwickler im Produktivbetrieb ähnliche Geschwindigkeiten melden und ob Microsoft Copilot tatsächlich auf MAI-Modelle umstellt. Falls ja, wäre das ein deutliches Signal, dass der Konzern seine eigenen Modelle für gut genug hält, um die seiner Partner in Kernprodukten zu ersetzen, und nicht nur in Entwicklerwerkzeugen.
