MAI-Transcribe-2-Streaming: Microsoft mikt op spraakagents
Microsoft heeft drie nieuwe modellen aan zijn MAI-familie toegevoegd, en die hebben allemaal hetzelfde doel: spraakagents die een gesprek kunnen voeren zonder ongemakkelijke stiltes. De belangrijkste nieuwkomer is MAI-Transcribe-2-Streaming, het eerste streamingmodel voor transcriptie van het bedrijf. Het verschijnt samen met twee text-to-speechmodellen, MAI-Voice-2.1 en MAI-Voice-2.1-Flash.
De doelgroep is ontwikkelaars. Microsoft wil dat zij agents bouwen die naar een spreker luisteren en vrijwel direct reageren. Dat ligt dichter bij het ritme van een menselijk gesprek dan het patroon van spreken en wachten bij veel huidige assistenten.
Zo werkt het streamingmodel
MAI-Transcribe-2-Streaming ontvangt spraak via een WebSocket-verbinding en levert een transcript dat steeds wordt bijgewerkt terwijl iemand nog praat. Zodra de spreker stopt, markeert het model het transcript als definitief.
Volgens Microsoft is dat belangrijk voor twee soorten toepassingen:
- Live ondertiteling, waarbij tekst moet verschijnen terwijl iemand spreekt.
- Vroege verwerking, waarbij een agent al aan een verzoek kan beginnen voordat de gebruiker zijn zin heeft afgemaakt.
Het model ondersteunt meer dan 60 talen en herkent zelf welke taal er wordt gesproken. Volgens Microsoft levert het gemiddeld binnen 320 milliseconden zijn eerste transcripthypotheses. Het bedrijf plaatst daar wel een kanttekening bij: het kan die snelheid niet in alle gevallen beloven, omdat de totale reactietijd ook afhangt van de netwerkverbinding en van het AI-systeem dat het antwoord schrijft.
Het model staat op Microsofts Vercel AI Gateway voor 54 cent per audio-uur.
Waarom streaming duurder is
Microsoft heeft al een transcriptiemodel zonder streaming. Vorige maand lanceerde het bedrijf MAI-Transcribe-2 voor 10 cent per audio-uur. De nieuwe variant is daarmee meer dan vijf keer zo duur.
Het verschil zit in de hoeveelheid werk. Het standaardmodel wacht tot de spreker klaar is en verwerkt de audio dan in één keer. De streamingversie werkt door terwijl er nog audio binnenkomt en stuurt voortdurend voorlopige resultaten terug. Meer verwerking betekent een hogere prijs, en ontwikkelaars zullen moeten afwegen of een lagere vertraging dat voor hun toepassing waard is.
Twee stemmen, twee prijsniveaus
Aan de uitvoerkant laat Microsoft de keuze tussen kwaliteit en snelheid:
- MAI-Voice-2.1 wordt neergezet als de optie voor expressievere spraak met een hogere kwaliteit. Het kost 22 dollar per miljoen tekens op de Vercel AI Gateway.
- MAI-Voice-2.1-Flash levert een deel van die expressiviteit in voor snellere reacties en een lagere prijs van 15 dollar per miljoen tekens.
Volgens Microsoft ondersteunen beide 23 talen. Dat is ruim minder dan de meer dan 60 talen van het transcriptiemodel, waardoor een agent mogelijk meer talen kan verstaan dan hij kan spreken.
De complete spraakketen
Een werkende spraakagent moet drie dingen doen: begrijpen wat er is gezegd, bepalen wat hij daarmee doet en een antwoord uitspreken. Met deze release dekt Microsoft nu alle drie de stappen af met eigen modellen.
MAI-Transcribe-2-Streaming verzorgt het luisteren. De MAI-Voice-modellen verzorgen het spreken. Daartussen zit Mai-Thinking-1, het redeneermodel van Microsoft. Dat is een standaard groot taalmodel dat het transcript leest en bepaalt hoe de agent moet reageren.
Doordat de keten is opgesplitst in drie aparte modellen, krijgen ontwikkelaars meer controle. Ze kunnen bij elke stap kwaliteit, vertraging en kosten afstemmen, in plaats van genoegen te nemen met één pakket. Dat soort modulaire opzet duikt ook elders op, bijvoorbeeld bij AWS met zijn open beslismodel voor agents.
De strategie achter de lancering
De release past ook in een bredere koerswijziging bij Microsoft. Het bedrijf is een grote investeerder in zowel OpenAI als Anthropic, maar bouwt toch eigen modellen om minder van hen afhankelijk te zijn.
In juli werd gemeld dat Mustafa Suleyman, topman van Microsoft AI, zich zorgen was gaan maken over de kosten van de frontiermodellen van OpenAI en Anthropic. Hij zou zijn onderzoekers hebben opgedragen zich te richten op de MAI-familie, met als doel om Copilot-agents in producten als Excel en Outlook uiteindelijk op Microsofts eigen modellen te laten draaien. "We betalen Anthropic veel geld, dus ons doel is om die kosten te verlagen en uiteindelijk helemaal te schrappen", zei Suleyman tegen Bloomberg.
Onze analyse
Voor ontwikkelaars is de transparante prijsstelling misschien wel het nuttigste aan deze lancering. Met batchtranscriptie voor 10 cent, streaming voor 54 cent en twee spraakniveaus naast elkaar wordt het makkelijker om vooraf door te rekenen wat een spraakagent werkelijk gaat kosten. Ook de afweging is duidelijk: realtime reageren kost veel meer dan wachten tot een spreker is uitgepraat.
De release laat ook zien dat spraak uitgroeit tot een eigen concurrentieterrein. Specialisten zoals ElevenLabs trekken veel belangstelling van investeerders, en dat bedrijf zag zijn waardering onlangs verdubbelen tot 22 miljard dollar. Dat Microsoft een complete eigen keten aanbiedt, zet die markt onder druk, vooral bij klanten die al binnen het ecosysteem van het bedrijf werken.
Er zijn nog open vragen. Het getal van 320 milliseconden is een gemiddelde, en Microsoft zegt zelf dat de vertraging in de praktijk afhangt van factoren waar het geen invloed op heeft. Het verschil in taalondersteuning tussen transcriptie en spraakuitvoer kan sommige internationale toepassingen beperken. Het is de moeite waard om te volgen of onafhankelijke ontwikkelaars in productie vergelijkbare snelheden melden, en of Microsoft Copilot echt naar MAI-modellen verhuist. Gebeurt dat, dan is dat een sterk signaal dat het bedrijf zijn eigen modellen goed genoeg vindt om die van zijn partners te vervangen in kernproducten, en niet alleen in tools voor ontwikkelaars.
