Microsoft MAI-Transcribe-2-Streaming vise les agents vocaux

Microsoft MAI-Transcribe-2-Streaming vise les agents vocaux

Microsoft ajoute trois nouveaux modèles à sa famille MAI, tous avec le même objectif : des agents vocaux capables de tenir une conversation sans blancs gênants. La principale nouveauté s'appelle MAI-Transcribe-2-Streaming, le premier modèle de transcription en streaming de l'entreprise. Il arrive avec deux modèles de synthèse vocale, MAI-Voice-2.1 et MAI-Voice-2.1-Flash.

Ces modèles s'adressent aux développeurs. Microsoft veut leur permettre de créer des agents qui écoutent leur interlocuteur et répondent presque immédiatement. Le rythme se rapproche ainsi davantage d'une conversation humaine que du schéma "on parle, puis on attend" de nombreux assistants actuels.

Comment fonctionne le modèle de streaming

MAI-Transcribe-2-Streaming reçoit la parole via une connexion WebSocket et renvoie une transcription qui se met à jour pendant que la personne parle encore. Quand l'interlocuteur s'arrête, le modèle marque la transcription comme définitive.

Selon Microsoft, cela compte pour deux types d'applications :

  • Le sous-titrage en direct, où le texte doit s'afficher pendant que quelqu'un parle.
  • Le traitement anticipé, où un agent peut commencer à traiter une demande avant que l'utilisateur ait terminé sa phrase.

Le modèle prend en charge plus de 60 langues et détecte seul la langue parlée. Microsoft affirme qu'il produit ses premières hypothèses de transcription en 320 millisecondes en moyenne. L'entreprise apporte toutefois une nuance : elle ne peut pas garantir cette rapidité dans tous les cas, car le temps de réponse global dépend aussi de la connexion réseau et du système d'IA qui rédige la réponse.

Le modèle est proposé sur la Vercel AI Gateway de Microsoft à 54 cents par heure d'audio.

Pourquoi le streaming coûte plus cher

Microsoft dispose déjà d'un modèle de transcription sans streaming. Le mois dernier, l'entreprise a lancé MAI-Transcribe-2 à 10 cents par heure d'audio, ce qui rend la nouvelle variante plus de cinq fois plus chère.

L'écart s'explique par la charge de travail. Le modèle standard attend que l'interlocuteur ait fini, puis traite l'audio d'un seul coup. La version en streaming, elle, travaille pendant que l'audio continue d'arriver et renvoie des résultats provisoires en continu. Plus de traitement, c'est un prix plus élevé, et les développeurs devront décider si une latence réduite en vaut la peine pour leur usage.

Deux voix, deux prix

Côté sortie, Microsoft propose de choisir entre qualité et rapidité :

  • MAI-Voice-2.1 se présente comme l'option pour une voix plus expressive et plus fidèle. Il coûte 22 dollars par million de caractères sur la Vercel AI Gateway.
  • MAI-Voice-2.1-Flash sacrifie une partie de cette expressivité au profit de réponses plus rapides et d'un prix plus bas, à 15 dollars par million de caractères.

Selon Microsoft, les deux prennent en charge 23 langues. C'est bien moins que les plus de 60 langues couvertes par le modèle de transcription : un agent pourra donc comprendre plus de langues qu'il ne peut en parler.

La chaîne vocale complète

Un agent vocal fonctionnel doit faire trois choses : comprendre ce qui a été dit, décider quoi en faire et prononcer une réponse. Avec ce lancement, Microsoft couvre désormais ces trois étapes avec ses propres modèles.

MAI-Transcribe-2-Streaming se charge de l'écoute. Les modèles MAI-Voice se chargent de la parole. Entre les deux se trouve Mai-Thinking-1, le modèle de raisonnement de Microsoft, un grand modèle de langage classique qui lit la transcription et décide comment l'agent doit répondre.

Découper la chaîne en trois modèles distincts donne plus de contrôle aux développeurs. Ils peuvent ajuster la qualité, la latence et le coût à chaque étape au lieu d'accepter un ensemble figé. Ce type de conception modulaire apparaît aussi ailleurs, par exemple avec le modèle de décision ouvert pour agents d'AWS.

La stratégie derrière le lancement

Ce lancement s'inscrit aussi dans un virage plus large chez Microsoft. L'entreprise est un investisseur majeur à la fois dans OpenAI et dans Anthropic, mais elle développe ses propres modèles pour moins dépendre d'eux.

En juillet, selon plusieurs informations, le directeur général de Microsoft AI, Mustafa Suleyman, s'inquiétait du coût des modèles de pointe d'OpenAI et d'Anthropic. Il aurait demandé à ses chercheurs de se concentrer sur la famille MAI, avec l'objectif de faire tourner à terme les agents Copilot de produits comme Excel et Outlook sur les modèles maison de Microsoft. "Nous versons beaucoup d'argent à Anthropic, notre objectif est donc de réduire puis, à terme, de supprimer ce coût", a déclaré Suleyman à Bloomberg.

Notre analyse

Pour les développeurs, l'aspect le plus utile de ce lancement est peut-être la transparence des prix. Avec la transcription par lots à 10 cents, le streaming à 54 cents et deux gammes de voix affichées côte à côte, il devient plus facile d'estimer le coût réel d'un agent vocal avant de le construire. Le compromis est lui aussi clair : la réactivité en temps réel coûte bien plus cher que d'attendre que l'interlocuteur ait fini de parler.

Ce lancement suggère aussi que la voix devient un terrain de concurrence à part entière. Des spécialistes comme ElevenLabs suscitent un fort intérêt des investisseurs, l'entreprise ayant récemment doublé sa valorisation à 22 milliards de dollars. En proposant une chaîne complète développée en interne, Microsoft met la pression sur ce marché, en particulier auprès des clients qui travaillent déjà dans son écosystème.

Des questions restent ouvertes. Le chiffre de 320 millisecondes avancé par Microsoft est une moyenne, et l'entreprise reconnaît elle-même que la latence en conditions réelles dépend de facteurs qu'elle ne maîtrise pas. L'écart de couverture linguistique entre la transcription et la synthèse vocale pourrait freiner certains déploiements internationaux. Il faudra voir si des développeurs indépendants constatent des vitesses comparables en production, et si Microsoft va jusqu'au bout de la migration de Copilot vers les modèles MAI. Si c'est le cas, ce serait un signal fort : l'entreprise jugerait ses propres modèles assez bons pour remplacer ceux de ses partenaires dans ses produits phares, et pas seulement dans ses outils pour développeurs.