Microsoft MAI-Transcribe-2-Streaming apunta a agentes de voz
Microsoft ha incorporado tres nuevos modelos a su familia MAI, todos con el mismo objetivo: agentes de voz capaces de mantener una conversación sin pausas incómodas. El lanzamiento principal es MAI-Transcribe-2-Streaming, el primer modelo de transcripción en tiempo real de la compañía. Llega acompañado de dos modelos de texto a voz, MAI-Voice-2.1 y MAI-Voice-2.1-Flash.
El público objetivo son los desarrolladores. Microsoft quiere que creen agentes que escuchen a quien habla y respondan casi al instante, más cerca del ritmo de una conversación humana que del patrón de hablar y esperar de muchos asistentes actuales.
Cómo funciona el modelo en tiempo real
MAI-Transcribe-2-Streaming recibe la voz a través de una conexión WebSocket y devuelve una transcripción que se va actualizando mientras la persona sigue hablando. Cuando el hablante se detiene, el modelo marca la transcripción como definitiva.
Según Microsoft, esto es importante para dos tipos de aplicaciones:
- Subtítulos en directo, donde el texto tiene que aparecer mientras alguien habla.
- Procesamiento anticipado, donde un agente puede empezar a trabajar en una petición antes de que el usuario haya terminado la frase.
El modelo admite más de 60 idiomas y detecta por sí solo la lengua hablada. Microsoft asegura que genera sus primeras hipótesis de transcripción en 320 milisegundos de media. La compañía añade una advertencia: no puede garantizar esa velocidad en todos los casos, porque el tiempo de respuesta total también depende de la conexión de red y del sistema de IA que redacta la respuesta.
El modelo figura en el Vercel AI Gateway de Microsoft a 54 céntimos por hora de audio.
Por qué el tiempo real cuesta más
Microsoft ya cuenta con un modelo de transcripción que no funciona en tiempo real. El mes pasado lanzó MAI-Transcribe-2 a 10 céntimos por hora de audio, lo que hace que la nueva variante sea más de cinco veces más cara.
La diferencia se explica por la carga de trabajo. El modelo estándar espera a que el hablante termine y después procesa el audio de una sola vez. La versión en tiempo real sigue trabajando mientras el audio aún está llegando y envía resultados provisionales de forma continua. Más procesamiento implica un precio más alto, y los desarrolladores tendrán que decidir si una menor latencia compensa en su caso.
Dos voces, dos precios
En el lado de la salida, Microsoft ofrece elegir entre calidad y velocidad:
- MAI-Voice-2.1 se presenta como la opción para una voz más expresiva y de mayor fidelidad. Cuesta 22 dólares por millón de caracteres en el Vercel AI Gateway.
- MAI-Voice-2.1-Flash sacrifica parte de esa expresividad a cambio de respuestas más rápidas y un precio más bajo, de 15 dólares por millón de caracteres.
Ambos admiten 23 idiomas, según Microsoft. Es bastante menos que los más de 60 que cubre el modelo de transcripción, así que un agente podría entender más idiomas de los que es capaz de usar para responder.
La cadena de voz completa
Un agente de voz que funcione tiene que hacer tres cosas: entender lo que se ha dicho, decidir qué hacer al respecto y pronunciar una respuesta. Con este lanzamiento, Microsoft ya cubre los tres pasos con modelos propios.
MAI-Transcribe-2-Streaming se encarga de escuchar. Los modelos MAI-Voice se encargan de hablar. En medio está Mai-Thinking-1, el modelo de razonamiento de Microsoft, un gran modelo de lenguaje convencional que lee la transcripción y decide cómo debe responder el agente.
Dividir el proceso en tres modelos independientes da a los desarrolladores más control. Pueden ajustar la calidad, la latencia y el coste en cada paso en lugar de aceptar un único paquete. Ese tipo de diseño modular también está apareciendo en otros sitios, por ejemplo en el modelo de decisión abierto para agentes de AWS.
La estrategia detrás del lanzamiento
El lanzamiento encaja además en un cambio más amplio dentro de Microsoft. La compañía es una gran inversora tanto en OpenAI como en Anthropic, pero está desarrollando sus propios modelos para depender menos de ellas.
En julio, varias informaciones apuntaron a que el consejero delegado de Microsoft AI, Mustafa Suleyman, estaba preocupado por el coste de los modelos punteros de OpenAI y Anthropic. Al parecer, pidió a sus investigadores que se centraran en la familia MAI, con el objetivo de que los agentes de Copilot en productos como Excel y Outlook acaben funcionando con modelos propios de Microsoft. "Pagamos mucho dinero a Anthropic, así que nuestro objetivo es reducir y, en última instancia, eliminar ese coste", declaró Suleyman a Bloomberg.
Nuestra opinión
Para los desarrolladores, lo más útil de este lanzamiento puede ser la transparencia en los precios. Tener la transcripción por lotes a 10 céntimos, la de tiempo real a 54 céntimos y dos niveles de voz uno al lado del otro facilita calcular lo que costará realmente un agente de voz antes de construirlo. El equilibrio también queda claro: responder en tiempo real sale mucho más caro que esperar a que el hablante termine.
El lanzamiento indica también que la voz se está convirtiendo en un terreno competitivo por derecho propio. Especialistas como ElevenLabs han despertado un gran interés entre los inversores, y la empresa acaba de duplicar su valoración hasta los 22.000 millones de dólares. Que Microsoft ofrezca una cadena completa de desarrollo propio presiona a ese mercado, sobre todo entre los clientes que ya trabajan dentro de su ecosistema.
Quedan preguntas abiertas. La cifra de 320 milisegundos de Microsoft es una media, y la propia compañía reconoce que la latencia en condiciones reales depende de factores que no controla. La diferencia de idiomas entre la transcripción y la salida de voz podría limitar algunos despliegues internacionales. Habrá que ver si los desarrolladores independientes registran velocidades similares en producción y si Microsoft cumple con el traslado de Copilot a los modelos MAI. Si lo hace, sería una señal clara de que la compañía considera sus propios modelos lo bastante buenos como para sustituir a los de sus socios en productos clave, y no solo en herramientas para desarrolladores.
