Strands Decider 2B: modelo abierto de decisión para agentes
No todos los pasos de un agente de IA necesitan un modelo que escriba. Muchos solo necesitan un modelo que elija. Esa es la idea detrás de Strands Decider 2B, el nuevo lanzamiento de código abierto del equipo Strands Labs de Amazon Web Services. AWS lo describe como un "modelo de decisión" ligero, pensado para tomar decisiones rápidas dentro de flujos de trabajo agénticos sin generar texto alguno.
El modelo ya está disponible en Hugging Face. El código completo, los scripts de entrenamiento y los ejemplos están en GitHub. AWS lo ha ajustado para uso local y pruebas rápidas, de modo que los desarrolladores pueden ejecutarlo tanto en su propio portátil como en entornos de nube pública.
Qué hace realmente un modelo de decisión
Los modelos de decisión, a veces llamados "modelos de Sistema 1", funcionan de forma distinta a los grandes modelos de lenguaje que hoy conoce casi todo el mundo. Un LLM recibe una entrada y produce algo nuevo, como texto, código, imágenes o vídeo. A un modelo de decisión se le da un conjunto de opciones predefinidas y devuelve una de ellas. Esa es su única salida.
Cada elección va acompañada de una puntuación de confianza. Esa puntuación importa más de lo que parece. Como el modelo no produce texto, no puede explicar por qué ha elegido lo que ha elegido. La puntuación es la única pista que tienen los usuarios sobre lo fiable que puede ser una respuesta concreta.
Prescindir de la generación de texto tiene una ventaja clara: la velocidad. Generar texto consume muchos tokens y añade latencia. Un modelo que solo selecciona de una lista se ahorra ambos costes.
Por qué ahora
AWS reconoce que los modelos de decisión no son nuevos, pero hasta hace poco apenas despertaban interés. Eso cambió hace un par de semanas, cuando una startup llamada TypeSafe AI Inc. lanzó Jev. Jev se diseñó para tomar decisiones rápidas y estructuradas que el software y los agentes de IA pueden usar directamente.
AWS atribuye a Jev el mérito de demostrar lo útil que puede ser este tipo de modelo. Pero también señala que tiene debilidades estructurales. La principal, a juicio de AWS, es una estructura de salida en paralelo que provoca problemas de rendimiento cuando el modelo tiene que enfrentarse a razonamientos complejos. Strands Decider 2B es el primer intento serio de la compañía de mejorar el concepto.
Cómo lo ha construido AWS
El modelo parte de un LLM estándar. AWS tomó el tronco base de Qwen3.5-2B y le quitó la habitual "cabeza de LLM", la parte que normalmente genera el texto. En su lugar ha colocado una pequeña "cabeza de puntero" personalizada con alrededor de 1 millón de parámetros.
Después, el equipo ajustó el tronco de Qwen3.5-2B con un adaptador LoRA de rango 16. LoRA es una técnica habitual que adapta un modelo entrenando un pequeño conjunto de pesos añadidos en lugar de toda la red. En este caso, enseña al modelo a puntuar los estados ocultos de las opciones disponibles directamente frente a las posiciones de respuesta.
AWS asegura que ha pasado por muchas iteraciones antes de este lanzamiento. El tamaño de 2.000 millones de parámetros fue una decisión deliberada. Según la compañía, es lo bastante pequeño para ejecutarse en una máquina local con una latencia inferior a 150 milisegundos, pero lo bastante capaz para gestionar decisiones complejas. Si has seguido de cerca los modelos pequeños que funcionan en hardware local, la base de Qwen te sonará.
En cuanto a pruebas de rendimiento, AWS afirma que Strands Decider 2B obtuvo muy buenos resultados en precisión y calibración en JevBench frente a otros modelos de código abierto del mismo tamaño de 2B. La calibración mide hasta qué punto la confianza de un modelo coincide con la frecuencia con la que realmente acierta. En un modelo cuya puntuación de confianza es su única forma de explicarse, esa es la cifra en la que hay que fijarse.
Qué papel cumple dentro de un agente
AWS enumera varias tareas en las que espera que el modelo resulte útil:
- Enrutamiento de modelos: enviar una petición al modelo adecuado.
- Selección de herramientas: elegir qué herramienta debe invocar un agente.
- Gestión del contexto: decidir qué información conservar o transmitir.
- Aplicación de salvaguardas: comprobar si una acción debe permitirse.
- Clasificación según políticas: ordenar entradas conforme a reglas definidas.
La compañía también ve este lanzamiento como un paso hacia los "agentes híbridos". En ese esquema, un modelo de decisión se encarga de las elecciones sencillas y repetitivas, y un LLM toma el relevo cuando un problema exige razonamiento de verdad. AWS dice que su objetivo más amplio es acelerar el desarrollo de la IA agéntica en toda la comunidad de desarrolladores.
Nuestro análisis
Este lanzamiento indica que quienes construyen agentes empiezan a dividir sus sistemas en piezas especializadas, en lugar de hacer pasar cada paso por un único modelo grande. Muchos pasos de un agente son, en realidad, preguntas tipo test: qué herramienta, qué modelo, permitir o bloquear. Usar un LLM completo para eso es lento y caro. Un modelo pequeño que responde en menos de 150 milisegundos podría cambiar las cuentas, algo que encaja con una tendencia más amplia hacia modelos más baratos que se acercan al rendimiento de los buques insignia.
El caso de las salvaguardas merece una mirada más atenta. Situar los controles de seguridad para agentes en un componente separado y rápido resulta atractivo. Pero un modelo de decisión no puede explicarse, así que los equipos dependerán en gran medida de lo bien calibradas que estén sus puntuaciones de confianza.
Hay varias cosas a las que conviene estar atentos. ¿Confirmarán pruebas independientes los resultados de AWS en JevBench? ¿Cómo responderá TypeSafe AI con futuras versiones de Jev? ¿Y se convertirán los agentes híbridos en un patrón habitual o se quedarán en una optimización de nicho? Al tratarse de un lanzamiento abierto, los desarrolladores podrán comprobarlo por sí mismos.
