AWS Strands Decider 2B : modèle de décision pour agents

AWS Strands Decider 2B : modèle de décision pour agents

Toutes les étapes d'un agent IA n'ont pas besoin d'un modèle qui écrit. Beaucoup n'ont besoin que d'un modèle qui choisit. C'est l'idée derrière Strands Decider 2B, un nouveau modèle open source publié par l'équipe Strands Labs d'Amazon Web Services. AWS le présente comme un "modèle de décision" léger, conçu pour faire des choix rapides au sein des workflows agentiques sans générer le moindre texte.

Le modèle est déjà disponible sur Hugging Face. L'ensemble du code, les scripts d'entraînement et des exemples se trouvent sur GitHub. AWS l'a optimisé pour un usage local et des expérimentations rapides : les développeurs peuvent donc le faire tourner sur leur propre ordinateur portable comme dans des environnements de cloud public.

Ce que fait vraiment un modèle de décision

Les modèles de décision, parfois appelés "modèles Système 1", fonctionnent différemment des grands modèles de langage que la plupart des gens connaissent désormais. Un LLM reçoit une entrée et produit quelque chose de nouveau : du texte, du code, des images ou de la vidéo. Un modèle de décision, lui, reçoit un ensemble d'options prédéfinies et renvoie l'une d'entre elles. C'est sa seule sortie.

Chaque choix s'accompagne d'un score de confiance. Ce score compte plus qu'il n'y paraît. Comme le modèle ne produit aucun texte, il ne peut pas expliquer pourquoi il a fait tel ou tel choix. Le score est le seul indice dont disposent les utilisateurs pour juger de la fiabilité probable d'une réponse.

Renoncer à la génération de texte a un avantage évident : la vitesse. Générer du texte consomme beaucoup de tokens et ajoute de la latence. Un modèle qui se contente de choisir dans une liste évite ces deux coûts.

Pourquoi maintenant

Selon AWS, les modèles de décision n'ont rien de nouveau, mais ils ont longtemps suscité peu d'intérêt. La situation a changé il y a quelques semaines, quand une startup baptisée TypeSafe AI Inc. a lancé Jev. Jev a été conçu pour prendre des décisions rapides et structurées, directement exploitables par des logiciels et des agents IA.

AWS reconnaît à Jev le mérite d'avoir montré l'utilité de cette catégorie de modèles. Mais l'entreprise estime aussi que Jev souffre de faiblesses structurelles. La principale, selon AWS, est une structure de sortie parallèle qui pose des problèmes de performance quand le modèle doit gérer un raisonnement complexe. Strands Decider 2B est la première tentative sérieuse de l'entreprise pour améliorer le concept.

Comment AWS l'a construit

Le point de départ est un LLM classique. AWS a repris le tronc de base de Qwen3.5-2B et retiré la "tête LLM" habituelle, la partie qui produit normalement le texte. À sa place, on trouve une petite "tête de pointage" sur mesure d'environ 1 million de paramètres.

L'équipe a ensuite affiné le tronc de Qwen3.5-2B avec un adaptateur LoRA de rang 16. LoRA est une technique courante qui adapte un modèle en entraînant un petit ensemble de poids ajoutés plutôt que tout le réseau. Ici, elle apprend au modèle à évaluer directement les états cachés des choix disponibles par rapport aux positions de réponse.

AWS affirme être passé par de nombreuses itérations avant cette version. La taille de 2 milliards de paramètres est un choix délibéré. D'après l'entreprise, elle est assez réduite pour tourner sur une machine locale avec une latence inférieure à 150 millisecondes, tout en restant capable de gérer des décisions complexes. Si vous suivez les petits modèles qui tournent sur du matériel local, la base Qwen vous sera familière.

Côté benchmarks, AWS indique que Strands Decider 2B a obtenu de très bons résultats en précision et en calibration sur JevBench, face à d'autres modèles open source de même taille (2B). La calibration mesure à quel point la confiance d'un modèle correspond à la fréquence à laquelle il a réellement raison. Pour un modèle dont le score de confiance est la seule forme d'explication, c'est le chiffre à surveiller.

Sa place dans un agent

AWS cite plusieurs tâches pour lesquelles le modèle devrait être utile :

  • Routage de modèles : envoyer une requête vers le bon modèle.
  • Sélection d'outils : choisir l'outil qu'un agent doit appeler.
  • Gestion du contexte : décider quelles informations conserver ou transmettre.
  • Application des garde-fous : vérifier si une action doit être autorisée.
  • Classification selon des politiques : trier les entrées en fonction de règles définies.

L'entreprise voit aussi dans cette publication un pas vers les "agents hybrides". Dans ce schéma, un modèle de décision prend en charge les choix simples et répétitifs, et un LLM prend le relais quand un problème exige un vrai raisonnement. AWS dit avoir pour objectif plus large d'accélérer le développement de l'IA agentique dans toute la communauté des développeurs.

Notre analyse

Cette sortie laisse penser que les concepteurs d'agents commencent à découper leurs systèmes en composants spécialisés, au lieu de faire passer chaque étape par un seul grand modèle. Beaucoup d'étapes d'un agent sont en réalité des questions à choix multiples : quel outil, quel modèle, autoriser ou bloquer. Mobiliser un LLM complet pour cela est lent et coûteux. Un petit modèle qui répond en moins de 150 millisecondes pourrait changer l'équation économique, ce qui s'inscrit dans une tendance plus large vers des modèles moins chers qui approchent les performances des modèles phares.

Le cas des garde-fous mérite qu'on s'y attarde. Confier les contrôles de sécurité des agents à un composant séparé et rapide est séduisant. Mais un modèle de décision ne peut pas s'expliquer, si bien que les équipes dépendront fortement de la qualité de calibration de ses scores de confiance.

Plusieurs points seront à suivre. Des tests indépendants confirmeront-ils les résultats d'AWS sur JevBench ? Comment TypeSafe AI répondra-t-il avec les prochaines versions de Jev ? Et les agents hybrides deviendront-ils un modèle courant, ou resteront-ils une optimisation de niche ? Grâce à la publication en open source, les développeurs peuvent le découvrir par eux-mêmes.