AWS Strands Decider 2B: open beslismodel voor agents

AWS Strands Decider 2B: open beslismodel voor agents

Niet elke stap in een AI-agent heeft een model nodig dat schrijft. Voor veel stappen volstaat een model dat kiest. Dat is het idee achter Strands Decider 2B, een nieuwe opensourcerelease van het Strands Labs-team van Amazon Web Services. AWS omschrijft het als een lichtgewicht "beslismodel" dat snelle keuzes maakt binnen agentische workflows, zonder ook maar een letter tekst te genereren.

Het model staat nu op Hugging Face. De volledige codebase, trainingsscripts en voorbeelden staan op GitHub. AWS heeft het geoptimaliseerd voor lokaal gebruik en snelle experimenten, zodat ontwikkelaars het zowel op hun eigen laptop als in de publieke cloud kunnen draaien.

Wat een beslismodel eigenlijk doet

Beslismodellen, soms ook "System 1-modellen" genoemd, werken anders dan de grote taalmodellen die de meeste mensen inmiddels kennen. Een LLM krijgt een invoer en maakt daar iets nieuws van, zoals tekst, code, afbeeldingen of video. Een beslismodel krijgt een reeks vooraf bepaalde opties en geeft er een daarvan terug. Dat is de enige uitvoer.

Bij elke keuze hoort een betrouwbaarheidsscore. Die score is belangrijker dan je misschien zou denken. Omdat het model geen tekst produceert, kan het niet uitleggen waarom het een bepaalde keuze maakte. De score is het enige signaal dat gebruikers krijgen over hoe betrouwbaar een antwoord waarschijnlijk is.

Het schrappen van tekstgeneratie heeft een duidelijk voordeel: snelheid. Tekst genereren kost veel tokens en zorgt voor vertraging. Een model dat alleen uit een lijst kiest, ontloopt beide kosten.

Waarom nu

Volgens AWS zijn beslismodellen niet nieuw, maar kregen ze tot voor kort weinig aandacht. Dat veranderde een paar weken geleden, toen een start-up genaamd TypeSafe AI Inc. Jev uitbracht. Jev is ontworpen om snelle, gestructureerde beslissingen te nemen die software en AI-agents direct kunnen gebruiken.

AWS geeft Jev de eer dat het heeft laten zien hoe nuttig deze categorie modellen kan zijn. Tegelijk wijst het bedrijf op structurele zwakheden. De belangrijkste is volgens AWS een parallelle uitvoerstructuur die prestatieproblemen veroorzaakt wanneer het model ingewikkeld redeneerwerk moet doen. Strands Decider 2B is de eerste serieuze poging van het bedrijf om het concept te verbeteren.

Hoe AWS het bouwde

Het model begint als een standaard-LLM. AWS nam de basistorso van Qwen3.5-2B en verwijderde de gebruikelijke "LLM-head", het deel dat normaal tekst produceert. Daarvoor in de plaats kwam een kleine, zelfgebouwde "pointer-head" met ongeveer 1 miljoen parameters.

Vervolgens heeft het team de Qwen3.5-2B-torso gefinetuned met een LoRA-adapter van rang 16. LoRA is een veelgebruikte techniek waarbij je een model aanpast door een kleine set toegevoegde gewichten te trainen in plaats van het hele netwerk. Hier leert het het model om de verborgen toestanden van de beschikbare keuzes rechtstreeks tegen antwoordposities te scoren.

AWS zegt dat er vele iteraties aan deze release voorafgingen. De omvang van 2 miljard parameters was een bewuste keuze. Volgens het bedrijf is het model klein genoeg om op een lokale machine te draaien met een latentie van minder dan 150 milliseconden, maar nog steeds krachtig genoeg voor complexe beslissingen. Wie kleinere modellen op lokale hardware volgt, zal de Qwen-basis bekend voorkomen.

Op benchmarks scoorde Strands Decider 2B volgens AWS hoog op nauwkeurigheid en kalibratie op JevBench, vergeleken met andere opensourcemodellen van dezelfde 2B-omvang. Kalibratie meet hoe goed de zekerheid van een model overeenkomt met hoe vaak het daadwerkelijk gelijk heeft. Voor een model waarvan de betrouwbaarheidsscore de enige vorm van uitleg is, is dat het getal om in de gaten te houden.

Waar het past in een agent

AWS noemt een aantal taken waarbij het model volgens het bedrijf kan helpen:

  • Modelroutering: een verzoek naar het juiste model sturen.
  • Toolselectie: kiezen welke tool een agent moet aanroepen.
  • Contextbeheer: bepalen welke informatie bewaard of doorgegeven wordt.
  • Handhaving van guardrails: controleren of een actie toegestaan moet worden.
  • Beleidsclassificatie: invoer indelen aan de hand van vastgelegde regels.

Het bedrijf ziet de release ook als een stap richting "hybride agents". In die opzet handelt een beslismodel eenvoudige, terugkerende keuzes af en neemt een LLM het over wanneer een probleem echt redeneerwerk vraagt. AWS zegt dat het breder gezien de ontwikkeling van agentische AI in de hele ontwikkelaarsgemeenschap wil versnellen.

Onze kijk

Deze release laat zien dat bouwers van agents hun systemen beginnen op te knippen in gespecialiseerde onderdelen, in plaats van elke stap door een groot model te laten lopen. Veel stappen in een agent zijn eigenlijk meerkeuzevragen: welke tool, welk model, toestaan of blokkeren. Daar een volledige LLM voor inzetten is traag en duur. Een klein model dat binnen 150 milliseconden antwoord geeft, kan de rekensom flink veranderen, en dat past in een bredere beweging richting goedkopere modellen die dicht bij de prestaties van vlaggenschepen komen.

Vooral de toepassing voor guardrails verdient een nadere blik. Veiligheidscontroles voor agents onderbrengen in een apart, snel onderdeel is aantrekkelijk. Maar een beslismodel kan zichzelf niet verklaren, dus teams zullen sterk afhankelijk zijn van hoe goed de betrouwbaarheidsscores gekalibreerd zijn.

Er zijn een paar dingen om in de gaten te houden. Bevestigen onafhankelijke tests de JevBench-resultaten van AWS? Hoe reageert TypeSafe AI met toekomstige versies van Jev? En worden hybride agents een gangbaar patroon, of blijven ze een nicheoptimalisatie? Dankzij de open release kunnen ontwikkelaars het zelf uitzoeken.