AWS Strands Decider 2B: Entscheidungsmodell für Agenten

AWS Strands Decider 2B: Entscheidungsmodell für Agenten

Nicht jeder Schritt in einem KI-Agenten braucht ein Modell, das schreibt. Viele Schritte brauchen nur ein Modell, das auswählt. Genau darauf setzt Strands Decider 2B, eine neue Open-Source-Veröffentlichung des Teams Strands Labs von Amazon Web Services. AWS beschreibt es als schlankes "Entscheidungsmodell", das innerhalb agentischer Abläufe schnell Entscheidungen treffen soll, ohne dabei Text zu erzeugen.

Das Modell ist ab sofort auf Hugging Face verfügbar. Der vollständige Code, die Trainingsskripte und Beispiele liegen auf GitHub. AWS hat es für den lokalen Einsatz und schnelle Experimente abgestimmt. Entwickler können es also auf dem eigenen Laptop ebenso betreiben wie in öffentlichen Cloud-Umgebungen.

Was ein Entscheidungsmodell eigentlich macht

Entscheidungsmodelle, manchmal auch "System-1-Modelle" genannt, funktionieren anders als die großen Sprachmodelle, die inzwischen die meisten kennen. Ein LLM nimmt eine Eingabe entgegen und erzeugt etwas Neues, etwa Text, Code, Bilder oder Videos. Ein Entscheidungsmodell bekommt eine Reihe vorgegebener Optionen und gibt eine davon zurück. Das ist seine einzige Ausgabe.

Zu jeder Wahl gibt es einen Konfidenzwert. Dieser Wert ist wichtiger, als es auf den ersten Blick scheint. Weil das Modell keinen Text erzeugt, kann es nicht erklären, warum es sich so entschieden hat. Der Wert ist das einzige Signal, das Nutzer darüber bekommen, wie verlässlich eine bestimmte Antwort vermutlich ist.

Der Verzicht auf Textgenerierung hat einen klaren Vorteil: Tempo. Text zu erzeugen verbraucht viele Tokens und kostet Zeit. Ein Modell, das nur aus einer Liste auswählt, spart sich beides.

Warum gerade jetzt

Laut AWS sind Entscheidungsmodelle nicht neu, sie fanden aber bis vor Kurzem kaum Beachtung. Das änderte sich vor ein paar Wochen, als ein Start-up namens TypeSafe AI Inc. Jev veröffentlichte. Jev wurde dafür entwickelt, schnelle, strukturierte Entscheidungen zu treffen, die Software und KI-Agenten direkt verwenden können.

AWS rechnet es Jev an, gezeigt zu haben, wie nützlich diese Modellklasse sein kann. Zugleich habe Jev strukturelle Schwächen. Die wichtigste ist aus Sicht von AWS eine parallele Ausgabestruktur, die zu Leistungsproblemen führt, sobald das Modell verschachtelte Schlussfolgerungen bewältigen muss. Strands Decider 2B ist der erste ernsthafte Versuch des Unternehmens, das Konzept zu verbessern.

Wie AWS es gebaut hat

Ausgangspunkt ist ein gewöhnliches LLM. AWS hat den Grundkörper von Qwen3.5-2B genommen und den üblichen "LLM-Kopf" entfernt, also den Teil, der normalerweise Text erzeugt. An seine Stelle tritt ein kleiner, eigens entwickelter "Pointer-Kopf" mit rund 1 Million Parametern.

Anschließend hat das Team den Qwen3.5-2B-Körper mit einem LoRA-Adapter vom Rang 16 feinabgestimmt. LoRA ist eine verbreitete Methode, die ein Modell anpasst, indem sie eine kleine Zahl zusätzlicher Gewichte trainiert statt des ganzen Netzes. Hier bringt sie dem Modell bei, die verborgenen Zustände der verfügbaren Optionen direkt gegen Antwortpositionen zu bewerten.

Nach Angaben von AWS gingen dieser Veröffentlichung viele Durchläufe voraus. Die Größe von 2 Milliarden Parametern war eine bewusste Entscheidung. Sie ist laut dem Unternehmen klein genug, um auf einem lokalen Rechner mit einer Latenz von unter 150 Millisekunden zu laufen, aber immer noch leistungsfähig genug für komplexe Entscheidungen. Wenn Sie kleinere Modelle auf lokaler Hardware verfolgt haben, wird Ihnen die Qwen-Basis bekannt vorkommen.

Bei den Benchmarks erzielte Strands Decider 2B laut AWS auf JevBench hohe Werte bei Genauigkeit und Kalibrierung, verglichen mit anderen Open-Source-Modellen derselben 2B-Größe. Die Kalibrierung misst, wie gut die Konfidenz eines Modells damit übereinstimmt, wie oft es tatsächlich richtig liegt. Bei einem Modell, dessen Konfidenzwert die einzige Form von Erklärung ist, ist das die entscheidende Zahl.

Wo es in einen Agenten passt

AWS nennt mehrere Aufgaben, bei denen das Modell helfen soll:

  • Modell-Routing: eine Anfrage an das passende Modell weiterleiten.
  • Werkzeugauswahl: festlegen, welches Werkzeug ein Agent aufrufen soll.
  • Kontextverwaltung: entscheiden, welche Informationen behalten oder weitergegeben werden.
  • Durchsetzung von Schutzmechanismen: prüfen, ob eine Aktion erlaubt sein soll.
  • Richtlinienklassifizierung: Eingaben anhand festgelegter Regeln einordnen.

Das Unternehmen sieht die Veröffentlichung außerdem als Schritt hin zu "hybriden Agenten". In diesem Aufbau übernimmt ein Entscheidungsmodell einfache, wiederkehrende Entscheidungen, und ein LLM springt ein, wenn ein Problem echtes Nachdenken erfordert. Das übergeordnete Ziel ist laut AWS, die Entwicklung agentischer KI in der gesamten Entwicklergemeinde zu beschleunigen.

Unsere Einschätzung

Die Veröffentlichung deutet darauf hin, dass Entwickler von Agenten beginnen, ihre Systeme in spezialisierte Bausteine zu zerlegen, statt jeden Schritt durch ein einziges großes Modell zu schicken. Viele Agentenschritte sind im Grunde Multiple-Choice-Fragen: welches Werkzeug, welches Modell, zulassen oder blockieren. Dafür ein vollständiges LLM einzusetzen, ist langsam und teuer. Ein kleines Modell, das in unter 150 Millisekunden antwortet, könnte die Kostenrechnung verändern. Das passt zu einem breiteren Trend hin zu günstigeren Modellen, die nah an die Leistung der Spitzenmodelle herankommen.

Der Einsatz als Schutzmechanismus verdient einen genaueren Blick. Sicherheitsprüfungen für Agenten in eine eigene, schnelle Komponente auszulagern, ist verlockend. Doch ein Entscheidungsmodell kann sich nicht erklären, also werden Teams stark davon abhängen, wie gut seine Konfidenzwerte kalibriert sind.

Mehrere Punkte sind im Auge zu behalten. Werden unabhängige Tests die JevBench-Ergebnisse von AWS bestätigen? Wie wird TypeSafe AI mit künftigen Versionen von Jev reagieren? Und werden hybride Agenten zu einem gängigen Muster, oder bleiben sie eine Nischenoptimierung? Durch die offene Veröffentlichung können Entwickler das selbst herausfinden.