BootLoops: Open-Source-Werkzeug macht Claude zum Laborgerät

BootLoops: Open-Source-Werkzeug macht Claude zum Laborgerät

Ein KI-Modell eine Aufgabe lösen zu lassen, ist nicht dasselbe, wie es Forschung betreiben zu lassen, die wirklich zählt. Das ist die wichtigste Lehre, die der Harvard-Physiker Matthew Schwartz in einem Gastbeitrag für Anthropic zieht. Schwartz ist derzeit außerdem Gastforscher bei dem Unternehmen.

Sein Ansatz änderte sich, als er aufhörte, Claude als Ersatz für einen menschlichen Wissenschaftler zu behandeln. Stattdessen suchte er nach dem, was er "Claude-förmige Probleme" nennt: Aufgaben, die zu den Stärken heutiger KI-Modelle passen. Das Ergebnis heißt BootLoops, ein Open-Source-Werkzeug für exakte wissenschaftliche Berechnungen. Der Code ist auf GitHub veröffentlicht.

Die Lücken zwischen den Fächern füllen

Schwartz erklärt die Idee mit der "konvexen Hülle", einem Begriff aus der Geometrie. Menschliches Wissen ist ungleichmäßig verteilt. Einzelne Disziplinen stoßen in ihre eigene Richtung vor, und der Raum dazwischen bleibt oft unerforscht. Ein Labor kann 20 Jahre lang mit einer einzigen Methode an einer Gruppe von Genen arbeiten, ohne je die benachbarten Gene oder andere Ansätze anzurühren.

BootLoops soll genau in diesen Lücken arbeiten, indem es Ergebnisse über die zerklüfteten Ränder verschiedener Fachgebiete hinweg verknüpft. Laut Schwartz fand Claude mit dem Werkzeug Verbindungen zwischen Teilchenphysik, Ökologie, Populationsgenetik, Wirtschaftswissenschaften und Linguistik. Wissenschaftlich brauchbar wurden die Ergebnisse allerdings oft erst, nachdem Fachleute eingegriffen und die Richtung vorgegeben hatten.

36 Manuskripte in drei Monaten

Die Zahlen sind beachtlich. In drei Monaten haben Schwartz und 19 Mitautoren 36 Manuskripte in 18 Fachgebieten verfasst.

Den Anfang machte die Teilchenphysik, mit Streuamplituden und elliptischen Integralen. Innerhalb weniger Wochen hatte Claude mit BootLoops 30 Integrale berechnet. Fünfzehn davon bestätigten bekannte Ergebnisse. Die anderen fünfzehn waren noch nie zuvor berechnet worden.

Von dort aus weitete das Team seine Arbeit aus:

  • Ökologie: Claude löste eine 20 Jahre alte Gleichung aus der neutralen Biodiversitätstheorie, die sich bisher nicht in großem Maßstab berechnen ließ. Angewandt auf echte Daten zeigte sich, dass sich die Zusammensetzung der Baumarten auf Barro Colorado Island im Panamakanal 4,5-mal schneller verändert, als die Theorie zulässt. Der Ökologe James O'Dwyer half anschließend, daraus ein besseres Vorhersagemodell zu machen.
  • Populationsgenetik: Das Team analysierte 5,7 Milliarden Mutationspaare aus dem 1000 Genomes Project und fand Hinweise auf einen Mechanismus namens Genkonversion.
  • Wirtschaftswissenschaften: Ein KI-Dateneditor für wirtschaftswissenschaftliche Fachzeitschriften prüfte automatisch 4.452 Replikationspakete. Diese Arbeit erschien als NBER Working Paper.
  • Linguistik: Gemeinsam mit drei Sprachwissenschaftlern baute das Team eine Datenbank zur Wortbetonung auf, die 6.072 Sprachen abdeckt.

Ein erschüttertes Bild von Ausbildung und Förderung

Schwartz sagt, das Tempo des Wandels mache vorausschauende Planung fast unmöglich. Warum einen Förderantrag über drei Jahre stellen, um eine Berechnung zu finanzieren, die ein KI-Modell womöglich über Nacht erledigt?

Er stellt auch infrage, wie Doktoranden ausgebildet werden sollten. In manchen Bereichen, etwa der Informatik, nennt er die Umwälzungen alarmierend. Vor zwei Jahren hätte er einen Kurs "Python für Ingenieure" noch als "unverzichtbar" bezeichnet. Heute hält er ihn für "überflüssig", weil Claude diese Arbeit übernehmen kann. Auch das Erstellen von Machine-Learning-Modellen zur Untersuchung physikalischer Phänomene sieht er als Aufgabe, die die KI übernimmt.

Wo das Modell an Grenzen stößt

Bei den Schwächen nimmt Schwartz kein Blatt vor den Mund. Claude neigt dazu, zu früh den Sieg zu verkünden. Eine Formulierung wie "erledigt, mit einem Sternchen" bedeutet oft, dass die Arbeit überhaupt nicht erledigt ist. Das Modell schätzt falsch ein, wie lange Aufgaben dauern, und greift lieber zu Rechnen mit roher Gewalt als zu eleganteren Lösungen. Automatische Prüfungen sind nicht verlässlich, und Claude kann aus korrekten Berechnungen falsche Schlüsse ziehen.

Außerdem driftet es zu alten, vielzitierten Debatten ab, statt sich neuen Fragen zu widmen. Und die Projekte seien "rechen- und token-intensiv" gewesen, merkt er an. Sein Rat ist einfach: alles selbst anschauen.

Unsere Einschätzung

BootLoops ist ein nützliches Gegengewicht zu den üblichen Schlagzeilen über KI, die große mathematische Probleme löst. Schwartz' Bilanz legt nahe, dass der kurzfristige Nutzen in weniger glamouröser Arbeit liegt: Dinge zu berechnen, die bisher zu mühsam waren, und Fachgebiete zu verbinden, die selten miteinander sprechen.

Die Warnungen verdienen genauso viel Aufmerksamkeit wie die Ergebnisse. Ein Modell, das die Mathematik richtig und die Schlussfolgerung falsch macht, ist ein bekanntes Muster. Ähnliche Lücken haben wir bei Agenten gesehen, die Szenen bauen, die sie nicht beurteilen können, und bei KI-Buchhaltung, die weiterhin Aufsicht braucht. Der Experte im Prozess ist hier keine Option, sondern Pflicht.

Es lohnt sich zu beobachten, ob andere Forschungsgruppen das Open-Source-Werkzeug übernehmen und ob die 36 Manuskripte dem Peer-Review standhalten. Auch die Kosten für Rechenleistung und Tokens könnten darüber entscheiden, wie weit sich dieser Ansatz über gut finanzierte Labore hinaus verbreitet.