BootLoops: open-source harness maakt van Claude labtool
Een AI-model een probleem laten oplossen is niet hetzelfde als het onderzoek laten doen dat ertoe doet. Dat is de belangrijkste les die Harvard-natuurkundige Matthew Schwartz trekt in een gastbijdrage voor Anthropic. Schwartz is momenteel ook gastonderzoeker bij het bedrijf.
Zijn aanpak veranderde toen hij Claude niet langer behandelde als vervanger van een menselijke wetenschapper. In plaats daarvan ging hij op zoek naar wat hij "Claude-vormige problemen" noemt: taken die passen bij de sterke kanten van de huidige AI-modellen. Het resultaat is BootLoops, een open-source harness voor exacte wetenschappelijke berekeningen. De code staat op GitHub.
De gaten tussen vakgebieden vullen
Schwartz legt het idee uit aan de hand van het "convexe omhulsel", een begrip uit de meetkunde. Menselijke kennis is ongelijk verdeeld. Afzonderlijke disciplines groeien elk hun eigen kant op, en de ruimte daartussen blijft vaak onontgonnen. Een lab kan twintig jaar besteden aan één groep genen met één methode, zonder ooit naar de naburige genen of andere benaderingen te kijken.
BootLoops moet juist in die gaten werken, door resultaten over de grillige randen van verschillende vakgebieden heen met elkaar te verbinden. Volgens Schwartz vond Claude met de harness verbanden tussen deeltjesfysica, ecologie, populatiegenetica, economie en taalkunde. Maar de uitkomsten werden vaak pas wetenschappelijk bruikbaar nadat vakexperts ingrepen en de richting bepaalden.
36 manuscripten in drie maanden
De aantallen zijn fors. In drie maanden tijd produceerden Schwartz en 19 coauteurs 36 manuscripten in 18 vakgebieden.
Het werk begon in de deeltjesfysica, met verstrooiingsamplitudes en elliptische integralen. Binnen enkele weken had Claude met BootLoops 30 integralen berekend. Vijftien daarvan reproduceerden bekende resultaten. De andere vijftien waren nog nooit eerder berekend.
Vanaf daar breidde het team uit:
- Ecologie: Claude loste een twintig jaar oude vergelijking uit de neutrale biodiversiteitstheorie op die eerder niet op grote schaal te berekenen was. Toegepast op echte data liet die zien dat de samenstelling van boomsoorten op Barro Colorado Island in het Panamakanaal 4,5 keer sneller verschuift dan de theorie toestaat. Ecoloog James O'Dwyer hielp vervolgens om dit om te zetten in een beter voorspellend model.
- Populatiegenetica: Het team analyseerde 5,7 miljard mutatieparen uit het 1000 Genomes Project en vond aanwijzingen voor een mechanisme dat genconversie heet.
- Economie: Een AI-data-editor voor economische vakbladen controleerde automatisch 4.452 replicatiepakketten. Dat werk verscheen als NBER Working Paper.
- Taalkunde: Samen met drie taalkundigen bouwde het team een database van woordklemtoon die 6.072 talen beslaat.
Een wankelend beeld van opleiding en financiering
Volgens Schwartz maakt het tempo van de veranderingen vooruitplannen bijna onmogelijk. Waarom zou je een driejarige subsidie aanvragen voor een berekening die een AI-model misschien in één nacht afrondt?
Ook zet hij vraagtekens bij de manier waarop promovendi worden opgeleid. Op sommige terreinen, zoals informatica, noemt hij de ontwrichting zorgwekkend. Twee jaar geleden had hij een cursus "Python for Engineers" nog "essentieel" genoemd. Nu vindt hij die "overbodig", omdat Claude dat werk kan doen. Het bouwen van machinelearningmodellen om natuurkundige verschijnselen te bestuderen is een andere taak die AI volgens hem overneemt.
Waar het model tekortschiet
Schwartz is open over de zwakke punten. Claude roept vaak te vroeg de overwinning uit. Een zin als "klaar, met één kanttekening" betekent vaak dat het werk helemaal niet klaar is. Het model schat verkeerd in hoe lang taken duren en kiest liever voor rekenen met brute kracht dan voor elegantere oplossingen. Geautomatiseerde controles zijn niet betrouwbaar, en Claude kan uit correcte berekeningen verkeerde conclusies trekken.
Daarnaast dwaalt het af naar oude, veelgeciteerde discussies in plaats van nieuwe vragen. En de projecten waren "reken- en tokenintensief", merkt hij op. Zijn advies is simpel: controleer alles zelf.
Onze analyse
BootLoops is een nuttig tegenwicht voor de gebruikelijke koppen over AI die grote wiskundige problemen oplost. Het werk van Schwartz suggereert dat de waarde op korte termijn ligt in minder glamoureus werk: dingen berekenen die te omslachtig waren om te berekenen, en vakgebieden verbinden die zelden met elkaar praten.
De waarschuwingen verdienen evenveel aandacht als de resultaten. Een model dat de wiskunde goed heeft maar de conclusie fout, is een bekend patroon. We zagen vergelijkbare tekortkomingen bij agents die scènes bouwen die ze zelf niet kunnen beoordelen en bij AI-boekhouding die nog steeds toezicht nodig heeft. De expert in de lus is hier geen optie, maar een vereiste.
Het is de moeite waard om te volgen of andere onderzoeksgroepen de open-source harness gaan gebruiken, en of de 36 manuscripten overeind blijven tijdens peerreview. Ook de kosten van rekenkracht en tokens kunnen bepalen hoe ver deze aanpak zich verspreidt buiten de goed gefinancierde labs.
