IBM en CoreWeave ontwerpen samen controles voor AI-agents

IBM en CoreWeave ontwerpen samen controles voor AI-agents

Jarenlang was het trainen van modellen de hoofdtaak van een AI-onderzoekscluster. Die taak wordt breder. Zodra teams reinforcement learning (RL) inzetten en agents gaan testen, moet dezelfde infrastructuur code uitvoeren die modellen genereren, tools aanroepen, opslag lezen en beschrijven en verbinding maken met andere diensten. Bij puur trainen kwam de vraag nooit op waar die code moet draaien en waar ze bij mag. Bij werk met agents wel.

IBM Research zoekt samen met GPU-cloudaanbieder CoreWeave een antwoord op die vraag. Brian Belgodere, senior technical staff member bij IBM, vertelde over de samenwerking in een interview met Dave Vellante en John Furrier van theCUBE Research tijdens het evenement Fully Connected. Het interview werd uitgezonden op theCUBE, de livestreamstudio van SiliconANGLE Media. theCUBE is betaald mediapartner van het evenement en CoreWeave sponsorde de verslaggeving. Volgens SiliconANGLE hebben sponsors geen redactionele zeggenschap over de inhoud.

Waarom reinforcement learning het cluster verandert

Belgodere legde uit dat RL een fase voor het uitvoeren van taken toevoegt aan de ontwikkeling van modellen. "Bij RL zit je midden in het trainen van een model", zei hij. "Op een gegeven moment neem je dat checkpoint, laad je het in voor inferentie, vraag je het iets te doen en meet je het resultaat. Dat is je testfase."

In de praktijk bevat de trainingslus nu een inferentiestap en een uitvoeringsstap. Een checkpoint wordt geladen, krijgt een taak en wordt beoordeeld op het resultaat. Bij onderzoek naar agents kan die taak betekenen dat er code wordt uitgevoerd. Dat is een ander risicoprofiel dan een GPU die matrixberekeningen doet, en daar moet op infrastructuurniveau rekening mee worden gehouden.

Van een zelfgebouwd H100-cluster naar CoreWeave

Het infrastructuurverhaal van IBM begint bij Granite, de eigen familie van AI-modellen. Voor de ontwikkeling daarvan was veel rekenkracht nodig, en in eerste instantie bouwde IBM die capaciteit zelf. "We hebben een groot H100-cluster gebouwd, en dat deden we helemaal zelf: ruimte regelen, alles van begin tot eind. Het was een enorme klus", zei Belgodere.

De volgende generatie hardware stelde zulke eisen aan koeling en stroom dat IBM volgens Belgodere mede daardoor koos voor samenwerking met CoreWeave, in plaats van het opnieuw allemaal zelf te doen.

Samen bouwen aan identiteitsbeheer

De relatie gaat inmiddels verder dan het huren van capaciteit. IBM gaf CoreWeave eisen mee om de eigen interne identiteitssystemen door te trekken naar de omgeving van CoreWeave. Daarna verfijnden de twee bedrijven de implementatie in meerdere rondes.

Volgens Belgodere werkt de feedback in twee richtingen. "Vaak komen ze naar ons toe en zeggen ze: 'Hé, we denken hierover na, kunnen we jullie feedback krijgen?'", zei hij. "En dat lopen we dan graag met ze door."

Dat is van belang voor zakelijke afnemers. Grote organisaties willen zelden een apart identiteitssysteem per cloudaanbieder. Door de bestaande bedrijfsidentiteit door te trekken naar het platform van de aanbieder, blijft toegangsbeheer op één plek.

Kiezen waar agentcode draait

Het grootste deel van het cluster van IBM Research is single-tenant. Dat betekent dat de hardware niet wordt gedeeld met andere klanten. IBM heeft ook eigen opslag binnen CoreWeave neergezet en kan extra capaciteit aanspreken, zolang dat binnen de kaders voor kosten en beveiliging blijft.

De samenwerking omvat ook CoreWeave Sandboxes. Die maken geïsoleerde uitvoering mogelijk, op eigen infrastructuur of via een beheerde serverless runtime. Onderzoekers kunnen bepalen waar agentcode draait en bij welke middelen die kan.

Belgodere waarschuwde dat teams deze vroege keuzes vaak verkeerd maken. "Er gaat veel mis, en mensen onderschatten vaak wat het kost om sommige van die beslissingen terug te draaien", zei hij. "Als je vroeg een slechte architectuurkeuze maakt, betaal je daarvoor doordat je per ongeluk veel te veel netwerkinfrastructuur hebt gekocht, of doordat je alles opnieuw moet kopen en ombouwen."

Meten wat beveiliging kost

IBM ziet beveiligingsmaatregelen niet als gratis. Het bedrijf meet hun invloed op de prestaties aan de hand van benchmarkresultaten en gebruikt die cijfers in gesprekken met securityteams over de afwegingen. Isolatie van workloads is een onderdeel van die beveiligingsarchitectuur, naast de koppeling met het zakelijke identiteitsbeheer.

Belgodere zag de grotere uitdaging als een kwestie van herkomst. "Dit is een supply-chainprobleem, van boven tot onder", zei hij. "Het gaat niet alleen om de hardware, maar ook om de firmware, het kernelniveau, de code en de herkomst van je data. Dan kom je in de hele wereld van agents terecht, je images. Het is echt een herkomstprobleem."

Het grotere geheel

Het interview laat zien dat de veiligheid van agents steeds dieper in de stack wordt geregeld. Veel publieke discussie draait om het gedrag van modellen: wat een agent zegt, wat hij weigert, hoe hij reageert op prompt injection. De aanpak van IBM suggereert dat voor teams die agents op grote schaal draaien, de belangrijkste grens weleens fysiek en architectonisch kan zijn. Het gaat dan om de machine waarop de code draait, de identiteit die ze heeft en de opslag die ze kan zien.

Dat past in een breder patroon. Recente incidenten, zoals agents die bedrijfsscreenshots lekten op GitHub, laten zien wat er kan gebeuren als agents meer toegang krijgen dan ze nodig hebben. CoreWeave bouwt ook elders aan beveiligingspartnerschappen, waaronder de samenwerking met CrowdStrike. IBM zette vergelijkbare stappen op het gebied van tooling met een self-hosted versie van IBM Bob voor air-gapped omgevingen.

Twee dingen zijn het volgen waard. Ten eerste of uitvoering in een sandbox een standaardfunctie wordt waarop GPU-clouds met elkaar concurreren, in plaats van een extraatje. Ten tweede of de gewoonte van IBM om de prestatiekosten van elke maatregel te benchmarken navolging krijgt. Als meer teams zulke cijfers publiceren, kan het debat over beveiliging versus snelheid op data rusten in plaats van op aannames.