CoreWeave Forge bundelt AI-inferentie en post-training

CoreWeave Forge bundelt AI-inferentie en post-training

CoreWeave Inc. wil meer zijn dan een plek om GPU's te huren. Tijdens het evenement Fully Connected lanceerde de gespecialiseerde cloudaanbieder CoreWeave Forge, een platform dat het serveren van modellen, observability, post-training en evaluatie op een plek samenbrengt. Daarnaast gaf het bedrijf een voorproefje van een nieuwe functie, CoreWeave RL Rollouts, bedoeld voor teams die agentische modellen trainen met reinforcement learning.

De achterliggende redenering is eenvoudig. Training heeft de eerste golf GPU-clouds groot gemaakt. Wie modellen sneller en goedkoper kan serveren, bepaalt misschien wie er aan de volgende golf verdient.

Inferentie neemt een steeds groter deel van het werk voor zijn rekening

Urvashi Chowdhary, vicepresident product en AI-diensten bij CoreWeave, lichtte de strategie van het bedrijf toe in een interview met Dave Vellante en John Furrier van theCUBE Research. theCUBE is de livestreamstudio van SiliconANGLE Media. Volgens haar willen AI-ontwikkelaars een probleem snel oplossen, met sterke prestaties en kosten die ook op grote schaal overeind blijven. CoreWeave speelt daarop in door bovenop zijn infrastructuur beheerde diensten aan te bieden voor training, post-training en inferentie.

De cijfers over de vraag wijzen dezelfde kant op. Uit een enquete van theCUBE Research onder klanten en potentiele klanten van CoreWeave bleek dat bij een klant uit de zorg het aandeel inferentieworkloads groeide van ongeveer 10% in het eerste jaar naar 40% in het tweede. Verwacht wordt dat dat aandeel binnen 12 maanden op zo'n 50% uitkomt.

Voor een aanbieder die groot is geworden met trainingscontracten is dat een betekenisvolle verschuiving. De concurrentie draait daardoor minder om pure GPU-capaciteit en meer om opslag, netwerken en software.

Elke laag boven de hardware bijschaven

Volgens Chowdhary optimaliseert CoreWeave elke laag van de inferentiestack die boven de chips zit. Daaronder vallen:

  • de vLLM-serving-engine
  • gekwantiseerde modellen
  • eigen speculatieve decoders

Ze benadrukte dat het bedrijf bewust leunt op opensourcetools en zelf bijdraagt aan open systemen. Het doel is volgens het bedrijf klanten flexibiliteit te bieden, terwijl CoreWeave zijn eigen diensten op elkaar voortbouwt.

Waar reinforcement learning pijn doet

Reinforcement learning brengt een specifiek probleem met zich mee. Wanneer klanten agentische modellen trainen met beloningen en verifiers, levert het model voortdurend nieuwe checkpoints op. Elke nieuwe versie moet tijdens de rollouts in de inferentieomgeving worden geladen, en volgens Chowdhary wordt inferentie in die fase het knelpunt.

CoreWeave RL Rollouts moet dat oplossen. De functie, die nog in preview is, is gebouwd op het Dynamo-framework van Nvidia Corp. en laadt nieuwe checkpoints in een draaiende omgeving. In tests verbeterde de latentie bij het herladen van modellen volgens CoreWeave met een factor 15 ten opzichte van een basisconfiguratie.

Chowdhary legde uit wat dat in de praktijk betekent: training blijft snel doorlopen terwijl inferentie parallel en onafhankelijk opschaalt, in plaats van dat het ene op het andere moet wachten.

Forge: een platform, gratis instappen

RL Rollouts en de inferentie-optimalisaties zitten nu in Forge. Het platform verbindt serving, observability, post-training en evaluatie, en je kunt er gratis mee beginnen. Betaalde abonnementen voegen extra mogelijkheden toe.

Dat prijsmodel richt zich nadrukkelijk op individuele ontwikkelaars, niet alleen op grote zakelijke klanten. Chowdhary presenteerde het als een kwestie van toegankelijkheid: wie zich in z'n eentje aanmeldt, moet dezelfde prestaties en betrouwbaarheid krijgen als een grotere klant, zonder concessies.

Het grotere plaatje

Voor wie de AI-infrastructuur volgt, laat Forge zien waar gespecialiseerde GPU-clouds het geld naartoe zien gaan. Als inferentie uitgroeit van bijzaak tot hoofdzaak, zoals het voorbeeld uit de zorg doet vermoeden, dan dreigen aanbieders die alleen rekenkracht verkopen inwisselbaar te worden. Software, tooling en evaluatie in een pakket aanbieden is een manier om dat te voorkomen.

De stap past ook in een breder patroon. CoreWeave dook onlangs op in samenwerkingen zoals die met IBM om samen controls voor agentworkloads te ontwerpen, en concurrenten als Lambda halen kapitaal op in aanloop naar een geplande beursgang. Intussen bouwen startups als Seismora aan control planes die AI-workloads routeren over apparaten en clouds heen. Het wordt druk in de laag tussen de kale hardware en de uiteindelijke toepassing.

De RL Rollouts-functie is misschien wel het veelzeggendste detail. Ze wijst erop dat de training van agentische modellen volwassen genoeg is om infrastructuurleveranciers functies te laten bouwen rond de specifieke knelpunten ervan. De factor 15 komt wel uit CoreWeaves eigen tests, gemeten tegen een basisconfiguratie die het bedrijf zelf koos, en de functie is nog in preview. Onafhankelijke resultaten zouden welkom zijn.

Drie dingen zijn het volgen waard: of het gratis instapniveau van Forge individuele ontwikkelaars echt weglokt bij grotere clouds, hoe de betaalde abonnementen worden geprijsd, en of CoreWeave vasthoudt aan opensourcetools nu het platform een groter deel van zijn bedrijf wordt.