CoreWeave Forge réunit inférence IA et post-entraînement
CoreWeave Inc. ne veut plus se contenter de louer des GPU. Lors de son événement Fully Connected, le fournisseur de cloud spécialisé a lancé CoreWeave Forge, une plateforme qui rassemble au même endroit le déploiement de modèles, l'observabilité, le post-entraînement et l'évaluation. Il a aussi présenté en avant-première une nouvelle fonctionnalité, CoreWeave RL Rollouts, destinée aux équipes qui entraînent des modèles agentiques par apprentissage par renforcement.
Le raisonnement de fond est simple. L'entraînement a fait naître la première vague de clouds GPU. Servir les modèles plus vite et moins cher pourrait bien décider qui profitera de la suivante.
L'inférence prend une part croissante du travail
Urvashi Chowdhary, vice-présidente produit et services d'IA chez CoreWeave, a détaillé la stratégie de l'entreprise lors d'un entretien avec Dave Vellante et John Furrier de theCUBE Research. theCUBE est le studio de diffusion en direct de SiliconANGLE Media. Selon elle, les développeurs d'IA veulent résoudre un problème rapidement, avec de bonnes performances et des coûts qui tiennent à grande échelle. La réponse de CoreWeave a consisté à ajouter des services managés d'entraînement, de post-entraînement et d'inférence par-dessus son infrastructure.
Les chiffres de la demande vont dans le même sens. Une enquête de theCUBE Research menée auprès de clients et de prospects de CoreWeave montre que, chez un client du secteur de la santé, la part des charges d'inférence est passée d'environ 10 % la première année à 40 % la deuxième. Elle devrait atteindre près de 50 % d'ici 12 mois.
Pour un fournisseur qui s'est construit sur des contrats d'entraînement, le changement est notable. La concurrence se déplace de la capacité GPU brute vers le stockage, le réseau et le logiciel.
Optimiser chaque couche au-dessus du matériel
D'après Urvashi Chowdhary, CoreWeave optimise chaque couche de la pile d'inférence située au-dessus des puces. Notamment :
- le moteur de déploiement vLLM
- les modèles quantifiés
- des décodeurs spéculatifs sur mesure
Elle a insisté sur le fait que l'entreprise s'appuie délibérément sur des outils open source et contribue en retour aux systèmes ouverts. L'objectif affiché : offrir de la souplesse aux clients pendant que CoreWeave empile ses propres services les uns sur les autres.
Là où l'apprentissage par renforcement coince
L'apprentissage par renforcement pose un problème bien particulier. Quand les clients entraînent des modèles agentiques avec des récompenses et des vérificateurs, le modèle génère sans cesse de nouveaux checkpoints. Chaque nouvelle version doit être injectée dans le dispositif d'inférence pendant les rollouts, et c'est à ce stade, selon Urvashi Chowdhary, que l'inférence devient le goulot d'étranglement.
CoreWeave RL Rollouts doit justement y remédier. Proposée en avant-première, la fonctionnalité repose sur le framework Dynamo de Nvidia Corp. et charge les nouveaux checkpoints dans un déploiement en production. Lors de ses tests, CoreWeave affirme avoir réduit d'un facteur 15 la latence de rechargement des modèles par rapport à une configuration de référence.
Urvashi Chowdhary en a expliqué l'effet concret : l'entraînement continue d'avancer rapidement pendant que l'inférence monte en charge de façon indépendante, en parallèle, au lieu que l'un attende l'autre.
Forge : une seule plateforme, un accès gratuit
RL Rollouts et les optimisations d'inférence sont désormais intégrés à Forge. La plateforme relie déploiement, observabilité, post-entraînement et évaluation, et on peut commencer gratuitement. Des offres payantes ajoutent des fonctionnalités.
Ce modèle tarifaire vise clairement les développeurs individuels, et pas seulement les grands comptes. Urvashi Chowdhary le présente comme une question d'accessibilité : une personne qui s'inscrit seule doit bénéficier des mêmes performances et de la même fiabilité qu'un gros client, sans compromis.
Une vue d'ensemble
Pour qui suit l'infrastructure de l'IA, Forge indique où les clouds GPU spécialisés pensent que l'argent va aller. Si l'inférence passe du statut de charge secondaire à celui de charge principale, comme le suggère l'exemple du secteur de la santé, les fournisseurs qui ne vendent que de la puissance de calcul risquent de devenir interchangeables. Regrouper logiciel, outillage et évaluation est une façon d'y échapper.
Cette initiative s'inscrit aussi dans une tendance plus large. CoreWeave a récemment multiplié les partenariats, comme son travail avec IBM pour concevoir ensemble des contrôles pour les charges d'agents, et des concurrents comme Lambda lèvent des fonds avant une introduction en Bourse prévue. Dans le même temps, des start-up comme Seismora développent des plans de contrôle qui répartissent les charges d'IA entre appareils et clouds. La couche située entre le matériel brut et l'application finale devient encombrée.
La fonctionnalité RL Rollouts est peut-être le détail le plus révélateur. Elle laisse penser que l'entraînement des modèles agentiques est assez mûr pour que les fournisseurs d'infrastructure conçoivent des fonctionnalités autour de ses difficultés propres. Le chiffre d'un facteur 15 provient toutefois des propres tests de CoreWeave, face à une référence qu'elle a elle-même choisie, et la fonctionnalité n'est encore qu'en avant-première. Des résultats indépendants seraient bienvenus.
Trois points méritent d'être suivis : si l'offre gratuite de Forge parvient réellement à détourner les développeurs individuels des grands clouds, à quel prix seront proposées les offres payantes, et si l'engagement de CoreWeave envers les outils open source tiendra à mesure que la plateforme pèsera davantage dans son activité.
