CoreWeave Forge bündelt KI-Inferenz und Post-Training
CoreWeave Inc. will mehr sein als ein Ort, an dem man GPUs mietet. Auf der Veranstaltung Fully Connected hat der spezialisierte Cloud-Anbieter CoreWeave Forge vorgestellt, eine Plattform, die Modellbereitstellung, Beobachtbarkeit, Post-Training und Evaluierung an einem Ort zusammenführt. Außerdem gab das Unternehmen einen ersten Einblick in eine neue Funktion namens CoreWeave RL Rollouts, die sich an Teams richtet, die agentische Modelle mit Reinforcement Learning trainieren.
Die Grundidee ist einfach. Das Training hat die erste Welle der GPU-Clouds hervorgebracht. Wer bei der nächsten Welle profitiert, könnte sich daran entscheiden, wer Modelle schneller und günstiger bereitstellt.
Inferenz macht einen immer größeren Teil der Arbeit aus
Urvashi Chowdhary, Vice President of Product and AI Services bei CoreWeave, erläuterte die Strategie des Unternehmens im Gespräch mit Dave Vellante und John Furrier von theCUBE Research. theCUBE ist das Livestreaming-Studio von SiliconANGLE Media. Aus ihrer Sicht wollen KI-Entwickler ein Problem schnell lösen, mit hoher Leistung und Kosten, die auch im großen Maßstab tragbar bleiben. CoreWeave hat darauf reagiert, indem es auf seiner Infrastruktur verwaltete Dienste für Training, Post-Training und Inferenz aufgesetzt hat.
Die Nachfragedaten zeigen in dieselbe Richtung. Eine Umfrage von theCUBE Research unter Kunden und Interessenten von CoreWeave ergab, dass bei einem Kunden aus dem Gesundheitswesen der Anteil der Inferenz-Workloads von etwa 10 % im ersten Jahr auf 40 % im zweiten Jahr gestiegen ist. Innerhalb von 12 Monaten soll dieser Anteil rund 50 % erreichen.
Für einen Anbieter, der mit Trainingsaufträgen groß geworden ist, ist das eine spürbare Verschiebung. Der Wettbewerb verlagert sich damit weg von reiner GPU-Kapazität und hin zu Speicher, Netzwerk und Software.
Feinschliff auf jeder Ebene oberhalb der Hardware
Laut Chowdhary optimiert CoreWeave jede Ebene des Inferenz-Stacks, die oberhalb der Chips liegt. Dazu gehören:
- die Serving-Engine vLLM
- quantisierte Modelle
- eigene spekulative Decoder
Sie betonte, dass das Unternehmen bewusst auf Open-Source-Werkzeuge setzt und selbst zu offenen Systemen beiträgt. Erklärtes Ziel ist es, Kunden Flexibilität zu bieten, während CoreWeave seine eigenen Dienste aufeinander aufbaut.
Wo Reinforcement Learning schmerzt
Reinforcement Learning bringt ein ganz bestimmtes Problem mit sich. Wenn Kunden agentische Modelle mit Belohnungen und Verifizierern trainieren, erzeugt das Modell laufend neue Checkpoints. Jede neue Version muss während der Rollouts in die Inferenzumgebung eingespielt werden, und in dieser Phase wird laut Chowdhary die Inferenz zum Engpass.
Genau hier setzt CoreWeave RL Rollouts an. Die Vorschaufunktion basiert auf dem Dynamo-Framework der Nvidia Corp. und lädt neue Checkpoints in eine laufende Bereitstellung. In Tests habe sie die Latenz beim Neuladen von Modellen im Vergleich zu einer Basiskonfiguration um das 15-Fache verbessert, so CoreWeave.
Chowdhary erklärte die praktische Wirkung: Das Training läuft weiterhin zügig, während die Inferenz parallel und unabhängig davon skaliert, statt dass das eine auf das andere warten muss.
Forge: eine Plattform, kostenloser Einstieg
RL Rollouts und die Inferenz-Optimierungen sind jetzt Teil von Forge. Die Plattform verbindet Bereitstellung, Beobachtbarkeit, Post-Training und Evaluierung, und der Einstieg ist kostenlos. Kostenpflichtige Stufen bieten zusätzliche Funktionen.
Dieses Preismodell zielt klar auf einzelne Entwickler und nicht nur auf große Unternehmenskunden. Chowdhary stellte es als Schritt zu mehr Zugänglichkeit dar: Wer sich allein anmeldet, soll dieselbe Leistung und Zuverlässigkeit bekommen wie ein größerer Kunde, ohne Abstriche.
Das große Ganze
Für alle, die die KI-Infrastruktur verfolgen, ist Forge ein Hinweis darauf, wo spezialisierte GPU-Clouds das Geld vermuten. Wenn sich Inferenz von einer Nebenaufgabe zur Hauptlast entwickelt, wie das Beispiel aus dem Gesundheitswesen nahelegt, laufen Anbieter, die nur Rechenleistung verkaufen, Gefahr, austauschbar zu werden. Software, Werkzeuge und Evaluierung zu bündeln, ist ein Weg, das zu vermeiden.
Der Schritt passt auch zu einem größeren Muster. CoreWeave tauchte zuletzt in Partnerschaften auf, etwa bei der Zusammenarbeit mit IBM, um gemeinsam Kontrollen für Agenten-Workloads zu entwickeln, und Konkurrenten wie Lambda sammeln vor einem geplanten Börsengang Kapital ein. Gleichzeitig bauen Start-ups wie Seismora Steuerungsebenen, die KI-Workloads über Geräte und Clouds hinweg verteilen. Die Schicht zwischen reiner Hardware und fertiger Anwendung wird zunehmend voll.
Die Funktion RL Rollouts ist vielleicht das aufschlussreichere Detail. Sie deutet darauf hin, dass das Training agentischer Modelle reif genug ist, dass Infrastrukturanbieter Funktionen rund um seine spezifischen Schwachstellen entwickeln. Der Wert von 15x stammt allerdings aus CoreWeaves eigenen Tests gegen eine selbst gewählte Basis, und die Funktion befindet sich noch in der Vorschau. Unabhängige Ergebnisse wären hilfreich.
Als Nächstes lohnt es sich, drei Dinge im Blick zu behalten: ob die kostenlose Stufe von Forge tatsächlich einzelne Entwickler von größeren Clouds weglockt, wie die kostenpflichtigen Stufen bepreist werden und ob CoreWeave an seinem Bekenntnis zu Open-Source-Werkzeugen festhält, wenn die Plattform einen größeren Teil seines Geschäfts ausmacht.
