CoreWeave Forge une inferencia y postentrenamiento de IA

CoreWeave Forge une inferencia y postentrenamiento de IA

CoreWeave Inc. quiere ser algo más que un sitio donde alquilar GPU. En el evento Fully Connected, el proveedor de nube especializado presentó CoreWeave Forge, una plataforma que reúne en un mismo lugar el despliegue de modelos, la observabilidad, el postentrenamiento y la evaluación. También mostró en versión preliminar una nueva función llamada CoreWeave RL Rollouts, pensada para los equipos que entrenan modelos agénticos con aprendizaje por refuerzo.

El argumento de fondo es sencillo. El entrenamiento dio origen a la primera oleada de nubes de GPU. Servir modelos más rápido y a menor coste puede decidir quién saca partido de la siguiente.

La inferencia gana peso en la carga de trabajo

Urvashi Chowdhary, vicepresidenta de producto y servicios de IA de CoreWeave, explicó la estrategia de la compañía en una entrevista con Dave Vellante y John Furrier, de theCUBE Research. theCUBE es el estudio de retransmisiones en directo de SiliconANGLE Media. Según Chowdhary, los desarrolladores de IA quieren resolver un problema rápidamente, con un buen rendimiento y unos costes que se sostengan a gran escala. La respuesta de CoreWeave ha sido añadir servicios gestionados de entrenamiento, postentrenamiento e inferencia sobre su infraestructura.

Los datos de demanda apuntan en la misma dirección. Una encuesta de theCUBE Research entre clientes y potenciales clientes de CoreWeave reveló que, en el caso de un cliente del sector sanitario, el peso de las cargas de inferencia pasó de alrededor del 10% en su primer año al 40% en el segundo. Se espera que esa proporción llegue a cerca del 50% en un plazo de 12 meses.

Para un proveedor que creció gracias a los contratos de entrenamiento, se trata de un cambio importante. La competencia se desplaza de la capacidad bruta de GPU hacia el almacenamiento, las redes y el software.

Ajustar cada capa por encima del hardware

Según Chowdhary, CoreWeave está optimizando cada capa de la pila de inferencia que se sitúa por encima de los chips. Eso incluye:

  • el motor de servicio vLLM
  • modelos cuantizados
  • decodificadores especulativos personalizados

Chowdhary subrayó que la empresa ha apostado deliberadamente por herramientas de código abierto y que contribuye a los sistemas abiertos. El objetivo declarado es ofrecer flexibilidad a los clientes mientras CoreWeave construye sus propios servicios unos encima de otros.

Donde duele el aprendizaje por refuerzo

El aprendizaje por refuerzo plantea un problema concreto. Cuando los clientes entrenan modelos agénticos con recompensas y verificadores, el modelo no deja de generar nuevos checkpoints. Cada nueva versión tiene que cargarse en la infraestructura de inferencia durante los rollouts, y Chowdhary afirmó que en esa fase la inferencia se convierte en el cuello de botella.

CoreWeave RL Rollouts pretende resolverlo. La función, en versión preliminar, se basa en el framework Dynamo de Nvidia Corp. y carga los nuevos checkpoints en un despliegue en funcionamiento. En sus pruebas, según CoreWeave, redujo 15 veces la latencia de recarga del modelo frente a una configuración de referencia.

Chowdhary explicó el efecto práctico: el entrenamiento sigue avanzando con rapidez mientras la inferencia escala de forma independiente y en paralelo, en lugar de que una parte tenga que esperar a la otra.

Forge: una sola plataforma y acceso gratuito

RL Rollouts y las optimizaciones de inferencia forman ahora parte de Forge. La plataforma conecta el despliegue, la observabilidad, el postentrenamiento y la evaluación, y empezar a usarla es gratis. Los planes de pago añaden más funciones.

Ese modelo de precios se dirige claramente a desarrolladores individuales, no solo a las grandes cuentas empresariales. Chowdhary lo planteó como una cuestión de accesibilidad: quien se registre por su cuenta debería obtener el mismo rendimiento y la misma fiabilidad que un cliente más grande, sin concesiones.

El panorama general

Para quien siga de cerca la infraestructura de IA, Forge es una señal de hacia dónde creen las nubes de GPU especializadas que va el dinero. Si la inferencia pasa de ser una carga secundaria a convertirse en la principal, como sugiere el ejemplo del sector sanitario, los proveedores que solo venden capacidad de cómputo corren el riesgo de volverse intercambiables. Empaquetar software, herramientas y evaluación es una forma de evitarlo.

El movimiento encaja además en una tendencia más amplia. CoreWeave ha aparecido recientemente en alianzas como su trabajo con IBM para diseñar conjuntamente controles para cargas de trabajo de agentes, y rivales como Lambda están captando capital antes de una salida a bolsa prevista. Mientras tanto, startups como Seismora están creando planos de control que dirigen cargas de trabajo de IA entre dispositivos y nubes. La capa situada entre el hardware puro y la aplicación final empieza a estar abarrotada.

La función RL Rollouts es quizá el detalle más revelador. Sugiere que el entrenamiento de modelos agénticos ha madurado lo suficiente como para que los proveedores de infraestructura desarrollen funciones en torno a sus problemas concretos. Eso sí, la cifra de 15 veces procede de las propias pruebas de CoreWeave frente a una referencia elegida por la empresa, y la función sigue en versión preliminar. Harían falta resultados independientes.

Conviene estar atentos a tres cosas a partir de ahora: si el plan gratuito de Forge consigue de verdad atraer a desarrolladores individuales que hoy usan nubes más grandes, cómo se fijan los precios de los planes de pago y si el compromiso de CoreWeave con las herramientas de código abierto se mantiene a medida que la plataforma gane peso en su negocio.