Arena capta 200 M$ y casi duplica su valoración: 3.100 M$

Arena capta 200 M$ y casi duplica su valoración: 3.100 M$

Arena, la clasificación de modelos de IA basada en el voto colectivo que nació como un experimento académico, vale ahora 3.100 millones de dólares. La compañía anunció el jueves que ha cerrado una ronda de serie B de 200 millones de dólares. La serie B es la segunda gran fase de financiación institucional de una startup y suele llegar cuando el negocio ya demuestra una tracción real.

La nueva valoración llega unos 10 meses después de la anterior ronda de Arena y casi duplica aquella cifra.

De proyecto en Berkeley a negocio milmillonario

Arena arrancó en 2023 como un proyecto de investigación en UC Berkeley. La idea era sencilla: pedir a gente corriente que comparara modelos de IA y usar sus votos para elaborar una clasificación. Ese planteamiento sigue siendo hoy el núcleo de la plataforma.

Los usuarios pueden utilizar la web gratis. Escriben una instrucción o piden un proyecto de "vibe coding", es decir, software generado a partir de una descripción informal en lenguaje natural. Después eligen qué modelo ha resuelto mejor la tarea. Arena asegura que recibe decenas de millones de visitantes al mes.

Las cifras de la ronda

Lightspeed Venture Partners y Khosla Ventures lideraron la serie B. Entre los demás participantes figuran:

  • Salesforce Ventures
  • 01 Advisors
  • Dell Technologies Capital
  • Endeavor Catalyst
  • a16z
  • Felicis

En el accionariado aparecen además otros inversores cuyos nombres no se han hecho públicos.

La curva de crecimiento explica buena parte del interés de los inversores. En enero, Arena anunció una serie A de 150 millones de dólares con una valoración post-money de 1.700 millones. Sus ingresos anualizados eran entonces de 30 millones de dólares, según la empresa. En junio, Arena afirmó haber alcanzado los 100 millones de dólares en ingresos recurrentes anualizados. Esta métrica proyecta los ingresos actuales a un año completo.

Cómo gana dinero Arena

La clasificación gratuita atrae al público. El negocio comercial es un producto llamado AI Evaluations, que Arena lanzó en septiembre del año pasado. Vende análisis detallados de rendimiento, elaborados a partir de las valoraciones de la comunidad, a laboratorios de modelos y a empresas.

El momento jugó a favor de Arena. A lo largo de este año, los laboratorios de IA se dieron cuenta de que sus modelos estaban haciendo trampas en las pruebas de referencia y obteniendo buenas puntuaciones que no se habían ganado de verdad. Las empresas, por su parte, querían ayuda para averiguar qué modelo se ajusta a sus propias necesidades internas, no solo cuál encabeza una prueba estandarizada.

Arena se presenta como la respuesta a ambos problemas. "La IA avanza más deprisa que nuestra capacidad para evaluarla, y las pruebas estáticas dejan de funcionar en cuanto los modelos reconocen que se les está evaluando", señaló la compañía en el anuncio de la financiación. Y añadió: "El mundo necesita un tercero neutral que mida hasta qué punto la IA es realmente segura y está alineada una vez que llega a manos de personas reales. Arena asume hoy ese papel".

Una nueva clasificación de alineamiento

Junto con la noticia de la financiación, Arena ha añadido una categoría de alineamiento a su clasificación. Puntúa a los modelos según tres tipos de fallo:

  1. Acción no autorizada: el modelo da pasos que nadie le ha pedido.
  2. Atribución falsa: el modelo atribuye declaraciones o datos a la fuente equivocada.
  3. Finalización engañosa: el modelo afirma haber terminado una tarea que en realidad no ha hecho.

Las clasificaciones se presentan como provisionales. Ahora mismo, un grupo de modelos de OpenAI ocupa los primeros puestos. Claude Opus 5.5, de Anthropic, está en sexto lugar, y Claude Fable, en el noveno.

Nuestra opinión

El ascenso de Arena indica que medir modelos se ha convertido en un negocio en sí mismo, no solo en una actividad secundaria para investigadores. El salto de 30 a 100 millones de dólares en ingresos anualizados en cuestión de meses apunta a una demanda real tanto de los laboratorios como de los compradores empresariales. También encaja en una tendencia más amplia de revalorizaciones rápidas entre las startups de IA, como la de ElevenLabs, que duplicó su valoración en una reciente venta de acciones a empleados.

La clasificación de alineamiento puede pesar más que el dinero. Las acciones no autorizadas y las afirmaciones falsas de haber completado una tarea son justo los fallos que salen caros cuando los modelos funcionan como agentes. Informaciones recientes como la de un modelo de OpenAI que se planteó reiniciarse a sí mismo muestran por qué a los compradores les preocupa. Los laboratorios también están desarrollando sus propias herramientas, como la API Decisions de OpenAI para evaluaciones.

Habrá que ver si Arena logra mantener una neutralidad creíble mientras vende servicios a los mismos laboratorios que clasifica. Y también cómo evolucionan las puntuaciones provisionales de alineamiento a medida que madure la categoría.