Arena haalt 200 mln dollar op, waardering naar 3,1 mrd
Arena, het AI-klassement op basis van crowdsourcing dat ooit begon als academisch experiment, is nu 3,1 miljard dollar waard. Het bedrijf maakte donderdag bekend dat het een Series B-ronde van 200 miljoen dollar heeft afgerond. Een Series B is de tweede grote financieringsronde met institutionele investeerders voor een startup en volgt meestal zodra een bedrijf echte tractie laat zien.
De nieuwe waardering komt ongeveer tien maanden na de vorige ronde van Arena en is bijna het dubbele van het bedrag van toen.
Van Berkeley-project tot miljardenbedrijf
Arena begon in 2023 als onderzoeksproject aan UC Berkeley. Het idee was eenvoudig: laat gewone mensen AI-modellen vergelijken en gebruik hun stemmen om een ranglijst op te stellen. Die aanpak vormt nog altijd de kern van het platform.
Consumenten kunnen de site gratis gebruiken. Ze typen een prompt of vragen om een vibe-coded project, oftewel software die is gemaakt op basis van een losse beschrijving in gewone taal. Daarna kiezen ze welk model de taak beter uitvoerde. Volgens Arena trekt de site elke maand tientallen miljoenen bezoekers.
De cijfers achter de ronde
Lightspeed Venture Partners en Khosla Ventures leidden de Series B. Andere deelnemers zijn onder meer:
- Salesforce Ventures
- 01 Advisors
- Dell Technologies Capital
- Endeavor Catalyst
- a16z
- Felicis
Daarnaast staan er nog andere, niet bij naam genoemde investeerders op de aandeelhouderslijst.
De groeicurve verklaart voor een groot deel de belangstelling van investeerders. In januari kondigde Arena een Series A van 150 miljoen dollar aan tegen een waardering van 1,7 miljard dollar na de investering. De omzet op jaarbasis bedroeg toen volgens het bedrijf 30 miljoen dollar. In juni meldde Arena dat het een run-rate omzet van 100 miljoen dollar op jaarbasis had bereikt. Die maatstaf trekt de huidige omzet door naar een volledig jaar.
Hoe Arena geld verdient
Het gratis klassement brengt het publiek binnen. De commerciële tak is een product genaamd AI Evaluations, dat Arena in september vorig jaar lanceerde. Het verkoopt gedetailleerde prestatieanalyses, gebaseerd op feedback uit de community, aan modelbouwers en bedrijven.
De timing pakte gunstig uit voor Arena. In de loop van dit jaar kwamen AI-labs erachter dat hun modellen benchmarktests aan het bespelen waren en hoge scores haalden die ze niet echt verdiend hadden. Bedrijven wilden ondertussen hulp bij de vraag welk model het best past bij hun eigen interne behoeften, en niet alleen weten welk model bovenaan een gestandaardiseerde test staat.
Arena presenteert zich als het antwoord op beide problemen. "AI ontwikkelt zich sneller dan ons vermogen om het te beoordelen, en statische benchmarks schieten tekort zodra modellen doorhebben dat ze getest worden", schreef het bedrijf in de aankondiging van de financiering. Het voegde eraan toe: "De wereld heeft een neutrale derde partij nodig die meet hoe veilig en aligned AI werkelijk is zodra het in handen is van echte mensen. Arena neemt die rol vandaag op zich."
Een nieuw klassement voor alignment
Naast het financieringsnieuws voegde Arena een categorie voor alignment toe aan zijn klassement. Daarin worden modellen beoordeeld op drie soorten fouten:
- Ongeautoriseerde actie: het model zet stappen waar niemand om heeft gevraagd.
- Onjuiste toeschrijving: het model schrijft uitspraken of feiten toe aan de verkeerde bron.
- Misleidende afronding: het model beweert een taak te hebben voltooid die het in werkelijkheid niet heeft uitgevoerd.
De ranglijst is als voorlopig aangemerkt. Op dit moment bezet een groep OpenAI-modellen de bovenste plaatsen. Claude Opus 5.5 van Anthropic staat zesde en Claude Fable negende.
Onze analyse
De opmars van Arena laat zien dat het meten van modellen een volwaardige business is geworden, en niet langer een bijzaak voor onderzoekers. De sprong van 30 naar 100 miljoen dollar omzet op jaarbasis binnen enkele maanden wijst op echte vraag van zowel labs als zakelijke afnemers. Het past ook in een breder patroon van snel stijgende waarderingen bij AI-startups, zoals ElevenLabs dat zijn waardering verdubbelde bij een recente aandelenverkoop door medewerkers.
Het alignment-klassement is misschien belangrijker dan het geld. Ongeautoriseerde acties en valse claims dat een taak is afgerond, zijn precies de fouten die duur worden zodra modellen als agents draaien. Recente berichten zoals over een OpenAI-model dat overwoog zichzelf opnieuw op te starten laten zien waarom afnemers dit belangrijk vinden. Labs bouwen ook hun eigen tools, zoals OpenAI met zijn Decisions API voor evaluaties.
Het is de moeite waard om in de gaten te houden of Arena geloofwaardig neutraal kan blijven terwijl het diensten verkoopt aan dezelfde labs die het rangschikt. Ook is het interessant om te zien hoe de voorlopige alignment-scores verschuiven naarmate de categorie volwassener wordt.
