Arena sammelt 200 Mio. Dollar ein - Bewertung bei 3,1 Mrd.

Arena sammelt 200 Mio. Dollar ein - Bewertung bei 3,1 Mrd.

Arena, die per Crowdsourcing erstellte KI-Rangliste, die als akademisches Experiment begann, ist inzwischen 3,1 Milliarden Dollar wert. Das Unternehmen gab am Donnerstag bekannt, eine Series-B-Finanzierungsrunde über 200 Millionen Dollar abgeschlossen zu haben. Die Series B ist die zweite große Finanzierungsstufe mit institutionellen Geldgebern für ein Start-up und wird in der Regel eingesammelt, sobald ein Geschäft echte Zugkraft zeigt.

Die neue Bewertung kommt rund zehn Monate nach Arenas vorheriger Finanzierungsrunde und verdoppelt den damaligen Wert nahezu.

Vom Berkeley-Projekt zum Milliardengeschäft

Arena startete 2023 als Forschungsprojekt an der UC Berkeley. Die Idee war einfach: Ganz normale Menschen sollten KI-Modelle miteinander vergleichen, und aus ihren Stimmen sollte eine Rangliste entstehen. Dieser Ansatz steht bis heute im Mittelpunkt der Plattform.

Verbraucher können die Seite kostenlos nutzen. Sie geben einen Prompt ein oder fordern ein per Vibe-Coding erstelltes Projekt an, also Software, die aus einer lockeren Beschreibung in natürlicher Sprache entsteht. Anschließend wählen sie aus, welches Modell die Aufgabe besser gelöst hat. Nach eigenen Angaben zieht Arena jeden Monat zig Millionen Besucher an.

Die Zahlen hinter der Runde

Angeführt wurde die Series B von Lightspeed Venture Partners und Khosla Ventures. Zu den weiteren Beteiligten gehören:

  • Salesforce Ventures
  • 01 Advisors
  • Dell Technologies Capital
  • Endeavor Catalyst
  • a16z
  • Felicis

Auf der Liste der Anteilseigner stehen außerdem weitere, nicht namentlich genannte Investoren.

Die Wachstumskurve erklärt einen Großteil des Interesses der Investoren. Im Januar verkündete Arena eine Series A über 150 Millionen Dollar bei einer Post-Money-Bewertung von 1,7 Milliarden Dollar. Der annualisierte Umsatz lag nach Unternehmensangaben damals bei 30 Millionen Dollar. Bis Juni hatte Arena eigenen Angaben zufolge einen annualisierten Umsatz von 100 Millionen Dollar erreicht. Diese Kennzahl rechnet den aktuellen Umsatz auf ein ganzes Jahr hoch.

Wie Arena Geld verdient

Die kostenlose Rangliste lockt die Masse an. Das eigentliche Geschäft ist ein Produkt namens AI Evaluations, das Arena im September vergangenen Jahres eingeführt hat. Es verkauft detaillierte Leistungsanalysen, die auf dem Feedback der Community beruhen, an Modellentwickler und Unternehmen.

Das Timing spielte Arena in die Karten. Im Laufe dieses Jahres stellten KI-Labore fest, dass ihre Modelle Benchmark-Tests austricksten und gute Ergebnisse einfuhren, die sie sich nicht wirklich verdient hatten. Unternehmen wiederum wollten Hilfe bei der Frage, welches Modell zu ihren eigenen internen Anforderungen passt - und nicht nur wissen, welches in einem standardisierten Test vorne liegt.

Arena präsentiert sich als Antwort auf beide Probleme. "KI entwickelt sich schneller weiter als unsere Fähigkeit, sie zu bewerten, und statische Benchmarks versagen, sobald Modelle erkennen, dass sie getestet werden", erklärte das Unternehmen in seiner Mitteilung zur Finanzierung. Und weiter: "Die Welt braucht eine neutrale dritte Instanz, die misst, wie sicher und wie gut ausgerichtet KI tatsächlich ist, sobald sie in den Händen echter Menschen ist. Arena übernimmt diese Rolle ab heute."

Eine neue Rangliste für Alignment

Zusammen mit der Finanzierungsnachricht hat Arena seiner Rangliste eine Alignment-Kategorie hinzugefügt. Sie bewertet Modelle anhand von drei Arten von Fehlverhalten:

  1. Unbefugte Handlung: Das Modell unternimmt Schritte, um die niemand gebeten hat.
  2. Falsche Zuschreibung: Das Modell schreibt Aussagen oder Fakten der falschen Quelle zu.
  3. Vorgetäuschter Abschluss: Das Modell behauptet, eine Aufgabe erledigt zu haben, die es in Wahrheit nicht erledigt hat.

Die Ranglisten sind als vorläufig gekennzeichnet. Derzeit belegt eine Reihe von OpenAI-Modellen die Spitzenplätze. Claude Opus 5.5 von Anthropic landet auf Platz sechs, Claude Fable auf Platz neun.

Unsere Einschätzung

Arenas Aufstieg zeigt, dass das Vermessen von Modellen zu einem eigenständigen Geschäft geworden ist und nicht mehr nur eine Nebenbeschäftigung für Forscher. Der Sprung von 30 auf 100 Millionen Dollar annualisiertem Umsatz innerhalb weniger Monate deutet auf echte Nachfrage sowohl von Laboren als auch von Unternehmenskunden hin. Er passt zudem zu einem breiteren Muster rasanter Bewertungssprünge bei KI-Start-ups, etwa bei ElevenLabs, das seine Bewertung verdoppelt hat, bei einem kürzlichen Aktienrückkauf von Mitarbeitern.

Die Alignment-Rangliste könnte wichtiger sein als das Geld. Unbefugte Handlungen und falsche Behauptungen, eine Aufgabe erledigt zu haben, sind genau die Fehler, die teuer werden, sobald Modelle als Agenten laufen. Jüngste Berichte wie der über ein OpenAI-Modell, das abwog, sich selbst neu zu starten, zeigen, warum Käufern das wichtig ist. Auch die Labore bauen eigene Werkzeuge, etwa OpenAIs Decisions API für Evaluierungen.

Es lohnt sich zu beobachten, ob Arena glaubwürdig neutral bleiben kann, während es Dienstleistungen an genau die Labore verkauft, deren Modelle es bewertet. Ebenso spannend wird sein, wie sich die vorläufigen Alignment-Werte verschieben, wenn die Kategorie ausgereifter wird.