LEGO-Anything: KI-Agenten bauen 3D-Szenen ohne Urteilskraft

LEGO-Anything: KI-Agenten bauen 3D-Szenen ohne Urteilskraft

Coding-Agenten können inzwischen aus einem einzigen Foto eine bearbeitbare 3D-Szene machen, indem sie Blender-Code schreiben. Ein neuer Benchmark von Forschern der University of Maryland und von AWS zeigt, dass die Agenten meist etwas abliefern, das läuft. Er zeigt aber auch, dass sie nicht zuverlässig erkennen, ob ihre eigene Arbeit besser wird.

Vom Bild zum Programm

Das Projekt heißt LEGO-Anything, die Methode "Image-to-Code". Ein Coding-Agent erhält ein Bild und schreibt Code für Blender, die beliebte 3D-Software. Die Szene entsteht dabei nicht in einem Durchgang. Der Agent schreibt Code, führt ihn aus, prüft das gerenderte Bild und überarbeitet. Diese Schleife wiederholt er, bis das Ergebnis der Vorlage ähnelt.

Am Ende steht ein Programm, kein Mesh und kein Bild. Objekte, Geometrie, Anordnung und Kameraposition sind ausdrücklich festgelegt. Die Szene lässt sich also wie jeder andere Code ausführen, untersuchen, abfragen und bearbeiten.

Ein Benchmark mit verdecktem Lösungsschlüssel

Um die Agenten zu bewerten, hat das Team LEGO-Bench entwickelt. Er umfasst 208 Bilder aus 104 Innen- und Außenszenen, die aus 443 registrierten Assets aufgebaut sind.

Der Aufbau löst ein grundsätzliches Problem. Echte Fotos haben keine exakte 3D-Referenz, und einfache synthetische Szenen wirken künstlich. LEGO-Bench rendert seine Bilder deshalb aus professionell erstellten Simulatorszenen. Die Eingaben sehen natürlich aus, während die genaue Geometrie, die Tiefe und die Zuordnung der Objekte verborgen bleiben und als Lösungsschlüssel dienen. Zudem können die Forscher Szenen komplexer machen, ohne Beleuchtung oder Kameraeinstellungen zu verändern.

Jede Einreichung wird nach drei Kriterien bewertet:

  • Gültigkeit: Hat der Agent überhaupt eine brauchbare Szene geliefert?
  • Rekonstruktion: Wie genau ist die sichtbare Geometrie?
  • Erscheinungsbild: Wie genau stimmt ein erneutes Rendering der Szene Pixel für Pixel mit dem Referenzbild überein?

Lauffähige Ergebnisse, schwache Geometrie

Alle sechs getesteten GPT-Konfigurationen lieferten fast immer eine funktionierende Szene. Bei der Genauigkeit sah es anders aus. Das stärkste Modell, GPT-6 Astra, erreichte bei Innenszenen 53,4 Prozent und bei Außenszenen 39,6 Prozent. Schwächere Konfigurationen kamen auf rund 15 Prozent.

Je komplexer die Szenen wurden, desto stärker sank die Genauigkeit, und Außenszenen fielen schwerer als Innenräume. Ein größeres Budget für das Schlussfolgern half den GPT-6-Varianten deutlich. In einer Testauswahl mit Büroszenen stieg Astra von 32,3 auf 61,8 Prozent.

Anschließend nahmen die Forscher die einzelnen Arbeitsschritte der Agenten unter die Lupe. Die häufigsten Probleme waren schwache erste Versuche, Überarbeitungen, die frühere Fortschritte wieder zunichtemachten, und eine unzuverlässige Selbsteinschätzung.

Am auffälligsten ist das Ergebnis zur Selbsteinschätzung. Sollten die Modelle entscheiden, welche von zwei Versionen dem Original besser entspricht, lagen ihre geometrischen Urteile auf oder unter Zufallsniveau. In der Praxis heißt das: Ein Agent kann nicht erkennen, ob seine Szene besser oder schlechter geworden ist. Die Autoren folgern, dass die Verfeinerung auf konkreten Messungen beruhen sollte und nicht auf der Meinung des Modells.

Ein Plugin ersetzt die Selbstbewertung

Aus dieser Erkenntnis entstand LEGO-Plugin, eine Erweiterung, die kein zusätzliches Training benötigt. Sie verankert die erste Szene im Referenzbild, ersetzt die Selbstbewertung des Agenten durch konkrete Messungen und schützt korrekte Fortschritte vor Änderungen, die sie wieder rückgängig machen würden. Alle sechs Modelle verbesserten sich. Schwächere Agenten profitierten am meisten, mit Zuwächsen von bis zu 62,7 Prozent, während das Spitzenmodell nur rund zwei Prozentpunkte zulegte.

Für Bildverarbeitungsaufgaben noch nicht gut genug

Das Team prüfte außerdem, ob sich die rekonstruierten Szenen für gängige Aufgaben der Bildverarbeitung eignen. Da jede Szene aus Code besteht, lassen sich Objekterkennung, Segmentierung und Tiefenschätzung direkt ableiten. Ohne zusätzliches Training waren die Ergebnisse brauchbar, aber bescheiden. Am besten schnitt die Objekterkennung ab, die etwa die Hälfte der Leistung des spezialisierten Modells DINO erreichte. Bei Segmentierung und Tiefe war der Abstand zu SAM 3 und Depth Anything 3 größer. Die Autoren bezeichnen den Ansatz als vielversprechend, aber noch nicht genau genug.

Unsere Einschätzung

Die zentrale Lehre deckt sich mit dem, was wir in der Agentenforschung immer wieder sehen: Ein Modell kann leistungsfähig sein und trotzdem seine eigenen Ergebnisse schlecht beurteilen. Die Verbesserungen durch LEGO-Plugin kamen daher, dass die Bewertung aus dem Modell ausgelagert wurde. Das spricht dafür, dass sich dieses Muster auch in anderen Agenten-Workflows auszahlen könnte.

Zudem teilt sich das Feld in verschiedene Wege auf. Unity hat offizielle Plugins für Claude Code und Codex veröffentlicht, und das codebasierte Werkzeugangebot rund um Agenten wie Claude Code wächst weiter. Andere verzichten ganz auf Code, etwa das Weltmodell Atlas von World Labs, während GenCeption von Google Deepmind ein Videomodell für Tiefe und Segmentierung nutzt. Es lohnt sich zu beobachten, ob bearbeitbare Code-Szenen den Rückstand bei der Genauigkeit aufholen können oder ob direkte Weltmodelle bei der Detailtreue gewinnen, während Code bei der Kontrolle die Nase vorn hat.