LEGO-Anything: AI-agents bouwen 3D-scènes zonder zelfinzicht

LEGO-Anything: AI-agents bouwen 3D-scènes zonder zelfinzicht

Codeeragents kunnen nu van een enkele foto een bewerkbare 3D-scène maken door Blender-code te schrijven. Een nieuwe benchmark van onderzoekers van de University of Maryland en AWS laat zien dat de agents meestal iets afleveren dat werkt. Tegelijk blijkt dat ze niet betrouwbaar kunnen inschatten of hun eigen werk beter wordt.

Van afbeelding naar programma

Het project heet LEGO-Anything en de methode heet "Image-to-Code". Een codeeragent krijgt één afbeelding en schrijft code voor Blender, het populaire 3D-programma. De scène ontstaat niet in één keer. De agent schrijft code, voert die uit, bekijkt de render en past aan. Die cyclus herhaalt zich tot het resultaat op de invoer lijkt.

Wat eruit komt is een programma, geen mesh of plaatje. Objecten, geometrie, opbouw en camerapositie worden allemaal expliciet vastgelegd. Daardoor kun je de scène uitvoeren, inspecteren, bevragen en bewerken zoals elke andere code.

Een benchmark met een verborgen antwoordmodel

Om de agents te beoordelen bouwde het team LEGO-Bench. Die bestaat uit 208 afbeeldingen uit 104 binnen- en buitenscènes, opgebouwd uit 443 geregistreerde assets.

Het ontwerp pakt een basisprobleem aan. Echte foto's hebben geen exacte 3D-referentie, en eenvoudige synthetische scènes zien er kunstmatig uit. LEGO-Bench rendert zijn afbeeldingen daarom uit professioneel gebouwde simulatorscènes. De invoer ziet er natuurlijk uit, terwijl de precieze geometrie, diepte en objecttoewijzingen verborgen blijven en als antwoordmodel dienen. De onderzoekers kunnen scènes bovendien complexer maken zonder de belichting of camera-instellingen te veranderen.

Elke inzending wordt op drie punten beoordeeld:

  • Geldigheid: leverde de agent überhaupt een bruikbare scène af?
  • Reconstructie: hoe nauwkeurig is de zichtbare geometrie?
  • Uiterlijk: hoe goed komt een nieuwe render van de scène pixel voor pixel overeen met de referentieafbeelding?

Werkende output, zwakke geometrie

Alle zes geteste GPT-configuraties leverden vrijwel altijd een werkende scène op. Met de nauwkeurigheid was het anders gesteld. Het sterkste model, GPT-6 Astra, haalde 53,4 procent bij binnenscènes en 39,6 procent bij buitenscènes. Zwakkere configuraties bleven steken rond de 15 procent.

De nauwkeurigheid daalde naarmate scènes complexer werden, en buitenscènes waren lastiger dan interieurs. Meer redeneerbudget hielp de GPT-6-varianten flink. Op een testset met kantoren klom Astra van 32,3 naar 61,8 procent.

Daarna bekeken de onderzoekers stap voor stap hoe de agents te werk gingen. De meest voorkomende problemen waren zwakke eerste pogingen, aanpassingen die eerdere vooruitgang tenietdeden en een onbetrouwbaar zelfoordeel.

Dat laatste springt het meest in het oog. Toen de modellen moesten kiezen welke van twee versies beter op het origineel leek, waren hun geometrische oordelen niet beter dan gokken, of zelfs slechter. In de praktijk kan een agent dus niet zien of zijn scène beter of slechter is geworden. De auteurs concluderen dat verfijning moet worden gestuurd door concrete metingen, niet door de mening van het model zelf.

Een plug-in in plaats van zelfoordeel

Die bevinding leidde tot LEGO-Plugin, een uitbreiding die geen extra training vereist. De plug-in verankert de eerste scène in de referentieafbeelding, vervangt het zelfoordeel van de agent door concrete metingen en beschermt correcte vooruitgang tegen aanpassingen die die zouden terugdraaien. Alle zes modellen gingen erop vooruit. Zwakkere agents profiteerden het meest, met verbeteringen tot 62,7 procent, terwijl het topmodel er maar zo'n twee procentpunten bij kreeg.

Nog niet goed genoeg voor vision-taken

Het team keek ook of de gereconstrueerde scènes bruikbaar zijn voor standaard vision-taken. Omdat elke scène uit code bestaat, kun je objectdetectie, segmentatie en diepteschatting er direct uit halen. Zonder extra training waren de resultaten bruikbaar, maar bescheiden. Detectie deed het het best en haalde ongeveer de helft van de prestaties van het gespecialiseerde model DINO. De achterstand op SAM 3 en Depth Anything 3 bij segmentatie en diepte was groter. De auteurs noemen de aanpak veelbelovend, maar nog niet nauwkeurig genoeg.

Onze analyse

De belangrijkste les sluit aan bij wat we steeds weer zien in onderzoek naar agents: een model kan capabel zijn en toch slecht zijn eigen werk beoordelen. De winst van LEGO-Plugin kwam van het verplaatsen van de beoordeling naar buiten het model. Dat doet vermoeden dat hetzelfde patroon ook in andere agent-workflows kan lonen.

Het vakgebied splitst zich bovendien op in verschillende routes. Unity heeft officiële plug-ins uitgebracht voor Claude Code en Codex, en de op code gebaseerde tools rond agents als Claude Code blijven groeien. Anderen slaan code helemaal over, zoals het Atlas-wereldmodel van World Labs, terwijl GenCeption van Google Deepmind een videomodel gebruikt voor diepte en segmentatie. Het is de moeite waard om te volgen of bewerkbare codescènes de achterstand in nauwkeurigheid kunnen inlopen, of dat directe wereldmodellen winnen op getrouwheid en code wint op controle.