LEGO-Anything : des scènes 3D que l'IA ne sait pas juger

LEGO-Anything : des scènes 3D que l'IA ne sait pas juger

Les agents de programmation savent désormais transformer une simple photo en scène 3D modifiable en écrivant du code pour Blender. Un nouveau benchmark conçu par des chercheurs de l'University of Maryland et d'AWS montre que ces agents livrent généralement un résultat qui fonctionne. Il montre aussi qu'ils sont incapables de dire de manière fiable si leur propre travail progresse.

De l'image au programme

Le projet s'appelle LEGO-Anything, et sa méthode porte le nom d'"Image-to-Code". Un agent de programmation reçoit une seule image et écrit du code pour Blender, le célèbre logiciel 3D. Il ne produit pas la scène d'un seul coup. Il écrit le code, l'exécute, examine le rendu et corrige, puis recommence jusqu'à ce que le résultat ressemble à l'image de départ.

Le résultat est un programme, pas un maillage ni une image. Les objets, la géométrie, l'agencement et la position de la caméra y sont tous décrits explicitement. La scène peut donc être exécutée, inspectée, interrogée et modifiée comme n'importe quel autre code.

Un benchmark au corrigé caché

Pour noter les agents, l'équipe a créé LEGO-Bench. Il réunit 208 images tirées de 104 scènes intérieures et extérieures, composées de 443 objets répertoriés.

Cette conception répond à un problème de base. Les vraies photos ne s'accompagnent d'aucune vérité terrain 3D exacte, et les scènes de synthèse simples paraissent artificielles. LEGO-Bench génère donc ses images à partir de scènes de simulateur réalisées par des professionnels. Les images d'entrée ont l'air naturelles, tandis que la géométrie précise, la profondeur et l'attribution des objets restent cachées et servent de corrigé. Les chercheurs peuvent aussi complexifier les scènes sans toucher à l'éclairage ni aux réglages de la caméra.

Chaque rendu est évalué selon trois critères :

  • Validité : l'agent a-t-il seulement livré une scène exploitable ?
  • Reconstruction : quelle est la précision de la géométrie visible ?
  • Apparence : dans quelle mesure un nouveau rendu de la scène correspond-il, pixel par pixel, à l'image de référence ?

Des scènes qui tournent, une géométrie fragile

Les six configurations GPT testées ont produit une scène fonctionnelle presque à chaque fois. La précision, c'est une autre histoire. Le modèle le plus performant, GPT-6 Astra, a atteint 53,4 % sur les scènes intérieures et 39,6 % sur les scènes extérieures. Les configurations plus faibles plafonnaient autour de 15 %.

La précision baissait à mesure que les scènes se complexifiaient, et les extérieurs se sont révélés plus difficiles que les intérieurs. Un budget de raisonnement plus élevé a nettement aidé les variantes de GPT-6. Sur un sous-ensemble de tests consacré à des bureaux, Astra est passé de 32,3 à 61,8 %.

Les chercheurs ont ensuite examiné le travail des agents étape par étape. Les problèmes les plus fréquents : des premières tentatives médiocres, des corrections qui effaçaient les progrès déjà réalisés et une autoévaluation peu fiable.

C'est ce dernier point qui frappe le plus. Invités à choisir laquelle de deux versions correspondait le mieux à l'original, les modèles ont rendu des jugements géométriques au niveau du hasard, voire en dessous. Concrètement, un agent ne sait pas si sa scène s'est améliorée ou dégradée. Les auteurs en concluent que l'affinage doit s'appuyer sur des mesures concrètes, et non sur l'avis du modèle lui-même.

Un plugin qui remplace l'autoévaluation

Ce constat a donné naissance à LEGO-Plugin, un module complémentaire qui ne nécessite aucun entraînement supplémentaire. Il ancre la scène initiale dans l'image de référence, remplace l'autoévaluation de l'agent par des mesures concrètes et protège les avancées correctes des modifications qui les annuleraient. Les six modèles ont progressé. Les agents les plus faibles en ont le plus profité, avec des gains allant jusqu'à 62,7 %, tandis que le meilleur modèle n'a gagné qu'environ deux points de pourcentage.

Pas encore au niveau pour les tâches de vision

L'équipe a aussi vérifié si les scènes reconstruites pouvaient alimenter des tâches de vision classiques. Comme chaque scène est du code, la détection d'objets, la segmentation et l'estimation de profondeur peuvent en être extraites directement. Sans entraînement supplémentaire, les résultats étaient exploitables mais modestes. La détection s'en est le mieux sortie, avec environ la moitié des performances du modèle spécialisé DINO. L'écart avec SAM 3 et Depth Anything 3 en segmentation et en profondeur était plus important. Les auteurs jugent l'approche prometteuse, mais pas encore assez précise.

Notre analyse

La leçon principale rejoint ce que nous observons sans cesse dans la recherche sur les agents : un modèle peut être compétent et rester un piètre juge de son propre travail. Les gains de LEGO-Plugin viennent du fait que l'évaluation a été sortie du modèle, ce qui laisse penser que la même recette pourrait porter ses fruits dans d'autres workflows d'agents.

Le domaine se divise par ailleurs en plusieurs voies. Unity a publié des plugins officiels pour Claude Code et Codex, et l'outillage fondé sur le code autour d'agents comme Claude Code ne cesse de s'étoffer. D'autres se passent complètement du code, comme le modèle de monde Atlas de World Labs, tandis que GenCeption, de Google Deepmind, s'appuie sur un modèle vidéo pour la profondeur et la segmentation. Reste à voir si les scènes en code modifiable parviendront à combler leur retard en précision, ou si les modèles de monde directs l'emporteront sur la fidélité, le code gardant l'avantage sur le contrôle.