LEGO-Anything: la IA crea escenas 3D que no sabe evaluar
Los agentes de programación ya son capaces de convertir una sola foto en una escena 3D editable escribiendo código para Blender. Un nuevo banco de pruebas de investigadores de la Universidad de Maryland y AWS muestra que, por lo general, los agentes entregan algo que funciona. También muestra que no saben distinguir con fiabilidad si su propio trabajo está mejorando.
De la imagen al programa
El proyecto se llama LEGO-Anything y su método, "Image-to-Code". Un agente de programación recibe una imagen y escribe código para Blender, el conocido software 3D. No genera la escena de una sola vez. Escribe código, lo ejecuta, revisa el renderizado y corrige, y repite el ciclo hasta que el resultado se parece a la imagen de partida.
Lo que obtiene es un programa, no una malla ni una imagen. Los objetos, la geometría, la disposición y la posición de la cámara quedan definidos de forma explícita. Eso significa que la escena se puede ejecutar, inspeccionar, consultar y editar como cualquier otro código.
Un banco de pruebas con las soluciones ocultas
Para puntuar a los agentes, el equipo creó LEGO-Bench. Incluye 208 imágenes tomadas de 104 escenas interiores y exteriores, construidas con 443 recursos registrados.
El diseño responde a un problema básico. Las fotos reales no vienen con una referencia 3D exacta, y las escenas sintéticas sencillas parecen artificiales. LEGO-Bench, en cambio, renderiza sus imágenes a partir de escenas de simulador hechas por profesionales. Las imágenes de entrada parecen naturales, mientras que la geometría precisa, la profundidad y la asignación de objetos permanecen ocultas y sirven como plantilla de soluciones. Los investigadores también pueden hacer las escenas más complejas sin tocar la iluminación ni los ajustes de cámara.
Cada entrega se evalúa en tres dimensiones:
- Validez: ¿ha entregado el agente una escena utilizable?
- Reconstrucción: ¿qué precisión tiene la geometría visible?
- Apariencia: ¿hasta qué punto un nuevo renderizado de la escena coincide, píxel a píxel, con la imagen de referencia?
Resultados que funcionan, geometría floja
Las seis configuraciones de GPT evaluadas generaron una escena funcional casi siempre. La precisión fue otra historia. El modelo más potente, GPT-6 Astra, alcanzó un 53,4 % en escenas interiores y un 39,6 % en exteriores. Las configuraciones más débiles se quedaron en torno al 15 %.
La precisión caía a medida que las escenas se complicaban, y los exteriores resultaron más difíciles que los interiores. Un mayor presupuesto de razonamiento ayudó mucho a las variantes de GPT-6. En un subconjunto de pruebas de oficinas, Astra pasó del 32,3 al 61,8 %.
Después, los investigadores analizaron el trabajo de los agentes paso a paso. Los problemas más habituales fueron unos primeros intentos deficientes, revisiones que borraban avances anteriores y una autoevaluación poco fiable.
El resultado de la autoevaluación es el más llamativo. Cuando se les pidió elegir cuál de dos versiones se parecía más al original, los modelos emitieron juicios geométricos al nivel del azar o por debajo. En la práctica, un agente no sabe si su escena ha mejorado o empeorado. Los autores concluyen que el refinamiento debe guiarse por mediciones concretas, no por la opinión del propio modelo.
Un complemento que sustituye al autojuicio
Ese hallazgo dio lugar a LEGO-Plugin, un complemento que no requiere entrenamiento adicional. Ancla la escena inicial a la imagen de referencia, sustituye la autoevaluación del agente por mediciones concretas y protege los avances correctos de cambios que los deshagan. Los seis modelos mejoraron. Los agentes más débiles fueron los que más ganaron, con subidas de hasta el 62,7 %, mientras que el mejor modelo sumó apenas unos dos puntos porcentuales.
Todavía no basta para tareas de visión
El equipo también comprobó si las escenas reconstruidas podían alimentar tareas de visión estándar. Como cada escena es código, la detección de objetos, la segmentación y la estimación de profundidad se pueden extraer directamente. Sin entrenamiento adicional, los resultados fueron aprovechables pero modestos. La detección fue lo que mejor funcionó, con aproximadamente la mitad del rendimiento del modelo especializado DINO. La distancia respecto a SAM 3 y Depth Anything 3 en segmentación y profundidad fue mayor. Los autores califican el enfoque de prometedor, pero todavía no lo bastante preciso.
Nuestro análisis
La lección central coincide con lo que no dejamos de ver en la investigación sobre agentes: un modelo puede ser capaz y, aun así, juzgar mal su propio trabajo. Las mejoras de LEGO-Plugin llegaron al sacar la evaluación fuera del modelo, lo que sugiere que el mismo patrón podría dar frutos en otros flujos de trabajo con agentes.
El sector también se está dividiendo en caminos distintos. Unity ha lanzado complementos oficiales para Claude Code y Codex, y las herramientas basadas en código en torno a agentes como Claude Code no paran de crecer. Otros prescinden por completo del código, como el modelo de mundo Atlas de World Labs, mientras que GenCeption, de Google Deepmind, utiliza un modelo de vídeo para la profundidad y la segmentación. Merece la pena seguir de cerca si las escenas en código editables logran cerrar la brecha de precisión o si los modelos de mundo directos se imponen en fidelidad mientras el código gana en control.
