AI-агенты собирают 3D-сцены из фото, но не понимают своих ошибок
Метод LEGO-Anything заставляет кодинг-агента писать программу для Blender по одной фотографии. Агенты выдают рабочие сцены, но их геометрическая точность далека от идеала, а сами модели почти не способны оценить, стало ли лучше.
- Метод Image-to-Code заставляет агента итеративно писать и запускать код для Blender, пока сцена не совпадёт с фото
- Бенчмарк LEGO-Bench включает 208 изображений из 104 сцен и 443 зарегистрированных ассета
- GPT-6 Astra набрала 53,4% на сценах в помещениях и 39,6% на улице, слабые конфигурации — около 15%

Исследователи представили подход LEGO-Anything, в котором кодинг-агент получает одно изображение и пишет исполняемую программу для Blender — популярного 3D-редактора. Агент работает итеративно: генерирует код, запускает его, смотрит на результат и правит, пока сцена не станет похожа на исходное фото. Поскольку на выходе получается программа, в ней явно зафиксированы объекты, геометрия, расположение и позиция камеры — сцену можно запускать, проверять и менять как обычный код.
Как измеряли качество
Для оценки команда создала бенчмарк LEGO-Bench. В него вошли 208 изображений из 104 сцен в помещениях и на улице, для которых использовались 443 зарегистрированных ассета. Реальные фотографии не дают точной 3D-разметки для сравнения, а простые синтетические сцены выглядят неестественно. Поэтому изображения для бенчмарка отрендерили из профессионально построенных симуляторных сцен: входные данные выглядят натурально, а точная геометрия, глубина и разметка объектов остаются скрытыми и служат ключом для автоматической оценки.
Каждую сцену оценивают по трём осям: валидность (получился ли вообще рабочий артефакт), точность реконструкции видимой геометрии и визуальное сходство с оригиналом — для этого сцену перерисовывают и сравнивают с эталоном попиксельно.
Работает, но геометрия хромает
Все шесть протестированных конфигураций GPT почти всегда выдавали рабочую сцену, однако точность сильно разнилась. Лучшая модель, GPT-6 Astra, набрала 53,4% на сценах в помещениях и 39,6% на улице. Более слабые конфигурации показывали около 15%. Чем сложнее сцена, тем сильнее падает точность, а улица даётся моделям труднее интерьеров. Когда исследователи увеличили бюджет на рассуждения, варианты GPT-6 заметно улучшились: результат Astra на тестовом подмножестве с офисом вырос с 32,3 до 61,8%.
Анализ шагов агентов показал типичные проблемы: слабые первые попытки, правки, откатывающие уже достигнутый прогресс, и ненадёжная самооценка. Последнее оказалось самым показательным. Когда модели должны были выбрать из двух версий ту, что лучше совпадает с оригиналом, их геометрические суждения оказывались на уровне случайного угадывания или ниже. Агент фактически не понимает, стала ли его сцена лучше. Даже GPT-6 Astra в поздней части процесса ухудшала собственную сцену — с 33,9 до 4,4%. Исследователи делают вывод: доработку нужно строить на конкретных измерениях, а не на суждении самого агента.
Плагин без дообучения
На основе этого вывода авторы собрали LEGO-Plugin — расширение, не требующее дополнительного обучения. Оно привязывает стартовую сцену к исходному изображению, заменяет ненадёжную самооценку конкретными измерениями и защищает верный прогресс от регрессивных правок. Плагин улучшил все шесть моделей. Слабые агенты получили наибольший прирост — до 62,7%, а сильнейшая модель прибавила лишь около двух процентных пунктов.
Для стандартных задач зрения пока не хватает
Команда также проверила, можно ли использовать восстановленные сцены как основу для типовых задач компьютерного зрения. Поскольку каждая сцена — исполняемая программа, из неё напрямую извлекаются детекция объектов, сегментация и оценка глубины. Без дополнительного обучения результаты оказались рабочими, но скромными. Лучше всего показала себя детекция объектов: восстановленные сцены достигли примерно половины производительности специализированной модели DINO. Для сегментации и оценки глубины разрыв с моделями вроде SAM 3 и Depth Anything 3 оказался больше. Авторы заключают, что исполняемые сцены от нынешних кодинг-агентов перспективны, но пока недостаточно точны — между рабочим результатом и достоверной реконструкцией сохраняется большой разрыв.
Наблюдения за LEGO-Bench согласуются с другими оценками: исследователь ИИ Йоав Арци считает GPT-6 Astra крупным скачком в понимании пространства и предполагает, что модель обучали на больших объёмах 3D-данных вроде сцен Blender. Производители 3D-софта уже готовятся к таким агентам: Unity выпустила официальные плагины для Claude Code и Codex. Другие подходы обходятся без кода и восстанавливают сцены прямо внутри модели — например, world model Atlas от World Labs. Google DeepMind идёт третьим путём с GenCeption, используя видеомодель для оценки глубины и сегментации на уровне специализированных моделей.
Для профиТехнические детали: архитектура, цифры, ссылки
Метод: Image-to-Code — кодинг-агент получает одно изображение и итеративно пишет исполняемую программу для Blender: генерирует код, запускает, смотрит результат, правит. Выход — программа, явно фиксирующая объекты, геометрию, компоновку и позицию камеры.
Бенчмарк LEGO-Bench: 208 изображений из 104 сцен (интерьер и улица), 443 зарегистрированных ассета. Изображения отрендерены из симуляторных сцен, чтобы вход выглядел натурально, а точная геометрия, глубина и разметка объектов служили скрытым ключом для автоматической оценки.
Метрики: валидность (наличие рабочего артефакта), точность реконструкции геометрии, визуальное сходство (перерендер и попиксельное сравнение с эталоном).
- GPT-6 Astra: 53,4% на интерьерах, 39,6% на улице; слабые конфигурации — около 15%.
- Рост бюджета рассуждений: Astra на офисном подмножестве выросла с 32,3 до 61,8%.
- Самооценка моделей при выборе из двух версий — на уровне случайного угадывания или ниже; Astra в поздней стадии ухудшала сцену с 33,9 до 4,4%.
- LEGO-Plugin (без дообучения) улучшил все шесть моделей: слабые — до +62,7%, топовая — около +2 п.п.
- Применение сцен к задачам зрения: детекция объектов — примерно половина от DINO; разрыв с SAM 3 и Depth Anything 3 для сегментации и глубины больше.
Контекст: Unity выпустила официальные плагины для Claude Code и Codex; World Labs развивает world model Atlas (реконструкция внутри модели); Google DeepMind использует видеомодель в GenCeption для оценки глубины и сегментации.
Вопросы и ответы
- Что такое LEGO-Anything?
- Метод, в котором кодинг-агент по одному изображению пишет исполняемую программу для Blender, итеративно уточняя 3D-сцену.
- Насколько точны реконструкции?
- Лучшая модель GPT-6 Astra набрала 53,4% на интерьерах и 39,6% на улице; слабые конфигурации — около 15%.
- Помогает ли LEGO-Plugin?
- Да, без дообучения он улучшил все шесть моделей: слабые — до 62,7%, топовая — примерно на два процентных пункта.



