The Decoder 报道,马里兰大学和 AWS 的研究者做了 LEGO-Anything。编程智能体拿到一张照片,写出 Blender 程序,运行、看结果、再改,直到场景接近原图。输出是一段可以检查和修改的程序,里面写明物体、几何、布局和相机位置。文章在订阅墙之前给出了这些结果,墙后的部分这里没有。

[1]
三脚架上的相机对着用木块搭成的小沙发,一块红砖落在沙发外面。
相机对着搭好的木块,红砖落在外面。对应场景能搭出来,几何却对不齐。这是插画,不是新闻照片。, AI 生成插画,不是新闻照片

配套的 LEGO-Bench 有 208 张图,来自 104 个室内和室外场景,使用 443 个登记过的资产。图是从业已建好的模拟器场景渲染的,所以几何、深度和物体归属可以当答案,输入看起来又比较自然。评分分三项:交得出可用场景、可见几何准不准、重新渲染后和原图像不像。六个受测的 GPT 配置几乎每次都能交出能用的场景。最好的 GPT-6 Astra 室内 53.4%,室外 39.6%。更弱的配置大约 15%。研究者加大推理预算后,一组办公室测试里 Astra 从 32.3% 升到 61.8%。

[1]

文章说,常见问题是开头就差、修改把已经做好的部分改坏,以及自我评估不可靠。模型要在两个版本里选哪个更接近原图时,几何判断接近或低于随机。研究者的结论是,细化应该靠具体测量,而不是靠智能体自己的判断。他们因此做了不需要额外训练的 LEGO-Plugin:用原图锚定起点,用测量代替自我判断,并挡住会退步的修改。六个模型都有提升。较弱的提升最多到 62.7 个百分点,本来就强的顶尖模型只多了大约两个百分点。用这些场景直接做检测、分割和深度时,检测大约达到专用模型 DINO 的一半,分割和深度差距更大。作者说,能跑起来和重建得忠实,中间还差着一截。

[1]

要点

  • 智能体根据一张照片写 Blender 程序并反复改。基准有 208 张图、104 个场景。
  • GPT-6 Astra 室内 53.4%、室外 39.6%。判断自己的几何有没有变好时,接近或低于随机。
  • 换成测量之后,较弱模型提升更大,顶尖模型大约只多两个百分点。