Loading...
最近,GPT-6 Astra 在三维建模和空间理解方面的演示引起了广泛关注。该模型能够在 Blender 中创建带有家具和庭院的住宅,并将场景转移到 Unreal Engine 5,用户可以进入房间、打开柜门,甚至操作咖啡机。GPT-6 Astra 还能根据房源照片生成真实的 3D 房屋模型。这引发了一个问题:该模型内部是如何表示物体之间的空间关系的?
研究者对多模态模型进行了分析,发现它们内部具有类似空间地图的结构。MirroS 团队提取了多个模型的中间激活后,观察到模型会将物体的左右、上下及远近位置存储在一个稳定的低维空间中,研究者将其称为 S-Space(空间工作区)。更有趣的是,这种“内部地图”不仅适用于相机拍摄到的物体。模型能够预测画外物体的位置,观察者自己也在该空间的近端,而抽象概念如“socialist”这样的词可能因其政治含义而被放置在 S-Space 的左侧。
不过,这项研究也揭示了空间推理中的一些弱点:模型有时会混淆不同坐标系,错误地将“右”解释为“东”;此外,即使模型内部已经存储了物体位置,改变视角后仍可能导致判断失误。换句话说,尽管模型已经具备空间表征,但尚未能可靠地利用这些信息。 龙8头号玩家
近期,Anthropic 在 Claude 中发现了 J-space,这被形容为一种“语言工作区”,可暂存未说出口的概念供后续使用。而 S-Space 关注的是当模型观察到真实世界时,是否会形成可用于后续计算的空间工作区。该空间工作区是一个可以绑定物体与位置,并被感知、推理及输出等多个过程共同读取和操作的共享表征。
要回答这个问题,研究者将焦点放在模型的中间层上。他们假设物体名称对应的 token 中,线性编码了物体在空间中的位置。通过自然场景图像构建空间问题,结合答案的梯度,得到了 S-Space 中的三个方向:水平、垂直和距离。分析结果表明,从 S-Space 中获取的坐标与物体的真实位置显著相关,这意味着可以绕过模型的传统语言推理过程,直接基于 S-Space 的坐标差来完成空间问答。
更重要的是,这一空间结构在跨数据集和提示中表现出稳定性。即便在提问方式改变的情况下,模型仍能从相同的坐标轴上提取物体的空间位置,显示 S-Space 是一种持续存在的内部结构。尽管 S-Space 是从单视图样本中提炼的,它在多视图输入中依然能产生有意义的坐标。 龙8头号玩家
然而,能够从模型的内部表征读取空间信息并不意味着模型真正依赖这些信息来做判断。S-Space 可能仅仅是一个精准记录空间状态的“记分牌”,并不参与真实的判断过程。研究者通过干预物体在 S-Space 中的坐标,发现这些变化会导致模型的空间判断发生改变,而物体的颜色等其他判断不受影响。这表明,S-Space 并不仅仅是一个被动的副产品,而是在模型空间判断中具有因果关系的参与者。模型内部确实存在一个可以被读取、写入并操控的空间工作区。