GPT-4 在 Quest 上重做 Put-That-There:一句话可在 XR 里同时摆多扇窗口

Revisiting put-that-there, context aware window interactions via LLMs

Riccardo Bovo, Daniele Giunchi, Pasquale Cascarano, Eric J. Gonzalez, Mar Gonzalez-Franco

cs.HC

2025-11-04

Google 用未微调的 GPT-4 融合 Quest 场景语义、窗口元数据和指点视线,把 XR 窗口管理收成 JSON 放置动作,论文尚未做用户实验。

这篇在解决什么

1980 年 Bolt 的 Put-That-There 证明了一件事:语音加上指点,计算机可以执行含糊的空间指令。四十多年后,Quest Pro、Vision Pro 这类头显已经能实时重建头部和手、给墙面家具打语义标签。XR 里的「无限桌面」把显示器面积几乎变成免费的,窗口却要人自己往墙上、桌上、柜面上钉。Pavanatto 等人已经量过:在全景虚拟显示器里手工排窗口,认知开销很高。

这篇来自 Imperial、Birmingham、Bologna 和 Google,把 LLM 接到这套传感器栈上,重做一次 Put-That-There。目标不是再做一个更准的指点器,而是让用户用完整口令、用「把那个放到那儿」,或只用一个任务目标,把二维窗口锚到真实平面上。

方法

系统不微调模型。GPT-4(2025 年 3 月的 Chat Completions)吃三类 JSON,吐出可执行动作。

场景理解走 Meta Quest Scene API,自动标大约 10 类:墙、地板、柜子、床、椅、沙发、桌、门、窗、书架。粒度不够,用户再手补大约 30 类,包括柜台、书桌、白板、冰箱、水槽。平面检测在语义网格上做:相邻面按法向点积判断共面,再用 PCA 估主方向,平面继承底下的语义标签,并带一个可见度分数。窗口来自开源的 WindowMirror:把电脑上已有窗口镜像进 XR,每扇窗有 id、尺寸、当前所在平面(或 none)、名字。

用户行为包括语音、指点悬停(对象 id 加悬停时长)和头朝向。短悬停当噪声丢掉。指点时,窗口当前所在平面不会被当成目标,避免「还放回原处」。系统提示把助手锁成 JSON:response 字段加 actions 数组,每个动作是 [place|remove, windowid, surface]。提示里写了任务、字段含义、正反例,以及消解指示语的规则:优先可见平面、过滤短悬停、不要重复放置。

三种用法对应同一条管线。完整口令:「把 Google Maps 放到咖啡桌上。」口令加指点:「把那个放到那儿。」只有目标:「需要发一条消息」,模型自己选 Chat 一类应用,再挑一块当时看得见的平面。高阶目标可以一次触发多步,例如行程规划同时放置 Maps、Notes、Calendar。模型还会按任务关系补工具:找演示文稿配图时,同时开浏览器和幻灯片。

结果

这是系统论文,没有用户实验,也没有正确率、完成时间、NASA-TLX 这类数字。论文未给出与手工窗口管理或规则式放置器的对照。能核对的是能力边界,不是效果大小。

能核对的实现选择如下。动作空间只有 place 和 remove,窗口会按平面自动缩放。语义类是 Quest 自动 10 类加手标约 30 类。平面带可见度,示例里柜子可见度 0.8。指点事件带悬停时长,示例 1.5 秒。模型是未微调的 GPT-4。作者把意义写成三点:一对一操作变成一对多;显式坐标变成目标驱动;应用之间的功能依赖由 LLM 临时推断,不必手写规则。

为什么重要

XR 生产力一直卡在「屏幕免费、布置很贵」。这篇给出一条可复现的工程路径:场景语义、窗口元数据、指点和头朝向,全部收成 JSON,让现成 LLM 出动作,不必为窗口管理训专用模型。对做空间 agent 的人,值得抄的是输入输出契约,不是模型本身:动作三元组、可见度、悬停噪声过滤、当前平面排除。

一对多和目标驱动会改变控制权。用户说「需要发消息」,系统选哪扇窗、放哪块表面,中间没有确认步。论文把信任、透明、反馈写成未解问题,这是对的:自动化省的是手,可能把不确定转移到「它刚才为什么这么摆」。

局限与存疑

作者把下一步写成用户实验,比较认知负荷、任务表现和体验。在那之前,这篇没有证据表明目标驱动一定比显式操作更省心,也没有测错过放置、多用户或长时间使用。语义粒度依赖手标,自动 10 类撑不起「咖啡桌」这种指令,可扩展性差。平面检测是共面加 PCA,弯曲表面和堆满东西的桌面会脏。动作只有放置和移除,没有改大小、叠放、撤销、置信度。GPT-4 是黑盒,布局不可复现,也没有报告延迟。硬件绑定 Quest Scene API 和 WindowMirror,Vision Pro 上没有对等实现。示例全是办公客厅,没有工厂、手术或多人会议。

术语

原文与代码

社区讨论

相关论文

全部论文解读