美国科罗拉多大学、韩国光州科学技术院和 Google 的研究人员提出 VisionClaw,把无显示屏版 Ray-Ban Meta、Gemini Live 与 OpenClaw 连接起来,试图让 AI 在持续感知现实环境的同时,自动执行网页和应用里的数字任务。
这套系统通过定制手机应用持续传输佩戴者周围的音频和单帧画面,由 Gemini 处理多模态输入;当需要进一步操作时,再调用 OpenClaw 去使用浏览器、邮件、日历或搜索,并把结果返回给语言模型。研究团队想验证的是,把感知与行动放进同一系统后,日常交互会不会发生明显变化。
任务测试结果
在第一项实验中,研究人员让 12 名参与者分别使用 VisionClaw、只能持续感知但不能执行通用任务的对照系统,以及只能执行数字任务但无法持续感知周围环境的手机版 OpenClaw。参与者完成了四类与真实物体或纸质文件有关的任务,例如根据纸面材料记笔记、撰写邮件、查找商品或控制设备。
论文称,VisionClaw 在不同任务上完成速度提升了 13% 到 37%,用户主观负担下降了 7% 到 46%,心理负荷、时间压力和挫败感都有所降低。整体成功率与对照组差异不大,但在记笔记任务中,VisionClaw 的成功率降到约 58%,原因是眼镜摄像头难以稳定拍清小型或视觉条件较差的物体,例如收据。
研究人员写道,把感知和执行整合到一起,可以比非常开式和非智能体基线更快地完成任务,并减少交互开销。
日常使用观察
第二项带有自我民族志性质的实地研究由论文的 4 名作者亲自参与,累计记录了 55 个活跃参与者日、555 次语音发起的交互和 25.8 小时使用时长。研究团队据此总结出 6 类主要用途:信息获取占 30%,购物占 19%,保存内容占 16%,沟通占 14%,记忆辅助占 12%,控制类任务占 9%。
论文还归纳出 4 种新出现的交互模式,包括与 AI 智能体展开开放式多步骤对话、随手记录后再回溯信息、无屏 AI 带来的更隐蔽但有时不够可靠的使用方式,以及系统随着个人数据积累而逐渐变得更有用。作者据此认为,交互正在从一次性语音命令转向连续、情境驱动的使用。
意义与局限
作者认为,VisionClaw 指向的是一种更像“持续陪伴者”的可穿戴 AI:感知、记忆与行动协同工作,而不只是按命令回应。同时,常时录制带来的隐私风险、大量个人数据的处理方式,以及如何让系统在后台保持低打扰,仍是必须解决的问题。
不过,这项研究的样本量并不大,第一项实验只有 12 人,第二项只有 4 人;更关键的是,实地研究完全由论文作者本人完成。Google 研究人员也参与了项目,而 Google 已表示计划在今年晚些时候推出基于 Android XR 和 Gemini 的 AI 眼镜,因此这篇论文更适合被看作早期探索,而不是完全无偏的效果验证。



