现在咨询,获得最前沿的AR产品
2026-07-26
如果智能眼镜不只记录你看到了什么,还能在灵感出现的那一刻,把现实改写成一个故事,会发生什么?
7月23日,新加坡国立大学等研究者公开CRAFT研究,尝试把“情境感知的现实—虚构转换”带进智能眼镜。系统会结合佩戴者看到的环境与已有写作计划,给出简短灵感提示,再通过语音和戒指鼠标把现场观察转成角色、情节或场景素材。
核心结论:CRAFT的意义不在于证明“AI能替人写小说”,而在于展示智能眼镜的新角色——它可以成为连接现实环境、个人记忆和持续创作的情境界面。真正难点也随之从生成文字,转向何时介入、如何保持空间连续性,以及怎样保护旁观者与创作者的数据边界。
CRAFT全称为Context-aware Reality–Fiction Transformation,可理解为“情境感知的现实—虚构转换”。研究团队关注一个很日常的问题:创作者经常在散步、通勤或参观时获得灵感,但真正坐到电脑前,现场的声音、气氛和细节已经变淡。
传统做法是拍照、录音或记一条备忘录。CRAFT试图多走一步,让智能眼镜在现场完成“观察—联想—表达”的连续动作。
| 环节 | CRAFT的处理方式 | 目标 |
|---|---|---|
| 看见环境 | 通过第一视角相机理解建筑、物体和现场线索 | 保留真实世界的细节 |
| 触发灵感 | 把现场元素与既有角色、主题或情节缺口联系起来 | 给出可扫一眼的创作火花 |
| 现场表达 | 用户通过语音与戒指鼠标继续构思 | 减少掏手机和切换设备 |
| 形成素材 | 把观察与口述转为场景、人物或情节片段 | 支持分散的“微创作” |
| 继续创作 | 保留项目上下文并在后续场景中调用 | 连接现场灵感与长篇写作 |

传统灵感记录与CRAFT现场创作流程对比。图片来源:CRAFT论文(arXiv:2607.21394)。
这不是一项只停留在概念图上的研究。团队分三步验证需求和交互:先访谈9位有经验的写作者,再邀请16位写作者与研究者参加共同设计,最后让8位写作者在一周内完成24次支持式现场试用。
参与者最终完成8个故事。论文记录的849次交互中,单个虚构元素管理占53.4%,全局情节管理占15.4%,主动建议占15.3%,角色扮演式对话占9.0%,问答占6.9%。这些数据说明,使用者并没有把眼镜只当成语音备忘录,而是在现场持续调整人物、情节与故事结构。
研究者观察到两种路径。一种先有完整故事框架,再去现实空间寻找合适的场景和细节;另一种没有明确情节,让街道、博物馆或自然环境里的偶遇推动故事发展。两种路径都强调人保持主导权,AI负责放大注意力和补充联想,而不是直接接管创作。
参与者认为这种方式能加深与环境的联系,也带来较好的创作乐趣;但低干扰评分只有3.9/7。换句话说,系统有帮助,却还不够安静。什么时候主动提示、什么时候保持沉默,可能比“能生成多少内容”更决定长期体验。
情境AI的诱惑,是看到什么都想提醒。真正可用的系统需要判断用户是否方便被打断,并允许用户调整建议频率、深度和呈现方式。智能眼镜距离眼睛和耳朵太近,一次不合时宜的提示,比手机通知更难忽略。
现场创作往往不按故事顺序发生。今天在办公室想到结尾,明天在博物馆补出人物背景,后天又回到同一个地点修改冲突。论文提出“空间感知记忆”:当用户再次来到某处,系统能重新调出与这个地点有关的草稿。这与空间锚点和位置触发内容的思路高度相似。
第一视角设备会把旁观者、公共空间和私人对话带入数据流。论文建议采用可配置的拍摄区域、旁观者提示、端侧处理、加密链路,以及自动替换可识别面孔和姓名等方法。研究同时提醒,生成内容应标明哪些来自现实观察、哪些来自算法加工。
系统不仅要“看懂眼前的门”,还要记住它与用户项目、过去草稿和所在位置的关系。如果智能眼镜未来用于文旅讲解、现场培训或商业空间服务,同样需要稳定的定位、空间锚定和内容状态管理。
CRAFT研究的是小说写作,但它的交互框架可以迁移到更多现实场景。例如,游客在街区看到一处建筑时,眼镜不是只播放固定讲解,而是结合位置、兴趣和游览进度提出下一条线索;工业人员巡检设备时,系统可以把当前视野与历史记录关联起来;培训者也能在真实操作中收到恰到好处的提示。
这些应用需要两类能力协同:一类是多模态AI,负责理解用户意图、现场内容和长期任务;另一类是空间计算,负责回答“用户在哪里、看向哪里、内容应该固定在哪里”。EasyAR Sense SDK面向图像识别、运动跟踪与AR交互开发,EasyAR Mega进一步服务大场景定位与空间内容;不同终端的选择,则可以结合视+AR的AR/MR终端方案按场景评估。
CRAFT最打动我们的地方,是它没有把智能眼镜想成一台缩小版电脑,而是把“人在现实环境中如何产生想法”当成设计起点。
在实际项目里,好的AR内容也往往不是信息越多越好。走到关键地点时出现一条提示,比一路悬浮十个窗口更有效;重新回到同一展项时续上上次进度,比每次从头播放更自然。空间计算提供的不是炫技坐标,而是让内容知道什么时候出现、在哪里出现,以及如何与用户之前的行为连续起来。
不过,这项研究仍是探索性原型。8位写作者和24次支持式试用不足以证明长期商业效果,论文也没有披露可直接量产的硬件参数。把研究转成产品,还要解决续航、发热、端侧算力、隐私提示、公共空间礼仪和跨设备内容同步。它给行业的更大价值,是提前把这些问题摆到了桌面上。
不是。CRAFT是研究团队提出并通过技术探针与现场试用探索的交互方法,不是已经商业化销售的消费产品。论文未披露售价、量产计划或正式上市参数。
它把用户眼前的建筑、人物和环境线索与已有故事计划联系起来,提供简短灵感,再把现场口述转成角色、情节或场景素材,减少灵感记录与后续写作之间的断层。
主要风险包括主动提示造成打扰、碎片内容难以衔接、第一视角采集涉及旁观者隐私、云端模型处理敏感创作内容,以及现实观察与AI生成内容来源不清。
情境AI不仅要识别物体,还要理解地点、朝向、历史状态和内容锚点。空间计算可以让系统在用户回到同一地点时恢复相关内容,并把提示稳定关联到正确的现实对象。
本文由视+AR编辑整理,信息截至2026年7月26日。论文结果为探索性研究,不代表商业产品已经具备同等能力。