论文导读

常驻 AI 助手什么时候该开口?

2026年7月18日

综述导读(TMLR 在审):1999 年的可打扰性研究把打扰代价形式化到了效用理论的程度,2024 年后的主动智能体却把这一项整个丢了。综述把两条线接回同一条决策规则。

智能眼镜、MR 头显、环境 copilot 正在把 AI 助手从「问了才答」变成「常驻在场」。常驻带来一个全新的产品问题:助手什么时候应该主动开口?说早了是打扰,说晚了没价值,不说等于不存在。

论文说了什么

综述把整个问题组织在一条决策规则上:当行动的期望收益减去打扰的期望代价超过阈值时,才介入。写成式子是 intervene ⇔ E[收益] − E[打扰代价] > θ

这条规则本身不新,1999 年 Horvitz 的告警模型就是这么写的。综述的判断是:到 2026 年,收益项因为模型和感知能力的进步大幅变强了,代价项却几乎从现代实现里消失了。

两条互不引用的文献线由此形成。

1999 至 2022 年这条线,把打扰的代价量到了相当细的程度。Horvitz 把它建模成对推断出的注意力状态求期望;Iqbal 与 Horvitz 在 2007 年实测出,一次告警会带来 20 到 25 分钟的认知恢复弧,而 27% 被打断的任务再也没有被拾起来。这条线之所以停在那里,是因为那个年代的介入兑现不了多少收益,最多让你早几秒读到一封邮件。

2024 至 2026 年这条线有了能干活的执行者,YETI、ProAssist、VisionClaw、PRISM 都能跑多步任务,却把决策层从零重搭了一遍。47 篇被引工作里,只有一篇回头引用了 1999 年那套。代价项被拆散在各处重新发现:PRISM 用贝叶斯风险给误报定价,把误报率从 50.22% 压到 22.94%;Precision Proactivity 测了认知负荷但没接进闸门;EgoSocial 点了社交违规的名却没有量化;WakeAnchor 和 ProAgent 算的是算力开销而不是用户损失。注意力状态和沉默的代价这两项,1999 年之后没有人再碰。

代价项缺失的后果是被实验打出来的。有团队给主动智能体加了单边奖励,只罚误报、不奖及时,GPT-4o 的召回率从 98.11% 崩到 56.76%。两项缺一不可这件事,这个领域是靠付出代价重新学会的。

这篇的证据强度

综述指出评估是闸门层:在介入质量变得可测量之前,主动性的强化学习奖励无从定义。它把测量质量分成四档,L0 是显式的接受与忽略,便宜、可归因,但偏得厉害;L3 才是「这次介入时机确实好」的真实度量。整个领域只在 L0 上训练,因为只有它可操作,而 L0 分不清「我想要这个」和「我现在想要这个」。证据是 PRISM 一旦只按接受与否设闸门,误报率反弹到 62.50%:用户会欣然接受一条在糟糕时刻送达的有用建议。

现有基准没有一个能同时回答「受欢迎吗、抓住了吗、定价了吗」三个问题。Pro²Bench 的质量分给假阳性和假阴性都记 0,于是「打断一个人说无关的话」和「眼看着关键任务失败却不吭声」得到同样的惩罚,时机质量这个区别整个消失。EgoSocial 在识别社交场景上有 51.65 到 56.08 的宏 F1,但在介入时机上只有 12.50% 到 17.67%:模型看得懂场面,选不准时刻。

综述自己的短板也标了出来。47 篇引用里有 21 篇是未经评审的 2024 至 2026 年 arXiv 预印本,这是新兴方向的通病;论文正文与表格冲突时以表格为准,公式与开源代码冲突时另行注明。作为综述它不产出新实验证据,价值在把散落的代价项收拢成一个可用的账本。

文末给的基准设计也停留在提案:单一场景族、200 到 300 个窗口、每窗口 3 名标注者,从 HoloAssist 的教师发话里取真实介入时机做种子。关键设计是把二元标签换成三分窗口,「必须介入 / 可以介入 / 不可介入」,中间那段正是成本收益推理起作用的区域,被二元标注抹掉了;标注者的分歧保留而不裁决,因为受扰程度本来就因人而异。

对实践的意义

FIM One 编排的智能体越来越多带主动触发:定时巡检、异常提醒、待办推送。「什么时候打扰用户」在我们这里不是玄学,是可以按这条规则逐项拆解的工程问题。

两条可以直接抄走的经验。一是奖励必须双边,只罚误报会把助手训成哑巴,这一点已经有人替我们付过学费。二是代价与状态相关,同一条提醒推给正在开会的人和正在发呆的人不是一个价钱;PRISM 把成本比固定在整个部署周期,这正是 1999 年那篇的核心洞察至今仍然缺席的地方。

延伸阅读