CS329Z中文学习站

从人机交互中学习下一动作预测器

"Learning Next Action Predictors from Human-Computer Interaction"

"Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, et al." · "arXiv 2026 (Preprint) · Stanford University & HPI"

推荐论文精读查看原文(PDF) ↗

导读

本文是 GUM(通用用户模型)论文的直接续作,同属第 11 周"主动式智能体"专题。GUM 回答了"如何从观察中理解用户现在是谁",本文则更进一步:预测"用户接下来会做什么"。真正主动式 AI 系统必须在用户开口之前预判其需求,而这需要推理用户看到和做的一切,而不是只看提示词里那点稀疏信号。

论文做了两件事。数据上,作者形式化了下一动作预测(Next Action Prediction, NAP)任务,并开源 NAPsack 流水线:不要求用户手动标注,而是被动录制自然使用行为,再用视觉-语言模型(VLM)事后标注。他们据此标注了 20 名用户一个月的连续手机使用,共 36 万余条动作、1800 小时亮屏时间。模型上,作者提出 LongNAP(Long-context Next Action Predictor):结合参数化学习与上下文学习,先"为检索而推理"、再"为预测而推理",用 GRPO 策略梯度端到端训练。单用户训练时 LongNAP 比监督微调高 79%、比最强提示基线高 39%;在无限可能的动作空间中,17.1% 的预测轨迹与用户真实行为高度对齐(LLM 评审分 ≥0.5),高置信预测下升至约 26%。对于关心"智能体如何获得并利用长期用户记忆"的读者,这篇论文展示了从用户建模走向用户行为预测的完整技术路径。

论文精读

摘要

真正主动式 AI 系统必须能预判我们下一步会做什么。这种远见所需的信息远比我们敲进提示框的稀疏信号丰富——它需要对"我们所见所做"的全部上下文进行推理。作者将这一任务形式化为下一动作预测(next action prediction, NAP):给定用户与计算机的多模态交互序列(截图、点击、传感数据),预测该用户的下一个动作。该任务的进展同时需要新数据与新的建模范式。为扩展数据收集,作者用视觉-语言模型对纵向、自然主义的计算机使用进行标注:发布了一个可在私有基础设施上运行的开源标注流水线,并标注了 20 名用户一个月连续手机使用中的超过 36 万个动作,合计 1800 小时亮屏时间。随后,作者提出 LongNAP——一个结合参数化学习与上下文学习、在长交互历史上进行推理的用户模型。LongNAP 经策略梯度方法训练,流程为:给定上下文生成用户专属的推理轨迹;从过去的轨迹库中检索相关轨迹;再将检索到的轨迹应用于上下文以预测未来动作。在用 LLM-as-a-judge(与真实未来动作的 0-1 相似度)的评估下,LongNAP 在留出数据上显著超过监督微调与提示基线(分别高出 79% 与 39%)。此外,跨多个用户训练的 LongNAP 能泛化到留出的新用户。任一时刻用户可能的下一动作空间是无界的,横跨数千种可能;尽管如此,17.1% 的 LongNAP 预测轨迹与用户实际行为高度对齐(LLM 评审分 ≥0.5),过滤高置信预测后升至 26%。总之,作者论证:从用户行为的完整上下文中学习、从而预判用户需求,如今已是一个可行且有大量机会的任务。

1 Introduction(引言)

今天的语言模型只能透过狭窄的钥匙孔看我们:它们看到我们的提示、为此构建记忆,却对我们为何而来、我们在一般情况下是什么人一无所知。真正情境感知的 AI 应当深刻理解我们:我们在解决什么问题?受什么约束?我们如何在世界上行动?模型又如何支持这些行动?要实现这一点,需要能从我们与计算机的一般交互中学习的模型——预测我们可能需要或即将做什么——从而在我们开口之前提供主动支持。这要求在丰富的纵向行为数据上训练,而大部分流程可以运行在用户自管的基础设施上以保护隐私。

作者将目标具体化为 NAP 任务:给定用户多模态交互序列(截图、键击、点击),预测该用户的下一动作。示例:一位研究者收到通知、查看邮件、读了一批论文评审——好的预测器应结合序列与对用户过往习惯的了解,预测其接下来会查看实验追踪日志(如 Weights and Biases)、然后在 Slack 上联系合作者分摊修改工作。

论文在两条战线上推进:数据(如何大规模收集并标注合适的数据)与模型(如何训练能在长上下文、多模态交互上有效推理的专用模型)。收集数据是先决条件:让用户标注自己的一切行为既不现实又昂贵。作者提出被动监督(passive supervision):不指定任务,只观察用户在设备上自然做了什么,再用 VLM 流水线事后标注轨迹——这让我们看到人们实际做什么,而非他们说自己做什么。由此标注了 20 名用户一个月的手机使用:36 万+ 动作、1800 小时亮屏。该流水线以 NAPsack 之名开源,用户可自行安装。

有了数据,如何训练在长多模态历史上推理的模型?朴素做法是通过微调把用户模式直接学进权重。但参数化模型在潜伏学习(latent learning)上有困难:获取并保留当前任务用不上、但未来有用的信息。权重中的模式难以灵活迁移到新情境,且编码新模式所需的数据远多于上下文学习,限制了快速适应用户行为的演变。把全部交互历史塞进上下文窗口也不现实:上下文有界,且不加区分地全部放入会引入噪声损害性能。LongNAP 的选择是训练模型学会把相关的过往推理与观察检索进上下文,从而在训练过程中利用强大的上下文学习能力。LongNAP 分两阶段:第一阶段"为检索而推理"(reason to retrieve),第二阶段"为预测而推理"(reason to predict);带来好预测的轨迹会写回记忆库,使其随时间改善。评分采用时间性奖励(temporal reward):既然只需等一等就能看到用户实际做了什么,就用 LLM-as-a-judge 度量预测与真实未来动作的语义相似度,从而用策略优化端到端训练两个阶段。

评估结果:单用户数据训练的 LongNAP 显著超过监督微调(+79%)与提示基线(+39%);跨多用户训练后可泛化到全新用户(比最强基线——few-shot 提示的闭源模型——高 13%)。在无界动作空间中,17.1% 的预测轨迹与用户实际行为高度对齐,高置信预测下升至 26%。

2 Next Action Prediction(下一动作预测任务)

NAP 在时间性事件流 E = {e1, e2, …, eT} 上操作,每个事件 et = (at, It) 由一个动作 at 与可选的视觉观察 It 组成。动作的粒度是"可以委托给计算机使用智能体执行的自然语言任务"(如 07:00、07:01、07:02 连续三次"贪睡闹钟"配以截图)。给定查询时刻 t 与含 k 个近期事件的上下文窗口 Et−k:t,目标是预测未来事件 \^Et+1:t+h(h 为预测视野,h 与 k 由用户设定)。E 是完全非结构化的——自然语言与图像的任意组合。

建模上使用 VLM 策略 πθ,从分布 pθ(·|Et−k:t) 中采样未来轨迹。例如以三次连续贪睡闹钟为条件,模型可能预测轨迹:(继续贪睡闹钟)→(关闭闹钟)→(拿起手机)。由此引出两大挑战:数据(§3)与模型(§4)。

3 Labeling Interaction Data At Scale(大规模标注交互数据)

此类数据稀缺:收集成本高、实际约束多,让用户手动分段并标注一切并不现实。已有工作利用教学视频训练计算机使用智能体、或用被动轨迹数据学习机器人世界模型,但多依赖精选数据集、合成环境或狭窄任务分布;这里要收集的是自然主义、纵向、开放-ended、且反映特定用户行为的计算机使用。为此作者提出 NAPsack。

3.1 构建 NAPsack

NAPsack 持续录制计算机使用截图,并采集 I/O 事件(鼠标点击、移动、滚动、键盘输入)。I/O 事件先被分组成"突发(burst)"——相邻同类交互在 ε 时间内即合并。对每个突发,NAPsack 采集交互前后当前活动显示器的截图,这是一种压缩策略:只在用户主动交互时保存截图。不同事件类型的突发可能在时间上重叠,因此所有输入事件与截图被合并为按时间排序的单一序列,切分为 60 帧的块再交给 VLM——切块是为了保持上下文短,因为 VLM 会随上下文变长遗忘细节。VLM 的任务是把一个或多个连续截图(可附带随后的低层输入事件)聚合为更高层的用户动作并生成自然语言动作描述。每条数据样本 = 一张截图 + 生成的动作描述(如"点击侧栏的 Downloads 文件夹")+ 该截图之后、下一张之前的输入事件。选择这一粒度是因为它适合下游训练,并与计算机使用智能体的既有工作直接兼容;为保证描述粒度与风格一致,采用 few-shot 提示。

3.2 用 LLM 评审评估与真实标注的相似度

评估 NAPsack:一位作者录制三段各 10 分钟的个人电脑使用,两位作者在原始录屏与输入日志上产出共 354 条人工标注的真值动作描述。构造四种标注条件:(1) naive,单条提示标注全部 10 分钟输入;(2) +split,先切成 60 帧段;(3) +split+compress,加入 NAPsack 基于事件的压缩;(4) 再附带输入事件(IO)条件化生成。

用 Gemini 3.0 Flash 作为评审,对每块输出 0(完全不匹配)到 1(完美匹配)的连续相似度分,整体评估候选轨迹与真值的吻合度。论文给出不同得分下的定性示例:得分 1.0 的预测与真值逐步一致;0.72 时前几步正确但细节有偏差;0.52 时核心意图保留、细节漂移;0.15 时意图整体错误。每条件生成 45 条真值序列及对应候选。

LLM 评审结果:切分显著提升质量(naive 0.48 → split 0.57);事件压缩在保持质量的同时把存储降低约 70%(295MB → 76MB);IO 条件化进一步提升分数(0.60 → 0.70)。人工验证:两位作者独立做成对偏好标注(共 240 次比较,平局各计 0.5),人工胜率验证了评审结论:naive 19.2% → +split 45.4% → +compress 49.6%(不显著)→ +IO 85.8%。作者将 IO 增益归因于捕捉"键盘密集的短交互"(单条终端命令、窗口切换)——纯帧方法会遗漏的细节。

3.3 用 NAPsack 标注数据集

Screenomics:大规模真实交互数据来自 Screenomics 与 Human Screenome Project——约 1.7 亿张连续延时截图、采自 257 名成年用户的手机活动。鉴于数据高度敏感,采集与标注均经 Stanford IRB 批准,建模在第一作者机构批准处理个人数据的安全服务器上完成。抽样:选取 20 名每天至少使用设备一小时、持续一个月的用户;时间窗为 2021 年 3 月 16 日至 4 月 12 日,共 190 万张截图、1837 小时亮屏。标注:全部截图喂入 NAPsack,得到约 36 万条事件描述(Screenomics 不含 IO 数据,故省略 IO,改用图像哈希差异压缩)。平均每条事件覆盖约 15 秒,总计 359,219 条动作,覆盖游戏、购物、银行、消息、社交媒体等多样活动。28 天内人均日亮屏 4 小时 32 分,最轻 2 小时 17 分,最重 6 小时 52 分。作者也坦承:NAPsack 标签由模型生成,仍有噪声,与人工真值对齐并不完美,可能向训练引入误差。

4 LongNAP:长上下文下一动作预测器

要预测用户下一步,必须能对"其上下文的全部"推理,在可能无限的观察中检索并复用具体细节。仅靠权重学习做不到:用户查日历看到下午两点有会,这一信息必须立刻影响预测,而不是等若干次梯度更新之后;许多相关细节(新日程、合作者的消息)只出现一次,训练集中不再重复。LongNAP 转而利用 LLM 上下文学习的即时适应能力,但上下文窗口有限,因此设计了两阶段生成:reason to retrieve 相关过往上下文(旧观察与推理轨迹),再 reason to predict 最终动作集。

4.1 为检索而推理、为预测而推理

底层 VLM 策略 π 实例化为 Qwen-2.5-VL-7B。LongNAP 维护截至时刻 t 的记忆 Mt,每个记忆条目把一组观察与一条推理轨迹 z(模型在以往预测中生成的思维链,如"收到合作论文的评审;根据过去行为,用户拖延写作但最终会通过 Slack 与合作者协调")配对。记忆检索用 BM25 词法检索器 R,且只能访问时间戳 τ≤t 的条目以杜绝"偷看未来"。

阶段一:为检索而推理。 给定 k 条近期观察,先生成关于接下来可能发生什么的推理 zretrieve(例如:"收到合作者论文的评审……用户可能在看完反馈后修改论文")。该推理一石二鸟:显式化模型当前思考,并为检索提供语义查询。以 zretrieve 为查询检索条目 D = R(zretrieve, Mt),可能命中"在论文写作和图表上严重拖延""偏好用 Slack 协作""在合作者间分配工作"等过往轨迹。

阶段二:为预测而推理。 模型整合检索到的上下文修订初始预测:zpredict ∼ pθ(·|Et−k:t, zretrieve, D)。第一阶段没有用户历史,只能做泛化推测;现在检索到的拖延习惯、Slack 偏好、分派倾向让模型把"用户可能修改论文"改写为"基于过往模式,用户会联系合作者分派任务、检查哪些实验已跑"。在此推理上预测具体未来动作:滚动查看 Weights & Biases、打开 Slack 并进入 #research 频道、给合作者发未完成 TODO 等。

训练时每阶段采样 4 条候选轨迹,组成 4 个完整的"检索+预测"展开(rollout);预测结束后,把奖励最高的预测轨迹写回记忆(Mt+1 = Mt ∪ {(Et−k:t, z*predict, t)}),确保记忆随时间累积模型的最佳推理。

4.2 优化 LongNAP

LongNAP 端到端训练:学会如何生成初始推理、检索什么、如何修订推理。因为生成包含离散步骤(语言推理、调用检索器),采用策略梯度优化,用 GRPO(组规模 4)做方差缩减;受内存限制使用 LoRA(RL 结果通常与全量微调相当)。时间性奖励:任务的时间结构提供了天然训练信号——预测质量可以通过与观察到的未来行为比对来验证,即"等用户实际做了什么"。奖励复用 §3.2 中经过验证的 LLM 评审(Gemini 3.0 Flash),且把整组展开一次性交给模型同时打分,便于区分。带记忆训练的三个要点:(1) 按时间顺序训练、每个 epoch 结束重置记忆(直接从数据中段开始预测非常困难);(2) 对检索到的 token 做掩码,因为它们来自环境(沿用搜索引擎工具使用的做法);(3) 对检索器施加"dropout"——随机丢弃(10%)、重排(10%)、或什么都不给(10%),以稳定训练、防止记忆重置时的崩塌。

5 Experimental Setup(实验设置)

固定参数:上下文窗口 k=16 个事件,预测视野 h=8 个事件(不同视野留作未来工作)。

时间泛化(单用户):为 20 名参与者各训一个模型;参与者内按时间切分——前两周训练(人均 9.1K 动作),第三周验证(4.4K),第四周测试(4.4K)。

新用户泛化(跨用户):20 人随机分为 10 训练 / 5 验证 / 5 测试;单一策略 πθ 但记忆不能跨用户共享,训练期间为每名用户维护独立记忆(10 个),生成时只检索该用户自己的检索器。

指标:(1) 复用已验证的 LLM 评审,给出与真值轨迹的 0-1 相似度;(2) pass@k——从每个模型采样 k 次(temp=1.0),任一样本超过阈值即算"正确",阈值取评审分 0.50(该阈值下预测与实际轨迹共享相同动作,只是细节或顺序有差;例如"打开 Chrome、进入 W&B 仪表盘、调整图表滑块、查看训练指标"与真值"打开 Chrome、滚动 W&B 仪表盘、点进某流水线图表、切到终端"评分为 0.6,而"打开 YouTube 看音乐视频"对"分析实验仪表盘"则评 0.0)。模型置信度用 20 次采样预测的簇内方差度量:用 all-MiniLM-L6-v2 句向量嵌入,计算各嵌入到质心的平均欧氏距离,方差越低一致性越高、置信度越高;再转成用户内百分位以消除个体基线差异。人工评估:两位作者独立做成对偏好(共 300 次比较,跨用户分层抽样),平局各计 0.5。

基线:提示类有 zero-shot(只给近期动作,让它预测下一步)与 few-shot RAG(用过往动作作查询检索);微调类有监督微调(SFT)。闭源模型用 Gemini 3.0 Flash 提示(选用 Flash 因初步实验显示其相对 Pro 提升边际、成本却只是零头);开源模型用 Qwen-2.5-VL-7B 做提示与微调。

6 Results(结果)

LongNAP 能只从单个用户学习,预测其未来交互。 单用户设置下 LongNAP 平均 LLM 评审分 0.38,显著优于全部基线:比 Qwen SFT 高 79%(0.21 → 0.38);比 zero-shot 提示 Qwen 高 106%(0.18 → 0.38)、比 few-shot 高 88%(0.20 → 0.38);对闭源模型,比 zero-shot Gemini 3.0 Flash 高 43%(0.26 → 0.38)、比 few-shot(Gemini RAG)高 39%(0.27 → 0.38)。逐用户看(表 3),LongNAP 在全部 20 个用户上都取得最高分(0.30–0.46),SFT 相对自身基线的增量(+0.04 到 +0.17)远小于 LongNAP 的提升。人工评估进一步验证(表 4,300 次比较):LongNAP 胜率 79.0±6.6%,大幅超过 SFT(29.5±6.9)、zero-shot(33.0±7.2)、RAG(45.0±7.6)的 Qwen 基线,也超过 zero-shot(55.0±7.7)与 RAG(58.5±6.8)的 Gemini 基线。

LongNAP 能从多个用户学习并泛化到全新用户。 联合训练 10 人、在 5 个留出用户上测试:LongNAP 平均 0.26,比 zero-shot Qwen 高 66%、比 few-shot Qwen 高 53%,比 zero-shot Gemini(0.22)高 19%、比最强基线 few-shot Gemini(0.23)高 13%。增益小于单用户设置,作者推测用户专属权重对 NAP 尤其有效,并猜测加大用户规模可能缩小差距;这一变体可能更依赖"为检索而推理"过程——推理学到的更多是"如何保存与检索用户专属推断"的通用策略,而非参数化记忆。

最高置信的预测有 26% 与用户实际行为对齐。 以评审分 0.5 为阈值:LongNAP pass@1 为 17.1%,pass@20 升至 36.3%。模型置信度(20 采样簇内方差)与准确率相关:置信度前 10%(方差最低)的样本上 pass@1 升至 25.9%。

可预测性因人而异。 有的用户提升有限(u11:最强基线 Gemini few-shot 0.26,LongNAP 0.30,绝对 +4 点/相对 +15%),有的提升巨大(u8:Gemini few-shot 0.24,LongNAP 0.39,绝对 +15 点/相对 +63%)。作者怀疑部分用户本质上更可预测——每天重复类似任务,仅靠微调或提示即可建模,RL 的额外收益有限。

7 What Makes LongNAP Work?(什么让 LongNAP 生效?)

7.1 算法消融

在跨用户实验的同一 5 人子集上做三项消融:去掉推理(不生成检索/预测推理轨迹,直接用当前观察作查询只检索过往观察):0.38 → 0.30(相对 −19.2%,平均 −0.07);去掉检索器(跳过 reason-to-retrieve):0.38 → 0.32(−15.2%,−0.06);打乱训练数据(保留内容破坏时间顺序):0.38 → 0.34(−9.3%,−0.04)。三项皆降,其中推理组件影响最大;时间结构受损也有损性能,说明推理轨迹需要按观察顺序累积与演化。检索器可视化(图 6)显示 LongNAP 学会了从整个交互历史中检索——引用相隔数天的观察,而非只依赖近期活动。

7.2 推理轨迹分析

对 10 个完整 epoch 的分析显示:推理轨迹随训练总体变短;"为检索而推理"的轨迹远短于"为预测"(平均 10.11 token vs 85.34 token),且变得像查询语句(如"message Michael Diyi reminder"、"ice cream salted caramel youtube")——显然是针对 BM25 检索器优化了。预测轨迹内容在用户间乃至用户内差异很大,许多描述用户的习惯与偏好。用句向量嵌入并以 tSNE 可视化:有的用户轨迹高度同质——u7 几乎只用手机做在线问卷,其平均到质心距离 ravg=4.94,典型轨迹是"用户的行为提示了一种完成问卷和管理 Yahoo 邮箱的习惯性模式……";有的用户轨迹多样——u8(ravg=16.26)白天系统性看房("在交互式地图上移动、查看房源详情页照片、再继续平移地图")、夜间在社交应用间切换("完成 Instagram Stories 后,用户可能转向其他通知查看邮件、联系人消息")。作者也指出:推理是否"忠实"(faithful)仍待未来工作检验。

8 Beyond Next Action Prediction(超越 NAP)

在线学习(powerNAP):人的行为分布在持续漂移。论文中数据收集与训练是同步呈现的,但完全可以在线运行:NAPsack 持续跟踪并标注用户动作、入队等待训练;LongNAP 从队列消费标注动作、单遍训练、用后即弃。关键在于记忆永不重置、推理轨迹持续累积,模型得以随时间不断构建更好的用户表示。该版本以 powerNAP 之名作为 demo 开源。

助手(SleepWalk):有了好的 LongNAP,就能预判用户想要什么、打算做什么,从而构建"替用户完成可预测任务"的助手。LongNAP 本身不是计算机使用智能体,但可以为其领航:作者发布了简单版助手 SleepWalk,用现成的计算机使用智能体执行 LongNAP 预测出的动作。

世界模型、人类模型与用户模型:大规模多模态模型复兴了预测复杂物理与社会动态的长期目标——视频生成模型通过下一帧预测世界动态并反哺机器人学习;LLM 被用于模拟一般人类行为(生成式智能体)、支撑社会科学研究或构建主动提问的助手。这些方法共享一个假设:互联网上有大量现实行为数据可用作引导,但存在仿真-现实鸿沟(sim-to-real gap)——把它们部署到特定个体上就出了分布,而持续收集新数据去修补分布漂移要么技术上困难、要么昂贵得不可行。本文直接在个体用户层面训练用户模型:用户模型不能容忍仿真-现实鸿沟,因为它们即刻部署到具体的人身上,所以作者直接从个体交互轨迹收集数据,而非依赖代理数据集。

个性化推理(Personal Reasoning):理解人们想要什么,要求对我们不透明的个人偏好与信念灵活推理。主流 RL 依赖可轻易验证的结果(数学、符号推理),LLM 推理因此难以泛化到这些领域之外。在一个人所看所做的一切之上训练推理模型,能支撑各类以人为中心的应用:从"知道你的上下文到足以在正确时机做正确的事"的主动助手,到知道何时、如何向用户有效让渡的模型。最相关的是 Gandhi et al.(2026)训练 LLM 为对话模拟而推理;LongNAP 则在个体用户的全部数字上下文上学习预测一般动作,并从"元认知复用"与"推理抽象"研究中汲取灵感——在个体用户层面生成、检索、复用推理轨迹。

记忆与检索:预测下一动作需要用到用户数月乃至数年的数字上下文,但 LLM 上下文有限。RAG 从外部数据库检索是一解;LLM 也可被训练成通过生成查询来"使用检索器工具"。LongNAP 的独特之处:检索的不是外部索引或数据库,而是用户自己的交互历史;并且是"为预测用户下一动作"而推理出该检索什么,整个过程经策略梯度端到端优化。

10 Discussion(讨论)

隐私:LongNAP 处理大量上下文,必然包含用户的隐私敏感数据。架构本身限制了一部分暴露——"学会检索"使轨迹留在本地;也可以整个模型本地化,或保证"学会推理"阶段不在任何特定用户上微调(以性能为代价)。研究中依赖经批准的 PII/PHI 处理基础设施(该机构仅 Google Cloud 获准处理 PHI,故经审查的私有管线访问 Gemini 做标注),全部训练用开源模型(Qwen-2.5-VL-7B)、算力由团队自管。作者承认个人用户很难采取这些措施,而隐私悖论使集中式部署 LongNAP 困难:数据收集之易与主动式系统之利,会让用户向 LongNAP 披露越来越多。有前景的缓解方向:去中心化(模型更便宜更快后端侧推理与训练;FlashAttention、有效量化、合成数据专业化);用更小的本地模型脱敏后再交给大模型;基于用户个人情境决定共享(呼应 GUM 的情境完整性);或经 VPN 式系统解耦请求。

对齐 LongNAP:当前训练目标是"做用户接下来会做的事",但很多情况下这并无帮助——习惯性拖延的用户未必想要一个帮他拖延的模型。这与社交媒体的过滤气泡、聊天 LLM 的谄媚(sycophancy)是同构难题:我们希望 LongNAP 以"有帮助的方式"补足用户。一个方向是把"引导社交媒体算法的价值引出方法"用于 LongNAP。

局限与未来工作:仅从观察学习有根本限制——屏幕仍只是用户一般情境的窄代理;标注与训练都依赖大型预训练模型,VLM 标注错误会级联到训练与预测;LLM-as-a-judge 同时充当奖励与优化目标,长训练下可能被"奖励黑客"攻破;当前脚手架可以让 LongNAP 在单次生成中交错检索与推理、或配备网页搜索等更多工具;样本量小(20 人),更长时间视野与更多用户的规模化有待研究;每用户单独训权重不现实,需要高效训练与服务 per-user LoRA;现有 LLM 预训练/中期训练数据面向科学、代码、数学优化,未必是 NAP 的最优数据与推理策略。训练层面:因 PPO 需要额外价值网络的内存开销只用 GRPO;受预算限制未训练到收敛(验证分数仍在上升),作者怀疑论文中的性能数字可能是下界。

11 Conclusion(结论)

作者提出了 LongNAP——通过对用户完整多模态交互历史推理来预判其下一步行为的长上下文下一动作预测器;以及 NAPsack——用 VLM 大规模被动标注自然行为轨迹的流水线,证明无需用户任何主动付出即可获得丰富的标注交互数据。在 20 名用户、1800 小时亮屏的评估中,单用户训练的 LongNAP 显著超过监督微调与提示基线;跨用户训练亦展现对新用户的适度泛化。总而言之:从用户行为的完整上下文中学习、以预判用户需求,如今已是一个可循的研究方向。

要点速览

  • 任务形式化:NAP = 给定多模态交互事件流(动作+截图),以 k 个近期事件为上下文预测未来 h 个事件;论文固定 k=16、h=8;动作粒度对齐"可委托给计算机使用智能体"的自然语言任务。
  • 被动监督:不派任务、不让人标注,观察自然使用后用 VLM 事后标注——看到"人们实际做什么"而非"人们说自己做什么";NAPsack 以开源包发布,可在私有基础设施运行。
  • NAPsack 关键设计:I/O 事件按 ε 时间聚类成 burst、只在交互时存截图(压缩约 70% 存储:295MB→76MB);60 帧切块保上下文短;few-shot 提示保持描述粒度一致;四种条件评审分 0.48/0.57/0.60/0.70,人工胜率 19.2%/45.4%/49.6%/85.8%。
  • 数据集:基于 Screenomics(总量约 1.7 亿截图/257 人),抽样 20 人一个月(2021-03-16 至 04-12):190 万截图、1837 小时亮屏、359,219 条动作,事件平均覆盖约 15 秒;人均日亮屏 4h32m(最轻 2h17m、最重 6h52m)。
  • LongNAP 架构:Qwen-2.5-VL-7B + BM25 记忆检索;两阶段生成——reason to retrieve(推理即查询)→ reason to predict(整合检索修订推理再预测);最高奖励轨迹写回记忆;GRPO(组大小 4)+ LoRA 端到端训练。
  • 训练技巧:时间性奖励 = 与真实未来的 LLM 评审相似度;按时间顺序训练、每 epoch 重置记忆;检索 token 掩码;检索器 dropout(丢 10%/乱序 10%/空 10%)稳定训练。
  • 单用户结果:平均评审分 0.38,比 SFT(0.21)高 79%、比 zero-shot/few-shot Qwen(0.18/0.20)高 106%/88%、比 Gemini zero-shot/few-shot(0.26/0.27)高 43%/39%;人工评估胜率 79.0%。
  • 跨用户结果:10 训练/5 验证/5 测试,平均 0.26,仅比最强基线(few-shot Gemini 0.23)高 13%——用户专属权重对 NAP 尤其有效,跨用户泛化仍待扩展。
  • 可解释性能:pass@1 = 17.1%、pass@20 = 36.3%(阈值 0.5);置信度前 10% 的样本 pass@1 = 25.9%;用户间差异大(u8 相对提升 63%,u11 仅 15%)。
  • 消融:去推理 −19.2%(0.38→0.30)、去检索器 −15.2%(→0.32)、打乱时序 −9.3%(→0.34);检索轨迹平均仅 10.11 token 且被优化成 BM25 查询风格,预测轨迹平均 85.34 token。
  • 延伸系统:powerNAP(在线版:NAPsack 异步标注入队、LongNAP 单遍消费、记忆永不重置)与 SleepWalk(用现成计算机使用智能体执行 LongNAP 预测)。
  • 开放问题:屏幕仍是情境窄代理、VLM 标注噪声级联、LLM 评审可能被奖励黑客攻破、为每用户训权重难以规模化、以及"预测用户行为 ≠ 帮助用户"的对齐问题(拖延/谄媚/过滤气泡的同构难题)。