
transcript
show notes
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
PreAct: Computer-Using Agents that Get Faster on Repeated Tasks
Summary
计算机操作 Agent(Computer-using agents)通过屏幕直接驱动真实软件——进行点击与打字——但它们解决每个任务时都是“从头开始”:当被要求重复某项任务时,Agent 会重新读取屏幕、重新推理每一次点击,并再次付出全部代价。
我们提出了 PreAct,它能让此类 Agent 在执行曾经做过的任务时速度大幅提升。
在首次成功完成任务时,PreAct 会将该运行过程编译为一个精简的状态机程序(状态负责检查屏幕,转移负责执行动作);在后续运行中,PreAct 会直接重放该程序,而无需调用 Agent——不仅没有每一步的语言模型调用,速度还提升了 8.5 到 13 倍。这种重放并非盲目进行:在每一步执行前,PreAct 都会检查屏幕是否符合程序的预期,一旦出现异常便会立即将控制权交还给 Agent。
在决定保留哪些程序时,PreAct 同样遵循这一严格原则:一个新编译的程序只有在从干净状态重新运行、并经独立评估器确认确实解决了任务后,才会存入存储库——这能有效筛选出那些虽然重放到最后一步但实际并未完成任务的无效程序。在涵盖移动端、桌面端和 Web 端的三项基准测试中,这种存储阶段的校验将“越用越好”的重复运行与“因错误程序累积而导致性能下降”的运行成功区分开来,在三项基准测试中均带来了相同的正面效果(相当于每项基准测试提升 1.75 到 2.6 个任务);再加上当没有合适程序时重新进行探索的回退机制(fallback),使 PreAct 达到了与强劲的“录制与重放”(record-and-replay)基线相媲美的水平。
此外,我们还报告了哪些因素并不重要:提示词措辞、运行时防护栏(guardrails),以及究竟是由语言模型还是普通的嵌入检索器来选择复用哪种程序。
原文链接:https://arxiv.org/abs/2606.17929
前往小宇宙评论区与主播互动






