
transcript
show notes
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
AUTOMEM: Automated Learning of Memory as a Cognitive Skill
Summary
记忆专业能力(Memory expertise)是一项后天学会的技能:明确该编码什么、何时进行检索以及如何组织知识——这一能力在认知科学中被称为元记忆(metamemory)。我们通过将记忆管理视为一项可训练的技能,将这一视角引入到大语言模型(LLMs)中。我们将文件系统操作提升为与任务动作平起平坐的一等记忆动作(first-class memory actions),让模型自身来决定如何管理其记忆。
这种记忆技能沿着两个轴线进行提升:支持它的结构(Prompt、文件 Schema、动作词表),以及运用该技能的模型熟练度。然而,这两个轴线都难以通过人工优化来实现:长流程任务中的单次 episode 会运行数千个步骤,而且单个记忆错误可能在隐蔽很久之后才会浮出水面,这使得人类对完整轨迹进行评审变得不可行。
我们提出了 AutoMem,一个将上述两个轴线全自动化的框架。在第一个循环中,一个强 LLM 会评审 Agent 的完整轨迹,并迭代修改塑造 Agent 如何与其记忆文件交互的记忆结构。在第二个循环中,系统会从许多 episode 中识别出 Agent 自身做出的优秀记忆决策,并将其作为训练信号,直接提升模型的记忆熟练度。
在三个程序生成的长流程游戏(Crafter、MiniHack 和 NetHack)中,仅通过优化记忆——而不修改模型的任务动作行为——就将基线 Agent 的性能提升了约 2 到 4 倍,使得一个 32B 参数的开源模型能够具备与 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 等前沿系统相媲美的竞争力。我们的结果表明,记忆管理是一项可以独立学习的技能,也是一个能够在长流程任务中带来巨大收益的高杠杆目标。
原文链接:https://arxiv.org/abs/2607.01224
前往小宇宙评论区与主播互动






