Skip to content
Artwork for Seventy3
Seventy3 · July 25 · 19 min

【第664期】嵌套学习:深层架构的幻象与神经学习模块

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Nested Learning: The Illusion of Deep Learning Architecture Summary 尽管近年来取得了显著进展,尤其是在语言模型的发展方面,但关于这类模型如何能够持续学习/记忆、自我改进以及寻找有效解决方案,仍然存在一些根本性的挑战和未解问题。在本文中,我们提出了一种新的学习范式,称为嵌套学习(Nested Learning, NL)。该范式以一种统一的方式,将机器学习模型表示为一组嵌套的、多层次的和/或并行的优化问题,其中每一个优化问题都具有其自身的上下文流(context flow)。 通过 NL 的视角来看,现有的深度学习方法通过压缩自身的上下文流来从数据中学习,而**上下文学习(in-context learning)**则自然地在大规模模型中涌现出来。NL 提出了一种设计理念:通过引入更多层次来设计具有更强表达能力的学习算法,从而实现更高阶的上下文学习,并有可能解锁有效的持续学习能力。 我们通过以下三个核心贡献来阐述并倡导 NL: (1)表达性优化器(Expressive Optimizers): 我们展示了,诸如 Adam、带动量的 SGD(SGD with Momentum)等已知的基于梯度的优化器,实际上是联想记忆模块(associative memory modules),其目标是通过梯度下降来压缩梯度信息。在这一洞见的基础上,我们提出了其他更具表达能力的优化器,它们具备深层记忆能力和/或更强大的学习规则。 (2)自修改学习模块(Self-Modifying Learning Module): 利用 NL 对学习算法的洞察,我们提出了一种序列模型,该模型能够通过学习自身的更新算法,来学习如何修改自身。 (3)连续记忆系统(Continuum Memory System): 我们提出了一种新的记忆系统表述方式,将传统的长短期记忆(long/short-term memory)视角进行了推广。结合我们的自修改序列模型与连续记忆系统,我们提出了一种持续学习模块,称为 Hope。实验结果表明,该模块在语言建模、知识融入、少样本泛化任务、持续学习任务以及长上下文推理任务中均展现出了良好的潜力。 原文链接:https://arxiv.org/abs/2512.24695 前往小宇宙评论区与主播互动

0:00-19:30

transcript

No transcript — this publisher did not publish one.

show notes

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

Nested Learning: The Illusion of Deep Learning Architecture

Summary

尽管近年来取得了显著进展,尤其是在语言模型的发展方面,但关于这类模型如何能够持续学习/记忆、自我改进以及寻找有效解决方案,仍然存在一些根本性的挑战和未解问题。在本文中,我们提出了一种新的学习范式,称为嵌套学习(Nested Learning, NL)。该范式以一种统一的方式,将机器学习模型表示为一组嵌套的、多层次的和/或并行的优化问题,其中每一个优化问题都具有其自身的上下文流(context flow)。

通过 NL 的视角来看,现有的深度学习方法通过压缩自身的上下文流来从数据中学习,而**上下文学习(in-context learning)**则自然地在大规模模型中涌现出来。NL 提出了一种设计理念:通过引入更多层次来设计具有更强表达能力的学习算法,从而实现更高阶的上下文学习,并有可能解锁有效的持续学习能力。

我们通过以下三个核心贡献来阐述并倡导 NL:

(1)表达性优化器(Expressive Optimizers):
我们展示了,诸如 Adam、带动量的 SGD(SGD with Momentum)等已知的基于梯度的优化器,实际上是联想记忆模块(associative memory modules),其目标是通过梯度下降来压缩梯度信息。在这一洞见的基础上,我们提出了其他更具表达能力的优化器,它们具备深层记忆能力和/或更强大的学习规则。

(2)自修改学习模块(Self-Modifying Learning Module):
利用 NL 对学习算法的洞察,我们提出了一种序列模型,该模型能够通过学习自身的更新算法,来学习如何修改自身。

(3)连续记忆系统(Continuum Memory System):
我们提出了一种新的记忆系统表述方式,将传统的长短期记忆(long/short-term memory)视角进行了推广。结合我们的自修改序列模型与连续记忆系统,我们提出了一种持续学习模块,称为 Hope。实验结果表明,该模块在语言建模、知识融入、少样本泛化任务、持续学习任务以及长上下文推理任务中均展现出了良好的潜力。

原文链接:https://arxiv.org/abs/2512.24695


前往小宇宙评论区与主播互动
links2