
transcript
show notes
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
On the Geometry of On-Policy Distillation
Summary
在线策略蒸馏(On-Policy Distillation,简称 OPD)越来越多地被用于提升大语言模型的推理能力,但其训练动态机制(training dynamics)至今仍缺乏深入了解。我们对 OPD 在参数空间中的更新轨迹进行了刻画,并将其与监督微调(SFT)以及基于可验证奖励的强化学习(RLVR)进行了比较。
一系列参数空间诊断结果一致表明,OPD 处于一种宽松的非主方向机制(relaxed off-principal regime):与 SFT 相比,它的更新所影响的权重更少,且更强烈地避开了主方向(principal directions);而与 RLVR 相比,它的限制程度则没有那么严苛。
除了这种静态定位之外,OPD 还展现出了子空间锁定(subspace locking)现象:其累积更新会迅速进入一条狭窄的低维通道。将训练限制在训练早期形成的更新子空间内,能够保留 OPD 的性能,却会大幅降低 SFT 的效果,这表明被锁定的子空间在功能上对于 OPD 来说是充分的。
对照实验进一步表明,稀疏化更新 Token(sparsifying update tokens)以及将 Rollout 生成转为离线策略(off-policy)依然能保持其秩动态特性(rank dynamics);然而,将 OPD 目标与 RLVR 混合使用则会改变这一特性。
总体而言,这些结果表明 OPD 并非仅仅是 SFT 和 RLVR 之间的过渡状态,而是在参数空间中诱导出了其独特的更新几何结构(update geometry)。
原文链接:https://arxiv.org/abs/2606.07082
前往小宇宙评论区与主播互动






