Skip to content
Artwork for Seventy3
Seventy3 · August 9 · 19 min

【第679期】PAPO:对齐扩散大语言模型推理的奖励与状态

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models Summary 强化学习(RL)在提升扩散大语言模型(dLLM)的推理能力方面蕴含着巨大的潜力。然而,这一领域的进展从根本上受到了真实生成轨迹与梯度更新过程之间“双重错位”(dual misalignment)的限制: 过程-奖励错位(Process-reward misalignment):稀疏的终局奖励被无差别地赋予给生成过程的所有中间步骤,无法提供区分度高的信用分配(credit assignment)。 状态-轨迹错位(State-trajectory misalignment):策略更新往往偏离至人造的、脱离轨迹的状态,将梯度浪费在信息量较低的样本上。 为了解决这些局限,我们提出了过程对齐策略优化(Process Aligned Policy Optimization,简称 PAPO)。这是一个全新的框架,通过两大机制将 RL 更新与 dLLM 的生成轨迹进行整体对齐: 步骤感知过程奖励(Step-Aware Process Rewards,简称 SPR):将稀疏的终局奖励转化为密集的步骤级信用; 熵引导历史重演(Entropy-Guided Historical Re-enactment,简称 EHR):在高不确定性步骤下重演真实轨迹。 在四个基准测试上的大量实验表明,PAPO 显著优于基线方法,在 GSM8K 上实现了高达 4.5% 的提升, MATH500 上提升 4.8%, Countdown 上提升 42.2%, 数独(Sudoku)上提升 16.1%。 原文链接:https://arxiv.org/abs/2606.08501 前往小宇宙评论区与主播互动

0:00-19:45

transcript

No transcript — this publisher did not publish one.

show notes

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

Summary

强化学习(RL)在提升扩散大语言模型(dLLM)的推理能力方面蕴含着巨大的潜力。然而,这一领域的进展从根本上受到了真实生成轨迹与梯度更新过程之间“双重错位”(dual misalignment)的限制:

  1. 过程-奖励错位(Process-reward misalignment):稀疏的终局奖励被无差别地赋予给生成过程的所有中间步骤,无法提供区分度高的信用分配(credit assignment)。

  2. 状态-轨迹错位(State-trajectory misalignment):策略更新往往偏离至人造的、脱离轨迹的状态,将梯度浪费在信息量较低的样本上。

为了解决这些局限,我们提出了过程对齐策略优化(Process Aligned Policy Optimization,简称 PAPO)。这是一个全新的框架,通过两大机制将 RL 更新与 dLLM 的生成轨迹进行整体对齐:

  • 步骤感知过程奖励(Step-Aware Process Rewards,简称 SPR):将稀疏的终局奖励转化为密集的步骤级信用;

  • 熵引导历史重演(Entropy-Guided Historical Re-enactment,简称 EHR):在高不确定性步骤下重演真实轨迹。

在四个基准测试上的大量实验表明,PAPO 显著优于基线方法,在 GSM8K 上实现了高达 4.5% 的提升, MATH500 上提升 4.8%, Countdown 上提升 42.2%, 数独(Sudoku)上提升 16.1%。

原文链接:https://arxiv.org/abs/2606.08501


前往小宇宙评论区与主播互动
links2