Skip to content
Artwork for Seventy3
TechnologyEducationScience

Seventy3

任雨山

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

Play
  • 37 episodes
  • daily
  • Avg 19 min
  • Chinese
Counted on this page — what you have heard stays on this device, so it is not something the list can be paged by.
  • August 10 · 17 min

    【第680期】世界价值模型:机器人操纵的通用价值评估

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: World Value Models for Robotic Manipulation Summary 通用价值模型(Generalist value models)在从大规模、质量混合的数据中扩展机器人策略学习方面发挥着关键作用。从数学角度来看,准确的价值估计需要深刻的时序理解,这要求模型既能利用历史上下文来锚定当前信念,又能对未来结果进行规划。 然而,大多数现有的机器人价值模型都是基于视觉语言模型(VLM)底座构建的,这些底座主要在静态或时序稀疏的视觉观测数据上进行预训练,缺乏价值估计所需的时序建模能力。与 VLM 不同,世界模型(world models)天然擅长时序建模与未来规划,这使其成为学习具备泛化能力的价值函数的理想基础。 基于这一洞察,我们将世界模型与价值估计相结合,构建了一种全新的机器人通用价值模型——世界价值模型(World Value Model,简称 WVM),能够提供准确的任务进度预测以评估数据质量。 在标准基准测试中,WVM 取得了最先进的(SOTA)价值顺序相关性(VOC)结果。除了仅包含专家数据的标准评估套件外,我们还推出了 Suboptimal-Value-Bench,这是一个多具身(multi-embodiment)基准测试,由 800 条包含高保真、人工标注帧标签的次优轨迹组成。评估表明,WVM 在 Suboptimal-Value-Bench 上依然保持了 SOTA 性能,证实了其在处理专家数据和次优数据时的鲁棒性。 当应用于策略学习时,无论在模拟环境还是真实世界的部署中,WVM 都提升了各种策略提取方法的操纵性能,为从混合质量的数据中进行学习提供了稳健的指导。 原文链接:https://arxiv.org/abs/2606.24742 前往小宇宙评论区与主播互动

  • August 9 · 19 min

    【第679期】PAPO:对齐扩散大语言模型推理的奖励与状态

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models Summary 强化学习(RL)在提升扩散大语言模型(dLLM)的推理能力方面蕴含着巨大的潜力。然而,这一领域的进展从根本上受到了真实生成轨迹与梯度更新过程之间“双重错位”(dual misalignment)的限制: 过程-奖励错位(Process-reward misalignment):稀疏的终局奖励被无差别地赋予给生成过程的所有中间步骤,无法提供区分度高的信用分配(credit assignment)。 状态-轨迹错位(State-trajectory misalignment):策略更新往往偏离至人造的、脱离轨迹的状态,将梯度浪费在信息量较低的样本上。 为了解决这些局限,我们提出了过程对齐策略优化(Process Aligned Policy Optimization,简称 PAPO)。这是一个全新的框架,通过两大机制将 RL 更新与 dLLM 的生成轨迹进行整体对齐: 步骤感知过程奖励(Step-Aware Process Rewards,简称 SPR):将稀疏的终局奖励转化为密集的步骤级信用; 熵引导历史重演(Entropy-Guided Historical Re-enactment,简称 EHR):在高不确定性步骤下重演真实轨迹。 在四个基准测试上的大量实验表明,PAPO 显著优于基线方法,在 GSM8K 上实现了高达 4.5% 的提升, MATH500 上提升 4.8%, Countdown 上提升 42.2%, 数独(Sudoku)上提升 16.1%。 原文链接:https://arxiv.org/abs/2606.08501 前往小宇宙评论区与主播互动

  • August 8 · 13 min

    【第678期】OpenClaw-Skill:基于集合技能树搜索的智能体强化学习

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models Summary 为大语言模型(LLM)Agent 赋予有效的技能,对于解决像 OpenClaw 这类现实世界系统中的复杂任务至关重要。在这项工作中,我们的目标是开发一个能够自动构建此类可重用技能的框架,从而增强 LLM 在工具使用、多步推理以及动态环境交互方面的能力。 为此,我们提出了群体技能树搜索(Collective Skill Tree Search,简称 CSTS),这是一种全新的基于树搜索的技能构建框架,能够构建出结构化、多样化且具备泛化能力的技能树。CSTS 的核心思想是利用群体智慧,通过两个迭代阶段来共同搜索、识别与组合有效技能:群体技能节点生成(CSN-Gen)和群体技能节点评估(CSN-Assess)。CSN-Gen 利用来自多个模型的群体知识,为每个子任务探索多样化的候选技能,从而实现全面的技能探索。CSN-Assess 则采用多个模型作为裁判,通过两种打分机制来评估和选择技能节点:(1)群体质量打分,通过聚合独立评估,对技能有效性做出稳健的估计;(2)群体可迁移性打分,显式地验证某项技能是否能在不同模型间良好泛化。 借由 CSTS,我们构建了一套完整的技能树以及技能增强的训练数据,使模型能够有效地学习并利用技能。此外,我们还引入了群体技能强化学习,它能主动从树中选择多个相关技能,以拓宽解空间探索,避免陷于单一技能及其产生的同质化或次优解中。 结果表明,我们训练出的模型 OpenClaw-Skill 在长流程规划、工具使用以及挑战性基准测试的泛化能力方面,展现出了卓越的 Agent 能力。 原文链接:https://arxiv.org/abs/2606.16774 前往小宇宙评论区与主播互动

  • August 7 · 15 min

    【第677期】从学徒到导师:强化学习环境生成框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning Summary 强化学习(RL)在大语言模型(LLM)训练中的流水线,通常依赖于在不同阶段之间手动重新设计环境,这就需要从业人员凭启发式经验去推断哪种配置最能提升当前的策略模型。 为了将这一过程实现自动化,我们提出了 LLM 作为环境工程师(LLM-as-Environment-Engineer)的框架:在该框架中,当前的策略模型会分析失败轨迹并结合上下文信息,从而为下一阶段的训练环境配置提出修改建议。 我们还推出了 MAPF-FrozenLake,这是一个可控的测试床,其生成器暴露了多维度的环境配置,非常适合用来研究和评估环境的重新设计。在该测试床中,我们以策略行为、失败案例和环境统计数据的结构化摘要作为条件引导环境工程师,使其生成下一训练阶段的配置。 在以 Qwen3-4B 作为骨干模型时,我们的框架在基准测试中取得了最强的综合性能,超越了更大的闭源商业 LLM(例如 GPT、Gemini)以及固定环境训练的基线方法。 我们进一步分析了哪种形式的上下文最为有效,发现成功的环境更新依赖于失败证据,并且会保留已经生效的配置。有趣的是,当前的 RL 检查点(checkpoint)比原始的基座模型能扮演更好的环境工程师角色,这表明策略学习提升了模型诊断自身剩余缺陷的能力。 原文链接:https://arxiv.org/abs/2606.17682 前往小宇宙评论区与主播互动

  • August 6 · 17 min

    【第676期】智能自动机学习:大语言模型智能体发现世界模型

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning Summary 我们提出了“Agent 化的自动机学习”(agentic automata learning),用于评估工具调用型 LLM Agent 通过交互揭示隐藏环境的能力。 在我们的设定中,Agent 需通过与 Oracle(神谕/专家)进行两种交互来揭示一个隐藏的确定性有限状态自动机(DFA):(1)成员查询(“该字符串是否属于目标语言?”)以及(2)等价性查询(“这是目标 DFA 吗?”)。这提供了一个具有可控任务复杂度、可测量交互效率以及强基线(传统的自动机学习算法)的可扩展测试床。 对最先进的 LLM 进行评估后,我们发现其性能随着 DFA 规模的增大而急剧下降。推理模型(reasoning models)的表现显著强于非推理模型,但轨迹分析揭示了其在查询规划、证据整合和假设构建方面反复出现的失败。 总体而言,我们的结果表明,当前的 LLM Agent 有时能够完成非平凡的交互式探索,但该任务上的鲁棒性和效率仍远落后于传统算法。 原文链接:https://arxiv.org/abs/2606.16576 前往小宇宙评论区与主播互动

  • August 5 · 20 min

    【第675期】PreAct:基于状态机与验证机制的计算机辅助代理加速系统

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: PreAct: Computer-Using Agents that Get Faster on Repeated Tasks Summary 计算机操作 Agent(Computer-using agents)通过屏幕直接驱动真实软件——进行点击与打字——但它们解决每个任务时都是“从头开始”:当被要求重复某项任务时,Agent 会重新读取屏幕、重新推理每一次点击,并再次付出全部代价。 我们提出了 PreAct,它能让此类 Agent 在执行曾经做过的任务时速度大幅提升。 在首次成功完成任务时,PreAct 会将该运行过程编译为一个精简的状态机程序(状态负责检查屏幕,转移负责执行动作);在后续运行中,PreAct 会直接重放该程序,而无需调用 Agent——不仅没有每一步的语言模型调用,速度还提升了 8.5 到 13 倍。这种重放并非盲目进行:在每一步执行前,PreAct 都会检查屏幕是否符合程序的预期,一旦出现异常便会立即将控制权交还给 Agent。 在决定保留哪些程序时,PreAct 同样遵循这一严格原则:一个新编译的程序只有在从干净状态重新运行、并经独立评估器确认确实解决了任务后,才会存入存储库——这能有效筛选出那些虽然重放到最后一步但实际并未完成任务的无效程序。在涵盖移动端、桌面端和 Web 端的三项基准测试中,这种存储阶段的校验将“越用越好”的重复运行与“因错误程序累积而导致性能下降”的运行成功区分开来,在三项基准测试中均带来了相同的正面效果(相当于每项基准测试提升 1.75 到 2.6 个任务);再加上当没有合适程序时重新进行探索的回退机制(fallback),使 PreAct 达到了与强劲的“录制与重放”(record-and-replay)基线相媲美的水平。 此外,我们还报告了哪些因素并不重要:提示词措辞、运行时防护栏(guardrails),以及究竟是由语言模型还是普通的嵌入检索器来选择复用哪种程序。 原文链接:https://arxiv.org/abs/2606.17929 前往小宇宙评论区与主播互动

  • August 4 · 16 min

    【第674期】SkillWeaver:组合式 LLM 代理技能路由框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose Summary LLM Agent 越来越依赖外部技能(即包含重用工具规范的定义),但现实世界中的任务通常需要组合多个技能,而不仅仅是选择单个技能。我们将该问题形式化为组合式技能路由(Compositional Skill Routing)问题:给定一个复杂的用户查询和一个庞大的技能库,将查询拆解为原子子任务,为每个子任务检索合适的技能,并构建出一个可执行的规划。 我们提出了 SkillWeaver,这是一个结合了 LLM 任务分解器、带 FAISS 索引的双编码器(bi-encoder)技能检索器以及依赖感知 DAG 规划器的“拆解-检索-组合”框架。为了支持评估,我们推出了 CompSkillBench,这是一个包含 300 个组合式查询的基准测试,涵盖来自公开 MCP 生态系统、跨越 24 个功能类别的 2,209 个真实 MCP 服务端技能。 我们的实验表明,任务分解的质量是主要瓶颈:标准 LLM 分解在步骤层面的类别召回率(category recall)仅达到 34.2%。为了解决这个问题,我们提出了迭代式技能感知分解(Iterative Skill-Aware Decomposition,简称 SAD),这是一种检索增强的反馈循环,能够迭代地将分解过程与可用技能进行对齐。SAD 在单次迭代中将分解准确率从 51.0% 提升至 67.7%(相对提升 +32.7%,Wilcoxon 检验 p<10−6);基于分解准确性(DA)的条件分析证实,正确的粒度是实现有效检索的前提条件(当 DA=1 时,CatR@1 从 34% 上升至 41%)。 SkillWeaver 将上下文窗口的消耗降低了 99% 以上,迁移实验也证实了其泛化能力(即使检索池中缺失目标类别,相对 DA 收益仍达到了 +35.6%)。 原文链接:https://arxiv.org/abs/2606.18051 前往小宇宙评论区与主播互动

  • August 3 · 15 min

    【第673期】SpatialClaw:重塑智能体空间推理的代码动作接口

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning Summary 空间推理(即确定物体位置、相互关系以及在三维空间中如何运动的能力)依然是视觉语言模型(VLM)面临的一项根本性挑战。工具增强型 Agent 试图通过为 VLM 补强专业感知模块来解决这一问题,但其有效性受到调用这些工具的动作接口(action interface)的限制。 在本文中,我们研究了该接口的设计如何塑造 Agent 进行开放式空间推理的能力。现有的空间 Agent 要么采用单次代码执行,这种方式在观察到任何中间结果之前就已确定了完整的分析策略;要么依赖结构化的工具调用接口,这往往缺乏自由组合操作或针对具体任务量身定制分析的灵活性。这两种设计对于开放式、复杂的 3D/4D 空间推理所提供的灵活性都非常有限。 因此,我们提出了 SpatialClaw,这是一个采用代码作为动作接口的无需训练的空间推理框架。SpatialClaw 维持一个有状态的 Python 内核,其中预载了输入帧以及一系列感知和几何图元,允许由 VLM 支持的 Agent 在每一步根据所有先前的输出来编写一个可执行单元格,从而使 Agent 能够灵活地组合与操作感知结果,并根据中间的文本、视觉观察以及每个问题的需求来调整其分析过程。 在跨越广泛静态与动态 3D/4D 空间推理任务的 20 个空间推理基准测试上的评估表明,SpatialClaw 实现了 59.9% 的平均准确率,超越了近期的空间 Agent +11.2 个百分点;且在来自两个模型家族的六个 VLM 底座上均实现了持续的性能提升,期间无需任何针对基准测试或特定模型的微调适配。 原文链接:https://arxiv.org/abs/2606.13673 前往小宇宙评论区与主播互动

  • August 2 · 17 min

    【第672期】FlashMemory-DeepSeek-V4:前瞻稀疏注意力的超长上下文技术

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention Summary 传统大语言模型(LLM)在解码阶段需要将全部 KV 缓存(KV Cache)保持加载状态,这导致在超长上下文服务场景下面临严重的 GPU 显存瓶颈。在本报告中,我们提出了前瞻稀疏注意力(Lookahead Sparse Attention,简称 LSA),这是一种由基于 DeepSeek-V4 架构构建的神经记忆索引器(Neural Memory Indexer)驱动的全新推理范式。与被动地对所有历史 Token 进行注意力计算不同,LSA 能够主动预测未来的上下文需求,并仅在 GPU 显存中保留对查询至关重要的 KV 块(KV Chunks)。关键在于,我们通过脱离骨干模型的解耦训练(backbone-free decoupled training)策略实例化了该架构。通过将索引器构建为标准的双编码器(dual-encoder)架构,我们利用标准的检索训练框架对其进行独立训练,而无需将庞大的骨干模型加载到 GPU 显存中。 我们证明了这种“少即是多”的范式在大幅提升服务效率的同时,还能在依赖长期全局记忆的任务中充当有效的注意力去噪器(attention denoiser)。在主流的长上下文评估套件(例如 LongBench-v2、LongMemEval 和 RULER)中,FM-DS-V4 将平均物理 KV 缓存占用大幅压缩至全上下文基线(full-context baseline)的 13.5%,同时持续保持甚至略微提升了下游任务的准确率(平均绝对提升 +0.6%)。在 1M(百万)上下文长度下,每个解码 Token 的计算量降至基线的 0.30 倍,GPU KV 缓存体积缩减了 90%(从 3.73 GB 降至 0.37 GB),从而在 8× H20 GPU 上的首字/解码分离(PD-disaggregated)服务中,实现了2.8 倍的总吞吐量提升和 2.7 倍的并发量提升。 原文链接:https://arxiv.org/abs/2606.09079 前往小宇宙评论区与主播互动

  • August 1 · 15 min

    【第671期】从监督微调到强化学习:在线蒸馏的参数空间几何特性

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: On the Geometry of On-Policy Distillation Summary 在线策略蒸馏(On-Policy Distillation,简称 OPD)越来越多地被用于提升大语言模型的推理能力,但其训练动态机制(training dynamics)至今仍缺乏深入了解。我们对 OPD 在参数空间中的更新轨迹进行了刻画,并将其与监督微调(SFT)以及基于可验证奖励的强化学习(RLVR)进行了比较。 一系列参数空间诊断结果一致表明,OPD 处于一种宽松的非主方向机制(relaxed off-principal regime):与 SFT 相比,它的更新所影响的权重更少,且更强烈地避开了主方向(principal directions);而与 RLVR 相比,它的限制程度则没有那么严苛。 除了这种静态定位之外,OPD 还展现出了子空间锁定(subspace locking)现象:其累积更新会迅速进入一条狭窄的低维通道。将训练限制在训练早期形成的更新子空间内,能够保留 OPD 的性能,却会大幅降低 SFT 的效果,这表明被锁定的子空间在功能上对于 OPD 来说是充分的。 对照实验进一步表明,稀疏化更新 Token(sparsifying update tokens)以及将 Rollout 生成转为离线策略(off-policy)依然能保持其秩动态特性(rank dynamics);然而,将 OPD 目标与 RLVR 混合使用则会改变这一特性。 总体而言,这些结果表明 OPD 并非仅仅是 SFT 和 RLVR 之间的过渡状态,而是在参数空间中诱导出了其独特的更新几何结构(update geometry)。 原文链接:https://arxiv.org/abs/2606.07082 前往小宇宙评论区与主播互动

  • July 31 · 13 min

    【第670期】Agentopia:大语言模型长周期社会生活模拟与学习

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Agentopia: Long-Term Life Simulation and Learning in Agent Societies Summary 人类从社会生活中进行学习。利用大语言模型(LLM)驱动的 Agent 来模拟这一过程是一个很有前景的研究方向,由此也衍生出一个自然的问题:LLM 能否从这种模拟的社会经验中学习,从而更好地理解和复刻人类行为?然而,以往的 Agent 社会模拟通常局限在“天”的量级,限制了社会交互的深度与长期成长。 在本文中,我们针对 Agent 社会中的长期生活模拟与 LLM 学习展开研究,旨在实现两个目标:(1)探索终身模拟中涌现出的社会行为;(2)通过数年的模拟社会经验,培养 LLM 的拟人化能力,特别是其在社会生活中的智能水平。 具体而言,我们提出了 Agentopia,这是一个用于多 Agent 社会长期生活模拟的综合框架。在该框架中,100 个 Agent 在 10 个模拟年里自主追求个人成长、建立社会关系,并满足自身的需求与目标。我们定义了用来镜像人类幸福感(well-being)的“生活奖励”(life reward),并利用该奖励通过拒绝采样(rejection sampling)来训练 LLM。 大量实验表明,Agent 表现出了丰富且涌现出的社会行为。此外,基于生活奖励的训练有效提升了底座 LLM 的能力,这不仅改善了 Agent 在模拟中的幸福感,还泛化到了下游的角色扮演基准测试中,带来了 +15.6% 的性能提升。 原文链接:https://arxiv.org/abs/2606.07513 前往小宇宙评论区与主播互动

  • July 30 · 20 min

    【第669期】从助手到智能体:AI重塑知识工作的自主性、效率与范围

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: How AI Agents ReshapeKnowledge Work: Autonomy,Efficiency, andScope Summary 前沿 AI 系统正在实现从“对话助手”向“能够端到端执行任务的自主 Agent”的转变,从而弥合智能与实用价值之间的鸿沟。我们利用来自 Perplexity 的 Search(搜索)与 Computer(电脑/计算)产品的生产数据,通过研究 AI Agent 如何加速并重塑知识工作,对这一转型进行了探讨。 研究得出了三个关键的实证发现: 第一,将使用两个产品尝试相同底层任务且初始查询对近乎一致的会话作为自然实验,数据显示,在每个用户会话中,Computer 能够执行 26 分钟的自主工作,而 Search 仅为 33 秒。 Computer 实现了任务拆解与执行的自动化,而这些工作在过去可能需要 Search 用户手动去协调和实施。因此,Computer 将后续查询的分布推向了诸如“验证”与“拓展”等更高阶的工作。自主性同时也提升了执行质量:Computer 上每条查询的不满意率比 Search 低 55%。 第二,得益于其自主性优势,在匹配的同类任务上,Computer 将完成时间从 269 分钟缩减至 36 分钟。 与仅配备 Search 的人类相比,估计的时间和成本分别降低了 87% 和 94%。 第三,Computer 改变了用户尝试的工作范围: 相较于同一批用户对 Search 的使用,Computer 上的查询更频繁地跨越职业边界、需要更高阶的认知能力、调用更广泛的专业知识,并且更多地表现为将相互依存的子任务打包进单个查询的复合型任务,从而解锁了在 Search 使用中基本不存在的工作活动。 综合来看,这些证据表明 AI Agent 能够加速工作流程、提升输出质量、降低成本,并拓展自动化工作的广度与深度。 原文链接:https://arxiv.org/abs/2606.07489 前往小宇宙评论区与主播互动

  • July 29 · 24 min

    【第668期】Agents’ Last Exam:工业级通用AI智能体评测基准

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Agents’ Last Exam Summary 近期的人工智能系统在一系列广泛的基准测试中取得了优异的成绩,然而这些进步并未能在众多专业领域中转化为具备经济意义的落地应用。我们认为,这一差距很大程度上源于评估环节的问题:目前被广泛使用的基准测试缺乏对真实且具备经济价值的工作流程进行持续性的性能测量。 本文介绍了“Agent 的终极考场”(Agents' Last Exam, 简称 ALE),这是一个旨在评估 AI Agent 在具有可验证结果、长流程、具备经济价值且贴近现实世界任务中表现的基准测试。ALE 是与 250 多位行业专家合作开发的,其覆盖的非物理产业均参考了 O*NET / SOC 2018(美国联邦职业分类体系)进行定义。它围绕一个包含 55 个子领域、归类为 13 个行业集群的任务分类体系展开,涵盖 1000 多个任务。 目前的结果表明,最难的梯队距离“饱和”还差得远:在主流的框架(harness)和骨干模型(backbone)配置下,平均完全通过率低于 1%。ALE 被设计为一个动态发展的基准测试:随着新工作流程和新行业的不断加入,其任务池将持续扩大。更广泛地说,ALE 的定位不仅是另一个排行榜,更是缩小基准测试的成功与对国内生产总值(GDP)产生实际影响之间差距的工具。 原文链接:https://arxiv.org/abs/2606.05405 前往小宇宙评论区与主播互动

  • July 28 · 13 min

    【第667期】Self-harness:大语言模型代理的进化演进系统

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Self-Harness: Harnesses That Improve Themselves Summary Based LLM-based agent(基于大语言模型的智能体)的性能受其基座模型以及协调其与环境交互的框架/驾驭系统(harness)共同塑造。由于不同的模型表现出截然不同的行为特征,因此有效的 harness 设计本质上是需要针对特定模型定制的。然而,智能体 harness 至今在很大程度上仍由人类专家手动工程化构建,随着现代 LLM 日益多样化且快速迭代,这种范式在扩展性方面表现极差。 在本文中,我们提出了 Self-Harness——一种全新的范式,在此范式下,基于 LLM 的智能体可以在不依赖人类工程师或更强外部智能体的情况下,自我改进其运行 harness。我们将 Self-Harness 实例化为一个包含三个阶段的迭代循环: 弱点挖掘(Weakness Mining):从执行轨迹中识别特定模型的失败模式; Harness 方案提出(Harness Proposal):生成与这些失败紧密相关的、多样化且最小化的 harness 修正方案; 方案验证(Proposal Validation):仅在通过回归测试后才接受候选的修改。 我们在 Terminal-Bench-2.0 上使用一个极简的初始 harness 以及来自不同家族的三款基座模型(MiniMax M2.5、Qwen3.5-35B-A3B 和 GLM-5)对 Self-Harness 进行了实例化评估。在这三款模型上,Self-Harness 均一致提升了性能,保留测试集(held-out)的通过率分别从 40.5% 提升至 61.9%、从 23.8% 提升至 38.1%,以及从 42.9% 提升至 57.1%。 定性分析进一步表明,Self-Harness 并不仅仅是添加通用的指令,而是有效地将特定模型的弱点转化为具体、可执行的 harness 改动。这些结果表明,基于 LLM 的智能体不仅能被其 harness 塑造,还能开辟一条参与重塑自身 harness 的演进路径。 原文链接:https://arxiv.org/abs/2606.09498 前往小宇宙评论区与主播互动

  • July 27 · 23 min

    【第666期】MiniMax Sparse Attention-算力缩减28倍的MSA架构

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: MiniMax Sparse Attention Summary 超长上下文能力正在成为前沿大语言模型(LLM)不可或缺的能力:智能体工作流(agentic workflows)、代码仓库级别的代码推理(repository-scale code reasoning)以及持久化记忆(persistent memory)都要求模型能够联合关注数十万到数百万级别的 token。然而,softmax 注意力机制的二次计算复杂度,使得这种能力在实际部署规模下难以实现。 我们提出了 MiniMax 稀疏注意力(MiniMax Sparse Attention, MSA),这是一种基于分组查询注意力(Grouped Query Attention, GQA)构建的块级稀疏注意力机制。MSA 包含一个轻量级的索引分支(Index Branch),用于对键值(key-value)块进行评分,并为每个 GQA 组独立选择一个 Top-k 子集,从而实现针对不同组的稀疏检索,同时保持高效的块级执行;随后,**主分支(Main Branch)**仅在被选中的块上执行精确的块稀疏注意力计算。 MSA 的设计遵循简单性与可扩展性原则,经过刻意精简,使其能够在广泛的 GPU 平台上直接高效部署。为了将稀疏性转化为实际的速度提升,我们进一步针对 MSA 设计了专用的 GPU 执行路径:该路径采用无指数运算(exp-free)的 Top-k 选择机制以及 KV 外置稀疏注意力(KV-outer sparse attention),在块粒度访问模式下提升张量核心(tensor core)的利用率。 在一个具有原生多模态训练能力的 109B 参数模型上,MSA 的性能与 GQA 基本相当,同时在 100 万 token 上下文长度下,将每个 token 的注意力计算量降低了 28.4 倍。结合我们共同设计的 GPU 内核(kernel),MSA 在 H800 GPU 上实现了 14.2 倍的预填充(prefill)加速以及 7.6 倍的解码(decoding)端到端速度提升。 原文链接:https://arxiv.org/abs/2606.13392 前往小宇宙评论区与主播互动

  • July 26 · 26 min

    【第665期】语言模型的睡眠、记忆巩固与自进化

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories Summary 过去几十年见证了机器学习算法设计领域的重大进步,从早期针对特定任务的浅层模型研究,到如今更加通用的深度大语言模型(Large Language Models, LLMs)。尽管现有模型在需要即时预测或上下文学习(in-context learning)的任务中展现出了良好的效果,但它们仍然缺乏持续学习的能力,也无法有效地将其随时间积累的上下文知识迁移到长期参数中。 受到人类学习过程的启发,我们引入了一种称为 “睡眠(Sleep)”范式 的方法,使模型能够持续学习,通过回放(replay)机制将短期且脆弱的记忆蒸馏为稳定的长期知识,并通过“做梦(Dreaming)”过程递归地实现自我改进。 更具体地说,睡眠过程包含两个阶段: (1)记忆巩固(Memory Consolidation): 这是一个向上的蒸馏过程,称为知识播种(Knowledge Seeding)。在该过程中,将较小版本自身模型(smaller-self)的记忆蒸馏到一个更大的网络中,从而在保留已有知识的同时提供更大的容量。作为概念验证,我们提出了一种新的用于知识播种的广义蒸馏过程(Generalized Distillation process),即结合了**在策略蒸馏(on-policy distillation)**与基于强化学习(Reinforcement Learning, RL)的模仿学习(imitation learning)的蒸馏方法。 (2)做梦(Dreaming): 这是一个自我改进阶段。在该阶段,模型利用强化学习生成一个合成数据课程(curriculum of synthetic data),用于反复练习新知识,并在无需人工监督的情况下优化已有能力。 我们在长时间跨度任务(long-horizon tasks)、持续学习任务(continual learning)、知识融入任务(knowledge incorporation)以及少样本泛化任务(few-shot generalization tasks)上的实验结果,验证了睡眠阶段的重要性。 原文链接:https://arxiv.org/abs/2606.03979 前往小宇宙评论区与主播互动

  • July 25 · 19 min

    【第664期】嵌套学习:深层架构的幻象与神经学习模块

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Nested Learning: The Illusion of Deep Learning Architecture Summary 尽管近年来取得了显著进展,尤其是在语言模型的发展方面,但关于这类模型如何能够持续学习/记忆、自我改进以及寻找有效解决方案,仍然存在一些根本性的挑战和未解问题。在本文中,我们提出了一种新的学习范式,称为嵌套学习(Nested Learning, NL)。该范式以一种统一的方式,将机器学习模型表示为一组嵌套的、多层次的和/或并行的优化问题,其中每一个优化问题都具有其自身的上下文流(context flow)。 通过 NL 的视角来看,现有的深度学习方法通过压缩自身的上下文流来从数据中学习,而**上下文学习(in-context learning)**则自然地在大规模模型中涌现出来。NL 提出了一种设计理念:通过引入更多层次来设计具有更强表达能力的学习算法,从而实现更高阶的上下文学习,并有可能解锁有效的持续学习能力。 我们通过以下三个核心贡献来阐述并倡导 NL: (1)表达性优化器(Expressive Optimizers): 我们展示了,诸如 Adam、带动量的 SGD(SGD with Momentum)等已知的基于梯度的优化器,实际上是联想记忆模块(associative memory modules),其目标是通过梯度下降来压缩梯度信息。在这一洞见的基础上,我们提出了其他更具表达能力的优化器,它们具备深层记忆能力和/或更强大的学习规则。 (2)自修改学习模块(Self-Modifying Learning Module): 利用 NL 对学习算法的洞察,我们提出了一种序列模型,该模型能够通过学习自身的更新算法,来学习如何修改自身。 (3)连续记忆系统(Continuum Memory System): 我们提出了一种新的记忆系统表述方式,将传统的长短期记忆(long/short-term memory)视角进行了推广。结合我们的自修改序列模型与连续记忆系统,我们提出了一种持续学习模块,称为 Hope。实验结果表明,该模块在语言建模、知识融入、少样本泛化任务、持续学习任务以及长上下文推理任务中均展现出了良好的潜力。 原文链接:https://arxiv.org/abs/2512.24695 前往小宇宙评论区与主播互动

Showing 21–37 of 37 episodes