Skip to content
Artwork for Seventy3
TechnologyEducationScience

Seventy3

任雨山

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

Play
  • 35 episodes
  • daily
  • Avg 19 min
  • Chinese
Counted on this page — what you have heard stays on this device, so it is not something the list can be paged by.
  • Yesterday · 15 min

    【第698期】AIP:大模型上下文协议与代理间通信的可验证委派协议

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: AIP: Agent Identity Protocol for Verifiable Delegation Across MCP and A2A Summary AI Agent 越来越频繁地通过模型上下文协议(MCP)调用工具,并经由 Agent 到 Agent(A2A)协议将任务委托给其他 Agent,然而这两个协议目前均未对 Agent 身份进行验证。对约 2,000 个 MCP 服务器的扫描发现,所有服务器都缺乏身份验证。在我们的调查中,尚未发现先前有已实现的协议能够联合融合公钥可验证委托、持有者侧权能衰减(holder-side attenuation)、具表达力的链式策略、跨 MCP/A2A/HTTP 的传输绑定,以及面向出处的完成记录。 我们提出了调用绑定权能令牌(Invocation-Bound Capability Tokens, IBCTs),这是一种将身份、衰减授权和出处绑定融合到单个仅追加(append-only)令牌链中的原语。IBCTs 以两种传输格式运行:紧凑模式(用于单跳场景的签名 JWT)和链式模式(带有用于多跳委托的 Datalog 策略的 Biscuit 令牌)。 我们提供了 Python 和 Rust 的参考实现,具备完整的跨语言互操作性。紧凑模式的验证在 Rust 中耗时 0.049ms,在 Python 中耗时 0.189ms;在真实的基于 HTTP 的 MCP 部署中,相比无身份验证仅增加 0.22ms 的开销。在结合 Gemini 2.5 Flash 的真实多 Agent 部署中,Agent 身份协议(AIP)增加了 2.35ms 的开销(占总端到端延迟的 0.086%)。 跨 600 次攻击尝试的对抗性评估显示出 100% 的拦截率;其中两种攻击类型(委托深度违规,以及通过空上下文逃避审计)能够被 AIP 的链式委托模型独家捕获,而无签名或纯 JWT 部署均无法检测出这两类攻击。 原文链接:https://arxiv.org/abs/2603.24775 前往小宇宙评论区与主播互动

  • Thursday · 16 min

    【第697期】早期推理涌现:大模型推理数据的代币高效筛选

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Reasoning Quality Emerges Early: Data Curation for Reasoning Models Summary 在少量高质量的长推理轨迹(long reasoning traces)数据集上进行监督微调(SFT),是激发大语言模型(LLMs)强大推理能力的有效方法。然而,现有用于筛选高质 SFT 数据的方法高度依赖强推理模型来根据多样性和难度筛选样本,这导致数据筛选过程成本高昂,且往往只能得到次优的数据质量。 在这项工作中,我们展示了仅利用初始的推理 Token 即可识别出具备多样性且富有挑战性的推理样本。具体而言,我们证明了:仅需根据预训练模型在随机扰动检查点(randomly perturbed checkpoint)下评估的前 100 个推理 Token 的损失(loss),就能可靠地检测出难题。我们进一步证明,在沿微调轨迹推断的少数扰动检查点上,在前 1k 个推理 Token 中表现出相似 Loss 模式的样本,在证明上(provably)会诱导出相似的梯度。 我们通过在 M23K 医疗推理数据集和 OpenThoughts-Math 数据集上微调 Qwen2.5-7B 与 Llama3.1-8B 模型的广泛实验验证了该方法。我们的方法在 Token 效率提升 91% 的同时,性能超越了现有基线高出最多 1.7%。 原文链接:https://arxiv.org/abs/2606.26797 前往小宇宙评论区与主播互动

  • Wednesday · 19 min

    【第696期】强化学习元认知反馈:大模型不确定性的忠实表达

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Summary 元认知(Metacognition)是智能的核心组成部分,它描述了监控和调节自身认知过程的能力。然而,大语言模型(LLMs)在关键的元认知功能上展现出了系统性缺陷:它们以高度的自信产生幻觉、无法识别自身的知识边界,并歪曲其内部的不确定性——这严重削弱了模型的信任度与可靠性。 由于监控任务表现并据此调整行为是元认知能力的核心,我们假定:能够准确判断自身表现的模型,更有能力去提升这种表现。我们通过两种新颖的机制将这一思想付诸实践: 元认知反馈强化学习(RLMF):一种在偏好优化过程中,基于模型对自身表现自我判定的质量,来精炼补全结果(completion)排序的范式; 元认知数据选择:利用类似的自我判定来识别高价值训练样本,其效果超越了朴素的主动学习(naive active learning)。 我们将这些创新应用到忠实对齐校准(Faithful Calibration, FC)问题上,该任务本身就具备根本上的元认知属性:其目标是将表达出的不确定性与内在的不确定性保持一致,这即使对于前沿 LLM 而言也极具挑战。我们采用了解耦的两阶段方法:首先利用这些方法来校准模型自我报告的自信度得分的忠实度;随后通过有针对性的输出编辑,将其映射为自然且能适应上下文的语言学不确定性表达。 广泛的实验表明,RLMF 在保持准确率的同时,在多样化的任务上实现了具备泛化能力且达到 SOTA 水平的忠实对齐校准(FC)。此外,RLMF 的表现超越了标准强化学习(RL)高达 63%,同时增强了模型评估和表达自身能力边界的能力。这使得 RLMF 成为了一种极具前景的范式,能够提升 LLM 的元认知能力,进而推动能力与对齐(alignment)的改善;同时也表明元认知表现可以作为一种有效的强化学习信号,用以克服先前内在反馈方法的局限性。 原文链接:https://arxiv.org/abs/2606.32032 前往小宇宙评论区与主播互动

  • Tuesday · 20 min

    【第695期】AUTOMEM:记忆认知技能的自动学习研究

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: AUTOMEM: Automated Learning of Memory as a Cognitive Skill Summary 记忆专业能力(Memory expertise)是一项后天学会的技能:明确该编码什么、何时进行检索以及如何组织知识——这一能力在认知科学中被称为元记忆(metamemory)。我们通过将记忆管理视为一项可训练的技能,将这一视角引入到大语言模型(LLMs)中。我们将文件系统操作提升为与任务动作平起平坐的一等记忆动作(first-class memory actions),让模型自身来决定如何管理其记忆。 这种记忆技能沿着两个轴线进行提升:支持它的结构(Prompt、文件 Schema、动作词表),以及运用该技能的模型熟练度。然而,这两个轴线都难以通过人工优化来实现:长流程任务中的单次 episode 会运行数千个步骤,而且单个记忆错误可能在隐蔽很久之后才会浮出水面,这使得人类对完整轨迹进行评审变得不可行。 我们提出了 AutoMem,一个将上述两个轴线全自动化的框架。在第一个循环中,一个强 LLM 会评审 Agent 的完整轨迹,并迭代修改塑造 Agent 如何与其记忆文件交互的记忆结构。在第二个循环中,系统会从许多 episode 中识别出 Agent 自身做出的优秀记忆决策,并将其作为训练信号,直接提升模型的记忆熟练度。 在三个程序生成的长流程游戏(Crafter、MiniHack 和 NetHack)中,仅通过优化记忆——而不修改模型的任务动作行为——就将基线 Agent 的性能提升了约 2 到 4 倍,使得一个 32B 参数的开源模型能够具备与 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 等前沿系统相媲美的竞争力。我们的结果表明,记忆管理是一项可以独立学习的技能,也是一个能够在长流程任务中带来巨大收益的高杠杆目标。 原文链接:https://arxiv.org/abs/2607.01224 前往小宇宙评论区与主播互动

  • Monday · 19 min

    【第694期】SkillComposer:大语言模型智能体的生成式技能组合方案

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Generative Skill Composition for LLM Agents Summary 近期的大语言模型 Agent(LLM agents)得益于技能(Skills)来解决复杂任务。技能封装了执行特定任务(例如搭建沙箱环境、运行测试套件或跨多个文件重构函数)的模块化程序性知识与指令包。随着技能库不断扩大并在不同任务和领域间得以复用,选择合适的技能组合(skill composition)已成为核心瓶颈。 现有方法主要分为两类:一类是将 Agent 的推理完全暴露给整个技能集;另一类是通过嵌入向量(embeddings)或基于 LLM 的重排序器(rerankers)来进行技能检索。这两类方法虽然都提供了有价值的见解,但它们忽略了技能组合的结构化特性——这是一种关于“选用哪些技能、使用多少个以及以何种顺序执行”的联合决策,而这三个维度是无法解耦的。 我们将此形式化为结构化技能组合(structured skill composition):给定一项任务和一个技能库,预测出一个可执行的技能计划,该计划联合指定了激活的子集、数量和执行顺序。 我们提出了 SkillComposer,它将结构化技能组合实例化为基于任务条件的技能序列预测。SkillComposer 在技能标识符(skill identifiers)上使用受约束的自回归解码器,从而使子集、数量和顺序在单次解码过程中共同产生,并且顺次发生的技能之间的依赖关系能够被自然地捕获。 我们从真实的人工整理技能库中构建了一个“任务-组合”对的训练集。随后,我们从两个维度对 SkillComposer 进行了评估:留出测试集上的组合质量,以及在 SkillsBench 上跨两个生产级编程 Agent 的下游任务成功率。在 GPT-5.2-Codex 和 Gemini-3-Pro-Preview 上,SkillComposer 相较于无技能基线(no-skill baseline)将通过率分别提升了 +23.1 和 +18.2 个百分点,不仅超越了 Top-3 检索,还在更低的 Prompt Token 成本下达到了黄金技能检索(gold-skill retrieval)的性能上限。 原文链接:https://arxiv.org/abs/2606.32025 前往小宇宙评论区与主播互动

  • Sunday · 20 min

    【第693期】Google论文助手:迈向自动化科学评审之路

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Towards Automating Scientific Review with Google’s Paper Assistant Tool Summary 人工智能正推动着科学发现领域的一场变革,从假设生成到数学定理证明,全方位加速着科研进程。然而,这种飞速的提速正引发一项系统性挑战:传统的人类同行评审规模难以跟上 AI 辅助科学成果的爆炸式增长。归根结底,要化解这一紧张局势,我们必须同样部署 AI 来加速验证和评审过程本身。为了围绕这一转型展开探讨,我们提出了一个包含四个渐进层级的分类法,用于划分 AI 与人类在科学评估中的协作关系,并讨论了每个层级涉及的各种权衡。 作为迈向这一未来的一步,我们推出了“论文助手工具”(Paper Assistant Tool, PAT),这是一个专为深度科学评审与验证而构建的 Agent 式 AI 框架。PAT 可以摄入整篇科学手稿并生成综合评估,包括检查理论结果、验证实验、提出改进建议以及识别潜在缺陷。通过运用推理扩展技术(inference scaling techniques),PAT 能够比单次模型调用发现更深层次的问题,在 SPOT 基准测试的数学错误识别上相比零样本(zero-shot)召回率提升了 34%。PAT 在两大计算机科学顶级会议——STOC 和 ICML——被作为作者提交前(pre-submission)工具进行了试点部署,结果表明它具备识别关键错误并对研究论文提出实质性改进建议的能力。通过尽早捕抓错误,PAT 减轻了审稿人的认知负担,同时保留了他们对评审最终结果的控制权。 原文链接:https://arxiv.org/abs/2606.28277 前往小宇宙评论区与主播互动

  • August 22 · 17 min

    【第692期】验证之境:编程智能体的演进与协同

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: The Verification Horizon: No Silver Bullet for Coding Agent Rewards Summary 经典的直觉认为,验证一个解法要比生成一个解法更容易。然而对于当下的编程 Agent 而言,这一直觉正在被颠覆:随着基础模型具备更强的推理能力,以及工程框架(harnesses)变得日益精密,生成复杂的候选解法已不再困难——可靠地验证它们反而成了更棘手的问题。 我们所能构建的每一个验证器都只是人类意图的替代品(proxy),而非意图本身。这使得验证面临着双重困境:首先,意图在本质上是不明确的(underspecified),这使得忠实地检查意图是否得到满足变得天然困难;其次,在模型训练期间,优化过程会扩大替代品与意图之间的差距——表现为奖励破解(reward hacking)或信号饱和(signal saturation)。 为了解决这一问题,我们从三个维度刻画了验证信号的质量——可扩展性(scalability)、忠实度(faithfulness)和鲁棒性(robustness),并提出同时实现这三者是当前的核心挑战。我们进一步研究了四种奖励构造:用于通用编程任务的测试验证器(test verifier)、用于前端任务的量规验证器(rubric verifier)、用于真实世界 Agent 任务的“用户即验证器”(user as verifier),以及用于长流程任务的自动化 Agent 验证器(automated agent verifier)。针对不同的任务类型和策略能力水平,我们就奖励设计的核心挑战以及如何更有效地利用奖励信号进行了深入的分析与实验。 实验表明,有针对性的验证设计能够有效抑制奖励破解,提升任务完成质量,并在多个内部及公开基准测试中取得显著收益。这些实践共同指向了一个核心观察:随着策略能力的持续增长,没有任何固定的奖励函数能够保持有效;验证机制必须与生成器协同演化(co-evolve)。 原文链接:https://arxiv.org/abs/2606.26300 前往小宇宙评论区与主播互动

  • August 21 · 20 min

    【第691期】MCP服务器架构模式

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: MCP Server Architecture Patterns for LLM-Integrated Applications Summary 模型上下文协议(Model Context Protocol,简称 MCP)由 Anthropic 于 2024 年 11 月推出,它定义了一个标准化接口,用于将大型语言模型(LLM)连接到外部工具、数据源和服务。在发布后的几个月内,GitHub 上就涌现出了数百个由社区构建的 MCP 服务器,但目前尚无软件维护方面的文献对该生态系统在生产环境中的构建方式进行过描述。本篇行业经验论文对通过枚举包含 15 个独立开发的服务器(包括来自 ANSYR 语音 AI 平台的 5 个生产服务器,以及来自官方 MCP 注册表的 10 个公共服务器)组成的语料库所观察到的五种循环出现的 MCP 服务器架构模式进行了分类编目:资源网关(Resource Gateway)、工具编排器(Tool Orchestrator)、有状态会话服务器(Stateful Session Server)、代理聚合器(Proxy Aggregator)和特定领域适配器(Domain-Specific Adapter)。每种模式都采用了 Gamma 等人(设计模式“四人帮”)的结构化形式进行描述:上下文、问题、解决方案以及后果。我们还记录了四种反模式(anti-patterns),以及围绕身份验证、版本控制和可观测性的一系列横切关注点(cross-cutting concerns)。定量评估贡献了三项测量结果:跨两个独立 LLM 评估员在 54 个留出(held-out)服务器上针对该分类法算出的评分者间一致性(Cohen's kappa = 0.76),这也定位出了三种模式边界的歧义性;在环回(loopback)路径上实测并针对跨主机路径建模的端到端传输开销;以及一项工具数量研究,结果显示对于 Claude Haiku 4.5,当每个上下文包含 10 到 15 个工具时,工具选择准确率会降至 90% 以下,而对于 Sonnet 4,该临界值在 20 到 30 个工具之间。代码、语料库和提示词已作为复现包发布。 原文链接:https://arxiv.org/abs/2606.30317 前往小宇宙评论区与主播互动

  • August 20 · 17 min

    【第690期】红皇后哥德尔机:共进化代理与评估器

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators Summary 自我提升 Agent(Self-improving agents)在 Agent 编程基准测试中达到了 SOTA(当前最佳水平),并且最近已被扩展到通用领域。然而,它们的搜索方法通常假设一个静态的评估标准:一个固定的验证器、基准测试或标注数据集,并且在 Agent 提升的过程中始终有效。这忽视了演化的一个核心特征:物种会随着环境的改变而发生适应性变化。我们的目标是将相同的原则引入递归自我提升中,将评估纳入提升循环,并向不断演化的评估器、对抗性目标和可能超越静态基准的动态效用函数(dynamic utilities)开放搜索。 我们提出了红皇后哥德尔机(Red Queen Gödel Machine, RQGM),这是一个在非静态效用函数下实现递归自我提升的演化框架。RQGM 通过受控的效用函数演化使这成为可能:搜索被划分为多个 epoch,每个 epoch 内部保持固定的评估标准,而在 epoch 的边界处可以更新效用函数;因此,随着目标跨 epoch 演化,每个 epoch 内部依然能够保持自我提升的保证。 我们首先表明,即使在可验证的编程任务上,RQGM 通过引入互补的“Agent 即裁判”(agent-as-a-judge)代码审查信号,相较于先前的 SOTA 提高了测试通过率。该信号的成本更低,且 RQGM 消耗的 Token 减少了 1.35 倍至 1.72 倍。随后,我们转向科学论文撰写与评审,以及奥林匹克级别的定理证明与批改任务,在这些领域中,RQGM 相比先前的自我提升 Agent 均取得了性能提升:共同演化(co-evolved)的论文撰写者在多元化的“Agent 即裁判”评审团下取得了 1.78 倍至 1.86 倍更高的接受率,而共同演化的批改者在真实标准(ground-truth)上的准确率提升了 9%。在论文评审中,最强的基线评审员对 AI 生成论文的过高接受率可达人类论文的 1.91 倍。RQGM 通过引入对抗性目标纠正了这一现象,从而发现了对 AI 和人类作品保持同等严苛程度的评审员。 原文链接:https://arxiv.org/abs/2606.26294 前往小宇宙评论区与主播互动

  • August 19 · 26 min

    【第689期】[Ledger]去中心化交易所的演变:机遇、风险与监管策略

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: The Evolution of Decentralized Exchanges: Promise, Peril, and Policy Changes Summary 去中心化交易所(DEX)给监管和投资者保护带来了挑战;尽管如此,它们也为去中介化和透明度提供了诸多机遇。本文探讨了 DEX 的过去与现状,并指出监管机构应当认识到它们的风险与前景,采取兼顾灵活性与投资者保护的监管策略。 原文链接:https://ledgerjournal.org/ojs/ledger/article/view/613 前往小宇宙评论区与主播互动

  • August 18 · 14 min

    【第688期】Skill-MAS:多智能体系统的元技能进化框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Skill-MAS: Evolving Meta-Skill for Automatic Multi-Agent Systems Summary 基于大语言模型(LLM)的自动多智能体系统(MAS)生成已成为解决复杂任务的重要前沿方向。然而,现有的方法在“模型能力”与“经验保留”之间面临着两难困境:推理阶段 MAS 利用了冻结的顶尖 LLM,但因无法从过去经验中学习而导致重复相同的搜索;相反,训练阶段 MAS 通过梯度更新内化经验,却受限于较小模型较低的能力上限,且难以扩展至大型顶尖 LLM。为弥合这一差距,我们提出了 Skill-MAS,这是一种全新的“第三条路径”——它将高层级编排能力概念化为一种可进化的元技能(Meta-Skill),从而将经验保留与参数更新解耦。Skill-MAS 通过闭环优化机制来提炼该架构知识:(1) 多轨迹采样(Multi-Trajectory Rollout):在当前元技能下,针对每个任务采样行为分布;(2) 选择性反思(Selective Reflection):自适应选择高优先级任务,并运用分层对比分析将系统性经验提炼为通用的策略级原则。在 4 个复杂基准测试和 4 个不同 LLM 上的广泛实验表明,Skill-MAS 不仅取得了显著的性能提升,还保持了极佳的性价比。进一步的分析表明,进化出的元技能具有极高的鲁棒性,并在未见过的任务及不同的 LLM 之间展现出强大的可迁移性。 原文链接:https://arxiv.org/abs/2606.18837 前往小宇宙评论区与主播互动

  • August 17 · 22 min

    【第687期】自我对弈强化学习:30分钟数据教AI像人开车

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Human-like autonomy emerges from self-play and a pinch of human data Summary 自我对弈强化学习(Self-play reinforcement learning)近期成为一种无需任何人类数据即可训练驾驶策略的新方法。它利用低成本、大规模的仿真模拟来替代昂贵且大规模的人类驾驶演示。然而,该方法存在一个关键局限:通过纯自我对弈训练出的策略可能会学到有效但异类(alien)的驾驶习惯,与人类的习惯互不兼容。先前的研究尝试通过大量的奖励工程(reward engineering)和领域随机化(domain randomization)来缓解这种行为上的不对齐,但这些做法往往脆弱且耗费人力。 与完全抛弃人类演示不同,我们的方法将人类演示作为一种正则化目标,叠在极简的安全目标达成的奖励之上。正如好汤中的调味香料,我们发现少许人类数据就能起到极大的作用:我们的方法仅使用了 30 分钟的人类演示,比同类模仿学习方法减少了 2500 倍的数据量。由此产生的策略能够与未参与训练的人类轨迹达成协调,且在单块消费级 GPU 上仅需 15 小时即可完成训练。 原文链接:https://arxiv.org/abs/2606.19370 前往小宇宙评论区与主播互动

  • August 16 · 21 min

    【第686期】大语言模型智能体通信协议技术分类

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: A Technical Taxonomy of LLM Agent Communication Protocols Summary 随着大语言模型(LLM)的发展,以及多智能体系统(multi-agent systems)致力于突破单体智能体的局限,稳健的通信协议正在成为分布式智能体网络不可或缺的基础设施。然而,碎片化的协议格局带来了显著的互操作性挑战。本研究建立了一个技术分类法(taxonomy),用以分类和分析 LLM 智能体通信协议。遵循成熟的迭代方法,我们定义了该分类法的目标、元特征及终止条件,随后对 9 个活跃维护且具备明确应用案例的开源协议开展了 5 轮迭代(3 轮由经验到概念,2 轮由概念到经验)。该分类法包含 5 个维度:对手方(counterparty)、有效载荷(payload)、交互状态(interaction state)、发现机制(discovery mechanism)以及架构模式/模式灵活性(schema flexibility)。分类结果揭示了屡次出现的架构模式:所有抽样的智能体对智能体(agent-to-agent)协议均结合了混合有效载荷与会话状态持久化;大多数协议支持多种预定义模式(schema),其中两个协议支持运行时模式协商,这表明协议正在走向模式灵活性;去中心化的发现机制依然罕见。分析表明,短期内存在将智能体对智能体通信与智能体对上下文(工具和数据)通信进行统一的协议收敛压力。然而从长期来看,没有任何单一协议能够同时实现通用性、效率和便携性的最大化。该领域更有可能演进为一个联邦化、分层的协议栈。该框架为协议选择提供了指导,并突出了隐私保护和策略执行等尚存的研究空白。 原文链接:https://arxiv.org/abs/2606.19135 前往小宇宙评论区与主播互动

  • August 15 · 24 min

    【第685期】Agent-as-a-Router:编程任务的智能模型路由框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Agent-as-a-Router: Agentic Model Routing for Coding Tasks Summary 在现实场景中,用户通常可以接入来自不同供应商的多个大语言模型(LLM),且这些 LLM 往往在不同的领域各有所长,但没有单个模型能够独霸所有领域。因此,将每个任务路由至最合适的模型,对于提升性能和控制成本均至关重要。 现有的路由器将该问题视为一种静态的、一次性的分类问题。然而,我们发现这些路由器的性能瓶颈在于信息匮乏:仅仅为原生 LLM 路由器补充任务维度层面的性能统计数据,就能带来 15.3% 的相对收益,超越基于同等维度先验构建的启发式路由方式。 受此发现启发,我们提出了 Agent-as-a-Router 框架,将路由过程形式化为一个 C-A-F 循环(上下文 Context →行动 Action → 反馈 Feedback → 上下文 Context)。该框架通过在部署期间不断积累基于执行实践的经验,填补了信息鸿沟。 我们将该框架实例化为 ACRouter(由协调器 Orchestrator、验证器 Verifier 和记忆模块 Memory 组成),并推出了 CodeRouterBench 评估环境——该环境包含约 1 万个任务实例,并附带来自 8 个前沿 LLM 的验证得分,从而支持在流式任务上进行基于“后悔值”(regret-based)的路由器对比。 实验表明,ACRouter 在域内(in-distribution)任务上取得了最低的累计后悔值,并且能够泛化至域外的具主体性编程(agentic-programming)任务,证明了我们的路由框架能够主动弥合信息差。 原文链接:https://arxiv.org/abs/2606.22902 前往小宇宙评论区与主播互动

  • August 14 · 17 min

    【第684期】Autodata:以智能体模拟数据科学家构建高质量合成数据

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Autodata: An agentic data scientist to create high quality synthetic data Summary 我们推出了 Autodata,这是一种能够让 AI 智能体充当“数据科学家”来构建高质量训练和评估数据的通用方法。我们展示了如何训练(元优化,meta-optimize)这样一个数据科学家智能体,使其学会创建质量更高的数据。 我们阐述了其整体公式设计,以及一个具体的实用实现方案——Agentic Self-Instruct。我们在计算机科学研究任务、法律推理任务以及数学对象推理任务上进行了实验,与传统合成数据集创建方法相比,我们取得了更优异的结果。此外,对数据科学家智能体本身进行元优化,带来了更为显著的性能提升。 具主体性的数据创建(Agentic data creation)提供了一种将增加的推理算力转化为更高质量模型训练的途径。总体而言,我们相信这一方向有望改变我们构建 AI 数据的方式。 原文链接:https://arxiv.org/abs/2606.25996 前往小宇宙评论区与主播互动

  • August 13 · 16 min

    【第683期】Agent-Native Memory System的现状与评估综述

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Are We Ready For An Agent-Native Memory System? Summary 大语言模型(LLM)智能体的记忆系统已迅速从简单的检索增强机制,演变为能够在智能体执行过程中支持持久化信息存储、检索、更新、整合以及动态生命周期管理的数据管理系统。尽管有了这样的演进,现有评估仍主要通过端到端任务成功率指标(例如 F1、BLEU)来对智能体记忆进行基准测试,同时将底层系统视为一个单体黑盒。因此,包括运营成本、跨记忆模块的架构权衡以及在动态知识更新下的鲁棒性等关键系统层面的关切,依然缺乏充分探讨。 在本文中,我们从数据管理的视角对智能体记忆进行了系统的实验研究。我们提出了一个分析框架,将智能体记忆拆解为四个核心模块: 记忆表示与存储(memory representation and storage) 抽取(extraction) 检索与路由(retrieval and routing) 维护(maintenance) 在该框架下,我们在涵盖 11 个数据集的 5 个基准工作负载上,评估了 12 个具有代表性的记忆系统和 2 个参考基准(baselines)。 我们广泛的端到端评估表明,没有任何单一架构能在所有场景中占据绝对主导地位;相反,其有效性在很大程度上取决于记忆结构与工作负载瓶颈的匹配程度。此外,通过细粒度的消融实验,我们量化了各模块对表示忠实度、检索精确度、更新正确性以及长程稳定性的具体影响。 最后,我们揭示了在现实工作负载下的成本与性能权衡,表明局部维护比全局重组具有更高的成本效益。基于这些发现,我们指出了构建真正“智能体原生”(agent-native)记忆系统的前景方向。 原文链接:https://arxiv.org/abs/2606.24775 前往小宇宙评论区与主播互动

  • August 12 · 24 min

    【第682期】Sakana Fugu 技术报告:通过集体智能实现模型编排

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Sakana Fugu Technical Report Summary 前沿大语言模型(LLM)的能力持续提升,不同的提供商也日益在各自的领域形成独特优势。这自然引出了下一个目标:如何将各个 LLM 的独特专长整合为一个协同智能系统。为此,我们报告了 Sakana Fugu 的研发进展——这是一个协调器(orchestrator)模型家族,旨在驾驭并放大 LLM 智能体团队的能力。 Fugu 模型本身也是语言模型,经过专门训练后,能够理解用户查询并动态设计“具主体性”(agentic)的支架来解决问题。通过这些自适应支架,Fugu 释放出了超越任何单一 LLM 智能体的高强性能,在一系列极具挑战性的任务中(包括 SWE-Bench Pro、Terminal Bench、LiveCodeBench、GPQA-Diamond、Humanity's Last Exam 以及 CharXiv Reasoning),相较于其他公开可用的模型取得了最前沿(SOTA)的成果。 我们发布了两款模型: Fugu:兼顾性能与延迟,适合日常使用; Fugu-Ultra:在极高难度的任务上优先保证回答质量。 我们详细阐述了自身的训练范式——涵盖大规模微调、进化算法与强化学习方法,以及将这些方法转化为生产级系统的基础设施和核心设计原则。我们希望本报告能够推动对多智能体系统以及“动态/查询自适应”智能体支架的进一步研究,将其作为通过群体智能迈向 AI 能力下一前沿的有效路径。 原文链接:https://arxiv.org/abs/2606.21228 前往小宇宙评论区与主播互动

  • August 11 · 17 min

    【第681期】Critique of Agent Model:从代理系统到自主主体的演进

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Critique of Agent Model Summary 什么是智能体(Agent)?什么构成了主体性(Agency)?随着被营销为“编程智能体”、“AI联合科学家”以及其他承诺能大幅提升生产力的“具主体性”(agentic)工具的崛起,与此同时,关于AI可能在推测性的“机器主体性”驱使下摆脱人类控制并施加破坏性力量等“生存级”担忧也日益增长。在此背景下,无论对于构建能力强大的系统,还是对于理解我们是否以及该恐惧什么,明确自动化在哪里终结、主体性从哪里开始,都已变得至关重要。 借鉴笛卡尔将主体性建立在独立思考之上的观点,以及科幻小说中对自主存在的描绘,我们综述了当前AI智能体的现状,并从五个维度分析了智能体架构:目标(goal)、身份(identity)、决策(decision-making)、自我调节(self-regulation)和学习(learning)。 具体而言,我们认为真正的主体性要求这些结构内化于系统本身内部,而非通过外部支架搭建而成。这种在“代理型”(agentic)系统(其能力依赖于工程化的工作流)与“主体型”(agentive)系统(其能力包括社交互动,均源于内生)之间的区分,划清了专为预设任务设计的系统与能够在开放世界中以真正自主性运行的系统之间的界限。 基于这一分析,我们提出了一种用于通用智能体模型的“目标-身份-配置器”(Goal-Identity-Configurator, GIC)架构,它结合了层级化目标分解、身份演化、基于独立训练的世界模型的模拟推理、习得性自我调节,以及来自真实与模拟经验的自主学习。 此外,我们还就拥有更高自主性和“主体性”但仍处于人类监督之下的主体型系统的可审计性、可控性和安全性分享了见解。 原文链接:https://arxiv.org/abs/2606.23991 前往小宇宙评论区与主播互动

  • August 10 · 17 min

    【第680期】世界价值模型:机器人操纵的通用价值评估

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: World Value Models for Robotic Manipulation Summary 通用价值模型(Generalist value models)在从大规模、质量混合的数据中扩展机器人策略学习方面发挥着关键作用。从数学角度来看,准确的价值估计需要深刻的时序理解,这要求模型既能利用历史上下文来锚定当前信念,又能对未来结果进行规划。 然而,大多数现有的机器人价值模型都是基于视觉语言模型(VLM)底座构建的,这些底座主要在静态或时序稀疏的视觉观测数据上进行预训练,缺乏价值估计所需的时序建模能力。与 VLM 不同,世界模型(world models)天然擅长时序建模与未来规划,这使其成为学习具备泛化能力的价值函数的理想基础。 基于这一洞察,我们将世界模型与价值估计相结合,构建了一种全新的机器人通用价值模型——世界价值模型(World Value Model,简称 WVM),能够提供准确的任务进度预测以评估数据质量。 在标准基准测试中,WVM 取得了最先进的(SOTA)价值顺序相关性(VOC)结果。除了仅包含专家数据的标准评估套件外,我们还推出了 Suboptimal-Value-Bench,这是一个多具身(multi-embodiment)基准测试,由 800 条包含高保真、人工标注帧标签的次优轨迹组成。评估表明,WVM 在 Suboptimal-Value-Bench 上依然保持了 SOTA 性能,证实了其在处理专家数据和次优数据时的鲁棒性。 当应用于策略学习时,无论在模拟环境还是真实世界的部署中,WVM 都提升了各种策略提取方法的操纵性能,为从混合质量的数据中进行学习提供了稳健的指导。 原文链接:https://arxiv.org/abs/2606.24742 前往小宇宙评论区与主播互动

  • August 9 · 19 min

    【第679期】PAPO:对齐扩散大语言模型推理的奖励与状态

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models Summary 强化学习(RL)在提升扩散大语言模型(dLLM)的推理能力方面蕴含着巨大的潜力。然而,这一领域的进展从根本上受到了真实生成轨迹与梯度更新过程之间“双重错位”(dual misalignment)的限制: 过程-奖励错位(Process-reward misalignment):稀疏的终局奖励被无差别地赋予给生成过程的所有中间步骤,无法提供区分度高的信用分配(credit assignment)。 状态-轨迹错位(State-trajectory misalignment):策略更新往往偏离至人造的、脱离轨迹的状态,将梯度浪费在信息量较低的样本上。 为了解决这些局限,我们提出了过程对齐策略优化(Process Aligned Policy Optimization,简称 PAPO)。这是一个全新的框架,通过两大机制将 RL 更新与 dLLM 的生成轨迹进行整体对齐: 步骤感知过程奖励(Step-Aware Process Rewards,简称 SPR):将稀疏的终局奖励转化为密集的步骤级信用; 熵引导历史重演(Entropy-Guided Historical Re-enactment,简称 EHR):在高不确定性步骤下重演真实轨迹。 在四个基准测试上的大量实验表明,PAPO 显著优于基线方法,在 GSM8K 上实现了高达 4.5% 的提升, MATH500 上提升 4.8%, Countdown 上提升 42.2%, 数独(Sudoku)上提升 16.1%。 原文链接:https://arxiv.org/abs/2606.08501 前往小宇宙评论区与主播互动

Showing 1–20 of 35 episodes