
transcript
show notes
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators
Summary
自我提升 Agent(Self-improving agents)在 Agent 编程基准测试中达到了 SOTA(当前最佳水平),并且最近已被扩展到通用领域。然而,它们的搜索方法通常假设一个静态的评估标准:一个固定的验证器、基准测试或标注数据集,并且在 Agent 提升的过程中始终有效。这忽视了演化的一个核心特征:物种会随着环境的改变而发生适应性变化。我们的目标是将相同的原则引入递归自我提升中,将评估纳入提升循环,并向不断演化的评估器、对抗性目标和可能超越静态基准的动态效用函数(dynamic utilities)开放搜索。
我们提出了红皇后哥德尔机(Red Queen Gödel Machine, RQGM),这是一个在非静态效用函数下实现递归自我提升的演化框架。RQGM 通过受控的效用函数演化使这成为可能:搜索被划分为多个 epoch,每个 epoch 内部保持固定的评估标准,而在 epoch 的边界处可以更新效用函数;因此,随着目标跨 epoch 演化,每个 epoch 内部依然能够保持自我提升的保证。
我们首先表明,即使在可验证的编程任务上,RQGM 通过引入互补的“Agent 即裁判”(agent-as-a-judge)代码审查信号,相较于先前的 SOTA 提高了测试通过率。该信号的成本更低,且 RQGM 消耗的 Token 减少了 1.35 倍至 1.72 倍。随后,我们转向科学论文撰写与评审,以及奥林匹克级别的定理证明与批改任务,在这些领域中,RQGM 相比先前的自我提升 Agent 均取得了性能提升:共同演化(co-evolved)的论文撰写者在多元化的“Agent 即裁判”评审团下取得了 1.78 倍至 1.86 倍更高的接受率,而共同演化的批改者在真实标准(ground-truth)上的准确率提升了 9%。在论文评审中,最强的基线评审员对 AI 生成论文的过高接受率可达人类论文的 1.91 倍。RQGM 通过引入对抗性目标纠正了这一现象,从而发现了对 AI 和人类作品保持同等严苛程度的评审员。
原文链接:https://arxiv.org/abs/2606.26294
前往小宇宙评论区与主播互动






