Skip to content
Artwork for Seventy3
Seventy3 · August 10 · 17 min

【第680期】世界价值模型:机器人操纵的通用价值评估

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: World Value Models for Robotic Manipulation Summary 通用价值模型(Generalist value models)在从大规模、质量混合的数据中扩展机器人策略学习方面发挥着关键作用。从数学角度来看,准确的价值估计需要深刻的时序理解,这要求模型既能利用历史上下文来锚定当前信念,又能对未来结果进行规划。 然而,大多数现有的机器人价值模型都是基于视觉语言模型(VLM)底座构建的,这些底座主要在静态或时序稀疏的视觉观测数据上进行预训练,缺乏价值估计所需的时序建模能力。与 VLM 不同,世界模型(world models)天然擅长时序建模与未来规划,这使其成为学习具备泛化能力的价值函数的理想基础。 基于这一洞察,我们将世界模型与价值估计相结合,构建了一种全新的机器人通用价值模型——世界价值模型(World Value Model,简称 WVM),能够提供准确的任务进度预测以评估数据质量。 在标准基准测试中,WVM 取得了最先进的(SOTA)价值顺序相关性(VOC)结果。除了仅包含专家数据的标准评估套件外,我们还推出了 Suboptimal-Value-Bench,这是一个多具身(multi-embodiment)基准测试,由 800 条包含高保真、人工标注帧标签的次优轨迹组成。评估表明,WVM 在 Suboptimal-Value-Bench 上依然保持了 SOTA 性能,证实了其在处理专家数据和次优数据时的鲁棒性。 当应用于策略学习时,无论在模拟环境还是真实世界的部署中,WVM 都提升了各种策略提取方法的操纵性能,为从混合质量的数据中进行学习提供了稳健的指导。 原文链接:https://arxiv.org/abs/2606.24742 前往小宇宙评论区与主播互动

0:00-17:51

transcript

No transcript — this publisher did not publish one.

show notes

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

World Value Models for Robotic Manipulation

Summary

通用价值模型(Generalist value models)在从大规模、质量混合的数据中扩展机器人策略学习方面发挥着关键作用。从数学角度来看,准确的价值估计需要深刻的时序理解,这要求模型既能利用历史上下文来锚定当前信念,又能对未来结果进行规划。

然而,大多数现有的机器人价值模型都是基于视觉语言模型(VLM)底座构建的,这些底座主要在静态或时序稀疏的视觉观测数据上进行预训练,缺乏价值估计所需的时序建模能力。与 VLM 不同,世界模型(world models)天然擅长时序建模与未来规划,这使其成为学习具备泛化能力的价值函数的理想基础。

基于这一洞察,我们将世界模型与价值估计相结合,构建了一种全新的机器人通用价值模型——世界价值模型(World Value Model,简称 WVM),能够提供准确的任务进度预测以评估数据质量。

在标准基准测试中,WVM 取得了最先进的(SOTA)价值顺序相关性(VOC)结果。除了仅包含专家数据的标准评估套件外,我们还推出了 Suboptimal-Value-Bench,这是一个多具身(multi-embodiment)基准测试,由 800 条包含高保真、人工标注帧标签的次优轨迹组成。评估表明,WVM 在 Suboptimal-Value-Bench 上依然保持了 SOTA 性能,证实了其在处理专家数据和次优数据时的鲁棒性。

当应用于策略学习时,无论在模拟环境还是真实世界的部署中,WVM 都提升了各种策略提取方法的操纵性能,为从混合质量的数据中进行学习提供了稳健的指导。

原文链接:https://arxiv.org/abs/2606.24742


前往小宇宙评论区与主播互动
links2