Skip to content
Artwork for 每日AI
每日AI · August 20 · 20 min

LingBot-Video:具身智能混合专家视频预训练模型 AI视频终于懂物理了

这份技术文档介绍了 LingBot-Video,这是首个面向具身智能的大规模开源混合专家(MoE)视频生成模型。研究团队针对传统视频模型在物理真实性和计算效率上的不足,采用扩散转换器(DiT)架构结合稀疏 MoE 设计,实现了模型容量与推理成本的平衡。通过构建包含机器人操作和第一视角数据的增强型语料库,该模型能够更深刻地理解真实世界的动力学规律。此外,项目引入了多维奖励系统,在追求视觉美感的同时,重点强化了对物理合理性和任务达成度的对齐。实验证明,该架构在扩展至 1200亿参数时仍表现出优异的性能与效率,成功搭建了数字创作与物理动作执行之间的桥梁。

0:00-20:05

transcript

No transcript — this publisher did not publish one.

show notes

这份技术文档介绍了 LingBot-Video,这是首个面向具身智能的大规模开源混合专家(MoE)视频生成模型。研究团队针对传统视频模型在物理真实性计算效率上的不足,采用扩散转换器(DiT)架构结合稀疏 MoE 设计,实现了模型容量与推理成本的平衡。通过构建包含机器人操作第一视角数据的增强型语料库,该模型能够更深刻地理解真实世界的动力学规律。此外,项目引入了多维奖励系统,在追求视觉美感的同时,重点强化了对物理合理性和任务达成度的对齐。实验证明,该架构在扩展至 1200亿参数时仍表现出优异的性能与效率,成功搭建了数字创作与物理动作执行之间的桥梁。