
transcript
show notes
这份技术文档介绍了 LingBot-Video,这是首个面向具身智能的大规模开源混合专家(MoE)视频生成模型。研究团队针对传统视频模型在物理真实性和计算效率上的不足,采用扩散转换器(DiT)架构结合稀疏 MoE 设计,实现了模型容量与推理成本的平衡。通过构建包含机器人操作和第一视角数据的增强型语料库,该模型能够更深刻地理解真实世界的动力学规律。此外,项目引入了多维奖励系统,在追求视觉美感的同时,重点强化了对物理合理性和任务达成度的对齐。实验证明,该架构在扩展至 1200亿参数时仍表现出优异的性能与效率,成功搭建了数字创作与物理动作执行之间的桥梁。