
transcript
show notes
Show-Harness 是一种创新的机器人控制框架,旨在通过语义动作接口弥合高层视觉语言模型(VLM)与低层物理执行之间的鸿沟。该系统将复杂的机器人指令分解为离散且具有语义含义的动作单元(如前后移动或抓取),使模型能够以其原生理解的方式直接参与物理交互。通过这种方式,前沿大模型无需微调即可实现零样本部署,而轻量化开源模型则能通过极低成本的适配展现出卓越的泛化能力。此外,配套的 GUMI 接口统一了人类示教与智能体的数据采集过程,消除了对特殊硬件的依赖。实验证明,该方法在跨任务、跨环境及跨机器人形态的部署中显著优于传统的视觉-语言-动作(VLA)范式。