DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning
提出解耦的视频-动作架构,引入物理引导以增强对场景演变的预测能力。相比静态预训练目标,该方法提升了策略在动态环境中的泛化性,为VLA时序建模提供了新视角。
提出解耦的视频-动作架构,引入物理引导以增强对场景演变的预测能力。相比静态预训练目标,该方法提升了策略在动态环境中的泛化性,为VLA时序建模提供了新视角。
针对VLA推理延迟高的问题,提出运动感知的矢量量化框架及质心复用机制。显著降低GPU显存占用与计算冗余,为边缘端实时部署VLA模型提供了可复用的工程优化方案。
Haoyu Zhang et al. · 提出因果感知的测试时模态适应框架,通过推断-诊断- refine循环解决多模态融合难题。该方法无需重新训练即可提升VLA在分布外数据上的鲁棒性,具有明确的即插即用价值。
Simple AI et al. · 探索仅使用高保真UMI(无真实机器人)数据训练可部署策略的方法,解决真实数据采集成本高的问题。为VLA数据合成与Sim-to-Real迁移提供了新的数据利用路径和实验基准。
Zonghe Liu et al. · 利用SAM3D引导VLA模型进行以物体为中心的表示对齐,增强对遮挡和姿态变化的3D理解能力。通过引入细粒度3D先验,直接提升了VLA在复杂视觉场景下的操作精度。
Chenyang Ma et al. · 引入子任务回溯和最小贝叶斯风险解码,赋予VLA模型主动自我修正能力。解决了传统VLA错误累积问题,提供了可复用的推理阶段纠错机制,显著提升长视界任务成功率。
Jiarun Zhu et al. · 系统评估VLA模型在真实世界数据上的持续学习能力,分析灾难性遗忘问题。提供了关于VLA在线更新和数据回放策略的关键洞见,对部署实践具有重要指导意义。
Chuanke Pang et al. · 提出意图条件的臂手协调机制,解决VLA并行夹爪接口无法直接控制灵巧手的问题。通过解耦高层意图与底层执行,显著提升了VLA在灵巧操作任务中的适用性和性能。
Minhyeok Lee et al. · 通过思维链蒸馏技术,将大型VLA模型压缩至十亿参数以下,同时保持LIBERO-Plus基准上的鲁棒性。为资源受限设备上的VLA部署提供了高效、可复用的轻量化解决方案。
Yizhou Chen et al. · 结合符号规划(TAMP)与视觉运动策略,通过原语分解解决长视界操作难题。虽涉及VLA相关概念,但核心贡献在于分层规划框架,缺乏明确的端到端VLA架构创新或大规模基准对比。
Liyun Yan et al. · 解决VAE随机潜在空间与PPO策略优化之间的不匹配问题,提出概率策略传播方法。主要贡献在于强化学习稳定性改进,虽适用于机器人,但未直接针对VLA架构或语言条件进行优化。
Tao Wang et al. · 探讨硬件升级后遗留演示数据的迁移价值,分析跨配置学习的涌现现象。属于数据效率与迁移学习的实证研究,虽对VLA数据构建有启发,但非方法论层面的直接创新。
James Zhao et al. · 针对三臂系统提出视觉运动模仿学习方法,突破双臂遥操作的数据收集限制。专注于特定硬件构型的控制策略,缺乏通用VLA模型的架构贡献或广泛基准验证。
Kaneyoshi Hiratsuka et al. · 引入听觉空间信息辅助视觉模仿学习,拓展了多模态输入维度。虽具创新性,但主要聚焦于声学线索的利用,未深入探讨其在主流VLA架构中的通用集成方式或大规模基准表现。
Tim R. Winter et al. · 提出基于不确定性感知的上下文自适应策略框架,增强操作的鲁棒性。属于传统模仿学习的改进,缺乏与VLA语言-视觉-动作范式的深度结合或最新基准验证。
Yufeng Jin et al. · 旨在简化机器人学习工程的碎片化问题,提供提示驱动的插件式学习框架。侧重于工程基础设施和接口标准化,而非VLA核心算法或模型架构的创新。
Dayu Xia et al. · 发布RoboProcessBench基准,评估VLM在操作过程中的过程感知能力。作为数据集/基准论文,虽重要但不紧急,主要用于后续方法评估,本身不提供新的VLA架构或训练范式。
Soumil Rathi · 提出RoboMME-Interference基准,专门测试机器人在干扰下的长期记忆能力。属于评估工具类工作,填补了VLA记忆鲁棒性评估的空白,但非方法学创新。
Jinbang Huang et al. · 提出基于记忆的异构策略编排框架,用于长视界规划。虽涉及VLA应用,但核心在于策略调度与记忆管理,属于上层控制系统,未触及VLA底层表征或动作生成的根本改进。
Joel Currie et al. · 探讨通过空间接地合成世界训练VLM实现具身认知(如视觉观点采择)。偏向认知科学与仿真环境构建,距离具体的VLA操作策略学习尚有距离,且缺乏真实机器人验证。
Junhan Sun et al. · 提出无搜索的世界模型JEPA架构,实现从意图到动作的同构学习。虽与VLA有重叠,但更侧重世界模型的理论构建,未明确展示其在标准VLA操作基准上的SOTA性能或架构整合。
Jiaxin Bai et al. · 将代码世界模型作为潜在结构化表示用于规划,探索世界模型的新形式。属于基础表示学习研究,与VLA的直接应用路径尚不明确,缺乏针对操作任务的专项优化。
Jiaxin Bai et al. · 提出时间距离JEPA用于潜在世界模型预测控制,优化表示学习。主要贡献在于RL与世界模型的结合,未直接针对VLA的多模态对齐或动作生成进行创新。
Aditya Kamireddypalli et al. · 结合视觉-触觉信息进行不确定位姿估计,服务于接触丰富操作。虽属触觉VLA相邻方向,但核心是状态估计而非端到端策略学习,且依赖仿真推断,离通用VLA部署仍有距离。
Gaspard Lambrechts et al. · 提出非对称世界模型Dreamer变体,通过潜在引导提高训练效率。虽可用于机器人RL,但属于通用RL算法改进,未针对VLA架构或语言条件进行特异性优化。