Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience
Raymond Yu et al. · 提出支持约束RL,利用离线数据改进策略而无需真实世界交互。解决了VLA部署中昂贵的在线训练瓶颈,方法可直接用于提升现有VLA策略的鲁棒性。
Raymond Yu et al. · 提出支持约束RL,利用离线数据改进策略而无需真实世界交互。解决了VLA部署中昂贵的在线训练瓶颈,方法可直接用于提升现有VLA策略的鲁棒性。
Shiang-Feng Tsai et al. · 通过在VLA动作头注入接地3D点,解决空间泛化难题。该方法简单有效,显著提升了物体位置变化下的操作成功率,代码易于集成到现有VLA架构。
Zhipeng Xie et al. · 引入状态空间引导机制缓解长程任务中的误差累积。针对VLA长程规划痛点提出具体改进,实验显示在LIBERO等基准上有显著提升,具有较高复用价值。
Sijin Chen et al. · 研究从人类动作到双臂机器人的技能迁移,利用廉价的人类数据扩展机器人学习。提供了新的数据利用范式,有助于解决机器人数据稀缺问题。
Peiwen Zhang et al. · 通过物理强化改进视频生成世界模型,解决模拟中物理不合理的问题。为VLA训练提供更逼真的仿真环境,直接提升Sim2Real迁移效果。
Zijun Lin et al. · 提出FailSafe机制,使VLA具备失败推理与恢复能力。增强了VLA在复杂场景下的鲁棒性,方法模块化强,可轻松嵌入现有VLA系统以提升安全性。
Shengliang Deng et al. · 通过引入立体视觉增强VLA的空间感知能力,解决单目RGB编码器的深度缺失问题。显著提升视点鲁棒性和精细操作性能,硬件改造成本低。
Tao Lin et al. · 探索仅通过语言-动作预训练实现VLA,减少对视觉监督的依赖。提出新的预训练范式,可能在视觉退化场景下具有独特优势,值得深入阅读。
Sarvesh Patil et al. · 提出OGPO算法,实现生成控制策略的高效全参数微调。显著提升样本效率,适用于Diffusion Policy等VLA动作解码器的优化,实用性强。
Dihong Huang et al. · 提出DexCompose方法,复用灵巧手策略进行多任务操作。解决单一手部执行多任务的冲突问题,为灵巧操作VLA提供模块化组合思路。
Guoheng Sun et al. · 分析VLA模型中语言骨干网络的冗余度,探讨压缩可能性。虽具工程价值,但主要贡献为诊断性分析而非新架构或性能突破,暂归为值得了解。
Ruiqi Song et al. · 将脉冲神经网络引入VLA以降低能耗和延迟。属于底层硬件适配方向,目前缺乏在主流VLA基准上的全面对比,应用路径尚不明确。
Yuxuan Yan et al. · 探讨多机器人系统与Agentic AI的结合,迈向具身集体智能。偏向概念框架与综述性质,缺乏具体的VLA算法创新或量化实验支撑。
Junwu Xiong et al. · 提出云原生仿真基础设施以支持大规模训练和数据收集。虽对领域重要,但属于工具/数据集类工作,非核心算法进展,故归为值得了解。
Fanqi Lin et al. · 探究模仿学习中的数据缩放定律。作为基础性研究,揭示了数据量与性能的关系,但对当前VLA架构的直接指导意义有限,属长期参考。
Wenbo Wang et al. · 提出移动操作验证基准MobileManiBench。填补了移动操作评估空白,但作为基准测试工具,本身不提供新算法,故归为值得了解。
Wei-Cheng Tseng et al. · 利用自一致视频生成评估机器人基础模型,提供低成本评估方案。虽具创新性,但主要贡献在于评估方法论,非模型本身改进。
Rongxu Cui et al. · 发布LIBERO-Safety基准,关注VLA的物理与语义安全。重要但非算法突破,旨在建立安全评估标准,供社区后续研究参考。
Jiaxin Li et al. · 通过人机协作从单目视频重建4D多物体交互。为VLA提供新的数据源,但侧重于计算机视觉重建技术,与VLA核心控制逻辑关联较弱。
Xinqing Li et al. · 具身AI世界模型综合综述。梳理领域现状,适合快速入门,但无原创性算法贡献,归为值得了解。
Xuan Zhang et al. · 提出统一Agentic训练范式以增强LLM代理的前瞻规划能力。虽涉及决策,但主要基于LLM推理,缺乏具身物理世界的闭环验证。
Haoyu Chen et al. · 提出MemoBench基准以评估动态环境中的世界模型记忆一致性。虽相关,但侧重视频生成评估,非直接VLA控制算法,归为值得了解。
Wanhee Lee et al. · 结合感知与物理建模进行3D场景演化预测。虽对仿真有用,但主要贡献在视觉/图形学,与VLA策略学习的直接联系不够紧密。