CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy
Ria Doshi et al. · 提出单一VLA策略驱动去中心化多具身协作,突破了VLA仅适用于单臂/单机器人的局限。在移动操作和多机器人协同这一核心瓶颈上实现了架构级创新,且由Chelsea Finn团队主导,潜力巨大。
Ria Doshi et al. · 提出单一VLA策略驱动去中心化多具身协作,突破了VLA仅适用于单臂/单机器人的局限。在移动操作和多机器人协同这一核心瓶颈上实现了架构级创新,且由Chelsea Finn团队主导,潜力巨大。
指出世界动作模型中视觉生成与动作控制的对齐问题,提出通过重利用表示对齐来改进。为使用视频生成作为世界模型的VLA提供了关键的训练/推理优化思路。
针对VLA同步时钟与物理交互频率不匹配的问题,提出解耦异步多模态架构。允许视觉、语言和触觉以不同频率处理,直接提升了高频操作(如触觉)的响应能力。
Yuchi Zhao et al. · 解决分块策略中固定执行步长的僵化问题,动态预测最佳执行 horizon。可直接应用于 RT-2/Diffusion Policy 等 VLA 推理阶段,提升长程任务稳定性。
Harsh Gupta et al. · 从非结构化人类视频中学习具身无关的意图模型,解决了数据稀缺和具身绑定问题。为VLA提供了新的低成本数据源和预训练范式,具有高度复用价值。
Siyu Ma et al. · 通过仿真将触觉反馈集成到VLA中,填补了主流VLA缺乏接触感知的空白。提供了具体的Sim2Real路径,是触觉VLA方向的可操作级进展。
Chuanke Pang et al. · 通过意图条件微调将低自由度VLA适配至灵巧手,解决了形态差异导致的迁移难题。为现有VLA模型扩展至复杂末端执行器提供了明确的技术路径。
Hyun Joe Jeong et al. · 研究如何通过提示词引导(Steering)修正VLA的脆弱行为,提升指令遵循的鲁棒性。为VLA部署中的安全控制和人机交互提供了实用的调试工具。
Kechun Xu et al. · 通过动作专家预训练提升VLA对OOD指令的泛化能力。针对VLA语言理解与动作执行脱节的问题,提供了有效的模块化训练方案,易于复现和应用。
Zefu Lin et al. · 利用世界-动作先验引导VLA,弥补静态图文预训练的不足。为VLA引入动态物理常识提供了新的推理约束机制,有助于提升真实场景下的物理合理性。
Hanxin Zhang et al. · 通过因果干预分析VLA的视觉-动作归因,揭示泛化失败的根源。为理解黑盒VLA提供了可解释性工具,有助于诊断和改进模型偏差。
Pei Yang et al. · 提出体素动作热力图作为VLA的动作解码器,替代传统的连续回归。为3D空间中的精确操作提供了更直观且可能更稳定的输出形式,具有工程复用价值。
Yuan Zhang et al. · 引入几何感知动作表示以解决VLA在未见物体和背景下的泛化问题。通过增强3D几何理解来提升操作鲁棒性,是对现有VLA架构的有效补充。
Huaihang Zheng et al. · 结合触觉引导的在线RL对VLA进行精调,解决接触丰富任务中的离线数据分布偏移问题。为VLA在真实物理交互中的自适应提供了可行方案。
提出从次优数据中学习的方法,虽对数据效率有贡献,但主要聚焦于扩散策略的通用改进,未明确结合VLA架构或语言指令泛化,属于相邻领域的重要工作。
Yifu Yuan et al. · 声称整合认知、规划等能力的统一基础模型,但摘要缺乏具体架构创新和量化对比细节,且“R1.5”命名易混淆,需正文验证其是否超越现有SOTA或仅为工程堆叠。
Changyi Lin et al. · 专注于压阻式触觉传感器的硬件设计与可重复性制造,虽对触觉VLA至关重要,但属于传感器硬件层创新,非算法或模型架构层面的VLA进展。
Tongle Shen et al. · 利用对比强化学习从零开始学习物体操作,侧重于底层动力学表征。虽有用,但未涉及语言指令或高层语义对齐,属于传统机器人学习范畴。
Shengcheng Luo et al. · 专注于纯触觉盲抓策略的Sim2Real学习,虽涉及灵巧手,但未结合视觉-语言大模型,属于专用策略而非通用VLA架构,归为值得了解。
Tobias Jülg et al. · 发布双臂操作基准测试集,包含仿真和真机数据。作为基础设施重要,但本身无新算法,归类为数据集/基准类论文。
Song Chen et al. · 结合视频生成和上下文网络进行泛化操作,方法较为新颖但摘要未展示在LIBERO/CALVIN等核心VLA基准上的显著优势,暂归为值得了解。
Haoyuan Deng et al. · 提出代理干预机制优化在线RL效率,虽与VLA精调相关,但更偏向于通用RL框架优化,未深入探讨VLA特有的多模态对齐挑战。
Jadelynn Dao et al. · 研究具身规划器中测试时计算资源的分配策略,关注推理效率而非模型架构或核心性能突破,属于工程优化类工作。
Balázs Gyenes et al. · 利用傅里叶特征提升模仿学习的空间精度,主要解决RGB深度歧义问题。虽有效,但属于底层特征工程,未触及VLA的核心语义-动作映射瓶颈。
Jan Ole von Hartz et al. · 提出混合离散时间高斯过程用于策略学习,强调小样本效率。方法经典但新颖组合,未结合VLA大模型背景,归为相邻领域的理论进展。
Rickmer Krohn et al. · 针对接触丰富任务的自监督多感官预训练,虽涉及触觉和力觉,但基于RL框架而非VLA端到端架构,属于专用策略优化。
Alessio Palma et al. · 利用LLM的上下文学习能力实现双臂协作,侧重推理而非端到端训练。虽有趣,但依赖LLM实时推理,延迟高,非典型VLA训练范式。
Chengyue Huang et al. · 提出基于属性的时序安全评估基准,关注操作过程中的安全性而非最终成功率。作为评估工具重要,但无新算法贡献。