Emergent Compositional Skills in Mixture-of-Experts VLAs
Shlok Shah et al. · 探索 MoE 架构在 VLA 中涌现组合技能的能力,无需预设任务分解。提供简化 MoE 动作头设计,为提升 VLA 组合泛化能力提供可复用的架构实验洞见。
Shlok Shah et al. · 探索 MoE 架构在 VLA 中涌现组合技能的能力,无需预设任务分解。提供简化 MoE 动作头设计,为提升 VLA 组合泛化能力提供可复用的架构实验洞见。
Masaki Murooka et al. · 提出 GuidedAttention 框架,通过引入可解释且可纠正的视觉注意力机制增强模仿学习的 OOD 鲁棒性。方法可直接集成至现有 VLA/Visuomotor 策略中,提升部署可靠性。
Yu Qi et al. · 引入偏差感知评估框架诊断 VLA 捷径学习问题,并指导数据收集以提升组合泛化。提供具体的评估指标和数据采样策略,本周即可用于优化 VLA 训练数据 pipeline。
Shirui Chen et al. · 利用 LLM token 概率作为零样本奖励信号,解决机器人 RL 中的稀疏反馈问题。方法无需额外训练奖励模型,可直接应用于 VLA 的 RLHF 或精调阶段,具有极高复用价值。
Yuheng Lei et al. · 提出结合工作记忆和情景记忆的视觉运动策略,解决非马尔可夫任务中的长程依赖问题。架构改进可直接嵌入 VLA backbone,提升复杂时序任务的执行成功率。
Zinan Li et al. · 提出从视觉生成触觉信号的 FELT 方法,解决触觉数据稀缺问题。填补知识库中“触觉操作”方向空白,可直接增强 VLA 的视触融合能力,具备高复用价值。
Haocheng Yin et al. · 提出物理修正残差世界模型以预测可变形物体动力学,解决材料参数泛化问题。虽涉及操作场景,但侧重物理仿真与动力学建模,非直接 VLA 架构或训练范式创新。
Boyuan Wang et al. · 发布大规模桌面操作数据集 TableVerse,包含真实世界接地布局。作为数据资源对 VLA 训练有价值,但属数据集论文,无新算法贡献,归为值得了解。
Mengfei Zhao et al. · 介绍 AXIS 数据引擎,旨在通过社区驱动方式扩展机器人操作数据规模。虽对 VLA 数据瓶颈有潜在价值,但摘要未明确技术细节或开源状态,暂归为值得了解。
Ke Ma et al. · 发布透明生物医学物体多视角数据集,解决杂乱场景下的感知难题。属于特定领域数据集,对通用 VLA 研究间接相关,无核心算法贡献。
Zhanguang Zhang et al. · 对比世界动作模型与 VLA 的泛化能力及鲁棒性差异。属于系统性评估研究,虽具参考价值,但未提出新架构或显著超越 SOTA 的方法,归为值得了解。
Ahad Jawaid · 提出分层动作分块的离线 RL 方法以缓解视界诅咒。虽与 VLA 动作生成相关,但摘要未明确其在 VLA 或多模态场景中的应用,视为通用 RL 改进,归为值得了解。