Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
Taewook Kang et al. · 提出 Domain Arithmetic 实现 VLA 在环境偏移下的一次性适配,无需微调即可跨平台迁移。解决了 VLA 跨域泛化的核心瓶颈,在多个基准上显著优于 SOTA,是架构级的创新。
Taewook Kang et al. · 提出 Domain Arithmetic 实现 VLA 在环境偏移下的一次性适配,无需微调即可跨平台迁移。解决了 VLA 跨域泛化的核心瓶颈,在多个基准上显著优于 SOTA,是架构级的创新。
Xinghao Zhu et al. · 利用人类演示中的接触 wrench 引导灵巧手策略学习,解决触觉数据稀缺下的模仿难题。提供了具体的力/力矩引导机制,对触觉 VLA 和灵巧操作研究具有本周可复用的工程价值。
Kai Peng et al. · 提出动作组合训练范式以缓解 VLA 过拟合,提升动作空间泛化能力。针对 VLA 核心瓶颈(泛化)提供具体训练策略,若代码开源则具备极高的本周复用价值。
Qingda Hu et al. · 提出无标注的阶段自适应运动速度学习方法,优化 IL 策略的时间一致性。方法轻量且易于集成到现有 VLA 推理流程中,本周即可尝试以提升操作平滑度。
Chi Zhang et al. · 基于人类中心视角的触觉预训练方法,解决灵巧操作中触觉数据稀缺问题。填补了触觉 VLA 方向的数据空白,提供的预训练权重或范式可直接用于提升灵巧手性能。
Haoran Hao et al. · 提出失败感知重试机制,实现测试时恢复与策略持续改进。为 VLA 部署提供实用的容错模块,逻辑清晰且易于作为插件集成到现有系统中,具备高工程复用价值。
Tianxing Zhou et al. · 引入体素表示解决 2D-3D 映射不匹配问题,提升策略的空间推理鲁棒性。方法直接改进 VLA 的视觉编码端,若代码开源可快速集成以增强复杂场景下的操作成功率。
Haoyang Li et al. · 引入密集具身思维链监督信号训练 VLA,改善跨平台迁移能力。提供了一种新的数据标注/训练范式,可直接应用于现有 VLA 训练流程以提升泛化性。
Jaden Clark et al. · 提出多模态持续学习方法,将预训练视觉策略适配至力觉反馈。解决了多感官融合中的灾难性遗忘问题,为 VLA 引入触觉/力觉提供了可行的微调方案。
Dongyoon Hwang et al. · 通过 3D 轨迹引导桥接分层 VLA 的规划与控制,提升空间对齐精度。方法具体且针对分层架构痛点,易于在现有 hierarchical VLA 框架中复现和应用。
Yoonhyung Park et al. · 提出掩码隔离触觉对齐学习方法,增强 MLLM 的触觉感知能力。直接服务于触觉 VLA 的多模态对齐,方法新颖且易于集成到现有 MLLM/VLA 架构中。
Chih-Han Yang et al. · 利用语言批评从次优演示中学习,提升 IL 数据利用率。方法可直接应用于 VLA 训练以处理低质量数据,具备明确的本周复用路径和实质贡献。
Hassan Jaber et al. · 提出用于具身操作轨迹的空间场景图数据集与基准,旨在解决VLA空间 grounding 缺失问题。属于重要数据资源,但非直接的方法论突破或可立即复用的训练框架。
Burcu Kilic et al. · 通过效应预测联合发现物体与动作符号以辅助规划。方法偏向传统符号主义与规划结合,缺乏明确的VLA架构集成路径及大规模实证对比,暂归为值得了解。
Chenyang Ma et al. · 首个系统性研究真实尺度双臂家具组装的 VLA 工作。虽然任务极具挑战性,但摘要未明确展示超越现有 SOTA 的通用架构创新,更多是特定长程任务的 benchmark 拓展。
Ronghan Chen et al. · 提出统一移动与操作的 World Action Model。虽涉及 VLA 相关概念,但侧重于世界模型构建而非直接的策略控制架构,且需验证其在标准 VLA 基准上的表现,暂归为值得了解。
Koyo Fujii et al. · 利用物理引导 Transformer 通过单次推触估计物体物理属性。虽涉及触觉交互,但核心在于属性估计而非端到端操作策略,与 VLA 直接相关性较弱。
Junwu Xiong et al. · 构建云原生仿真基础设施框架。属于工程工具链建设,虽重要但不涉及 VLA 算法本身的创新,研究者需等待其正式发布后评估可用性。
Seok-Young Kim et al. · 利用世界模型先验生成深度感知的 3D 语义场景图。虽有助于 VLA 的环境理解,但核心贡献在于场景图生成算法,需进一步验证其在 VLA 闭环控制中的实际增益。
Jinkun Hao et al. · 提出第一人称世界模拟器以生成具身交互数据。属于数据生成工具,虽有价值但非直接的控制算法创新,需等待其生成的数据被 VLA 训练验证效果。
Jinwen Wang et al. · 提出任务相关表示解耦以提升视觉 RL 泛化。方法通用性强,但未明确针对 VLA 架构进行优化或实验,与当前主流 VLA 方法的直接关联性不足。
Skand Peri et al. · 利用点云补全提升 3D 世界模型的动力学学习精度。虽涉及世界模型,但侧重于几何表示与动力学预测,未直接展示其在 VLA 策略控制中的端到端优势。
Su Ann Low et al. · 在物理可行的世界模型中进行路径规划。侧重规划算法与世界模型的结合,缺乏与 VLA 行为克隆或扩散策略的直接对比与集成,暂归为值得了解。
Xiaoxiong Zhang et al. · 关于世界模型到世界动作模型的教程综述。属于教育性材料,无原创性算法贡献或新基准结果,适合初学者阅读但不影响前沿进展追踪。
Byeongguk Jeon et al. · 提出用于通用机器人策略评估的神经模拟器。属于评估工具,虽能加速 VLA 开发流程,但本身不提供新的训练方法或性能提升,需等待社区采用。
Christian Conti (Sony AI et al. · 针对机器人乒乓球的高动态 Sim-to-Real 转移研究。属于特定高难度技能习得,虽有趣但缺乏通用 VLA 架构的普适性贡献,难以直接迁移至其他操作任务。
Yuhan Wu et al. · 提出化学实验室人形灵巧操作仿真与基准。属于新数据集/基准发布,虽填补了特定领域空白,但需等待基于此基准的 VLA 方法出现才具紧迫性。
Jinwoo Jang et al. · 提出多尺度世界模型混合架构以适应动态环境。方法创新但侧重于世界模型内部结构,未明确展示其在 VLA 决策控制中的端到端性能优势,暂归为值得了解。
Amirreza Rouhi et al. · 研究零售场景中视频世界模型的外置/内置视角适应。侧重领域适应与视角转换,非核心 VLA 控制算法,且应用场景较为垂直。
Christopher Lindenberg et al. · 提出值扩散世界模型以支持 MPC。虽涉及控制,但核心在于世界模型的价值函数建模,未直接对比或集成于主流 VLA 架构,相关性中等。
Junyuan Xiao et al. · 提出解耦表示对齐方法以优化多模态世界模型。虽有助于多模态融合,但侧重于生成模型的对齐技巧,未直接展示其在 VLA 策略学习中的有效性。
Xiangchen Yin et al. · 实现视频世界模型中相机、物体和天气的统一控制。属于生成式世界模型的可控性研究,与 VLA 的策略控制目标距离较远,暂归为值得了解。
Haoyu Chen et al. · 提出动态环境下的世界模型记忆一致性基准。属于评估工具,虽重要但非算法创新,需等待基于此基准的 VLA 方法出现。
Aviral Chawla et al. · 在 Transformer 中研究多个世界模型的机制解释。属于机理可解释性研究,虽深刻但非直接的 VLA 控制算法创新,适合理论研究而非工程应用。