Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control
Rutav Shah et al. · 针对长程任务中的部分可观测性问题,提出在视觉运动策略中引入记忆检索机制。亮点在于通过回顾历史状态(如物体位置、任务进度)提升自主性,为VLA处理复杂时序依赖提供了可复用的记忆模块设计思路。
Rutav Shah et al. · 针对长程任务中的部分可观测性问题,提出在视觉运动策略中引入记忆检索机制。亮点在于通过回顾历史状态(如物体位置、任务进度)提升自主性,为VLA处理复杂时序依赖提供了可复用的记忆模块设计思路。
Mengying Lin et al. · 解决少样本泛化难题,通过图结构建立未见物体与已知物体的部件对应关系以转移操作 affordance。相比纯语义检索,该方法保留了几何约束,为VLA的零样本/少样本迁移提供了新的特征对齐路径。
Yanzhe Tang et al. · 针对端到端VLA中语义推理与空间控制耦合导致的对齐瓶颈,提出解耦架构并引入空间视觉提示。该方法显著提升了目标指代精度,为优化VLA的空间 grounding 能力提供了具体的工程改进方案。
Melya Boukheddimi et al. · 将VLA扩展至全身人形机器人的移动操作,解决数据稀缺和动力学约束问题。提出了结合最优控制的框架,填补了VLA在接触丰富型 locomotion 任务中的应用空白,具有明确的架构创新。
Tiecheng Guo et al. · 解决VLA推理延迟导致的高频控制不稳定问题,提出轻量级延迟感知适配器以实现平滑异步控制。该方法即插即用,可直接部署以提升现有VLA模型的实时执行性能,工程价值高。
Shuyi Zhang et al. · 针对VLA模仿学习天花板,提出高效的RL微调框架FORCE。通过值校准预热和自蒸馏解决样本效率低的问题,在标准基准上展示了超越IL的性能,为VLA后训练提供了可复用的SOTA方法。
Siyin Wang et al. · 指出VLA因忽略环境动态而泛化受限,提出上下文世界建模以预测动作后果。该方法增强了模型对新视角/形态的适应能力,从原理上弥补了纯反应式VLA的缺陷,具有理论深度。
Botao He et al. · 利用表面肌电信号(sEMG)捕捉人类演示中的力信息,解决传统视觉演示缺失力学线索的问题。为VLA引入了新的多模态输入通道,特别适用于需要精细力控的操作任务,数据收集方法具创新性。
Dong Jing et al. · 针对VLA动作模块缺乏物理先验的问题,提出学习跨实体动作先验。通过解耦视觉语言表征与动作分布,提升了不同机器人平台间的迁移能力,为改善VLA的动作生成质量提供了新视角。
Qing Lian et al. · 提出反射式VLA架构,通过在上下文中显式建模动作后果来克服反应式模型的局限性。该方法增强了状态估计的完整性,在长程任务中展现了更好的泛化性,是对VLA推理范式的有益补充。
Kejing Wang et al. · 解决VLA在线适应难的问题,利用自蒸馏提供密集监督信号以应对稀疏奖励。该方法允许模型在部署过程中持续优化,为VLA的动态环境适应性提供了可行的技术路径。
Yuteng Sun et al. · 针对VLA高频控制延迟问题,提出时间交错扩散与动作循环机制。通过并行化处理消除执行盲区,显著提升控制频率,是解决VLA实时性瓶颈的关键工程创新。
Yiteng Chen et al. · 提出无需训练的动态策略路由机制,根据任务难度自动选择VLA、VA或代码策略。该方法降低了单一模型的负担,提升了系统整体鲁棒性,为混合专家系统在机器人领域的应用提供了新思路。
Xianghui Wang et al. · 聚焦VLA部署效率,提出通过修剪提升策略内在效率的方法。不同于单纯的计算加速,该方法优化了策略本身的复杂度,有助于在资源受限设备上运行高性能VLA,具备实用价值。
Zhenguo Sun et al. · 提出基于潜在交互世界模型的“设想-验证-行动”框架,使策略能预判动作后果。该方法增强了VLA的规划能力和安全性,为解决黑盒策略的信任问题提供了可复用的架构组件。
Xincheng He et al. · 利用VLM初始化参数并通过可微仿真识别刚体物理属性(惯性、摩擦)。虽涉及VLM,但核心贡献是物理参数辨识方法,缺乏直接的操作策略实验,属于VLA前置感知/仿真环节。
Zhiming Chen et al. · 专注于解决非朗伯体(透明/反光)物体的深度感知噪声问题,通过仿射不变形状先验增强鲁棒性。虽对操作至关重要,但属纯感知算法优化,未涉及VLA决策或控制层面。
Piotr Koczy et al. · 探讨共身机器人手的人机共享控制权变机制,平衡用户代理权与自动化。重点在于交互范式而非VLA模型本身,缺乏对通用视觉语言动作模型的实质性改进。
Shuai Ke et al. · 针对特定工业抛光任务设计的阶段感知扩散策略。虽应用了Diffusion Policy,但高度定制化且缺乏通用基准验证,属于垂直领域应用,对通用VLA研究参考价值有限。
Pablo Valle et al. · 关注VLA模型的测试与验证,提出自动生成测试预言的方法。虽对工程落地重要,但属于QA/测试领域,不涉及VLA核心算法或性能提升,故归为值得了解。
Chuanrui Zhang et al. · 构建包含机器人动力学的2.5D世界模型,旨在弥补纯视频世界模型缺乏空间运动推理的缺陷。虽概念先进,但摘要未明确展示其在VLA控制闭环中的具体增益,暂归为相关探索。
Alexandre Chapin et al. · 研究以对象为中心的视觉表征对泛化的影响,提出聚焦任务相关特征的编码方式。虽有助于理解VLA内部机制,但主要贡献在于表征学习分析,而非直接的策略架构突破。
Pengzhi Yang et al. · 针对长程操作中的奖励稀疏问题,提出置信度门控的进度奖励建模。虽服务于RL微调,但核心是奖励函数设计,未直接涉及VLA架构,且缺乏与主流VLA基线的广泛对比。
Jingyu Guo et al. · 发布面向无人机的高层级VLA任务基准。作为数据集/基准类工作,其重要性在于填补评估空白,但本身不提供算法创新,符合“值得了解”类别定义。
探讨LLM智能体的世界建模目标,主张超越下一观测预测。虽涉及决策制定,但侧重于LLM代理层面,与具身VLA的控制闭环关联较弱,属于相邻领域理论探索。
Lan Wei et al. · 发布多传感器触觉感知基准数据集。填补了触觉VLA数据空白,对推动触觉模态融合有重要意义,但作为数据集论文,不直接提供算法进展。
Dexter R. Shepherd et al. · 提供用于公平比较触觉传感器的3D打印数据集。属于基础资源建设,虽有价值但无算法创新,归类为值得了解。
Hongbo Wang · 理论研究潜在世界模型中守恒律的保持性。虽涉及世界模型理论基础,但过于抽象且缺乏具体的机器人操作实验支撑,对当前VLA工程实践指导意义有限。
Hongbo Wang · 研究等变世界模型的可信地平线认证。属于理论安全边界分析,未直接应用于VLA控制回路,与日常开发距离较远。
Kaiwen Zheng et al. · 提出流式视频生成的扩散蒸馏方法。虽提及交互式世界模型,但核心贡献在视频生成效率,缺乏在机器人控制任务中的验证,属于相邻技术领域。