GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation
Sriram Krishna et al. · 提出分层策略框架,高层预测3D子目标分布,底层执行视觉运动策略。提供了解决长程任务泛化问题的具体工程路径,代码/方法易于集成到现有VLA流程中。
Sriram Krishna et al. · 提出分层策略框架,高层预测3D子目标分布,底层执行视觉运动策略。提供了解决长程任务泛化问题的具体工程路径,代码/方法易于集成到现有VLA流程中。
Jonathan C. Kao et al. · 引入无需重训练的实时干预机制,通过键盘等简单输入直接引导VLA动作。为VLA部署提供了即插即用的安全与控制接口,具有极高的工程实用价值。
Qianzhong Chen et al. · 针对长程操作提出阶段感知奖励模型,减少对高质量演示数据的依赖。为VLA的RL精调提供了新的数据效率优化方向,方法具有明确的复用性。
Xiaoquan Sun et al. · 结合层次记忆门控与世界动作模型(WAM),增强任务相关动态建模与泛化能力。填补了WAM在长期依赖处理上的空白,为提升VLA鲁棒性提供新架构思路。
Guiyu Zhao et al. · 提出空间接地动作验证模块,通过二次检查减少单步动作错误导致的失败。为VLA推理阶段增加了可复用的纠错机制,显著提升实际部署成功率。
Artur Kuramshin et al. · 提出通过重新标注视觉-动作数据来提升指令跟随鲁棒性。提供了一种低成本的数据清洗/增强手段,可直接应用于现有VLA训练流程以改善指令遵循能力。
Shilin Ma et al. · 引入语义注意力引导的未来感知Token剪枝,加速VLA实时推理。解决了VLA部署中的计算瓶颈问题,方法即插即用,显著提升推理速度。
Catherine Glossop et al. · 利用反事实标签增强VLA的指令跟随能力。通过数据增强策略解决常见痛点,方法简单有效,易于集成到现有训练管线中。
Ruicheng Zhang et al. · 构建分层世界模型并结合RL物理对齐,解决长程操作数据稀缺问题。为VLA提供了新的预训练/微调范式,显著提升复杂任务规划能力。
Clemence Grislain et al. · 提出分层扩散策略的在线自训练共适应机制。解决高低层策略协调难题,提升实机部署稳定性,方法具有明确的工程复用价值。
Yixuan Li et al. · 将量化深度预测作为辅助监督信号引入VLA,增强3D空间理解。方法轻量且易集成,能有效提升细粒度操作的空间推理精度。
Taishan Li et al. · 针对遮挡场景提出视点想象机制,并在LIBERO上建立新基准。既提供了克服感知瓶颈的新方法,又发布了评估工具,兼具理论与实用价值。
探讨 MLLM 在物理工具使用中的局限性,属于 Embodied AI 基础能力评估。缺乏具体的 VLA 架构创新或实时控制实验,主要贡献在于分析而非方法提出。
Jiaheng Hu et al. · 系统研究分层VLA代理的编排要素,属于实证分析与综述性质。虽对理解Hi-VLA有帮助,但无新算法或显著性能突破,适合了解现状而非立即应用。
Shuo Wang et al. · 提供改善仿真与现实相关性的实践指南,属于方法论总结。虽重要但非核心算法创新,且缺乏统一基准测试对比,适合作为评估参考而非技术突破。
Zi Yin et al. · 揭示扩散策略在视觉条件上的对抗脆弱性并提出劫持接口。属于安全性研究,虽具警示意义但不涉及VLA核心性能提升或通用架构改进。
Shi Jin et al. · 发布基于UMI数据的真实世界桌面操作基准。作为数据集/基准贡献,有助于标准化评估,但本身不包含新算法或模型改进。
Qingzi Wang (University of Maryland) et al. · 探索VLA在社交导航中对行人障碍物的区分与安全反应能力。聚焦于特定场景(移动操作)的安全性,未涉及通用操作范式的突破。
Minsoo Jo et al. · 分析VLA在关节级物理故障下的鲁棒性漏洞。属于可靠性评估研究,旨在发现缺陷而非提出通用的抗故障架构或训练方法。
Beomjun Kim et al. · 专注于灵巧手从人类演示中学习点云策略,解决具身差距。虽属触觉/灵巧操作热点,但侧重特定硬件适配,通用VLA迁移性有限。
Jiawei Gao et al. · 结合内部模型预测控制处理强力交互任务。针对接触丰富场景的专用方法,未展示在标准VLA基准上的通用泛化优势。
Yinchen Tian et al. · 针对双臂操作的多视图语义对齐方法。解决特定视角下的空间感知问题,实验局限于双臂场景,未证明对单臂或通用VLA的广泛适用性。
Lik Hang Kenny Wong et al. · 综述物理仿真器在机器人导航与操作中的应用。属于文献总结,无新方法或实验贡献,仅用于背景知识补充。
Huang Junda et al. · 提出视惯融合框架以增强灵巧手本体感觉。侧重传感器融合与硬件层改进,非VLA算法层面的核心进展。
Yunhai Han et al. · 利用Koopman算子作为伪规划器提升视觉运动灵巧性。理论新颖但实验多限于仿真或简化场景,离通用VLA部署尚有距离。
Kuofei Fang et al. · 探讨从被动指令执行向主动智能的转变概念。偏向哲学或高层架构讨论,缺乏具体的VLA算法实现或量化实验支撑。 [💧灌水]
Hangtao Zhang et al. · 研究实体LLM代理的物理世界越狱攻击。属于安全领域研究,不直接贡献于VLA性能提升或通用能力扩展。