Action-Effect Memory Pretraining for Robot Manipulation
Yijing Zhou et al. · 提出 AEM 预训练框架,从视觉-动作历史中学习紧凑的时间表示以增强操作能力。为 VLA 提供了新的记忆预训练范式,具有明确的模型改进路径。
Yijing Zhou et al. · 提出 AEM 预训练框架,从视觉-动作历史中学习紧凑的时间表示以增强操作能力。为 VLA 提供了新的记忆预训练范式,具有明确的模型改进路径。
Yangcen Liu et al. · 利用第一人称人类视频生成高保真灵巧手机器人演示数据,解决大规模数据收集瓶颈。提供从人类视频到机器人策略的数据转换工具,极具复用价值。
Yu Guo et al. · 学习动作对齐的稀疏 3D 表示以解决跨域操作中的几何推理问题。将 3D 结构与动作空间显式关联,提升了泛化能力,方法具有工程落地潜力。
Sunghwan Kim et al. · 提出时空环境与机器人特征图(SERF)以支持长视界移动操作。解决了仅凭图像难以推断定位和任务进度的问题,为移动 VLA 提供有效状态表征。
Shihefeng Wang et al. · 提出 EmbodiSteer 方法,通过关节空间引导实现零样本跨具身部署。解决了端到端策略在异构机器人间的迁移难题,具备直接的工程应用价值。
Sangkyu Lee et al. · 探讨自回归策略的实时执行,通过异步推理平衡平滑性与响应速度。直接解决 VLA 部署中的延迟痛点,提供可复用的推理优化方案。
Arnav Kumar Jain et al. · 提出 WEAVER 世界模型,支持策略评估、改进及测试时规划。为 VLA 引入有效的内部模拟能力,显著提升样本效率和长期规划性能。
Egor Cherepanov et al. · 引入循环记忆机制解决 VLA 在部分可观测环境下的决策缺陷。针对当前 VLA 忽略历史信息的痛点,提供具体的架构改进模块。
Hyeonbeom Choi et al. · 提出 SCALE 方法,基于自不确定性自适应调整观察和执行频率。优化测试时计算资源分配,提升 VLA 鲁棒性且无需额外训练,易于集成。
Mingyu Liu et al. · 提出通用动作专家(GAE)解耦 VLM 推理与物理执行,提升动作精度。为 VLA 提供了一种模块化改进思路,有助于缓解推理与动作纠缠问题。
Leo Xu et al. · 提出用于隐式人机协作的 VLA 框架,旨在通过互补优势提升效率。缺乏具体架构创新细节及公开基准对比,属于相邻领域应用探索。
Jianli Sun et al. · 针对无人机操作提出解耦移动与操作的级联双动作解码器及非对称 MoE。虽涉及 VLA,但局限于特定平台(UAV),通用性受限且无主流基准验证。
Zhe Liu et al. · 构建湿实验室机器人的仿真平台、基准及数据增强框架。主要贡献在于数据集和仿真环境,虽重要但属于基础设施类工作,非核心算法突破。
Wei Yu et al. · RGMC 2025 亚军方案,专注于杂乱环境中可靠顺序抓取。属于特定竞赛解决方案,缺乏通用 VLA 架构创新或广泛基准评估。
Gokul Puthumanaillam et al. · 研究 VLA 模型的轨迹级重定向攻击,揭示文本提示在闭环控制中的安全风险。属于安全性分析而非性能提升,对防御机制设计有参考价值。
Dayu Xia et al. · 发布 RoboProcessBench 基准,评估 VLM 对操作过程的理解而非仅结果。填补了过程感知评估空白,但作为基准论文,紧急程度低于算法突破。
Yoon-Ji Choi et al. · 提出双层结构分解方法处理双臂操作中的视觉信息变化和协调模式切换。针对双臂特定场景优化,未展示在通用 VLA 基准上的显著超越。
Pengfei Liu et al. · 将人类手势融入 VLA 模型以增强多模态交互意图理解。扩展了输入模态,但主要贡献在于交互界面而非核心控制架构,属相邻方向。
Baochang Ren et al. · 将 VLA 应用于科学实验室自动化,强调实验协议执行。属于垂直领域应用案例,缺乏通用方法论创新或跨平台基准验证。
Aaron O. Feldman et al. · 利用共形预测从稀疏人类反馈中学习机器人安全约束。侧重安全保证理论,虽相关但非 VLA 核心控制架构或性能优化方向。
Shengcheng Luo et al. · 通过 Real2Sim2Real 流程学习纯触觉盲抓策略。虽涉及灵巧操作这一热点,但侧重于触觉策略而非多模态 VLA 架构,属细分领域进展。
Zixing Lei et al. · 利用数字智能体作为教练加速物理智能体的训练。概念新颖但摘要缺乏具体技术实现细节及量化增益,偏向于高层方法论探讨。
Atindra Jha et al. · 提出 M* 多模态模型服务系统,支持复合架构的高效部署。属于系统工程/基础设施层,虽对 VLA 部署有帮助,但非算法或模型本身创新。
Aleksandar Taranovic et al. · 提出基于优势加权片段的偏好学习方法,避免显式奖励设计。虽可用于 RL 精调 VLA,但主要贡献在 RL 算法层面,与 VLA 架构直接关联较弱。
Balázs Gyenes et al. · 利用傅里叶特征提升模仿学习的空间推理精度。属于表示学习技巧,虽有效但未结合 VLA 语言模态或展示在大型 VLA 基准上的优势。
Yifu Yuan et al. · 提出统一具身基础模型 Embodied-R1.5,整合认知、规划与执行。标题宏大但摘要缺乏具体架构差异及 SOTA 对比证据,疑似综述或增量工作。 [💧灌水]
Tongle Shen et al. · 通过对比交互从零学习物体操作,利用 CRL 学习动力学表示。侧重底层控制表示,未体现 VLA 的多模态对齐或语言指令跟随特性。