ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining
Hao Li et al. · 提出利用大规模第一人称人类视频补充机器人数据稀缺问题,统一预训练VLA。亮点在于解决数据扩展瓶颈,为VLA研究者提供了新的数据源整合思路。
Hao Li et al. · 提出利用大规模第一人称人类视频补充机器人数据稀缺问题,统一预训练VLA。亮点在于解决数据扩展瓶颈,为VLA研究者提供了新的数据源整合思路。
Yuvan Sharma et al. · 针对机器人数据集规模不足,提出对比动作-图像预训练方法,利用互联网级数据增强视觉编码器。可直接用于提升现有VLA模型的视觉表征能力。
Xingyuming Liu et al. · 引入触觉等多模态感知到VLA模型,解决仅靠RGB无法感知物理属性的问题。填补了触觉VLA方向的空白,具有明确的实验验证和应用价值。
Haoqi Yuan et al. · 探讨将大语言模型的对齐与缩放策略应用于机器人操作。提供了关于数据对齐和规模化训练的实证洞见,对构建大规模VLA有参考意义。
Bochen Yang et al. · 在潜在空间中进行渐进式动作-计划细化,平衡低延迟控制与显式推理。提出了新的VLA推理范式,有助于提升长程任务性能。
Tianyi Lu et al. · 通过交错视觉和语言推理链(CoT)增强VLA的长程任务处理能力。明确引入了思维链机制,是对现有VLA架构的重要改进。
Guowei Shi et al. · 提出延迟感知的异步扩散策略,结合目标导向的避障规划以解决运动不平滑问题。针对Diffusion Policy部署痛点的具体工程优化,可立即复用。
Ralf Römer et al. · 针对基于流匹配的VLA模型提出不确定性量化方法。增强了VLA在安全关键场景下的可靠性评估能力,具有明确的理论贡献和应用价值。
Shoujing Zhu et al. · 通过事件驱动的跨子任务潜在记忆编织,解决重复性操作中上下文依赖问题。针对VLA短视窗缺陷的结构化改进,具有创新性。
Haoyu Wang et al. · 结合几何感知重建和受控记忆机制,提升VLA的3D理解和规划能力。是对GeneralVLA的显著升级,强调了3D证据在VLA中的作用。
Yuxuan Chen et al. · 针对压缩后的VLA模型,提出基于RL的恢复机制以弥补精度损失。解决了VLA轻量化部署中的性能回退问题,具有工程实用价值。
Lakshita Dodeja et al. · 从行为克隆(BC)策略中提取Q值,用于在线强化学习。为VLA模型的后续微调提供了新的初始化或奖励塑造方法,具有方法论价值。
Taiyi Su et al. · 专门针对可变形物体操作设计的VLA基础模型。填补了通用VLA在柔性物体处理上的能力空白,具有明确的领域针对性。
Huaihang Zheng et al. · 结合触觉引导和在线RL优化VLA,解决接触丰富任务。直接响应了触觉VLA的研究热点,提供了闭环优化的具体方案。
Zihao Li et al. · 提出轨迹路由因果记忆机制,处理延迟证据的视觉模仿任务。解决了VLA在部分可观测环境下的长期依赖问题,创新点明确。
Yunhao Cao et al. · 提出统一运动-动作模型(UMA),以3D物体轨迹为接口桥接视觉控制和动力学建模。提供了异构机器人学习的统一视角,具有理论深度。
Kairos Team et al. · 构建面向物理AI的原生世界模型栈,支持持久状态和异质经验获取。为VLA提供了底层的世界预测能力,是Agentic VLA的重要组件。
Gaotian Wang et al. · 构建Web级4D手部交互数据引擎,旨在将任意RGB视频转化为机器人训练数据。虽具潜力,但主要贡献为数据工程与重定向框架,非核心VLA架构创新。
Haoran Lu et al. · 提出自动标注3D资产语义和物理属性的工具,服务于仿真数据生成。属于基础设施类工作,对VLA训练有间接帮助,但非直接相关。
Nethmi Jayasinghe et al. · 研究连续技能学习中的离线巩固机制,防止灾难性遗忘。侧重于RL策略更新机制,虽与VLA相关,但更偏向传统RL而非多模态VLA核心架构。
Haoran Lu et al. · 提出连接控制、技能和规划的统一仿真基础设施。属于工程平台类工作,重要但不紧急,缺乏具体的VLA算法创新。
Jiawei Zhang et al. · 基于3D Gaussian Splatting自动化重建仿真环境。属于场景重建技术,为机器人提供仿真场地,非VLA模型本身的方法论创新。
Hong Yang et al. · 发布用于诊断具身智能推理能力的基准测试ERQA-Plus。作为评估工具很有价值,但属于Benchmark类,非方法创新。
Chongyu Zhu et al. · 发布针对工业柔性线性物体(DLO)操作的仿真基准。填补特定领域Benchmark空白,但非通用VLA方法创新。
Ning Gao et al. · 提出细粒度诊断移动操作策略能力的基准EBench。用于分析模型短板,属于评估工具,非算法改进。
Huyue Ma et al. · 研究将控制策略蒸馏到被动弹性体中,侧重身体动力学与控制协同。虽有趣,但更偏向传统机器人学与生物启发控制,非主流VLA路径。
Yutong Liang et al. · 提出约束下的手部运动跟踪方法,解决运动学间隙。属于底层控制与轨迹跟踪技术,非高层VLA决策模型。
Jiahao Yang et al. · 基于遥操作数据生成实时逆运动学解,保证正运动学一致性。属于底层运动规划模块,虽有用但非VLA核心架构。