EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
Yifan Zhong et al. · 提出从第一人称视频学习可操控灵巧手操作的全栈系统,解决数据稀缺瓶颈。亮点在于构建了语言对齐且动作精确的大规模演示数据集,为灵巧手VLA提供关键数据支撑。
Yifan Zhong et al. · 提出从第一人称视频学习可操控灵巧手操作的全栈系统,解决数据稀缺瓶颈。亮点在于构建了语言对齐且动作精确的大规模演示数据集,为灵巧手VLA提供关键数据支撑。
Shaopeng Zhai et al. · 针对VLA下游任务微调,提出VLAC-Cut引导的数据筛选流水线以最大化人工标注效率。该方法能显著减少迭代轮次,是提升VLA工程化部署效率的可复用工具。
Finn Ferchau et al. · 系统评估LoRA在工业VLA微调中的效率,对比全量微调。提供了明确的工程洞见和参数配置建议,有助于降低VLA在工业硬件上的部署成本,具备高复用价值。
Hengyuan Hu et al. · 提出通过视觉界面代理(GUI)控制机器人,连接基础模型的推理能力与物理执行。提供了一种新的VLA交互范式,具有明确的工程应用路径和复用价值。
Peijun Tang et al. · 介绍Lumo-2潜在世界-动作模型,通过在潜在动力学中推理生成动作。填补了世界模型与VLA结合的空白,提供了超越单纯模仿学习的可扩展学习新范式。
Byungkun Lee et al. · 提出以机器人为中心的点图表示,解决相机帧与机器人动作帧之间的不匹配问题。直接提升VLA的空间理解与动作精度,方法简洁有效,易于集成。
Dian Wang et al. · 针对双臂移动操作,提出混合帧策略在多帧动作去噪中融合末端执行器与基座坐标系。解决了复杂操作中的坐标变换难题,显著提升双臂协作性能。
Motubrain Team et al. · 提出MotuBrain统一世界动作模型,联合建模视频与动作。填补了VLA中世界动态精细建模的空白,为基于世界模型的VLA控制提供了新的架构参考。
Shijie Lian et al. · 针对多模态演示数据中的意图混淆,提出短视域意图建模。有效提升了VLA在相似观察下区分不同动作的能力,解决了模仿学习中的 aliasing 痛点。
Yifu Yuan et al. · 整合具身认知、规划、修正于一体的具身基础模型。虽标题蹭热点,但其提出的统一架构涵盖了VLA的高级推理能力,具备较高的跟踪价值和复用潜力。
Shengzhuo Yang et al. · 引入时空掩码机制改进VLA的自回归动作生成,旨在通过有效桥接提升性能。属于对现有架构的模块级改进,缺乏跨平台或SOTA级别的突破性验证。
Yi Li et al. · 利用对象中心槽表示替代全局场景嵌入,以分离任务相关与无关特征。虽具理论价值,但主要聚焦于视觉表征结构,未直接涉及VLA核心架构创新或大规模基准对比。
Wenke Xia et al. · 关注离线到在线RL中的价值估计可靠性问题,旨在简化复杂系统的复现与诊断。属于RL算法层面的优化,非VLA架构或训练范式的直接创新。
Muqun Hu et al. · 结合触觉感知实现四足机器人的全身Loco-Manipulation控制。重点在于底层控制律与触觉融合,而非高层VLA策略学习,属于传统机器人控制范畴。
Weichen Zhang et al. · 发布首个无人机具身感知基准ActiveFly-Bench,涵盖空中具身问答等任务。作为新数据集/基准具有重要参考价值,但本身非方法创新,归类为值得了解。
Rushuai Yang et al. · 探讨流匹配策略在RL中的稳定性问题,提出驯服生成式控制策略的方法。属于通用强化学习算法改进,未明确结合VLA的多模态特性或具体机器人操作场景。
Md Tanvir Islam et al. · 提出状态空间不确定性感知的残差流匹配以提升操作鲁棒性。虽涉及VLA常用的流匹配技术,但侧重于噪声下的控制稳定性,属算法微调而非架构突破。
Xiatao Sun et al. · 引入人工中央凹视觉机制以减少机器人基础模型中的捷径学习。属于视觉感知层面的改进,旨在提升泛化性,但未直接改变VLA的动作生成范式。
Haojie Huang et al. · 通过像素分类学习3D闭环操作策略,将动作空间映射为图像分割问题。属于动作表征的创新尝试,但缺乏与主流VLA基准的广泛对比验证。
Haitong Ma et al. · 探索仅用RL从零训练扩散策略进行多任务方块推动,并实现Sim2Real。任务过于简单(Block Pushing),缺乏复杂操作场景验证,贡献有限。
Haidong Cao et al. · 提出分段轨迹扩散以解决连续预测的不一致性问题。属于扩散策略内部的时序建模改进,未触及VLA核心的语言-动作对齐或架构设计。
Yuecheng Xu et al. · 学习环境依赖的动作表征以解决原始轨迹的噪声和冗余问题。属于动作编码层面的优化,创新点较为局部,未展示显著的SOTA提升。
Yuanzhi Liang et al. · 综述世界动作模型至具身大脑的发展路线图。属于观点/综述类文章,虽具启发性但无具体技术贡献或实验数据,适合宏观了解趋势。
Shichao Fan et al. · 通过统一视觉-运动表征提升VLA的通用性。虽标题宏大,但摘要未展示超越现有SOTA的显著优势或独特架构创新,暂归为常规改进。
Serdar Bahar et al. · 通过前向演示学习逆任务以实现任务参数的外推泛化。属于模仿学习泛化能力的研究,未直接涉及VLA的多模态架构或大规模预训练。
Xinggang Hu et al. · 构建开放词汇的功能性3D场景图以辅助室内机器人操作。属于环境表征研究,虽有用但非VLA核心决策架构,且缺乏直接的VLA端到端实验验证。
Hrishikesh Sathyanarayan et al. · 利用Stein变分推断实现分布鲁棒控制以应对接触丰富操作的不确定性。属于高级控制理论应用,未结合VLA的语言或多模态特性。
Ziyan Feng et al. · 提出基于噪声统计的视触反射控制,用于力敏感操作(如拿纸杯)。侧重底层快速反射控制,非高层VLA策略生成,属于传统机器人控制范畴。
Zhe Liu et al. · 发布湿实验室机器人仿真平台、基准及数据增强框架。作为垂直领域的重要基础设施,对特定应用场景有价值,但非通用VLA方法论创新。