SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation
Nie Lin et al. · 提出基于相似性的数据挖掘框架,用于筛选对灵巧操作有益的眼动视频数据。亮点在于解决数据质量而非数量问题,可直接用于优化VLA训练数据集构建。
Nie Lin et al. · 提出基于相似性的数据挖掘框架,用于筛选对灵巧操作有益的眼动视频数据。亮点在于解决数据质量而非数量问题,可直接用于优化VLA训练数据集构建。
Harshitha Rajaprakash et al. · 针对VLA部署时的分布偏移,提出对比集训练和校准的故障检测方法。提供明确的鲁棒性增强路径,适合关注VLA安全部署的研究者复用。
Suhas Hegde et al. · 专为Diffusion VLA设计的测试时故障检测机制,通过不确定性量化识别弱 grounding 预测。填补了扩散策略可靠性评估的工具空白,具有直接应用价值。
Yuze Fan et al. · 针对长视界VLA的累积误差,提出时间检索+频率校正的闭环修正方法。利用成功轨迹作为先验进行后处理修正,无需重新训练即可提升长程任务成功率。
Xingyu Ding et al. · 解决现有3D VLA指令无关的问题,引入指令感知的空间表示对齐。通过聚焦任务相关区域提升泛化能力,是对OpenVLA等基线方法的实质性架构改进。
Houze Xu et al. · 为VLA引入显式语言记忆模块以解决长视界规划中的指令遗忘问题。通过外部记忆增强上下文保持能力,是提升复杂任务执行稳定性的有效工程方案。
Peiyan Li et al. · 在BridgeData基础上引入内存增强和数据高效训练策略,旨在提升3D操作泛化性。作为知名基准的迭代版本,提供了具体的架构优化细节和实验对比。
Yuquan Xue et al. · 提出探索性采样数据增强框架,解决VLA训练中失败轨迹缺失导致的纠正能力不足。方法通用性强,可直接集成到现有IL/VLA训练流程中提升鲁棒性。
Cheng Yin et al. · 系统诊断CoT推理在VLA中的有效性,并提出增强推理能力的具体方法。澄清了思维链在具身智能中的作用边界,为后续VLA认知架构设计提供实证依据。
Yan Zhang et al. · 针对VLA的视觉覆盖现象,引入反事实干预进行去混淆处理。从因果推断角度解决模态不平衡问题,提供了新颖的训练视角和可复用的去偏模块。
Weiheng Zhao et al. · 优化World Action Models的推理效率,通过未来条件化机制平衡前瞻性与计算成本。解决了WAM在实时控制中的延迟瓶颈,提升了世界模型在VLA中的实用性。
Zehua Fan et al. · 将World Action Models扩展至移动操作领域,提出Chain-of-Foresight机制协调移动与操作。填补了WAM在动态大尺度场景下的应用空白,具有显著的场景适应性。
Zheng Liu et al. · 通过比特级稀疏化和推测解码加速Diffusion VLA推理。直接解决VLA部署中的计算密集型痛点,提供显著的延迟降低方案,具备极高的工程复用价值。
Yuhong Shi et al. · 揭示并解决动作可控世界模型中的统计偏差(Shortcut)问题。通过改进训练目标提升模型对真实物理因果的学习,对构建可靠的Embodied World Models至关重要。
Bohai Gu et al. · 提出自验证RL框架解决长视界视频世界模型的复合误差问题。通过自我验证机制提升预测一致性,为VLA的世界模型组件提供更可靠的预训练信号。
Myung-Hwan Jeon et al. · 模块化感知流水线,缺乏具体的VLA架构创新或端到端训练细节,属于传统感知与基础模型结合的工程应用。
Shaoguang Wang et al. · 深入分析Task Vector减法在闭环控制中的局部性失效问题。属于重要的诊断性研究(Audit),虽无新模型提出,但对理解VLA行为机理极具价值。
Hyesung Lee et al. · 专注于Sim2Real中的物体重建与关节建模,虽服务于机器人学习,但核心贡献在3D视觉重建领域,非VLA核心算法或训练范式。
Beining Han et al. · 聚焦触觉传感器的Sim2Real迁移,虽涉及灵巧操作,但核心是传感器信号处理与控制,未涉及多模态VLA模型的训练或推理机制。
Chenghua Wang et al. · 侧重物理AI系统的边缘计算与云端Rollout基础设施搭建。虽重要但属于系统工程层面,非VLA算法或模型层面的核心进展。
Zhaofeng Shi et al. · 利用第三人称演示辅助第一人称手部姿态预测,侧重视觉感知与姿态估计,未涉及VLA的动作生成或策略学习核心环节。
Akhil S Anand et al. · 通用Sim2Real RL优化路径,虽适用于机器人但未针对VLA特性(如多模态对齐、语言指令)进行专门设计,相关性较弱。
Liangyang Ouyang et al. · 视频世界模型中的社交交互角色生成,侧重内容创作而非具身控制,与VLA核心任务距离较远。
Xiaojie Xu et al. · 交互式视频世界模型的基准测试套件。虽重要但属于评估工具,非方法论突破,且侧重视频生成而非机器人动作执行。