Do as I Do: Dexterous Manipulation Data from Everyday Human Videos
Bhawna Paliwal et al. · Pieter Abbeel团队提出从日常人类视频中规模化生成灵巧手操作数据的方法,解决数据瓶颈。在多个灵巧操作基准上显著优于SOTA,为通用具身智能提供关键数据范式。
Bhawna Paliwal et al. · Pieter Abbeel团队提出从日常人类视频中规模化生成灵巧手操作数据的方法,解决数据瓶颈。在多个灵巧操作基准上显著优于SOTA,为通用具身智能提供关键数据范式。
Haowen Liu et al. · 提出一种将VLM转化为具身工具使用的框架,作为端到端VLA的替代方案。亮点在于通过工具调用解耦感知与执行,适合希望探索非端到端架构的研究者参考。
Yuhang Huang et al. · 构建支持多视角3D一致性的世界基础模型,解决现有WFM在机器人多相机设置下的几何不一致问题。为需要高保真仿真或基于模型的规划提供了新的基础设施。
Gershom Seneviratne et al. · 利用无标签野外第一人称视频和几何轨迹监督训练导航VLA,解决了数据稀缺问题。提供了一种低成本扩展导航策略数据的新路径,具有较高复用价值。
Wenxi Chen et al. · 引入潜在世界模型实现反应式动作分块,缓解传统开环执行的脆性。该方法提升了长序列操作的鲁棒性,可直接集成到现有VLA推理流程中改善执行稳定性。
Wei-Cheng Tseng et al. · 提出基于自洽视频生成的评估方法,替代昂贵的真实机器人测试。为快速迭代VLA策略提供了可扩展的离线评估工具,显著降低实验成本。
Kinam Kim et al. · 结合对象中心表示与残差RL,提升VLA在精确物理交互中的Sim2Real泛化能力。针对模仿学习遗留的执行误差提供修正机制,适用于高精度操作场景。
Arunim Joarder et al. · 构建富含物理信息的触觉共享潜空间,解决触觉传感器仿真保真度低的问题。填补了触觉VLA领域空白,为触觉Sim2Real迁移提供关键技术支持。
Yu Zhang et al. · 设计可逆神经网络适配器,实现一步流匹配生成高精度动作。显著提升推理速度并保留多模态条件能力,适合对延迟敏感的实时控制应用。
Jisoo Kim et al. · 利用多视图3D-grounded VLM进行零样本长程灵巧操作规划,无需端到端训练。展示了VLM在复杂任务分解中的潜力,适合探索神经符号混合架构的研究者。
Runze Xu et al. · 通过运动聚焦的潜在动作表示,实现从人类第一人称视频到跨实体VLA的训练。有效桥接人机形态差异,为利用海量人类视频数据提供可行方案。
Zirui Zheng et al. · 引入记忆增强机制改进动作条件世界模型,解决长期操作中的状态持久性问题。提升模型在部分可观测环境下的推理能力,适用于复杂连续任务。
Alexandre Chapin et al. · 提出基于Slot的任务感知对象中心表征,增强视觉特征的结构性与鲁棒性。改善密集特征在操作任务中的表现,可作为VLA感知模块的有效插件。
Arnav Kumar Jain et al. · 优化世界模型以支持更高效、更长的策略评估与规划。提升WM在有限真实交互下的下游应用能力,适合需要强化学习辅助训练的VLA项目。
Haoqi Yuan et al. · 报告Qwen系列在机器人操作领域的对齐与缩放实践,验证统一数据格式对规模效应的促进作用。为大规模VLA训练提供工程洞见和数据策略参考。
Haoran Lu et al. · 构建统一的具身交互执行基础设施,整合控制、技能与规划层。简化仿真到真实的部署流程,适合需要快速原型验证的团队使用。
Bochen Yang et al. · 在潜空间中渐进式细化动作计划,平衡生成效率与显式推理。为VLA提供中间层的 deliberation 能力,适合对安全性要求高的应用场景。
Kairos Team et al. · 提出面向Physical AI的原生世界模型栈,支持异构经验学习与长期状态维持。为构建具备持久记忆和操作能力的具身智能体提供底层架构支持。
Yuxuan Chen et al. · 针对压缩VLA模型设计基于RL的恢复机制,弥补量化/剪枝带来的性能损失。为边缘设备部署VLA提供实用的后处理优化方案,保障实时性与精度。
Lakshita Dodeja et al. · 从行为克隆策略中提取Q值,用于在线强化学习改进。解决BC缺乏自我提升机制的问题,为现有VLA模型提供低成本在线适应路径。
Taiyi Su et al. · 专为可变形物体操作设计的VLA基础模型,提升折叠等任务的泛化能力。填补刚性物体主导的VLA研究空白,适用于家庭服务机器人场景。
Zihao Li et al. · 引入轨迹路由因果记忆,解决证据消失后的延迟决策问题。增强VLA在部分可观测环境中的时序推理能力,适合复杂动态场景。
Jiahao Yang et al. · 基于遥操作数据生成实时逆运动学解,保证正运动学一致性。解决传统数值求解器的不连续问题,可作为VLA底层控制器的高效替代方案。
Seyed Alireza Azimi et al. · 系统评估不同动作空间(位姿增量、速度等)对RL性能的影响。虽为重要基准分析,但缺乏新算法或架构创新,主要供研究者选择基线时参考。
Yuzhe Huang et al. · 发布首个全面的手部触觉表征基准及数据集,涵盖多种传感器设计。虽无核心算法突破,但为触觉操作研究提供了必要的标准化评估平台。
Bartłomiej Baranowski et al. · 提出全景重投影方法提升VLM的3D场景理解能力,无需复杂几何编码器。虽主要贡献在视觉表征,但其空间推理增强对具身VLA有间接参考价值。
Nikita Kachaev et al. · 系统性评估VLA微调后常识与世界知识的保留情况。揭示知识遗忘现象,为平衡机器人技能学习与通用知识保持提供诊断依据,属重要基准分析。
Hong Yang et al. · 扩展ERQA基准以评估具身AI的空间、程序及常识推理能力。提供细粒度诊断工具,帮助识别VLA在复杂推理任务中的具体短板。
Jianing Zhang et al. · 利用语言指令预测3D点云轨迹,增强对物理交互的预判能力。虽未直接集成VLA,但其运动预测模块可作为VLA感知-规划链路的有益补充。