EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models
Thien-Loc Ha et al. · 提出旋转等变VLA框架,通过几何归纳偏置解决模型在不同朝向下泛化难的问题。在多个基准上显著优于基线,从架构层面解决了VLA核心的几何泛化瓶颈,具备战略意义。
Thien-Loc Ha et al. · 提出旋转等变VLA框架,通过几何归纳偏置解决模型在不同朝向下泛化难的问题。在多个基准上显著优于基线,从架构层面解决了VLA核心的几何泛化瓶颈,具备战略意义。
Hongkang Cui et al. · 将扩散策略应用于视觉伺服(Visual Servoing),解决传统回归方法在噪声下的轨迹抖动问题。提供了更鲁棒的闭环控制方案,可直接用于提升现有VLA底层的执行稳定性。
Chuer Pan et al. · 提出动作-视图增强技术,仅需少量演示即可生成大量多样化训练数据,显著提升视动策略对初始配置和障碍物的泛化能力。该方法即插即用,极具工程实用价值。
Trong-Bao Ho et al. · 针对流匹配策略的延迟问题,提出通过初始噪声选择实现异步执行,平衡了多步动作生成的连贯性与实时控制需求。为VLA部署提供了具体的工程优化路径。
Jinghan Yang et al. · 利用信息论指标构建VLA模型的失败预测器,提供可解释的安全监控机制。有助于在实际部署中识别黑盒模型的潜在风险,是VLA安全落地的关键工具。
Zheyu Zhuang et al. · 利用镜像对称性从成对演示中学习,有效降低数据采集成本并提升工作空间泛化能力。提供了一种低成本扩充高质量VLA训练数据的可行方案。
Jonghoon Lee et al. · 提出基于物理合理性的多视角物体交换数据增强方法,解决VLA对未见物体外观/几何分布敏感的问题。直接针对数据稀缺痛点,易于集成到现有训练流程中。
Gia-Binh Nguyen et al. · 发现VLA微调只需更新少数层即可达到全量微调效果,大幅降低计算负担。为资源受限环境下的VLA定制提供了重要的工程洞见和轻量化方案。
Yandong Wang et al. · 针对双臂协作引入结构化动作建模,显式编码协调约束以改善双臂操作的同步性与效率。填补了VLA在复杂双臂协同任务中的建模空白,具有明确的应用价值。
Sizhe Yang et al. · 在World Action Model中引入持久记忆机制,提升对动态环境的长期状态跟踪能力。为VLA处理长视界、部分可观测任务提供了有效的世界模型增强方案。
Yuyang Zhang et al. · 质疑WAM对视频生成的依赖,提出仅通过图像编辑即可实现高效的世界模型预测。显著降低推理成本,为VLA的世界模型组件提供了轻量级替代方案。
Sangoh Lee et al. · 通过视觉注意力提示解决VLA在个性化指令(如“拿我的杯子”)中的实例区分难题。提升了VLA在复杂语义场景下的细粒度理解与执行能力,方法简单有效。
Wenli Xiao et al. · 实现真实世界中具身智能体的策略自改进,减少人工监督依赖。展示了Agentic VLA在闭环反馈中自我进化的能力,具有重要的工程落地示范意义。
Navin Ranjan et al. · 提出任务证据感知的混合精度量化框架,在保持VLA性能的同时显著压缩模型体积。为VLA在边缘设备上的高效部署提供了关键的量化技术方案。
Wenbo Ma et al. · 提出基于LEGO Duplo的组装基准WorkBenchMark,旨在评估智能制造中的符号推理与物理操作结合能力。作为新数据集/基准值得关注,但非核心VLA架构创新。
Junyi Zhang et al. · 探索通过“玩耍”让具身智能体自主获取可复用技能,减少对显式指令的依赖。属于Agentic控制的前沿探索,但目前多为概念验证或仿真,缺乏大规模真实机器人部署证据。
Yinsen Jia et al. · 引入时间自模仿学习机制,防止长视界任务中高效行为在训练过程中被遗忘。虽涉及RL精调,但主要贡献在于训练技巧优化,未提出新的VLA架构或显著超越SOTA。
Xuetao Li et al. · 聚焦音乐表演场景的人机协作生成,强调创造性而非通用操作能力。属于特定领域的应用研究,方法论对通用VLA泛化性提升的直接参考价值有限。
Jianing Guo et al. · 改进流匹配算法以关注频率特性,提升动作生成的连续性和一致性。虽是对Diffusion Policy/Flow Matching的改进,但更多是算法层面的微调,未展示跨平台SOTA突破。
Ziyuan Tang et al. · 介绍一种用于连续体机器人学习的可重复平台及同构遥操作系统。侧重于硬件平台与数据采集流程,虽有价值但非VLA算法或模型层面的核心进展。
Hengfei Zhao et al. · 提出基于FEM的视觉触觉仿真框架,解决GPU加速下应力场模拟精度不足的问题。是触觉VLA的重要基础设施,但本身不涉及VLA模型架构或训练范式创新。
Sha Yi et al. · 探索从人类演示中逆向设计机器人手部结构,涉及形态与控制联合优化。属于机器人本体设计领域,与当前主流VLA软件/算法研究方向差异较大。
Ellina Zhang et al. · 提出自监督3D对象中心场景表示学习方法,分解RGB-D数据为潜在粒子。虽有助于提升VLA感知模块的表征能力,但属于纯视觉/表示学习范畴,未直接结合动作。
Zhenyu Zhao et al. · 发布面向人形机器人的开放世界操作数据集,涵盖移动与灵巧操作。重要数据资源,但作为数据集论文,其紧迫性低于算法突破,归为值得了解。
Soofiyan Atar et al. · 强调接触力转移而非单纯运动迁移,实现灵巧手间的合规抓取策略迁移。侧重触觉/力控细节,虽相关但未触及VLA大模型核心架构,且实验规模有限。
Jiange Yang et al. · 从互联网视频中学习连续潜在运动表示,旨在扩大机器人学习的数据规模。属于预训练表征学习,虽有价值但缺乏与具体VLA控制策略结合的实证SOTA提升。
Pengcheng Wang et al. · 提出域自适应扩散策略以应对未见动力学变化。虽针对泛化性问题,但主要贡献在于RL控制领域的域适应技巧,对VLA整体架构影响有限。
Zirui Zheng et al. · 类似MemoryWAM,引入记忆增强的世界模型以支持持久操作。与今日其他WAM论文方向重叠,若无显著超越SOTA的表现,视为常规进展。