Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching
William English et al. · 提出基于约束流匹配的神经符号安全引导层,可直接嵌入现有VLA模型以增强安全性,无需重新训练基座模型。
William English et al. · 提出基于约束流匹配的神经符号安全引导层,可直接嵌入现有VLA模型以增强安全性,无需重新训练基座模型。
Zhiyuan Zhang et al. · 通过想象触觉表征解决硬件依赖问题,为缺乏触觉传感器的VLA提供接触丰富操作的替代方案,具有明确的工程应用价值。
Yi Pan et al. · 提出轻量级检测-校正推理模块,动态调整动作执行 horizon,可即插即用提升现有VLA模型的时序一致性和效率。
Liuhaichen Yang et al. · 引入Q值引导的流匹配推理方法,允许在不重训基座策略的情况下进行测试时引导,提升了Flow-based VLA的控制灵活性。
Jincheng Tang et al. · 提出混合动态数据收集策略以改善VLA的空间泛化能力,通过主动视角选择解决静态视角不足的问题,具有数据层面的实用价值。
Junhao Shi et al. · 提出任务无关的移动预训练阶段,旨在缓解VLA对专家演示数据的依赖,为VLA预训练提供了新的范式思路。
Ling Xu et al. · 提供跨异构机器人的便携式VLA推理运行时,解决了部署碎片化问题,开发者可立即用于加速VLA模型在边缘设备的落地。
Wanpeng Zhang et al. · 利用传输差异作为VLA预测可靠性的信号,提供了一种无需额外训练的置信度评估方法,有助于提升部署安全性。
Songqiao Hu et al. · 提出即插即用的安全约束层,可无缝集成到现有VLA模型中,无需重新训练即可增强操作安全性,工程复用性强。
Ninghao Zhang et al. · 提出免训练的注意力重校准方法以恢复VLA的语言 grounding,可直接应用于现有模型以改善指令遵循能力,零成本部署。
Runze Xu et al. · 利用人类第一人称视频中的运动焦点潜在动作进行跨具身VLA训练,有效缓解数据稀缺问题,提供了新的数据利用路径。
Hexian Ni et al. · 利用VLM反馈优化RL奖励设计,虽涉及VLM但核心贡献在RL奖励机制,且未明确展示在VLA架构上的直接集成效果。
Peng Yun et al. · 构建物理原理驱动的3D世界模型以辅助动态操作,目前主要停留在仿真验证阶段,缺乏真实机器人部署证据。
Yongjie Bai et al. · 预测动作相关的场景变化以增强VLA能力,侧重于世界模型与动作的联合建模,但实验主要在仿真环境,真实泛化性待验证。
Satoshi Yamamori et al. · 通过塑造执行器现实来缩小Sim2Real差距,虽对机器人学习重要,但未直接针对VLA架构或训练范式进行创新。
Haokun Liu et al. · 专注于局部语言导航的低级动作表示,属于VLA相邻领域(导航),但未涉及通用的具身操作或VLA核心架构。
Boyang Sun et al. · 从第一人称视频学习意图感知的相机运动,侧重于感知与导航的前置步骤,未直接涉及VLA的操作策略生成。
Yuquan Xue et al. · 结合世界模型实现闭环真机RL,虽涉及真实机器人,但核心在于RL采样效率,未明确展示对VLA预训练或微调的直接贡献。
Guoyang Xia et al. · 提出统一训练框架并引入未来潜在对齐,虽名为VLA框架,但摘要未展示显著优于SOTA的基准结果,更像工程整合。
Zhanyi Sun et al. · 通过保持分布内学习鲁棒视运动策略,主要针对BC方法的协变量偏移,虽相关但未特指VLA架构的创新。
Yihang Zhu et al. · 学习语义原子技能以解决多任务干扰,侧重于技能分解而非VLA端到端架构,且未明确展示在大型VLA基准上的优势。
Borong Zhang et al. · 开源VLA基准测试框架,有助于量化模型极限,属于基础设施类工作,虽重要但不具备方法论上的即时创新性。
Letian Fu et al. · 聚焦Code-as-Policy范式的基准与改进,虽与VLA互补,但核心在于代码生成代理,非传统VLA视觉-动作映射研究。
Yu Sun et al. · 提供面向推理型通用机器人操作的真实世界评估平台,属于评测基准类工作,对理解模型局限有价值但非方法创新。
Ziyu Shan et al. · 通过解耦视频生成构建高效具身世界模型,侧重于状态预测而非直接的动作策略生成,与VLA核心任务有距离。
Ronghan Chen et al. · 提出移动与操作统一的世界动作模型,虽概念先进,但摘要未展示超越现有WAM/VLA的显著性能提升,需进一步验证。