RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation
将自回归归一化流引入离线RL,解决扩散策略似然不可计算的问题,支持基于似然的后训练优化。为VLA策略的离线微调提供了新的概率建模工具,本周可复用于提升策略稳定性。
将自回归归一化流引入离线RL,解决扩散策略似然不可计算的问题,支持基于似然的后训练优化。为VLA策略的离线微调提供了新的概率建模工具,本周可复用于提升策略稳定性。
Prachi Garg et al. · 针对VLA在新机器人部署时的硬件不匹配问题,提出自演示生成控制微调方法。解决了跨平台迁移中的具体工程痛点,提供明确的微调路径,适合快速应用。
Chao Xue et al. · 构建分层触觉世界动作模型,显式建模触觉状态的物理依赖关系,优于现有隐式表示。填补了触觉VLA中物理一致性建模的空白,对接触丰富操作有直接指导意义。
Jiaqi Wang et al. · 通过梯度感知的技能子空间适应解决VLA连续学习中的灾难性遗忘问题。在保持预训练知识的同时注入新技能,为多任务VLA的持续进化提供了可复用的算法模块。
Boyang Zhang et al. · 引入奖励引导的多路径潜在推理,增强VLA在长视界和高不确定性下的测试时决策能力。通过思维链扩展提升推理深度,为VLA推理阶段的优化提供了新思路。
Tianhang Yang et al. · 在MoE-VLA中引入运动学监督的路由机制,解决专家路由失效问题。通过结合运动学信号改善推理时的专家选择,提升了VLA处理异构动作的能力,具有明确的工程改进点。
Songwei Wu et al. · 针对人形机器人立体视觉,提出具身感知的令牌路由机制以融合互补视图。在不重新训练策略的前提下优化视觉接口,提升了长视界VLA控制的鲁棒性。
Yechan Park et al. · 利用3D高斯泼溅实现视角规范化,使冻结的VLA策略无需重训即可适应视角变化。提供了一种轻量级、即插即用的部署增强方案,极具工程实用价值。
Xin Yan et al. · 推进VLA模型的1-bit后训练量化,显著降低计算和内存占用。解决了VLA在资源受限边缘设备部署的关键瓶颈,具有极高的工程落地价值。
Zhengyi Luo et al. · 提出用于人形机器人全身控制的运动跟踪方法,强调自然性和鲁棒性。虽涉及具身控制,但摘要未明确展示VLA架构或语言指令交互,偏向底层控制与模仿学习。
Harry Zhang et al. · 利用神经降阶动力学加速复杂机器人系统的强化学习仿真评估。属于仿真效率优化方向,虽有助于大规模训练,但未直接涉及VLA核心架构或推理机制。
Xizhou Bu et al. · 深入分析潜在动作模型(LAMs)的关键设计要素,探讨无标签视频利用中的潜在动作表征。属于基础理论分析,虽重要但缺乏即时可用的新方法或基准突破。
Julien Merand et al. · 提出对象无关的灵巧抓取规划器,旨在解决特定数据集训练的泛化瓶颈。虽涉及灵巧操作,但侧重于传统抓取规划而非端到端VLA控制,与主流VLA范式距离较远。
Yuzhe Huang et al. · 建立基于第一人称视觉的灵巧全手触觉表征基准。作为数据集/基准类工作,对触觉VLA研究有长期价值,但非紧急的方法论突破。
Bowen Jing et al. · 提出面向可变形物体操作的视触觉安全基准。关注物理约束下的安全性,丰富了操作场景维度,但属于基准建设,暂无直接算法贡献。
Yuehao Huang et al. · 构建带3D场景条件的世界导航模型,用于闭环视觉语言导航。虽涉及VLA概念,但主要聚焦于导航领域,与通用机器人操作VLA的核心目标存在一定偏差。
Yufei Liu et al. · 复用视频扩散模型恢复遮挡鲁棒的3D手部运动。虽为具身AI提供数据预处理手段,但核心贡献在于计算机视觉重建,非直接的VLA控制方法。
Jingxuan Zhang et al. · 发布真实世界物体的密度场数据集,旨在提升物理属性推断能力。作为数据资源对具身AI有价值,但属数据集类工作,非方法论突破。
Lingwei Dang et al. · 合成多视角手物交互数据,协调外观与3D运动。主要用于动画和数据生成,虽服务于具身AI数据需求,但非核心控制算法。
Rohan Kota et al. · 研究分布式触觉反馈对遥操作灵巧度的影响。虽涉及触觉和具身交互,但侧重于人机交互体验评估,未提出新的VLA架构或训练方法。
Julien Merand et al. · 基于接触拓扑条件合成灵巧抓取,关注功能任务的接触方式。属于传统抓取规划范畴,未体现VLA的语言-视觉-动作端到端特性。
Fujiang Yuan et al. · 综述LLM、知识库与推理能力在通用具身智能中的应用。属于宏观综述,缺乏具体的VLA技术细节或实验验证,信息密度较低。
Zhixian Xie et al. · 结合RL与MPC的层次化框架,用于几何感知的Sim-to-Real操作。虽涉及接触操作,但方法偏向传统控制与RL混合,未明确整合VLA的大模型能力。
Yujia Chen et al. · 利用E-process理论提供Sim-to-Real性能的置信度序列。属于统计学习方法,虽可用于评估,但与VLA核心架构或训练范式无直接关联。
Ziyang Cheng et al. · 提出行为世界模型用于稳健的人形机器人全身控制。虽涉及具身控制,但侧重于底层WBC与世界模型的结合,未明确展示VLA高层语义理解能力。
Pardis Taghavi et al. · 提出免训练的稀疏注意力机制加速视频Transformer。虽可应用于VLA加速,但核心贡献在通用视觉生成领域,非VLA专用优化。
Eldad Haber et al. · 改进流匹配算法,通过路径校正提升生成建模效果。属于通用生成模型理论,虽可能间接惠及VLA,但无直接机器人应用证据。
Riccardo O. Feingold et al. · 利用分割掩码作为Sim-to-Real桥梁,构建可控的灵巧世界模型。虽涉及世界模型,但侧重于仿真到真实的域适应技术,非VLA核心推理架构。
Yang Liu et al. · 探索世界模型中低秩动态有效潜载体以进行反事实推演。属于世界模型内部机制分析,理论性强,短期难以转化为VLA直接应用。
Jiaming Fan et al. · 利用黎曼流匹配在4D高斯泼溅上进行动态4D场景重建。属于计算机视觉重建领域,虽为具身感知提供基础,但非VLA控制方法。
Taoyong Cui et al. · 提出正交JEPA以分解潜在世界模型的预测状态。属于世界模型基础架构改进,虽相关但缺乏针对VLA特定任务(如操作、导航)的实证。