Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
Mingyang Lyu et al. · 提出对Flow-Matching VLA进行RL精调,显著超越SOTA基准(如CALVIN)。解决了VLA仅靠BC受限的核心瓶颈,在多个Benchmark上展示显著优势,具备新训练范式特征。
Mingyang Lyu et al. · 提出对Flow-Matching VLA进行RL精调,显著超越SOTA基准(如CALVIN)。解决了VLA仅靠BC受限的核心瓶颈,在多个Benchmark上展示显著优势,具备新训练范式特征。
提出测试时缩放框架,通过推理机制和历史信息利用提升策略性能。为VLA部署提供新的推理优化思路,可直接应用于现有模型以提升长尾任务表现。
Anıl Can Ateş et al. · 利用VLM作为奖励函数解决长程操作RL稀疏奖励问题,结合微任务学习分解复杂任务。提供了一种无需密集人工标注的RL训练范式,适用于长程操作场景。
Yiyuan Pan et al. · 提出推理时行为引导方法,通过物理感知的任务结构重配置满足用户偏好。解决了预训练策略在测试时适应新约束的问题,具有明确的工程应用价值。
Vidullan Surendran et al. · 通过状态门控专家桥接手持数据与遥操作监督,解决接触丰富操作中的数据分布差异。为低成本数据采集(UMI)提供了有效的迁移学习方案,可复用性强。
Yuan Xu et al. · 引入结构化阶段和关键帧监督改进VLA微调,避免全时间步均匀监督带来的噪声。提供了具体的训练技巧,可直接用于提升现有VLA模型的微调效果。
Jiayu Yang et al. · 针对流匹配VLA提出相位感知MoE动作专家,解决多阶段操作的可靠性问题。改进了VLA的动作生成模块,具有明确的架构创新和实验验证。
Jiayu Yang et al. · 引入物理可行性和自反思调节机制,增强VLA在长程操作中的鲁棒性。通过自我修正机制解决执行偏差,为VLA部署提供了新的可靠性保障手段。
Tao Lin et al. · 探索仅通过语言-动作预训练实现VLA,减少对视觉监督的依赖。挑战了传统VLA的多模态对齐范式,可能为解决视觉主导问题提供新路径,值得深入阅读。
Xingyu Ren et al. · 利用部署前的烟雾测试数据监督异构VLA策略选择,将评估过程转化为训练信号。提供了一种高效的模型路由和选择机制,具有明确的工程应用价值。
Manish Kumar Govind et al. · 利用世界动作模型生成未来观测,提出递归生成回放框架进行持续模仿学习。结合了世界模型与IL,有效解决数据效率和持续学习问题,是VLA的重要扩展方向。
Arthur Allshire et al. · 发布ABC-130K大规模开源遥操作数据集及完整BC训练栈。填补了高质量开源数据空白,为VLA社区提供了重要的基础设施和数据资源,本周即可复用。
Xincheng He et al. · 利用VLM种子可微仿真进行刚体动态参数识别,提升数字孪生保真度。为VLA提供了更准确的物理环境建模工具,有助于改善策略的物理一致性。
Siyin Wang et al. · 引入上下文世界建模以增强VLA对新设置(如相机视角变化)的泛化能力。通过忽略当前观测局限,利用上下文信息提升控制鲁棒性,是对VLA架构的有效补充。
Xianghui Wang et al. · 通过修剪提升VLA模型的内在策略效率,解决部署时的计算瓶颈。提供了具体的模型压缩/加速方法,对VLA实际落地具有重要工程价值。
Tyler Ga Wei Lum et al. · 探究灵巧手预训练对精密装配的关键因素,结合Play Pretraining与RL。为灵巧操作VLA提供了重要的训练策略洞见,特别是针对接触丰富任务。
Siyu Wu et al. · 提出触觉感知世界动作模型,通过非对称注意力融合触觉信息。填补了触觉VLA方向的空白,提升了接触丰富操作中的物理完整性预测。
Zhihao Gu et al. · 从动态专家混合视角研究终身机器人操作以缓解灾难性遗忘。方法相邻但缺乏明确的VLA架构集成路径,且主要关注参数高效微调,属于增量改进。
Baiqi Li et al. · 发布基于行为 grounding 的新 benchmark,强调视频中的空间布局和物体历史。作为数据集/基准论文重要但不紧急,需等待后续基于此基准的方法论出现。
Kaijun Wang et al. · 学习结构化场景接口以增强低数据 regime 下的空间 grounding。方法创新一般,主要是在表征层面的改进,缺乏对VLA核心瓶颈的突破性解决。
Guodong Zhang et al. · 构建关系型6D可供性图以连接抽象语义与物理控制。侧重于感知与表征,虽相关但未直接涉及VLA动作生成架构,属于相邻领域工作。
Mingyang Lyu et al. · 提出VLA统一诊断安全基准,评估模型在物理世界中的安全性限制。作为基准论文重要,但本身不提供新的VLA架构或训练方法,归为值得了解。
Ilia Larchenko · LeHome挑战赛获奖方案,针对双臂衣物折叠任务优化VLA策略。属于特定任务的工程解决方案,通用性有限,但展示了VLA在灵巧操作中的应用潜力。
Junhao Shi et al. · 探讨从孤立技能到日常物理自主性的演进,涵盖网络与物理域的统一编排。概念宏大但偏向系统综述或高层架构设计,缺乏具体的VLA底层技术细节。
Alexandre Chapin et al. · 提出基于槽位的任务感知对象中心表征,增强视觉基础模型的结构性。侧重于感知表征改进,虽有助于操作但未直接改变VLA架构,属于相邻贡献。
Syed Hamzah Rizvi et al. · 分析Sim-to-Real转移中预算分配的权衡,提供理论洞察而非具体VLA方法。属于元分析类工作,对实验设计有指导意义但不直接贡献新算法。
分析世界模型幻觉的可预测性与预防方法。虽与VLA的世界模型组件相关,但侧重于生成模型的理论分析,未直接提出VLA架构改进。
Jiaxu Xing et al. · 通过变分神经动力学实现持续策略学习,应对硬件磨损等动态变化。方法相邻但缺乏明确的VLA集成证据,更多是控制理论的延续。
Munachiso Samuel Nwadike et al. · 探讨智能是否需要超越直接经验的推理能力,提出Einstein世界模型概念。偏哲学或基础AI理论,缺乏具体的机器人操作实验支撑。
Bin Hu et al. · 发布物理可编辑世界模型数据集,支持游戏/仿真环境编辑。虽涉及物理交互,但主要面向生成式世界模型社区,非直接VLA控制。
Zizhao Yuan et al. · 重新思考灵巧世界模型的条件输入,分析不同动作的重要性。侧重于世界模型的内部机制分析,未提出新的VLA架构或训练范式。
Jingyi Cui et al. · 提供JEPA世界模型的泛化理论分析。纯理论研究,虽对理解世界模型有帮助,但无直接VLA应用路径。