FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
提出用光流作为世界动作模型(WAM)的统一动作表示,解决视频生成器与控制对齐难题。为 VLA/WAM 提供了新的动作空间建模思路,具有直接的方法论参考价值。
提出用光流作为世界动作模型(WAM)的统一动作表示,解决视频生成器与控制对齐难题。为 VLA/WAM 提供了新的动作空间建模思路,具有直接的方法论参考价值。
Yuzhou Wu et al. · 针对 VLA 推理延迟高的问题,识别并消除视觉特征中的时间冗余。提供具体的工程优化方案,有助于提升 VLA 在资源受限设备上的实时部署能力。
Mohan Liu et al. · 引入 3D 高斯泼溅(3DGS)作为 VLA 的几何与语义 grounding,弥补传统 2D VLA 缺乏显式 3D 场景理解的缺陷。为提升 VLA 的空间感知和操作精度提供了新架构方向。
Zebin Yang et al. · 针对 Jetson Orin 等低功耗设备,提出前瞻对齐的异步推理框架以实现 VLA 实时控制。提供明确的嵌入式部署工程路径,对边缘侧 VLA 落地具有高复用价值。
Yilun Kong et al. · 针对 VLA 的 RL 微调,提出结构化探索策略(ExToken)以降低环境交互成本。解决了 VLA 从模仿学习到强化学习过渡中的样本效率瓶颈,方法具有直接应用潜力。
Zhao Yang et al. · 解决 VLA 中分块动作预测(Chunked Action)导致的边界抖动问题,通过连续性约束提升策略平滑度。针对当前主流 VLA 架构的具体痛点,提供可复用的训练/推理改进方案。
Yixian Zhang et al. · 通过记忆引导代理将冻结的 VLA 转化为可靠的操作原语。提供了一种无需重新训练即可增强 VLA 长期依赖处理和稳定性的后处理/Agent 层方案,具有较高复用价值。
Shengzhuo Yang et al. · 提出 2D 时空掩码机制以增强 VLA 的特征桥接能力。针对自回归 VLA 中的信息丢失问题提供具体改进,方法轻量且易于集成到现有架构中。
Hengyuan Hu et al. · 提出视觉接口代理(VIA),利用基础模型的能力通过 GUI 界面控制机器人。为 VLA 提供了一种新的交互范式和高层规划思路,具有独特的 Agent 控制视角。
Pinhan Fu et al. · 关注 VLA 模型的对抗后门攻击防御,属于安全领域。虽与 VLA 相关,但非核心性能或泛化能力提升,且主要侧重推理时防御机制,应用紧迫性低于算法本体改进。
Lirui Zhao et al. · 提出无监督的价值修正方法以改善强化学习中的进度代理信号质量。虽涉及机器人学习,但未明确结合 VLA 架构或语言指令,更偏向通用 RL 技巧,VLA 直接相关性较弱。
Ahaan Kotian et al. · 专注于越野移动机器人的导航鲁棒性,处理模态缺失问题。属于移动基座控制而非机械臂操作 VLA,且未体现多模态大模型在复杂操作任务中的核心优势,领域跨度较大。
Yu Fang et al. · 通过失败合成生成密集奖励信号以辅助 RL。虽提及视觉语言奖励模型,但核心贡献在于奖励塑造技术,未深入探讨其与 VLA 架构的深度耦合,VLA 特异性不足。
Jiayi Tian et al. · 提出一个具备终身记忆的多模态机器人代理操作系统。属于系统层/中间件创新,虽服务于 VLM/VLA,但非底层算法或模型架构突破,更多是工程集成框架。
Tri Le et al. · 发布大规模机器人设计数据集。属于数据资源类工作,重要但不紧急,且侧重于设计理解而非操作控制,与 VLA 核心任务距离较远。
Ian Chuang et al. · 利用人类注视和中央凹视觉 Transformer 提升学习效率。虽涉及视觉注意力机制,但未明确整合语言指令或 VLA 端到端框架,更偏向于视觉表征学习的改进。
Yuanjie Lu et al. · 利用 VLA 模型自适应调整规划器参数。属于 VLA 与传统规划器的混合架构尝试,但摘要未展示显著的性能超越或新范式,更多是参数调优层面的应用。
Motubrain Team et al. · 提出统一的世界动作模型 Motubrain。虽概念新颖,但摘要描述较为笼统,缺乏具体 benchmark 对比和消融实验细节,暂无法判断其相对于现有 WAM/VLA 方法的实质性突破。
Yirui Sun et al. · 针对像素空间 WAM 提出状态自适应调度器。属于 WAM 内部模块优化,未体现对 VLA 整体架构或泛化能力的根本性改变,贡献粒度较小。
Robert Jomar Malate et al. · 专注于遥操作数据收集中的手部重定向算法。虽服务于 VLA 数据质量,但属于数据采集预处理环节,非 VLA 模型本身的算法创新。
Shaopeng Zhai et al. · 提出基于 VLAC-Cut 的数据筛选管道以提升人工标注效率。属于数据工程工具,虽有用但非算法核心创新,且“最大化人类效率”表述略显营销化,缺乏技术深度展示。
Yi Li et al. · 引入对象中心表示以替代全局场景嵌入进行视觉运动模仿学习。虽与 VLA 视觉编码相关,但未明确结合语言指令或多模态对齐,更偏向于纯视觉策略的表征学习。
Wenke Xia et al. · 关注离线到在线 RL 中的价值估计可靠性。属于通用 RL 理论在机器人中的应用,未特指 VLA 架构,且摘要未展示其在 VLA 微调中的具体优势。
Weichen Zhang et al. · 发布无人机具身感知基准 ActiveFly-Bench。属于数据集/基准工作,虽结合 VLA 概念,但主要贡献在于评测体系构建,非算法模型创新。
Rushuai Yang et al. · 针对流匹配(Flow-matching)策略的 RL 驯服方法。虽涉及生成式策略,但未明确与 VLA 的语言模态结合,更偏向于连续控制算法的通用改进。
Haojie Huang et al. · 通过像素分类学习 3D 闭环操作策略。属于动作空间表示的创新,但未体现语言指令的作用或 VLA 的多模态特性,更接近传统的视觉伺服或扩散策略变体。