MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
Yuhan Hu et al. · 引入时空动作分词以动态调整运动模式,增强 VLA 对任务上下文的适应性;提供新的动作表征思路,可直接集成至现有 VLA 解码头。
Yuhan Hu et al. · 引入时空动作分词以动态调整运动模式,增强 VLA 对任务上下文的适应性;提供新的动作表征思路,可直接集成至现有 VLA 解码头。
Mingyang Sun et al. · 利用解析几何概念为 VLA 提供显式运动学引导,弥补 2D 输入的空间感知缺陷;方法轻量且可即插即用,提升复杂操作成功率。
Yushan Liu et al. · 结合动作条件世界模型在执行时验证长视界移动操作,解决开环执行错误累积问题;提供实时纠错机制,显著提升鲁棒性。
Tianhang Yang et al. · 在 MoE-VLA 中引入运动学监督的路由机制,解决异构动作路由失效问题;通过解耦运动规划与视觉执行,提升专家利用率。
Derek Ming Siang Tan et al. · 引入测试时缩放与自适应 RL 潜变量组合 steering,提升 VLA 域外泛化能力;提供无需重训的在线优化方案,实用性强。
Zuojin Tang et al. · 提出带时间约束的分布潜在动作模型,利用无标签视频预训练 VLA 动作先验;缓解数据稀缺问题,支持从互联网视频迁移。
Hengyi Xie et al. · 实现极低资源占用(<1GB VRAM)下 32Hz 实时 VLA 推理,突破部署瓶颈;提供高效架构设计细节,极具工程复用价值。
Junnan Nie et al. · 提出相位感知的动作块执行策略,优化扩散/VLA 策略的开环执行阶段;简单有效,可立即应用于提升现有 chunking 方法的稳定性。
Gershom Seneviratne et al. · 利用野生第一人称视频和几何轨迹监督训练导航 VLA,解决导航数据稀缺问题;提供从非机器人视频迁移的新路径。
Iok Tong Lei et al. · 针对小型 VLA 模型的空间定位与动作连贯性问题进行优化,提升边缘设备部署性能;提供轻量化 VLA 的训练技巧。
发布基于工业 CG 的世界模型数据集与协议,填补数据空白但缺乏真实机器人验证,属重要基础设施而非直接 VLA 方法。
改进世界模型潜在分布正则化方法,虽有助于 VLA 底层表示学习,但侧重通用 WM 训练稳定性,非 VLA 核心架构创新。
Xinyu Yang et al. · 提出具身智能可信度分级框架,属系统级综述/规范,无具体 VLA 算法或实验贡献,适合了解领域标准但不紧急。
Jialiang Li et al. · 探索零人类演示下的策略自举与巩固,虽具创新性但摘要未明确 VLA 架构关联及具体 benchmark 结果,暂归为值得了解。
Gabe Everett et al. · 提出对称性并行化框架加速机载 RL 训练,侧重工程扩展性与数据增强,非 VLA 核心范式突破,但对大规模部署有参考价值。
Jia Luo · 将被动视频转化为可编辑的物理经验以弥合具身差距,概念新颖但侧重数据合成 pipeline,需进一步验证对 VLA 训练的直接增益。
William Shen et al. · 整合基础模型与 TAMP 的模块化操作系统的更新版本,侧重系统集成而非单一 VLA 算法突破,适合参考架构设计。
James Zhao et al. · 专注于三臂系统的视觉运动模仿学习,属特定硬件配置下的控制策略,非通用 VLA 架构创新,适用场景较窄。
Yongxin Su et al. · 基于全景图的无限室内 3D 世界生成管道,主要贡献在仿真环境构建,间接服务于 VLA 训练,非直接算法进展。
Jasorsi Ghosh · 从多智能体演示中学习隐式因果世界模型,侧重理论分析与因果推断,缺乏具体的 VLA 应用验证。
Kaizhen Tan et al. · 探讨潜在世界模型中物理参数的可识别性,属基础理论研究,对理解 VLA 内部表示有帮助但无直接工程产出。
Marco Iannotta et al. · 研究上下文感知策略的 Sim-to-Real 迁移,侧重 RL 泛化性分析,未明确结合 VLA 架构或大模型先验。
Jiaxin Bai et al. · 改进 JEPA 架构以支持计划感知的表示学习,虽可用于 VLA 底层建模,但主要贡献在于通用 WM 训练目标,非 VLA 专属。
Anurag Bagchi et al. · 利用互联网先验构建第一人称世界模型,侧重视频生成与预测,虽具启发性但缺乏机器人操作闭环验证。