Learning 4D Geometric Priors for Inference-Efficient World Action Models
Jianjun Zhang et al. · 提出在World Action Models中引入4D几何先验,通过联合建模视觉未来动力学与可执行动作序列,提升推理效率。解决了现有视频-动作共训练方法过度优化外观而忽视几何结构的问题,为高效VLA推理提供新路径。
Jianjun Zhang et al. · 提出在World Action Models中引入4D几何先验,通过联合建模视觉未来动力学与可执行动作序列,提升推理效率。解决了现有视频-动作共训练方法过度优化外观而忽视几何结构的问题,为高效VLA推理提供新路径。
Hanan Gani et al. · 利用任务对齐的模拟未来(Simulated Futures)引导机器人策略学习,解决预训练视频生成模型在想象未来时偏离任务意图的问题。通过推理引导增强Visuomotor控制的可靠性,适合希望改进基于世界模型的规划的研究者参考。
Andreas Sochopoulos et al. · 将最优传输Q-learning应用于Flow Policy的转向与加速,旨在解决扩散/流策略在VLA模型中采样步骤多、速度慢的问题。提供了一种结合RL与流匹配的新思路,可直接用于优化现有Flow-based VLA的推理速度。
Ryuji Oi et al. · 提出无需训练的VLA加速方法,通过动作缓存与 refinement 机制减少重复计算。直接针对Flow Matching等VLA模型的推理瓶颈,代码实现简单且即插即用,本周即可在现有VLA部署中应用以提升FPS。
Changti Wu et al. · 提出结构感知数据选择方法SIEVE,解决VLA模型训练中数据冗余和噪声问题。通过筛选高质量演示数据提升模仿学习效率,方法具有通用性,可直接应用于Open-X等大规模数据集预处理阶段。
Jiaming Liu et al. · 将2D VLA模型提升至3D几何与动力学感知层面,解决传统VLA缺乏空间推理能力的问题。通过引入3D几何先验增强操作策略的物理一致性,为提升VLA在复杂空间任务中的泛化性提供了具体技术方案。
Zijun Lin et al. · 针对VLA模型的失败恢复机制,结合推理能力检测执行偏差并触发恢复策略。增强了VLA在长程任务中的鲁棒性,提供了处理意外状态的具体工程方案,适合关注VLA安全部署的研究者。
Pengwei Zhang et al. · 提出ResTacVLA,通过残差触觉表示解决VLA模型中触觉模态坍塌问题,增强接触丰富操作的能力。填补了触觉VLA方向的空白,提供了具体的多模态融合技巧,对提升灵巧操作性能有直接参考价值。
Haitao Lin et al. · 提出PoseVLA,通过通用姿态预训练解耦高层感知与稀疏动作监督,解决特征坍塌和低效训练问题。引入了新的预训练任务以增强VLA的泛化性,方法具有创新性且易于复现,适合改进现有VLA backbone。
Ke Rui et al. · 诊断长程家庭任务中技能组合时的语义交接失败问题,分析技能边界模糊导致的后条件不满足现象。属于Agentic VLA控制中的错误分析工作,虽无新算法但提供了重要的工程洞见和故障模式分类。
Xinye Yang et al. · 针对灵巧手真实世界学习难点,提出潜在运动先验引导的模仿学习与在线强化学习结合方法。主要贡献在于缓解高维动作空间的探索困难和接触断裂问题,侧重于灵巧手特定场景,非通用VLA架构创新。
Humphrey Munn · 发布面向农业机器人的苹果园仿真基准OrchardBench,支持GPU并行物理模拟。作为领域专用数据集/基准,有助于评估采摘机器人性能,但不涉及通用VLA核心算法或架构改进。
Wei Wu et al. · 介绍LingBot-VLA 2.0的工程改进,旨在缩小实验室与现实应用的差距。内容偏向系统整合与工程调优,缺乏明确的算法创新或跨平台泛化能力的理论突破,适合作为工程参考而非学术重点。
Haoyu Zhao et al. · 提出数字遥操作框架,利用动作条件世界模型解耦操作员时间与硬件限制。主要贡献在于数据收集范式的创新,虽与VLA数据扩展相关,但核心是遥操作技术而非VLA模型本身的架构或训练改进。
Haoyu Zhao et al. · 构建基于RGB-DF同步输入的4D具身世界模型,强调对3D结构动态变化的预测能力。虽然涉及世界模型这一热点方向,但摘要未明确展示其在标准VLA基准上的显著超越或新架构特性,暂归为值得了解。
Martin Matak et al. · 提出“先规划后评估”的多目标抓取流程,通过后验成功率评估优化基于学习的抓取管线。专注于抓取子任务的性能提升,未涉及VLA整体架构或语言-动作对齐的核心问题,属于局部优化。
Haoran Ding et al. · 提出任务感知的语义-几何表示学习方法,使视觉运动策略能忽略背景变化等干扰因素。侧重于表征学习以提高对外观变化的鲁棒性,虽与VLA感知相关,但未直接改进动作解码或语言对齐模块。
Yibin Liu et al. · 利用强化学习激发视频MLLM的过程推理能力,使其从被动观察者转变为主动批评者。主要贡献在于提升高层任务监督的准确性,属于VLA上层规划/监督的改进,而非底层Visuomotor控制的核心突破。
Ryan Punamiya et al. · 发布大规模第一人称人类操作数据集EgoVerse,旨在解决机器人数据稀缺问题。作为重要数据资源,有助于提升VLA模型的泛化能力,但本身不包含新的模型架构或训练算法。
Huanming Liu et al. · arXiv:2605.23128v2 Announce Type: replace Abstract: Currently, Vision-Language-Action (VLA) models have become the most adopted paradigm for robotic manipulation for its great potential for task generalization. While most generative flow-matching action decoders for VLA control are often deployed with fixed sampling horizons, limiting state-dependent compute and temporal reuse across control cycles. We present $\pi_0$-EqM, which replaces the flow-matching expert in $\pi_0$ with an Equilibrium Ma
Zeyi Liu et al. · 结合偏好校准的人类反馈强化学习,提高在线人机协作的数据效率。侧重于RL奖励塑造和人机交互机制,虽适用于机器人操作,但与当前主流VLA预训练范式关联度较低,属于辅助性优化手段。
Satoshi Yamamori et al. · 提出执行器现实塑造技术,通过调整仿真中的电机动力学模型以弥合Sim-to-Real差距。专注于底层控制层面的域适应问题,不涉及VLA高层语义理解或视觉-语言对齐,属于传统机器人学范畴。
Tianxing Chen et al. · 发布统一仿真与真实的基准RoboDojo,旨在全面评估通用机器人操作策略。作为评估工具,有助于标准化VLA性能比较,但本身不提供新的算法或模型改进,属于基础设施类工作。
Han-Jun Ko et al. · 通过视觉动作结果推理对齐,桥接物理推理与任务泛化,解决VLM在交互物理推理中的幻觉问题。侧重于高层逻辑推理与物理一致性的对齐,虽与VLA相关,但更偏向认知层面而非底层控制策略。
综述世界模型的定义与发展路线图,涵盖从模型基RL到具身AI的多个子领域。作为概念梳理和趋势展望,有助于理解领域全貌,但不包含具体的技术创新或实验结果。
Paul Koch. Adem Karakurt et al. · 发布GraspIT数据集,提供经过物理验证的SE(3)抓取姿态注释,连接仿真与真实世界。作为高质量数据资源有助于提升抓取模型性能,但非VLA核心算法创新,归类为数据集。
Yuanchuan Lai et al. · 提出基于运动重定向和自适应力控制的双臂灵巧遥操作系统。侧重于遥操作系统的工程实现与控制算法,虽为VLA提供数据收集手段,但未涉及VLA模型本身的训练或推理机制。
Ethan Foong et al. · 研究资源感知下的顺序抓取条件灵巧操作,关注多技能序列执行中的对象保持控制。专注于灵巧手特定任务的性能优化,未涉及通用VLA架构或语言指令跟随能力。
Nuo Chen et al. · 提出用于评估世界模型中多智能体动力学的物理基准,关注车辆碰撞等安全关键场景。主要应用于自动驾驶或多智能体仿真,与单机器人VLA操作场景差异较大。
Pu Li et al. · 提出将奖励函数视为智能体以增强具身世界模型的探索能力和行为多样性。虽涉及世界模型,但侧重于RL奖励设计的理论探讨,未明确展示在VLA基准上的应用或显著提升。
Anthony Hu et al. · 引入首个多人交互式世界模型,处理复杂物理互动环境中的多智能体行为。主要贡献在于动态环境的建模,与单机器人VLA操作场景关联度较低,属于多智能体仿真方向。
Team Moxin et al. · 提出快速世界模型MoWorld,强调高帧率推理以实现实时感知和规划。虽提及自主系统应用,但摘要未明确其在机器人操作任务中的具体表现或VLA相关性,暂归为一般世界模型进展。