Hydra-0: Action Flow for Generalist World Modeling and Control
Hongyu Li et al. · 提出Hydra-0,一种基于动作流(像素运动)的通用世界模型与控制框架。统一了不同具身形态的世界建模接口,实现了跨平台迁移,解决了VLA泛化和跨具身迁移的核心瓶颈,且在多个基准表现优异。
Hongyu Li et al. · 提出Hydra-0,一种基于动作流(像素运动)的通用世界模型与控制框架。统一了不同具身形态的世界建模接口,实现了跨平台迁移,解决了VLA泛化和跨具身迁移的核心瓶颈,且在多个基准表现优异。
Dhia Naouali et al. · 提出通过代码重规划实现VLA闭环控制的方法,避免微调损失推理能力。亮点在于利用LLM代码生成进行在线修正,为VLA部署提供可复用的工程路径,提升鲁棒性。
Disha Kamale et al. · 利用VLM从演示中自动提取PDDL符号抽象,解决长程操作规划瓶颈。该方法将神经符号主义与VLA结合,提供了明确的长程任务分解工具,具有较高复用价值。
Chang Nie et al. · 提出以代理为中心的学习架构,旨在解决VLA在未知物理接触下的可靠性问题。通过交互式教学扩展策略覆盖范围,为VLA的持续学习和泛化提供了新的系统级思路。
Muhammad A. Muttaqien et al. · 引入人类反馈进行在线残差策略适应,修正ACT等模仿学习策略的分布偏移。方法直接针对VLA部署中的执行误差,提供了即插即用的在线优化模块,实用性强。
Zeyun Deng et al. · 改进GRPO算法以加速VLA策略优化,通过分割同结果组降低采样成本。直接解决VLA强化学习训练效率痛点,代码/方法易于集成到现有RLHF流程中。
Songwei Wu et al. · 提出面向人形机器人的双目光束路由机制,优化VLA对立体视觉信息的利用。针对头部安装相机的特定视角问题,提供了具体的多模态融合改进方案,适用于双臂/人形VLA。
Yuhwan Jeong et al. · 分析测试时增强(TTA)中重用与检索的策略选择,诊断VLA策略的提升空间。提供关于何时使用外部演示或内部采样的实证洞见,指导VLA部署时的推理优化。
Kaiming Zhong et al. · 结合JEPA世界模型与基于模型的防护盾,为VLA提供校准后的预测安全性保障。解决了VLA缺乏执行保证的问题,提出了混合架构的安全控制方案,具有工程落地价值。
Zhen Zhang et al. · 解决VLA在处理逻辑连接词(如“或”)时的语义失败问题,保留多模态意图。针对VLA语言理解的结构性缺陷提出改进,提升了复杂指令下的操作准确性。
Zifeng Gao et al. · 利用一致性模型加速3D扩散策略推理,实现实时机器人操作。显著降低Diffusion Policy的计算延迟,解决了扩散模型在实时控制中的部署瓶颈,工程价值高。
Muhammad A. Muttaqien et al. · 结合视觉提示和标注引导改进ACT在密集场景下的抓取性能。通过简单的提示工程增强VLA的空间定位能力,方法轻量且易于在现有ACT模型上实施。
Qiwei Liang et al. · 提出动态感知的3D视觉表征预训练方法,弥补识别与操作间的差距。通过建模状态-动作-状态动力学,提升VLA对物理交互的理解,是有效的表征学习改进。
Zhihao Chen et al. · 结合KAN和RWKV优化3D流匹配策略,提升推理效率并减少UNet依赖。为扩散/流匹配类VLA策略提供新的骨干网络选择,旨在解决资源受限设备上的部署问题。
Perry Dong et al. · 提出样本高效的RL微调方法EXPO-FT,用于优化VLA策略。针对VLA预训练后适应新任务的数据稀缺问题,提供了高效的精调范式,直接提升SOTA潜力。
Yijing Zhou et al. · 提出动作-效应记忆预训练框架,学习紧凑的时间表征。不同于单帧视觉预训练,该方法强调历史动作与结果的关联,增强了VLA对时序物理因果的理解。
Shiqi Zhang et al. · 针对触觉丰富的灵巧操作,提出在线 refine 的触觉预测方法。填补了VLA中触觉模态融合的空白,提升了接触密集任务的精度,符合重点研究方向。
Boyang Shen et al. · 提出循环细化机制,让VLA根据任务难度自适应决定推理深度。解决了固定深度网络的计算冗余问题,通过早期退出或迭代 refinement 提升效率与精度平衡。
Shilin Ma et al. · 提出基于语义注意力和未来感知的Token剪枝方法,加速VLA推理。直接针对VLA计算量大、延迟高的问题,提供即插即用的加速模块,工程实用性强。
Perry Dong et al. · 探索在世界模型中进行Q-learning以提升样本效率,适用于VLA微调。将经典RL与世界模型结合,为VLA的后训练阶段提供了理论支持和潜在的高效算法路径。
Junfei Zhan et al. · 揭示边缘端VLM推理的能量瓶颈主要在文本生成而非视觉编码。为VLA系统的能效优化提供了关键洞见,指导硬件加速和模型压缩的重点方向。
提出无需高斯假设的对比逆动力学方法,用于JEPA世界模型。改进了世界模型的训练目标,避免了崩溃问题,为VLA的世界模型组件提供了更稳健的基础。
Lingjun Shao et al. · 提出仅靠触觉信号的粒子滤波方法, refine 手中物体位姿。解决了视觉遮挡下的精确操作难题,是触觉VLA的重要补充技术,具有明确的模块复用价值。
Isidoro Tamassia et al. · 利用神经符号世界模型实现零样本任务迁移。结合了符号规划的泛化性与神经网络的感知力,为VLA的零样本适应能力提供了可行的架构方案。
Hyojun Yun et al. · 提出将冻结视觉编码器卸载至NPU以加速策略训练的工程方案。针对VLA训练中的计算瓶颈,提供具体的硬件加速与内存优化技巧,极具工程复用价值。
Zhengyi Luo et al. · 提出用于人形机器人全身控制的运动跟踪框架,侧重底层动力学与动作模仿。虽涉及具身智能,但非VLA高层语义规划或视觉语言对齐核心架构,属于底层控制层进展。
Yushi Wang et al. · 针对人形机器人足球场景的视觉驱动反应式技能学习。属于特定任务领域的RL/模仿学习应用,缺乏VLA通用的语义理解与长程规划能力,对通用VLA研究参考有限。
Yan Gu et al. · 综述或研究人形机器人行走控制的演进。聚焦于底层运动控制算法,与Vision-Language-Action的高层语义决策关联度低,属于传统机器人学范畴。
Yiyan Peng et al. · 发布用于评估机器人操作安全性的基准数据集和框架。虽然重要,但属于数据/评测类工作,无新算法贡献,符合“值得了解”但不紧急的标准。
Zhengyan Qian et al. · 发布LIBERO-VIFO基准,评估VLA遵循视觉线索的能力与安全性。属于评测基准工作,有助于发现VLA在指令跟随上的缺陷,但本身不提供新算法。
Xinjie Wang et al. · 发布EmbodiedGen V2仿真引擎,支持生成可执行的3D任务环境。作为基础设施工具,对数据生成和Sim2Real有价值,但属于数据集/工具类,非核心算法突破。
理论分析连续代码世界模型中的采样验证风险。虽涉及世界模型,但偏向理论风险分析,缺乏具体的VLA应用路径或实验验证,适合了解背景。
Yifei Dong et al. · 结合记忆增强规划与前瞻能力的视觉导航世界模型。侧重导航而非操作,且为渐进式改进,未触及VLA核心架构变革,归为值得了解。
Haonan Xu et al. · 视频生成领域的流匹配优化方法,虽可能间接影响VLA视觉部分,但无直接机器人操作应用证据,属于相邻领域进展。
Rishi Upadhyay et al. · 发布WorldBench基准,隔离物理概念以评估世界模型的物理理解能力。属于评测基准工作,对VLA世界模型组件的评估有参考价值,但无新算法。
Jonathan Sadeghi et al. · 发布CaliBench基准,评估视频世界模型的随机动力学物理校准程度。属于评测基准,帮助量化VLA世界模型的物理真实性,非核心方法创新。
Mohamad H. Danesh et al. · 针对四足机器人的形态条件世界模型,侧重移动而非操作。虽涉及跨具身,但应用场景局限,对通用VLA操作研究的直接参考有限。
Renjie Zhao et al. · 研究多智能体环境下的可扩展世界模型。侧重多智能体协作与规模扩展,非单臂/双臂VLA操作核心,属于相关但非紧迫的研究方向。